論文の概要: Evaluation without Generation: Non-Generative Assessment of Harmful Model Specialization with Applications to CSAM
- arxiv url: http://arxiv.org/abs/2604.25119v1
- Date: Tue, 28 Apr 2026 01:54:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-29 16:49:17.65357
- Title: Evaluation without Generation: Non-Generative Assessment of Harmful Model Specialization with Applications to CSAM
- Title(参考訳): 生成のない評価:CSAMへの適用による有害モデルスペシャライゼーションの非生成的評価
- Authors: Vinith M. Suriyakumar, Ayush Sekhari, Lena Stempfle, Robertson Wang, Michael Simpson, Rebecca Portnoff, Marzyeh Ghassemi, Ashia C. Wilson,
- Abstract要約: 本稿では,LoRA適応器が潜在アンサンブルに対する応答を測定することでモデルの内部表現を摂動させる手法であるGaussian Probingを紹介する。
子どもの性的虐待に特有なモデルを検出することを含む,高リスク領域における有効性を示す。
以上の結果から,ガウス探索は高リスク生成システムを評価するためのスケーラブルな非生成的代替手段を提供することが示された。
- 参考スコア(独自算出の注目度): 24.60847002212009
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Auditing the fine-tunes of open-weight generative models for harmful specialization has become a new governance challenge for model hosting platforms. The standard toolkit, generative evaluation via curated prompts or red-teaming, does not scale to platform-level auditing and breaks down entirely for domains like CSAM where generation is legally constrained. This motivates the Evaluation without Generation problem: assessing model capabilities without producing outputs. We argue that in such settings, capability must be inferred from the model's state, either its parameters or internal representations, rather than its outputs. We introduce Gaussian probing, a method that characterizes how LoRA adaptors perturb a model's internal representations by measuring responses to Gaussian latent ensembles. Unlike raw-weight baselines, Gaussian probing reliably distinguishes benign from harmful specialization without sampling outputs. We demonstrate effectiveness in high-risk domains, including detecting models specialized for child sexual abuse material (CSAM), where output-based evaluation is legally and ethically constrained. Our results show that Gaussian probing provides a scalable non-generative alternative for evaluating high-risk generative systems and remains robust to weight rescaling, a representative adversarial manipulation.
- Abstract(参考訳): 有害な特殊化のためのオープンウェイト生成モデルの微調整を監査することは、モデルホスティングプラットフォームの新たなガバナンス課題となっている。
標準的なツールキットは、キュレートされたプロンプトまたはリピートによる生成的評価であり、プラットフォームレベルの監査にはスケールせず、ジェネレーションが法的に制約されたCSAMのようなドメインで完全に分解される。
これは、アウトプットを生成せずにモデル機能を評価する、生成不要の評価を動機付けます。
このような設定では、出力ではなく、パラメータや内部表現といったモデルの状態から機能を推論する必要があります。
ガウスの潜在アンサンブルに対する応答を計測することにより,LoRA アダプタがモデルの内部表現を摂動する方法を特徴付ける手法であるガウス探索を導入する。
生重量のベースラインと異なり、ガウスの探索は、良心と有害な特殊化を出力をサンプリングせずに確実に区別する。
子どもの性的虐待物質(CSAM)に特化しているモデルを検出することを含む高リスク領域において、アウトプットに基づく評価が法的に倫理的に制約されている場合の有効性を実証する。
以上の結果から,ガウス探索は高リスクな生成システムを評価するためのスケーラブルな非生成的代替手段であり,対数的操作である重み再スケーリングに頑健であることが示唆された。
関連論文リスト
- Conformal Selective Prediction with General Risk Control [8.936337121607677]
我々は、トレーニングされたモデルと、ユーザ定義、バウンダリ、継続的な評価のリスクに対して、そのような決定を導出するための新しいフレームワークを提案する。
SCoREは、システムがモデルを信頼することを選択したケースのリスクに関する2つの保証を提供する。
提案手法をシミュレーションにより評価し, 薬物発見, 健康リスク予測, 大規模言語モデルにおける誤り管理への応用を通じて, 有効性を示す。
論文 参考訳(メタデータ) (2026-03-25T18:29:23Z) - Efficient Adaptive Rejection Sampling for Accelerating Speculative Decoding in Large Language Models [2.4065240342323384]
本稿では, 適応型リジェクションサンプリング(EARS)について紹介する。
EARSは、ターゲットモデルの予測不確かさを1-max(P_target)として組み込むことで、受入閾値を動的に調整する。
投機的復号化の効率を大幅に向上させ、18.12%のスループット向上を実現し、GSM8Kベンチマークでは0.84%の精度低下を無視できる。
論文 参考訳(メタデータ) (2025-12-15T11:08:56Z) - Principled Input-Output-Conditioned Post-Hoc Uncertainty Estimation for Regression Networks [1.4671424999873808]
不確実性は安全性に敏感なアプリケーションでは重要であるが、予測性能に悪影響を及ぼすため、市販のニューラルネットワークから排除されることが多い。
本稿では,従来の入力と凍結モデルの両方に補助モデルを適用することにより,回帰タスクにおけるポストホック不確実性推定のための理論的基盤となるフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-01T09:13:27Z) - Uncertainty-Aware Decoding with Minimum Bayes Risk [70.6645260214115]
予測されたリスクに応じてモデル生成を選択する最小ベイズリスク復号法を,原理化された不確実性認識復号法に一般化する方法を示す。
この修正された予測リスクは、出力の選択と生成をいつ中止するかの判断の両方に有用であり、オーバーヘッドを発生させることなく改善を提供できることを示す。
論文 参考訳(メタデータ) (2025-03-07T10:55:12Z) - Controlling Risk of Retrieval-augmented Generation: A Counterfactual Prompting Framework [77.45983464131977]
我々は、RAGモデルの予測が誤りであり、現実のアプリケーションにおいて制御不能なリスクをもたらす可能性がどの程度あるかに焦点を当てる。
本研究は,RAGの予測に影響を及ぼす2つの重要な潜伏要因を明らかにする。
我々は,これらの要因をモデルに誘導し,その応答に与える影響を解析する,反実的プロンプトフレームワークを開発した。
論文 参考訳(メタデータ) (2024-09-24T14:52:14Z) - Risk-Sensitive Diffusion: Robustly Optimizing Diffusion Models with Noisy Samples [58.68233326265417]
非画像データは実際のアプリケーションで広く使われており、ノイズが多い傾向にある。
リスク感受性SDEは、リスクベクトルによってパラメータ化された微分方程式(SDE)の一種である。
我々はガウス雑音分布と非ガウス雑音分布の両方について系統的研究を行う。
論文 参考訳(メタデータ) (2024-02-03T08:41:51Z) - Toward Certified Robustness Against Real-World Distribution Shifts [65.66374339500025]
我々は、データから摂動を学ぶために生成モデルを訓練し、学習したモデルの出力に関して仕様を定義する。
この設定から生じるユニークな挑戦は、既存の検証者がシグモイドの活性化を厳密に近似できないことである。
本稿では,古典的な反例誘導的抽象的洗練の概念を活用するシグモイドアクティベーションを扱うための一般的なメタアルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-06-08T04:09:13Z) - OMASGAN: Out-of-Distribution Minimum Anomaly Score GAN for Sample
Generation on the Boundary [0.0]
生成モデルは, アウト・オブ・ディストリビューション(OoD)サンプルに高い可能性と低い再構成損失を設定した。
OMASGANは、負のデータ増大方法で、推定分布境界上の異常サンプルを生成する。
OMASGANは、分布境界上に発生する異常最小値のOoDサンプルを含むことにより、再訓練を行う。
論文 参考訳(メタデータ) (2021-10-28T16:35:30Z) - Continual Learning with Fully Probabilistic Models [70.3497683558609]
機械学習の完全確率的(または生成的)モデルに基づく継続的学習のアプローチを提案する。
生成器と分類器の両方に対してガウス混合モデル(GMM)インスタンスを用いた擬似リハーサル手法を提案する。
我々は,GMRが,クラス増分学習問題に対して,非常に競合的な時間とメモリの複雑さで,最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2021-04-19T12:26:26Z) - Generalized Multi-Output Gaussian Process Censored Regression [7.111443975103331]
本稿では、GPの非パラメトリックな柔軟性と、入力依存ノイズ条件下での相関出力からの情報を活用する能力を組み合わせたヘテロスセダスティック多出力ガウスプロセスモデルを提案する。
結果として、柔軟性を追加することで、潜在的に複雑な検閲ダイナミクスの下で、モデルが基盤となる非検閲プロセス(すなわち、真)をより正確に見積もることができるかが示される。
論文 参考訳(メタデータ) (2020-09-10T12:46:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。