論文の概要: Surrogate Fidelity: When Can Open LLMs Explain Closed Ones?
- arxiv url: http://arxiv.org/abs/2606.32008v1
- Date: Tue, 30 Jun 2026 17:43:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.331496
- Title: Surrogate Fidelity: When Can Open LLMs Explain Closed Ones?
- Title(参考訳): LLMはいつクローズドなものを説明できるのか?
- Abstract要約: 予測,属性,表現レベルでの代理的忠実度を評価する。
注意パターンや大きさのようなホワイトボックス信号は、モデル間で非常に安定しているが、因果属性の弱い予測しかできない。
- 参考スコア(独自算出の注目度): 6.786301369955054
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mechanistic interpretability (MI) requires full access to model internals, yet the APIs for most widely deployed language models at best expose log-probabilities over output tokens. This creates a surrogate problem: when do measurements made on open models allow us to make claims about a closed model? We evaluate surrogate fidelity at the prediction, attribution, and representation levels. For binary classification tasks, log-odds provide an API-compatible scalar readout of the model's representation space, and leave-one-out attributions provide insight into model behavior. Across eleven models spanning four families (Llama, Qwen, GPT, and Gemini), we find that prediction fidelity substantially overstates attribution fidelity: models that agree on what the answer is often disagree on why. We document an access-validity inversion: white-box signals like attention patterns and perturbation magnitudes are highly stable across models but only weakly predictive of causal attributions, which black-box input ablations capture by design. Mechanistic insight does not automatically transfer to closed targets, and prediction-level agreement is insufficient to warrant such transfer. Code and results are available at https://github.com/facebookresearch/surrogate.
- Abstract(参考訳): 機械的解釈可能性(MI)はモデル内部への完全なアクセスを必要とするが、最も広くデプロイされている言語モデルのAPIは、出力トークンよりもログ確率を最も多く公開している。
オープンモデルによる測定によって、クローズドモデルに関する主張がいつできるのか?
予測,属性,表現レベルでの代理的忠実度を評価する。
バイナリ分類タスクでは、log-oddsはモデル表現空間のAPI互換のスカラー読み込みを提供する。
4つの家系にまたがる11のモデル(Llama、Qwen、GPT、Gemini)で、予測忠実度は帰属忠実度を大幅に上回っている。
注意パターンや摂動マグニチュードのようなホワイトボックス信号は、モデル間で非常に安定しているが、因果属性の弱い予測しかできない。
機械的な洞察は自動的に閉じた目標に伝達するわけではなく、予測レベルの合意はそのような移動を保証するには不十分である。
コードと結果はhttps://github.com/facebookresearch/surrogate.comで公開されている。
関連論文リスト
- Catch-Only-One: Non-Transferable Examples for Model-Specific Authorization [26.668781698446832]
最近のAI規制では、不正使用に抵抗しながらイノベーションに役立つデータを求めている。
本研究では,データに依存しない入力側利用制御機構であるNon-transferable Example (NEs)を提案する。
我々は、認可されたモデルの効用を保証し、許可されていないモデルの偏差を定量化する形式的境界を確立する。
論文 参考訳(メタデータ) (2025-10-13T03:43:11Z) - Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs [27.544312683007234]
細調整された大言語モデル(LLM)の理解・監視・制御のための新しい手法を提案する。
微調整モデルとそのベースモデルの間の重み差のトップ特異点が,新たに獲得した挙動に対応することを示す。
シークレットトリガーが存在する場合の安全メカニズムをバイパスするバックドアモデルでは、我々の手法は1.2%以下の偽陽性率で攻撃の最大100%を停止する。
論文 参考訳(メタデータ) (2025-07-31T21:04:12Z) - Predicting the Performance of Black-box LLMs through Self-Queries [60.87193950962585]
大規模言語モデル(LLM)は、AIシステムにおいてますます頼りになってきている。
本稿では、フォローアッププロンプトを使用し、異なる応答の確率を表現として捉え、ブラックボックス方式でLCMの特徴を抽出する。
これらの低次元表現上で線形モデルをトレーニングすると、インスタンスレベルでのモデル性能の信頼性を予測できることを示す。
論文 参考訳(メタデータ) (2025-01-02T22:26:54Z) - Promises and Pitfalls of Generative Masked Language Modeling: Theoretical Framework and Practical Guidelines [74.42485647685272]
GMLM(Generative Masked Language Models)に焦点を当てる。
我々は,マルコフ連鎖の入力として使用されるマスキングにより,データ分布の条件付き確率に適合するモデルを訓練し,モデルからサンプルを抽出する。
我々は,T5モデルを並列デコーディングに適応させ,最小品質の犠牲を伴って機械翻訳における2~3倍の高速化を実現した。
論文 参考訳(メタデータ) (2024-07-22T18:00:00Z) - Co(ve)rtex: ML Models as storage channels and their (mis-)applications [2.792027541710663]
機械学習システムでは、不注意な状態と未定義の振る舞いが重大な脆弱性の原因であることが示されている。
MLモデルは,パラメータ化の超過に伴って増大するキャパシティを持つストレージチャネルであると考えている。
本稿では,ML固有の置換に基づく誤り訂正プロトコルを含む,このケースにおけるキャパシティ向上のための最適化手法を提案する。
論文 参考訳(メタデータ) (2023-07-17T19:57:10Z) - Black-Box Anomaly Attribution [13.455748795087493]
ブラックボックスの機械学習モデルが真の観察から逸脱したとき、その逸脱の背後にある理由について何を言えるだろうか?
これは、ビジネスまたは産業用AIアプリケーションのエンドユーザがよく問う、基本的でユビキタスな質問である。
「新たな可能性に基づく帰属の枠組みを「可能性補償」と呼ぶ。」
論文 参考訳(メタデータ) (2023-05-29T01:42:32Z) - VisFIS: Visual Feature Importance Supervision with
Right-for-the-Right-Reason Objectives [84.48039784446166]
モデルFI監督は、VQAモデルの精度と、Right-to-the-Right-Reasonメトリクスの性能を有意義に向上させることができることを示す。
我々の最高のパフォーマンス手法であるVisual Feature Importance Supervision (VisFIS)は、ベンチマークVQAデータセットで強いベースラインを上回ります。
説明が妥当で忠実な場合には予測がより正確になる。
論文 参考訳(メタデータ) (2022-06-22T17:02:01Z) - Probing Model Signal-Awareness via Prediction-Preserving Input
Minimization [67.62847721118142]
モデルが正しい脆弱性信号を捕捉して予測する能力を評価する。
SAR(Signal-Aware Recall)と呼ばれる新しい指標を用いて,モデルの信号認識を計測する。
その結果,90年代以降のリコールから60年代以降のリコールは,新たな指標で大幅に減少した。
論文 参考訳(メタデータ) (2020-11-25T20:05:23Z) - How do Decisions Emerge across Layers in Neural Models? Interpretation
with Differentiable Masking [70.92463223410225]
DiffMaskは、差分性を維持しながら入力のサブセットをマスクアウトすることを学ぶ。
入力トークンを包含または無視する決定は、中間隠蔽層に基づく単純なモデルで行われる。
これにより、属性のヒートマップをプロットするだけでなく、ネットワーク層間で意思決定がどのように形成されるかを分析することができます。
論文 参考訳(メタデータ) (2020-04-30T17:36:14Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。