論文の概要: Are We Recovering Mechanisms? Objective-Level Recovery Gaps in Mechanistic Interpretability
- arxiv url: http://arxiv.org/abs/2610.02098v1
- Date: Thu, 01 Oct 2026 17:25:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.330768
- Title: Are We Recovering Mechanisms? Objective-Level Recovery Gaps in Mechanistic Interpretability
- Title(参考訳): メカニズムの回復は可能か? 機械的解釈可能性における客観レベル回復ギャップ
- Abstract要約: 介入定義忠実度は、モデルの振る舞いを再現しにくくする等サイズの回路を好むことを示す。
除外された信号を置き換えることで、保持されたコンポーネントが動作する入力が変化する。
- 参考スコア(独自算出の注目度): 9.522452128296834
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mechanistic interpretability aims to recover the internal computations responsible for model behavior. Progress in automated circuit discovery is often framed as a search problem: better attribution or optimization should identify better mechanisms. This assumes that the evaluation objective can recognize a better circuit once it is found. We show that intervention-defined faithfulness can instead prefer an equally sized circuit that reproduces the model's behavior less well, creating an objective-level recovery gap. Across four human-reference tasks and InterpBench, we compare validation faithfulness with behavior on held-out prompts under fixed ordinary resampling. The behavioral criterion is agreement with the intact model, including its mistakes, except on Greater-Than, where we use semantic accuracy. Controlled reference edits reveal misranking without any discovery algorithm, and outputs of EAP, EAP-IG, ACDC, and Edge-SP exhibit the same failure. Under resampling, KL misranks 9.4%-41.2% of candidate pairs across these methods on the human-reference tasks. We investigate context distortion as an explanation: replacing excluded signals changes the inputs on which retained components operate. Restoring selected signals from the recipient's intact-model execution repairs 96 of 100 persistent KL misrankings from the discovery pool on both validation and held-out prompts. The circuits and their original behavioral scores remain unchanged. These findings show why better discovery alone is insufficient when its objective rewards the wrong candidate.
- Abstract(参考訳): 機械的解釈可能性(Mechanistic Interpretability)は、モデル行動に責任のある内部計算を復元することを目的としている。
自動回路発見の進歩は、しばしば探索問題としてフレーム化され、より良い帰属や最適化はより良いメカニズムを特定するべきである。
これにより、評価対象が見つかると、より良い回路を認識できると仮定する。
介入定義忠実度は、モデルの振る舞いを再現しにくくし、目的レベルのリカバリギャップを生じさせる等サイズの回路を好んで選択できることを示す。
4つのヒューマン・リフレクション・タスクとInterpBenchで、検証の忠実度と固定された通常のリサンプリングの下でのホールトアウトプロンプトの挙動を比較した。
行動基準は、意味的正確性を使用するグレーター・タンを除いて、その誤りを含む無意味なモデルと一致している。
制御された参照編集では、発見アルゴリズムを使わずに誤ってランク付けされ、EAP、EAP-IG、ACDC、Edge-SPの出力は同じ失敗を示す。
再サンプリングでは、KLはこれらの方法の候補ペアの9.4%-41.2%を人間参照タスクで間違えている。
除外された信号を置き換えることで、保持されたコンポーネントが動作する入力が変化する。
受信者の無傷モデル実行修復から選択された信号の復元は、検出プールから検出された100個のKLのうち96個の永続的なKLをバリデーションとホールドアウトプロンプトの両方で誤る。
回路と元の動作スコアは変わっていない。
これらの結果は、目的が間違った候補に報酬を与える場合に、より良い発見だけで不十分な理由を示している。
関連論文リスト
- Rethinking Circuit Evaluation: Do Circuits Explain Model Errors? [10.705929494771231]
モデルの動作を説明する回路がほとんどのエラーを考慮できないことを示す。
多くの試験回路は、モデルのエラーの大半を見逃しながら、正確な動作を密に再現した。
これらの結果から,回路はモデルの故障を適切に説明せずにタスク成功を維持できることがわかった。
論文 参考訳(メタデータ) (2026-09-28T17:34:45Z) - Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction [22.654396704495934]
開発セット障害は、どのリカバリ介入が許容可能かを決定することにより、欠落診断基板の一部を回復することができる。
DARCは、タスクファミリー障害モードをプロファイリングし、共有リカバリライブラリから不正な介入を発生させ、検証者選択によるデプロイメント成功コストポリシーを凍結する、診断誘導型リカバリハーネスである。
論文 参考訳(メタデータ) (2026-08-12T08:14:45Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Interventional Causal Circuits for Safe Robot Action Testing and Failure Recovery [4.492262382019958]
運動パラメータの形式的テストは計算に費用がかかり、コストはアクション空間の次元に悪影響を及ぼす。
本稿では,JPT(Joint Probability Tree)とMarginal-Deterministic Variable Tree(Marginal-Deterministic Variable Tree)から派生した因果回路を結合した閉ループフレームワークを提案する。
このフレームワークは、ロボットが動作を開始する前に全ての介入クエリのトラクタビリティを検証し、サポート外候補を自動的に検出し、修正から除外する。
論文 参考訳(メタデータ) (2026-07-16T10:41:20Z) - Demystifying Variance in Circuit Discovery of LLMs [51.97489679448601]
我々は,再サンプリングのばらつきを大幅に軽減する新しい回路探索法を開発した。
テンプレートの異なるプロンプトは、モデル内の異なる回路を活性化する傾向があるため、リフレージングのばらつきが生じることを示す。
我々は、よりコンパクトで解釈可能なタスク回路を形成すると主張されている空間性は、この問題の解決に失敗すると主張している。
論文 参考訳(メタデータ) (2026-06-15T16:25:07Z) - Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration [76.08899010904652]
CapCalは、ランキング決定から位置バイアスを機械的に分離する、トレーニング不要のフレームワークである。
シングルパス効率を保ちながら、トレーニング不要の手法で優れた性能を発揮する。
論文 参考訳(メタデータ) (2026-04-11T10:47:22Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - Decoding the Critique Mechanism in Large Reasoning Models [50.821607345799386]
大規模推論モデル(LRM)は、バックトラックと自己検証メカニズムを示し、中間ステップを修正して正しい解に到達できるようにする。
中間推論ステップに算術ミスを挿入することにより,現在のLEMがエラーからどのように回復するかを検討する。
チェーン・オブ・シークレットを伝播する誤りにもかかわらず、モデルは依然として正しい最終解に達している。
論文 参考訳(メタデータ) (2026-03-17T10:03:30Z) - CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning [4.765206163164323]
CLEANERは本質的な自己訂正機能を利用して、データ収集中にエラーに汚染されたコンテキストを除去する。
類似性を考慮した適応ロールバック機構は、クリーンで清浄な軌道を自律的に構築する。
その結果, 平均精度は6%, 3%, 5%であった。
論文 参考訳(メタデータ) (2026-01-21T16:14:30Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。