論文の概要: Right Answer, Wrong Mechanism: Detecting Pernicious Divergence in Causal Interventions
- arxiv url: http://arxiv.org/abs/2609.39243v1
- Date: Wed, 30 Sep 2026 08:12:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.430539
- Title: Right Answer, Wrong Mechanism: Detecting Pernicious Divergence in Causal Interventions
- Title(参考訳): 正しい答え, 間違ったメカニズム: 因果的介入における悪質な多様性の検出
- Abstract要約: アクティベーションパッチや分散アライメントサーチ(DAS)などの因果的介入は、ニューラルネットワークを機械的に主張するための主要なツールである。
最近の研究は、これらの介入がモデル自然分布の表現を日常的に押し出すことを示した。
我々は、事前訓練された言語モデル内に隠れた経路を植え込むことで、この問題を検証できるようにする。
- 参考スコア(独自算出の注目度): 2.8536637803101836
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Causal interventions such as activation patching and distributed alignment search (DAS) are the main tool for making mechanistic claims about neural networks. Recent work showed that these interventions routinely push representations off the model's natural distribution, and that such divergence is sometimes harmless and sometimes pernicious: it can recruit pathways the model never uses on natural inputs, so that an intervention produces the expected answer through the wrong mechanism. No method currently tells the two cases apart. We make this question testable by planting hidden pathways inside pretrained language models; the pathways are silent on every benchmark prompt by construction, so which interventions depend on them is known exactly. Across 72 configurations and 100,800 interventions on GPT-2 small, we find three things. (i) Nearest-neighbour and local-PCA distances at the intervention site, as used in prior work, score below chance (AUROC 0.35-0.47) at picking out interventions that give the right answer through a planted pathway. (ii) Hidden-Pathway Contribution (HPC), a label-free test that clamps downstream units to the regime of natural runs with the same output and measures how much of the decision disappears, flags pathway-dominated interventions with AUROC >= 0.99 when the pathway shows up as unit-level out-of-regime activity, but fails when every unit stays within its natural range, which we identify as the open problem. (iii) Optimised interventions actively seek hidden pathways: on a gender task, DAS routes 90-95% of its successes through planted pathways for three of four families, and a downstream on-manifold penalty cuts this share to under 5% at a cost of 6-11 points of success rate. In unmodified GPT-2, successful interventions show almost no unit-level out-of-regime reliance.
- Abstract(参考訳): アクティベーションパッチや分散アライメントサーチ(DAS)などの因果的介入は、ニューラルネットワークを機械的に主張するための主要なツールである。
最近の研究は、これらの介入がモデルの自然な分布から表現を定期的に押し出し、そのようなばらつきは時として無害であり、時には悪質であることを示した。
現在、この2つのケースを区別する手段はない。
この問題は、事前訓練された言語モデル内に隠された経路を配置することで検証可能である。
72以上の構成と100,800件のGPT-2の介入により、3つのことが判明した。
一 介入現場の近辺及び局所PCA距離は、先行作業において、植林経路を介して適切な回答を与える介入を採点する機会(AUROC 0.35-0.47)を下回る。
(II)Hdden-Pathway Contribution(HPC)は、下流のユニットを自然界にまとめて同じアウトプットで実行し、その決定のどれだけが消えるかを測定するラベルのないテストであり、経路が単位レベルのアウト・オブ・レジーム活動として現れるとき、AUROC >= 0.99 で経路に支配される介入をフラグするが、全てのユニットがその自然圏内に留まると失敗する。
3) 最適介入は, 隠蔽経路を積極的に求め, ジェンダータスクにおいて, DASは4家族のうち3家族の植林経路を通じて90~95%の成功をパスし, 下流の1対1のペナルティにより, 成功率6~11ポイントで5%未満に低下する。
修正されていないGPT-2では、成功した介入は、ほとんど単位レベルの登録外依存を示さない。
関連論文リスト
- Path-specific harm decomposition: A partial identification framework [47.08749868865109]
害に対する広く用いられる概念は、介入が個人の結果を減少させる確率として定義される負の影響を受ける(FNA)の割合である。
本研究では、FNAの経路特異的な類似体を紹介する。
直接的および間接的FNAのための新しい部分識別フレームワークを開発する。
論文 参考訳(メタデータ) (2026-09-24T15:03:08Z) - The Intervention Gap in Latent World Models [0.0]
計画時介入の忠実さは、学習された世界モデルの際立った、測定可能な特性である。
リリースされたTD-MPC2チェックポイントサイズ全体で、タスクオブザーバのオペレータエラー診断が増加するにつれて、エピソードリターンが減少する。
タスク信号無しで訓練された自己教師付き世界モデルは、共有タスク上のタスク選択モデルよりもかなり優れた演算子を保存する。
論文 参考訳(メタデータ) (2026-08-30T19:47:51Z) - Below the Noise Floor: Bimodal Seed Collapse and Distinct Failure Modes in Small-Model Knowledge Distillation [0.3525984766628294]
1.5B Qwenの学生と20Bの教師による740インスタンスの医療APIルーティングタスクでは、8つのKD変種と教師付きクロスエントロピーを比較した。
i) 種子当たりの標準偏差は2.8から48.7%の範囲であり、クレームKDの上昇率は5ポイント以下である。
論文 参考訳(メタデータ) (2026-08-27T21:40:19Z) - A Few Neurons Reveal When LLMs Misuse Tools: Sparse Detection and Selective Steering for Reliable Tool Use [28.57781785937644]
PRISMS(Probing Representations In Support of Monitoring and Steering)は,スパース検出とアクティベーションの間に障害特異的ニューロンベースを共有するクローズループフレームワークである。
6つのモデル全体で、PRISMSはプールされたオーバーコール率を80%削減し、ツール要求の精度を14.2%向上させた。
論文 参考訳(メタデータ) (2026-07-31T19:03:44Z) - The Saturation Trap and the Subjectivity of Intervention Timing: Why Affect-Based Triggers and LLM Judges Fail to Time Interventions on Autonomous Agents [0.0]
インターベンションタイミングは信頼性の低い構造であり、シングルアノテータF1を不適切な最適化ターゲットとする。
我々の貢献は、人間のレータ間の信頼性、4つの検出器アーキテクチャ、モデルのLEM-judgeスイープ、再現された飽和効果にまたがるこの問題を、共同でマッピングすることである。
論文 参考訳(メタデータ) (2026-06-02T23:54:27Z) - Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs [9.127363793428119]
摂動探索は、大規模言語モデルにおけるFFNニューロンに対するタスク特異的因果仮説を生成する。
8つの動作回路、13のモデル、および4つのアーキテクチャファミリにまたがって、LLMの動作を整理する2つの回路構造を同定する。
論文 参考訳(メタデータ) (2026-04-30T04:13:33Z) - TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention [44.64827167753535]
有害なセマンティクスは分散層間回路として機能し、局所的な介入が不安定で実用性に有害である。
我々は,不特定意味論の因果伝播回路をトレースし,切断するパスレベルフレームワークである textbfTrace を提案する。
トレースは最先端のベースラインを著しく上回り、敵の堅牢性と汎用性とのトレードオフが優れている。
論文 参考訳(メタデータ) (2026-01-29T15:58:12Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z) - Score-based Causal Representation Learning with Interventions [54.735484409244386]
本稿では,潜在因果変数を間接的に観察する際の因果表現学習問題について検討する。
目的は、 (i) 未知の線形変換(スケーリングまで)を回復し、 (ii) 潜在変数の下の有向非巡回グラフ(DAG)を決定することである。
論文 参考訳(メタデータ) (2023-01-19T18:39:48Z) - BaCaDI: Bayesian Causal Discovery with Unknown Interventions [118.93754590721173]
BaCaDIは因果構造と介入の両方の潜在確率的表現の連続的な空間で機能する。
BaCaDIは、合成因果発見タスクとシミュレートされた遺伝子発現データの実験において、因果構造と介入ターゲットを識別する関連手法より優れている。
論文 参考訳(メタデータ) (2022-06-03T16:25:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。