論文の概要: Conditional Co-Ablation: Recovering Self-Repair Backups in Transformer Circuits
- arxiv url: http://arxiv.org/abs/2607.01940v1
- Date: Thu, 02 Jul 2026 09:32:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.772698
- Title: Conditional Co-Ablation: Recovering Self-Repair Backups in Transformer Circuits
- Title(参考訳): コンディショナルコアブレーション:変圧器回路における自己修復バックアップの復元
- Abstract要約: 条件付き共アブレーションは、各単位のアブレーション効果が一次集合が取り除かれたときにどれだけ増大するかを問う。
GPT-2の小型IOI回路では、CoAxはバックアップヘッドのリカバリを0.33から0.91 ROC-AUCに引き上げる。
- 参考スコア(独自算出の注目度): 47.668752416295185
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mechanistic interpretability often relies on component-level interventions to discover how a model produces a behavior. This guides attribution, capability knockout, and model pruning downstream to operate by scoring each unit by the effect of ablation in isolation. Such first-order scoring is natural when component importance is additive, but becomes misleading when a transformer self-repairs: after a primary component is removed, a dormant backup can take over, muting the primary's measured effect while the backup itself appears irrelevant on the intact model. We recast this failure as a recovery task, conditional circuit completion, and introduce Conditional Co-Ablation (CoAx), a label-free, output-grounded score that asks how much each remaining unit's ablation effect grows once a primary set has been removed. This conditional growth exposes the second-order interaction that single-unit scores discard. On the GPT-2-small IOI circuit, CoAx raises backup-head recovery from 0.33 to 0.91 ROC-AUC, outperforming all baselines, including self-repair-aware gradient scores (best 0.82); counterfactual patching verifies that the recovered heads causally carry the repair. The same label-free procedure transfers to induction across eight models. Beyond discovery, the recovered backups correct self-repair-masked attribution, identify the components required for capability knockout, and yield repair-aware structured pruning scaling from 124M to 7B. Component importance is therefore not merely an isolated-unit property: in robust circuits, the components that matter can become visible only under the interventions that make them necessary.
- Abstract(参考訳): 機械的解釈可能性はしばしば、モデルがどのように振る舞いを生み出すかを知るためにコンポーネントレベルの介入に依存する。
これにより、帰属、能力ノックアウト、モデルプルーニングを下流に誘導し、個別にアブレーションの効果で各ユニットをスコアリングして動作させる。
このような一階のスコアリングは、成分の重要度が加算的である場合に自然であるが、トランスフォーマーが自己修復を行うと誤解を招く: プライマリコンポーネントが削除された後、休眠バックアップが引き継がれ、プライマリの計測効果がミュートされ、バックアップ自体が無傷モデルに無関係に見える。
我々は,この障害を回復タスク,条件付き回路完成,条件付き共アブレーション(CoAx)として再評価し,一次セットが削除された後に各ユニットのアブレーション効果がどれだけ増大するかを問うラベルなしのアウトプットグラウンドスコアを導入する。
この条件付き成長は、単一ユニットが破棄する2階の相互作用を露呈する。
GPT-2の小型IOI回路では、CoAxはバックアップヘッドのリカバリを0.33から0.91ROC-AUCに引き上げ、自己修復性勾配スコア(best 0.82)を含む全てのベースラインを上回っている。
同じラベルフリープロシージャは、8つのモデル間で誘導に転送される。
発見の他に、回収されたバックアップは自己修復マインド属性を補正し、機能ノックアウトに必要なコンポーネントを特定し、修復対応の構造化プルーニングスケールを124Mから7Bに拡大する。
したがって、コンポーネントの重要性は単に孤立したユニットの性質ではない:ロバスト回路では、重要なコンポーネントは必要な介入の下でのみ見えるようになる。
関連論文リスト
- The Curse of Multiple Mediators: Hidden Interaction Effects in Activation Patching [28.393865595242872]
アクティベーションパッチ(Activation patching)は、機械的解釈可能性の主要なツールである。
モデル行動の因果責任は、その自然な間接効果を見積もることによって、個々のコンポーネントに比例する。
また、コンポーネントの因果効果自体がモデル内の他のコンポーネントの状態に依存するかを測定する相互作用効果(INT)も含む。
論文 参考訳(メタデータ) (2026-06-25T19:52:16Z) - SAE Interventions are Unreliable: Post-Intervention Recovery of Suppressed Behavior [38.75847400495247]
スパースオートエンコーダ(SAE)は残ストリームの活性化を解釈可能な特徴に分解する。
特定の有害な特徴をクランプすることで,モデルの誤動作を確実に防止できることが示唆された。
我々は、この脆弱性を、制約付き残空間最適化問題であるポスト・インターベンション・リカバリ(英語版)として定式化する。
論文 参考訳(メタデータ) (2026-06-16T15:04:17Z) - Deployment-Time Memorization in Foundation-Model Agents [18.40535884093806]
個人化リコール(PR)と適応抽出レート(AER)によるプライバシユーティリティフロンティアとしてのエージェントメモリの検討
キーファクト要約は、ほとんどすべてのパーソナライズリコールを維持しながら、Gemma 3 12Bで76%、GPT-4o-miniで64%のカナリア抽出を減少させる。
LongMemEvalでは、キーファクトの要約はGemma 3 12Bで76%、GPT-4o-miniで64%のカナリア抽出を減らし、ほぼすべてのパーソナライズリコールを保存する。
論文 参考訳(メタデータ) (2026-06-08T18:38:41Z) - Beyond Spatial Compression: Interface-Centric Generative States for Open-World 3D Structure [55.17771962316751]
現在の3Dトークンは、表現を空間圧縮として扱うが、コンポーネントの所有権とアタッチメントの妥当性は暗黙的に残す。
我々は、トークン化がパッシブ圧縮コードではなく操作状態を構成する、インターフェイス中心の生成状態という別の視点を定式化する。
我々は、この定式化を、C2LT-3D(Component-Conditioned Canonical Local Tokens)でインスタンス化し、表現を標準局所幾何学、パーティション条件付きコンテキスト、およびリレーショナルシーム変数に分解する。
論文 参考訳(メタデータ) (2026-05-11T12:09:28Z) - ANNEAL: Adapting LLM Agents via Governed Symbolic Patch Learning [12.44509691077682]
本稿では,繰り返し発生する障害をプロセス知識グラフのシンボル編集に変換する神経シンボルエージェントであるANNEALを紹介する。
その中核となるメカニズムであるFDKA(Failure-Driven Knowledge Acquisition)は、責任のあるオペレータをローカライズし、制約付きLLM生成を通じて型付きパッチを合成し、提案を検証する。
4つのドメインと27のマルチシードランをまたいだANNEALは、永続的な構造修復を行う唯一の評価システムである。
論文 参考訳(メタデータ) (2026-05-04T05:24:03Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - CUE-R: Beyond the Final Answer in Retrieval-Augmented Generation [0.996038809132083]
CUE-Rは、単発RAGにおいて、エビデンス単位の操作性を測定するためのフレームワークである。
CUE-RはREMOVE、REPLACE、DUPLICATE演算子を介して個々の証拠項目を摂動し、3つのユーティリティ軸に沿って変化を測定する。
その結果,回答のみの評価は重要なエビデンス効果を見逃し,介入に基づくユーティリティ分析がRAG評価の実践的補完となることが示唆された。
論文 参考訳(メタデータ) (2026-04-07T06:05:08Z) - A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Transformer Training [86.64715217940274]
外接線は正規化と共に機能する。
アウトリーチは、コントリビュータではなく、再スケール要因として役立ちます。
外乱は学習可能なパラメータに吸収されるか、明示的なゲート再スケーリングによって緩和される。
論文 参考訳(メタデータ) (2026-01-30T13:29:45Z) - ERIS: An Energy-Guided Feature Disentanglement Framework for Out-of-Distribution Time Series Classification [51.07970070817353]
理想的な時系列分類(TSC)は不変表現をキャプチャできるべきである。
現在の手法は、真に普遍的な特徴を分離するために必要な意味的な方向性を欠いている。
本稿では,シフト・ロバストネス・フレームワークのためのエンドツーエンドのエネルギー規則化情報を提案する。
論文 参考訳(メタデータ) (2025-08-19T12:13:41Z) - REFINE: Inversion-Free Backdoor Defense via Model Reprogramming [60.554146386198376]
ディープニューラルネットワーク(DNN)に対するバックドア攻撃は、重大なセキュリティ脅威として浮上している。
モデル再プログラミングに基づく逆フリーバックドア防御手法であるREFINEを提案する。
論文 参考訳(メタデータ) (2025-02-22T07:29:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。