論文の概要: Slaying the Hydra: Interaction-Aware Circuit Discovery in Language Models
- arxiv url: http://arxiv.org/abs/2610.04017v1
- Date: Fri, 02 Oct 2026 20:25:06 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:23:33.190329
- Title: Slaying the Hydra: Interaction-Aware Circuit Discovery in Language Models
- Title(参考訳): ハイドラのスレイディング:言語モデルにおける対話型回路発見
- Abstract要約: 回路探索手法であるJuntaLearnerを導入する。これは様々なサイズの部品や目撃者に対して因果的影響によってランク付けを学習する回路探索手法である。
JuntaLearnerは、セットレベルのインタラクションを考慮し、一階近似を避けながら、大きなモデルにスケールする。
- 参考スコア(独自算出の注目度): 2.4078365225187386
- License:
- Abstract: Localizing behavior to individual components of a language model is a central goal of mechanistic interpretability. However, scoring components one at a time misses context-dependent effects: a primary component can inhibit the activation of a backup, leading to issues with ranking components. Actual causality studies the structure of such interactions via witnesses: variables that provide contextual information to resolve interaction terms. However, estimation with witnesses typically requires combinatorial enumeration and is infeasible in practice. We introduce the witness-integrated set effect (WISE), a family of causal estimands that build on the witness mechanism while taking expectations over sets of causes and witnesses to remain computationally feasible. Building on this approach, we introduce JuntaLearner, a gradient-based circuit discovery method that learns to rank components by their causal impact across varying-sized sets of components and witnesses. Alongside faithfulness metrics, we introduce measures of necessity and task specificity, and the circuit recognition score (CRS) to summarize each metric across circuit sizes while emphasizing effects achieved by small circuits. Across tasks and models of increasing size, JuntaLearner achieves higher mean CRS compared to attribution baselines on all metrics. Since its cost does not grow with the number of candidate components, JuntaLearner scales to large models while accounting for set-level interactions and avoiding first-order approximations.
- Abstract(参考訳): 言語モデルの個々のコンポーネントに振る舞いをローカライズすることは、機械的解釈可能性の中心的な目標である。
プライマリコンポーネントはバックアップのアクティベーションを阻害し、ランキングコンポーネントの問題を引き起こします。
実際の因果関係は、これらの相互作用の構造を目撃者を通して研究する: 相互作用項を解決するための文脈情報を提供する変数。
しかし、目撃者による推定には組み合わせ列挙が必要であり、実際は不可能である。
我々は,証人統合セットエフェクト (WISE) を導入し, 原因や目撃者の集合に対する期待を計算可能のままに保ちながら, 証人のメカニズムに基づく因果推定のファミリーを紹介する。
このアプローチに基づいて、さまざまなサイズのコンポーネントや目撃者の集合にまたがる因果的影響によって、コンポーネントのランク付けを学習する勾配に基づく回路探索手法であるJuntaLearnerを導入する。
信頼性の指標に加えて,必要条件とタスク特異性の尺度を導入し,小型回路で達成した効果を強調しつつ,各測定値の回路サイズを要約する回路認識スコア(CRS)を導入する。
JuntaLearnerは、タスクとサイズ拡大のモデル全体で、すべてのメトリクスの属性ベースラインよりも高い平均CRSを達成する。
候補コンポーネントの数によってコストが増大しないため、JuntaLearnerは、セットレベルの相互作用を考慮しつつ、一階近似を避けながら、大きなモデルにスケールする。
関連論文リスト
- Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control [59.15149762610843]
強化学習システムは、他の機械学習パラダイムよりもはるかに複雑である。
個々のアルゴリズムコンポーネントの進歩にもかかわらず、それらの機能的相互依存性は未解明のままである。
モデルベース表現,最適化安定性,経験再現の3つの重要な次元を協調する RL フレームワーク ROSER を提案する。
論文 参考訳(メタデータ) (2026-08-07T10:38:31Z) - Multi-component Causal Tracing in Large Language Models [36.05807217872701]
因果トレースは、大きな言語モデルの内部表現に介入する。
本稿では,複数のコンポーネントを同時に因果的にトレースする統合フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-02T03:15:35Z) - Semantic Interaction Information mediates compositional generalization in latent space [0.0]
我々は、静止部分観測可能なマルコフ決定過程(POMDP)である認知グリッドワールドを開発する。
観測は複数の潜伏変数によって共同で生成されるが、フィードバックは1つのゴール変数に限られる。
本研究では,これらのインタラクションを備えたリカレントニューラルネットワーク(RNN)を分析し,意味的相互作用情報(SII)がEcho状態とフルトレーニングネットワークの精度ギャップを説明する。
論文 参考訳(メタデータ) (2026-03-28T04:46:44Z) - Explicit Multi-head Attention for Inter-head Interaction in Large Language Models [70.96854312026319]
マルチヘッド明示的注意(Multi-head Explicit Attention、MEA)は、頭間相互作用を明示的にモデル化した、単純で効果的な注意法である。
MEAは事前トレーニングにおいて強い堅牢性を示し、より高速な収束につながる学習率を使用することを可能にします。
これにより、KVキャッシュメモリ使用率を50%削減できる実用的なキー値キャッシュ圧縮戦略が実現される。
論文 参考訳(メタデータ) (2026-01-27T13:45:03Z) - EgoPrompt: Prompt Learning for Egocentric Action Recognition [49.12318087940015]
EgoPromptは、エゴセントリックな行動認識タスクを実行するための、素早い学習ベースのフレームワークである。
EgoPromptは、内部データセット、クロスデータセット、ベース・ツー・ノーベルの一般化ベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-08-05T09:47:07Z) - Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization [10.944365976254442]
大規模言語モデルにおける知識編集と未学習の方法は、性能を損なうことなく、望ましくない知識の編集や削除を試みている。
異なる手法でローカライズされたトレーニングコンポーネントでは、学習の非学習と編集の堅牢性に大きな違いがある。
論文 参考訳(メタデータ) (2024-10-16T18:35:02Z) - A Unified Causal View of Instruction Tuning [76.1000380429553]
メタ構造因果モデル(meta-SCM)を開発し、異なるNLPタスクをデータの単一因果構造の下で統合する。
主なアイデアは、タスク要求因果関係を学習し、タスクの予測にのみそれらを使用することである。
論文 参考訳(メタデータ) (2024-02-09T07:12:56Z) - CausalWorld: A Robotic Manipulation Benchmark for Causal Structure and
Transfer Learning [138.40338621974954]
CausalWorldは、ロボット操作環境における因果構造と伝達学習のベンチマークである。
タスクは、ブロックのセットから3D形状を構築することで構成される。
論文 参考訳(メタデータ) (2020-10-08T23:01:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。