論文の概要: Data-driven Circuit Discovery for Interpretability of Language Models
- arxiv url: http://arxiv.org/abs/2605.09129v1
- Date: Sat, 09 May 2026 19:20:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.077001
- Title: Data-driven Circuit Discovery for Interpretability of Language Models
- Title(参考訳): 言語モデルの解釈可能性のためのデータ駆動回路探索
- Abstract要約: 回路探索は、言語モデル(LM)が回路をローカライズし解釈することで、特定のタスクをどのように実装するかを説明することを目的としている。
既存のメソッドは、まずデータセットでタスクを非公式に定義し、次にそのデータセットに回路探索アルゴリズムを適用して単一の回路を得る。
データ駆動型サーキットディスカバリ(DCD)を提案する。
- 参考スコア(独自算出の注目度): 32.70005004096789
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Circuit discovery aims to explain how language models (LMs) implement a specific task by localizing and interpreting a circuit, a computational subgraph responsible for the LM's behavior. Existing circuit discovery methods are hypothesis-driven; they first informally define a task with a dataset, and then apply a circuit discovery algorithm over that dataset to obtain a single circuit. This imposes two strong assumptions: that the LM implements the task with a single circuit, and that the dataset adequately represents the task as humans understand it. We systematically test these assumptions across four previously studied tasks and find that even minor dataset variations that preserve task semantics can produce circuits with low edge overlap and cross-dataset faithfulness. More strikingly, when applied to a mixed dataset with two distinct tasks whose separately discovered circuits have near-zero cross-faithfulness, existing methods still return a single circuit with high faithfulness across both tasks. This indicates that current methods discover dataset-specific circuits, rather than general task circuits. We propose Data-driven Circuit Discovery (DCD), a new discovery framework that drops both assumptions: instead of returning a single circuit for a dataset, DCD first clusters examples in the dataset by how similarly the model processes them and discovers a separate circuit for each group. This allows distinct mechanisms to appear separately rather than merged into a single circuit; each circuit explains its group, not the full task. Experiments show that DCD discovers multiple circuits per dataset, each more faithful to its group than a single circuit discovered by existing methods. Broadly, DCD lets the data reveal mechanistic structure within LMs, rather than relying on human-defined task boundaries that may not align with how models organize their computation.
- Abstract(参考訳): サーキットディスカバリ(Circuit Discovery)は、LMの振る舞いに責任を持つ計算サブグラフであるサーキットをローカライズし、解釈することで、言語モデル(LM)が特定のタスクをどのように実装するかを説明することを目的としている。
既存の回路探索法は仮説駆動であり、まずデータセットでタスクを非公式に定義し、そのデータセットに回路探索アルゴリズムを適用して単一の回路を得る。
これは、LMが1つの回路でタスクを実装し、データセットが人間の理解に従ってタスクを適切に表現する、という2つの強い仮定を課している。
従来研究されてきた4つのタスクにまたがってこれらの仮定を体系的に検証し、タスクのセマンティクスを保存するマイナーなデータセットのバリエーションでさえ、エッジの重複度が低く、データセット間の忠実度が低い回路を生成できることを見出した。
さらに驚くべきことに、別々に発見された回路がほぼゼロの交差忠実度を持つ2つのタスクからなる混合データセットに適用した場合、既存の手法は両方のタスクに高い忠実度を持つ単一回路を返す。
これは、現在の手法が一般的なタスク回路ではなく、データセット固有の回路を発見することを示している。
データ駆動型サーキットディスカバリ(Data-driven Circuit Discovery, DCD)は、データセットの単一回路を返す代わりに、モデルがどのように処理し、各グループごとに別々のサーキットを発見するかによって、データセット内のサンプルをクラスタ化する。
これにより、個々の機構が単一の回路にマージされるのではなく、別々に現れるようになる。
実験により、DCDはデータセットごとに複数の回路を発見し、それぞれが既存の方法で発見された単一の回路よりもそのグループに忠実であることが示されている。
広範に言えば、DCDは、モデルが計算を整理する方法と一致しないような、人間の定義したタスク境界に頼るのではなく、LM内のメカニスティック構造を明らかにすることができる。
関連論文リスト
- EEVEE: Towards Test-time Prompt Learning in the Real World for Self-Improving Agents [64.96332056338923]
EEVEEは、LLMエージェントのための最初のマルチデータセットテスト時プロンプト学習フレームワークである。
実世界のタスクストリーム下でテスト時のプロンプト学習を可能にする。
EEVEEはQwen3-4B-InstructとDeepSeek-V3.2で平均マルチベンチマークスコアを10.38点、24.32点改善している。
論文 参考訳(メタデータ) (2026-06-09T17:57:16Z) - Certified Circuits: Stability Guarantees for Mechanistic Circuits [80.30622018787835]
Certified Circuitsは、回路発見のための証明可能な安定性を保証する。
ImageNetとOODデータセットでは、認定回路は91%高い精度を達成する。
論文 参考訳(メタデータ) (2026-02-26T13:07:31Z) - Finding Highly Interpretable Prompt-Specific Circuits in Language Models [4.768156759829138]
固定タスク内であっても、回路は即時特異的であることを示す。
本稿では,よりクリーンで低次元の因果信号を1つの前方パスから抽出するACC++を提案する。
我々はACC++信号を用いて人間の解釈可能な特徴を抽出する自動解釈可能性パイプラインを開発した。
論文 参考訳(メタデータ) (2026-02-13T21:41:17Z) - Query Circuits: Explaining How Language Models Answer User Prompts [13.16677655895186]
クエリ回路を導入し、特定の入力を出力にマッピングするモデル内の情報の流れをトレースする。
NDFは、発見回路が特定の入力に対するモデルの判断をいかにうまく回復するかを評価する指標である。
モデル内には非常にスパースなクエリ回路が存在し、単一のクエリでその性能を回復できることがわかった。
論文 参考訳(メタデータ) (2025-09-29T13:59:02Z) - Position-aware Automatic Circuit Discovery [59.64762573617173]
我々は既存の回路探索手法のギャップを同定し、モデル成分を入力位置間で等しく関連するものとして扱う。
可変長例を含むタスクであっても,回路に位置性を組み込むための2つの改良を提案する。
提案手法により, 位置感応回路の完全自動検出が可能となり, 従来よりも回路サイズと忠実度とのトレードオフが良好になる。
論文 参考訳(メタデータ) (2025-02-07T00:18:20Z) - A Unified Data Representation Learning for Non-parametric Two-sample Testing [50.27067977793069]
本稿では,表現学習型2サンプルテスト(RL-TST)フレームワークを提案する。
RL-TSTはまず、データセット全体に対して純粋に自己教師付き表現学習を行う。
識別モデルはこれらの赤外線で訓練され、識別表現(DR)を学習する。
論文 参考訳(メタデータ) (2024-11-30T23:23:52Z) - Transformer Circuit Faithfulness Metrics are not Robust [0.04260910081285213]
回路の「忠実さ」を、モデルの計算の一部を損なうことによって測定する。
既存の回路忠実度スコアは、研究者の方法論的選択と回路の実際の構成要素の両方を反映していると結論付けている。
機械的解釈可能性の研究の最終的な目標は、ニューラルネットワークを理解することです。
論文 参考訳(メタデータ) (2024-07-11T17:59:00Z) - Sheaf Discovery with Joint Computation Graph Pruning and Flexible Granularity [18.71252449465396]
ニューラルネットワークモデル(LM)から自己完結型モジュールユニットを抽出するフレームワークであるDiscoGPを紹介する。
筆者らのフレームワークは,両者をグラデーション・ベース・プルーニング・アルゴリズムを用いてせん断を同定し,この手法により元のLMを,特定のコア機能を保持するスパーススケルトンに還元する。
論文 参考訳(メタデータ) (2024-07-04T09:42:25Z) - Efficient Automated Circuit Discovery in Transformers using Contextual Decomposition [10.13822875330178]
大規模言語モデルで解釈可能な回路を構築するために,変換器 (CD-T) のコンテキスト分解を導入する。
CD-Tは任意のレベルの抽象化の回路を生成でき、アテンションヘッドと同じくらいきめ細かな回路を最初に生成できる。
CD-T回路は、全てのタスクのベースラインよりも少ないノードで、オリジナルのモデルの動作を完璧に再現できることを示す。
論文 参考訳(メタデータ) (2024-07-01T01:12:20Z) - Interpetable Target-Feature Aggregation for Multi-Task Learning based on Bias-Variance Analysis [53.38518232934096]
マルチタスク学習(MTL)は、タスク間の共有知識を活用し、一般化とパフォーマンスを改善するために設計された強力な機械学習パラダイムである。
本稿では,タスククラスタリングと特徴変換の交点におけるMTL手法を提案する。
両段階において、鍵となる側面は減った目標と特徴の解釈可能性を維持することである。
論文 参考訳(メタデータ) (2024-06-12T08:30:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。