論文の概要: ADAG: Automatically Describing Attribution Graphs
- arxiv url: http://arxiv.org/abs/2604.07615v1
- Date: Wed, 08 Apr 2026 21:34:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-10 18:34:05.57604
- Title: ADAG: Automatically Describing Attribution Graphs
- Title(参考訳): ADAG: 属性グラフの自動記述
- Abstract要約: 完全自動化されたこれらの属性グラフを記述するためのエンドツーエンドパイプラインである textbfADAG を導入する。
次に、特徴群をグループ化するための新しいクラスタリングアルゴリズムと、これらの特徴群の機能的役割に関する自然言語的説明を生成・スコアするLLM説明器-シミュレータ構成を導入する。
我々は、既知の人為的な回路追跡タスクでシステムを実行し、解釈可能な回路を復元し、さらに、Llama 3.1 8Bインストラクトにおける有害なアドバイスジェイルブレイクの原因となる、ステアブルクラスタを見つけることができることを示す。
- 参考スコア(独自算出の注目度): 50.460651620833055
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In language model interpretability research, \textbf{circuit tracing} aims to identify which internal features causally contributed to a particular output and how they affected each other, with the goal of explaining the computations underlying some behaviour. However, all prior circuit tracing work has relied on ad-hoc human interpretation of the role that each feature in the circuit plays, via manual inspection of data artifacts such as the dataset examples the component activates on. We introduce \textbf{ADAG}, an end-to-end pipeline for describing these attribution graphs which is fully automated. To achieve this, we introduce \textit{attribution profiles} which quantify the functional role of a feature via its input and output gradient effects. We then introduce a novel clustering algorithm for grouping features, and an LLM explainer--simulator setup which generates and scores natural-language explanations of the functional role of these feature groups. We run our system on known human-analysed circuit-tracing tasks and recover interpretable circuits, and further show ADAG can find steerable clusters which are responsible for a harmful advice jailbreak in Llama 3.1 8B Instruct.
- Abstract(参考訳): 言語モデル解釈可能性の研究において、 \textbf{circuit Trace} は、特定の出力に因果的に寄与する内部特徴と、それらがどのように影響するかを、ある振る舞いの根底にある計算を説明することを目的としている。
しかしながら、以前の回路トレース作業はすべて、コンポーネントがアクティベートするデータセット例などのデータアーティファクトを手動で検査することで、回路内の各特徴が果たす役割のアドホックな人間の解釈に依存している。
完全自動化されたこれらの属性グラフを記述するためのエンドツーエンドパイプラインである \textbf{ADAG} を紹介する。
これを実現するために、入力と出力の勾配効果によって特徴の機能的役割を定量化する「textit{attribution profiles」を導入する。
次に、特徴群をグループ化するための新しいクラスタリングアルゴリズムと、これらの特徴群の機能的役割に関する自然言語的説明を生成・スコアするLLM説明器-シミュレータ構成を導入する。
我々は、既知の人為的な回路追跡タスクでシステムを実行し、解釈可能な回路を復元し、さらに、Llama 3.1 8Bインストラクトにおける有害なアドバイスジェイルブレイクの原因となる、ステアブルクラスタを見つけることができることを示す。
関連論文リスト
- GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization [101.37117235471709]
本稿では,タスク関連要因に着目したアクション生成を支援するフレームワークである GuidedVLA を紹介する。
私たちの中核的な洞察は、アクションデコーダをモノリシックな学習者としてではなく、機能的なコンポーネントの集合として扱うことです。
この結果から,アクションデコーダ学習を明示的に指導することが,より堅牢で汎用的なVLAモデルを構築する上で有望な方向であることが示唆された。
論文 参考訳(メタデータ) (2026-05-12T16:38:40Z) - Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features [1.5874067490843806]
Control Reinforcement Learningは、各トークンでステアリングするためのSAE機能を選択するポリシーをトレーニングし、解釈可能な介入ログを生成する。
Adaptive Feature Maskingは、単一機能解釈性を維持しながら、多様な機能発見を促進する。
MMLU、BBQ、GSM8K、HarmBench、XSTestにわたるGemma 2Bでは、CRLは、トークン単位の介入ログを提供しながら改善されている。
論文 参考訳(メタデータ) (2026-02-11T02:28:49Z) - Beyond Activation Patterns: A Weight-Based Out-of-Context Explanation of Sparse Autoencoder Features [11.463277740376236]
現在の解釈法では、アクティベーションパターンから特徴セマンティクスを推測するが、前方通過における計算的役割を果たすアクティベーションを再構築するために特徴が訓練されているという見落としがある。
本稿では, 直接重み相互作用による機能的効果を計測し, アクティベーションデータを必要としない新しいウェイトベース解釈フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-30T01:30:48Z) - Circuit Insights: Towards Interpretability Beyond Activations [20.178085579725472]
WeightLensとCircuitLensの2つの相補的手法を提案する。
WeightLensは学習したウェイトから直接機能を解釈し、説明モデルやデータセットの必要性を取り除く。
CircuitLensは、コンポーネント間のインタラクションから機能アクティベーションがどのように発生し、回路レベルのダイナミクスを明らかにするのかをキャプチャする。
論文 参考訳(メタデータ) (2025-10-16T17:49:41Z) - Contextualize-then-Aggregate: Circuits for In-Context Learning in Gemma-2 2B [51.74607395697567]
In-Context Learning (ICL)は、大規模言語モデル(LLM)の興味深い能力である。
我々は5つの自然主義ICLタスクに対してGemma-2 2Bにおける情報フローを因果介入を用いて同定する。
このモデルでは,2段階戦略を用いてタスク情報を推論し,コンテキスト化-then-aggregateと呼ぶ。
論文 参考訳(メタデータ) (2025-03-31T18:33:55Z) - Position-aware Automatic Circuit Discovery [59.64762573617173]
我々は既存の回路探索手法のギャップを同定し、モデル成分を入力位置間で等しく関連するものとして扱う。
可変長例を含むタスクであっても,回路に位置性を組み込むための2つの改良を提案する。
提案手法により, 位置感応回路の完全自動検出が可能となり, 従来よりも回路サイズと忠実度とのトレードオフが良好になる。
論文 参考訳(メタデータ) (2025-02-07T00:18:20Z) - Automatically Identifying Local and Global Circuits with Linear Computation Graphs [45.760716193942685]
Sparse Autoencoders (SAEs) と Transcoders と呼ばれる変種を用いた回路発見パイプラインを導入する。
本手法は各ノードの因果効果を計算するために線形近似を必要としない。
GPT-2 Small: Bracket, induction, Indirect Object Identification circuits の3種類の回路を解析する。
論文 参考訳(メタデータ) (2024-05-22T17:50:04Z) - Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models [55.19497659895122]
本稿ではスパース特徴回路の発見と適用方法を紹介する。
これらは言語モデルの振る舞いを説明するための人間の解釈可能な特徴の因果関係の著作である。
論文 参考訳(メタデータ) (2024-03-28T17:56:07Z) - FIND: A Function Description Benchmark for Evaluating Interpretability
Methods [86.80718559904854]
本稿では,自動解釈可能性評価のためのベンチマークスイートであるFIND(Function Interpretation and Description)を紹介する。
FINDには、トレーニングされたニューラルネットワークのコンポーネントに似た機能と、私たちが生成しようとしている種類の記述が含まれています。
本研究では、事前訓練された言語モデルを用いて、自然言語とコードにおける関数の振る舞いの記述を生成する手法を評価する。
論文 参考訳(メタデータ) (2023-09-07T17:47:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。