論文の概要: S^3martCirc: Self-supervised Smart Circuit Discovery
- arxiv url: http://arxiv.org/abs/2609.00755v1
- Date: Tue, 01 Sep 2026 05:37:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.404325
- Title: S^3martCirc: Self-supervised Smart Circuit Discovery
- Title(参考訳): S^3martCirc: 自己監督型スマートサーキットディスカバリ
- Authors: Wendy Zheng, Yinhan He, Liang Wu, Jundong Li,
- Abstract要約: 大規模言語モデル(LLM)は、様々なタスクにまたがる顕著なパフォーマンスを示している。
これらの能力にもかかわらず、ブラックボックスの性質は内部決定過程を曖昧にしている。
機械的解釈可能性(Mechanistic Interpretability)は、ニューラルネットワークを人間の理解可能なアルゴリズムにリバースエンジニアリングすることで、この問題に対処することを目的としている。
- 参考スコア(独自算出の注目度): 44.37905543632994
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) have demonstrated remarkable performance across diverse tasks, from text summarization to question answering. Despite these capabilities, their black-box nature obscures internal decision-making processes. Mechanistic interpretability (MI) aims to address this by reverse-engineering neural networks into human-understandable algorithms. Current MI approaches for LLMs typically follow a two-stage paradigm: first identifying important components (circuit discovery), where components are typically individual nodes such as an attention head or feedforward neuron, and second determining the role they play in a certain task (functional interpretation). However, this sequential approach overlooks a fundamental insight: a component's importance and its functional role are inherently codependent. Unifying these stages presents two key challenges: (1) functional roles are often tied to specific nodes or components, limiting generalization, and (2) their identification relies on subjective interpretation rather than quantifiable metrics. To address these challenges, we propose S^3martCirc (Self-supervised Smart Circuit Discovery), a unified framework that simultaneously discovers circuits and interprets functionality. S^3martCirc abstracts node behavior into two general computational roles that generalize across tasks and defines a quantitative metric for assigning them, enabling importance and functional role to be discovered jointly rather than in sequence. Extensive experiments show that our framework outperforms existing methods in circuit discovery.
- Abstract(参考訳): 大規模言語モデル(LLM)は、テキストの要約から質問応答に至るまで、様々なタスクで顕著なパフォーマンスを示している。
これらの能力にもかかわらず、ブラックボックスの性質は内部決定過程を曖昧にしている。
機械的解釈可能性(MI)は、ニューラルネットワークを人間の理解可能なアルゴリズムにリバースエンジニアリングすることで、この問題に対処することを目的としている。
LLMの現在のMIアプローチは、2段階のパラダイムに従っており、まず重要なコンポーネント(回路探索)を識別し、そこでは、コンポーネントは通常、注意頭やフィードフォワードニューロンのような個々のノードであり、次に、特定のタスク(機能的解釈)でそれらが果たす役割を決定する。
しかしながら、このシーケンシャルなアプローチは、コンポーネントの重要性とその機能的役割が本質的に共依存的であるという、基本的な洞察を見落としている。
これらの段階を統一することは、(1) 機能的役割は、しばしば特定のノードやコンポーネントに結び付けられ、一般化を制限し、(2) それらの識別は、定量化メトリクスよりも主観的解釈に依存している。
これらの課題に対処するため,S^3martCirc (Self-supervised Smart Circuit Discovery) を提案する。
S^3martCircは、ノードの振る舞いを2つの一般的な計算ロールに抽象化し、タスクを一般化し、それらを割り当てるための定量的な計量を定義する。
大規模な実験により,回路発見における既存の手法よりも優れた性能が得られた。
関連論文リスト
- Cognitive Mirrors: Exploring the Diverse Functional Roles of Attention Heads in LLM Reasoning [54.12174882424842]
大規模言語モデル(LLM)は、様々なタスクにおいて最先端のパフォーマンスを達成したが、内部メカニズムに関してはほとんど不透明である。
本稿では,注目者の役割と行動を体系的に分析する新しい解釈可能性フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-03T10:24:34Z) - Selection, Reflection and Self-Refinement: Revisit Reasoning Tasks via a Causal Lens [19.316594303998667]
推論タスクは、機械学習モデルの能力を評価するための厳格なベンチマークとみなされてきた。
我々は、因果的視点から推論タスクを再考し、潜在空間におけるそれらの振る舞いを理解する。
SR$2$と呼ばれるフレームワークを導入し、推定された潜在変数を選択機構にフィードバックとして組み込む。
論文 参考訳(メタデータ) (2025-10-09T13:45:31Z) - From Indirect Object Identification to Syllogisms: Exploring Binary Mechanisms in Transformer Circuits [5.1877231178075425]
本稿では,GPT-2小さめの2値真理値処理能力について,その振る舞いをシロジカル・プロンプトを用いて解析することによって検討する。
GPT-2の論理推論能力を機械的に説明できる複数の回路を同定する。
論文 参考訳(メタデータ) (2025-08-22T05:54:11Z) - EgoPrompt: Prompt Learning for Egocentric Action Recognition [49.12318087940015]
EgoPromptは、エゴセントリックな行動認識タスクを実行するための、素早い学習ベースのフレームワークである。
EgoPromptは、内部データセット、クロスデータセット、ベース・ツー・ノーベルの一般化ベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-08-05T09:47:07Z) - Benchmarking and Understanding Compositional Relational Reasoning of LLMs [1.915591735124465]
我々はまず、Generalized Associative Recall (GAR)と呼ばれる新しい合成ベンチマークを提案する。
評価は、GARが既存のLLMにとって十分困難であることを示し、CRRの基本的な欠陥を明らかにしている。
次に、属性パッチを用いて、Vicuna-33Bで再利用されたコア回路の様々なタスクと重要な注意点のセットを発見する。
論文 参考訳(メタデータ) (2024-12-17T12:10:38Z) - Adaptive Circuit Behavior and Generalization in Mechanistic Interpretability [3.138731415322007]
GPT-2小領域における間接物体識別(IOI)回路の汎用性について検討する。
その結果、回路は驚くほどよく一般化し、全ての部品と機構を再利用し、入力エッジを追加するだけでよいことがわかった。
論文 参考訳(メタデータ) (2024-11-25T05:32:34Z) - Compositional Attention: Disentangling Search and Retrieval [66.7108739597771]
Multi-head, key-value attention は Transformer モデルとそのバリエーションのバックボーンである。
標準的なアテンションヘッドは、検索と検索の間の厳密なマッピングを学ぶ。
本稿では,標準ヘッド構造を置き換える新しいアテンション機構であるコンポジションアテンションアテンションを提案する。
論文 参考訳(メタデータ) (2021-10-18T15:47:38Z) - Distribution Matching for Heterogeneous Multi-Task Learning: a
Large-scale Face Study [75.42182503265056]
マルチタスク学習は、共有学習アルゴリズムによって複数のタスクを共同で学習する方法論として登場した。
我々は異種mtlに対処し,検出,分類,回帰問題を同時に解決する。
大規模な顔分析のための最初のフレームワークであるFaceBehaviorNetを構築し、すべての顔行動タスクを共同で学習する。
論文 参考訳(メタデータ) (2021-05-08T22:26:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。