論文の概要: Architecture, Not Scale: Circuit Localization in Large Language Models
- arxiv url: http://arxiv.org/abs/2605.08853v1
- Date: Sat, 09 May 2026 10:05:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.932226
- Title: Architecture, Not Scale: Circuit Localization in Large Language Models
- Title(参考訳): アーキテクチャ、スケールではなく:大規模言語モデルにおける回路ローカライゼーション
- Abstract要約: グループ化されたクエリアテンションは、同じ規模の標準的なマルチヘッドアテンションよりもはるかに集中し、機械的に安定していることを示す。
同じ濃度パターンは間接的な物体識別、誘導ヘッド、事実的リコールにまたがる。
これらの結果は、いくつかのアーキテクチャ上の選択が、大きなモデルをより研究しやすくしていることを示唆している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mechanistic interpretability assumes that circuit analysis becomes harder as models scale. We challenge this assumption by showing that the attention architecture matters more than parameter count. Studying three circuit types across Pythia and Qwen2.5, we find that grouped query attention produces circuits that are far more concentrated and mechanistically stable than standard multi-head attention at comparable scales. The same concentration pattern holds across indirect object identification, induction heads, and factual recall. Within a single architecture family (Qwen2.5), factual recall circuits undergo a discrete phase transition above a critical scale, collapsing to a single bottleneck rather than degrading gradually. These findings suggest that some architectural choices make large models more tractable to study and that interpretability difficulty is not a fixed consequence of model size.
- Abstract(参考訳): 機械的解釈可能性(Mechanistic interpretability)は、回路解析がモデルがスケールするにつれて難しくなると仮定する。
我々は,注目アーキテクチャがパラメータ数以上に重要であることを示すことによって,この仮定に挑戦する。
Pythia と Qwen2.5 の3種類の回路タイプを調べたところ、グループ化されたクエリアテンションは、同等のスケールで標準的なマルチヘッドアテンションよりもはるかに集中的で機械的に安定な回路を生成することがわかった。
同じ濃度パターンは間接的な物体識別、誘導ヘッド、事実的リコールにまたがる。
単一のアーキテクチャファミリ(Qwen2.5)内では、実際のリコール回路は臨界スケール以上の離散位相遷移を行い、徐々に劣化するのではなく、単一のボトルネックに崩壊する。
これらの結果から,大規模モデルをより学習しやすくするアーキテクチャ的な選択があり,解釈可能性の難しさはモデルサイズに一定の結果をもたらすものではないことが示唆された。
関連論文リスト
- Differentiable Faithfulness Alignment for Cross-Model Circuit Transfer [73.0825876244911]
DFAは、より小さなソースモデルからより大きなターゲットモデルに回路情報を転送するフレームワークである。
Llama-3 と Qwen-2.5 の DFA を,実数検索,複数選択推論,算術の6つのタスクで評価した。
DFAは、単純なベースラインを一貫して上回り、いくつかの設定では、直接帰属に匹敵する、あるいは強い忠実さでターゲットモデル回路を回復する。
論文 参考訳(メタデータ) (2026-04-27T10:49:10Z) - Quantifying LLM Attention-Head Stability: Implications for Circuit Universality [2.6132365604376404]
様々な大きさのトランスフォーマー言語モデルの安定性について検討する。
中層ヘッドは最も安定していないが、最も表現的に異なる。
より深いモデルでは、より深い奥行きが示される。
論文 参考訳(メタデータ) (2026-02-17T23:30:59Z) - Dynamics Within Latent Chain-of-Thought: An Empirical Study of Causal Structure [58.89643769707751]
表現空間における潜在連鎖を操作可能な因果過程として研究する。
遅延ステップの予算は、均質な余分な深さよりも、非局所的なルーティングを備えたステージ機能のように振る舞う。
これらの結果は、モード条件と安定性を意識した分析を、潜伏推論システムの解釈と改善のための信頼性の高いツールとして動機付けている。
論文 参考訳(メタデータ) (2026-02-09T15:25:12Z) - How Attention Sinks Emerge in Large Language Models: An Interpretability Perspective [67.08306259095778]
モデルがゼロ位置のトークンを認識できるように簡単なメカニズムを同定し、2つの変圧器ブロック内で注意シンクを誘導する。
スクラッチからトレーニングされた30B A3B MoEモデルからのトレーニングトレースを分析することで、このメカニズムはトレーニングの初期段階に現れ、最初の2層に集中するようになる。
論文 参考訳(メタデータ) (2026-02-04T11:10:34Z) - Right Looks, Wrong Reasons: Compositional Fidelity in Text-to-Image Generation [34.89831673834612]
本研究は,3つの基本的論点,計数,空間的関係の分解について検討する。
この失敗を3つの重要な要因に遡る。まず、トレーニングデータから明らかな否定がほとんどないことを示す。
我々は、既存のアーキテクチャへの漸進的な調整よりも、表現と推論の根本的な進歩が必要であると結論付けている。
論文 参考訳(メタデータ) (2025-11-13T09:49:21Z) - Scaling Laws and Symmetry, Evidence from Neural Force Fields [14.109815254143205]
アーキテクチャに依存した指数によるデータ、パラメータ、計算について、明確なパワールールのスケーリング動作を示します。
特に、タスク対称性を利用する同変アーキテクチャは、非同変モデルよりもスケールが優れていることを観察する。
我々の分析は、計算最適トレーニングでは、データサイズとモデルサイズはアーキテクチャに関わらず、瞬時にスケールする必要があることを示唆している。
論文 参考訳(メタデータ) (2025-10-10T18:22:00Z) - Why Can't Transformers Learn Multiplication? Reverse-Engineering Reveals Long-Range Dependency Pitfalls [54.57326125204404]
言語モデルはますます能力が高くなっているが、多桁乗算という一見単純なタスクではまだ失敗している。
直観的連鎖を通して乗法をうまく学習するモデルをリバースエンジニアリングすることでなぜ研究する。
論文 参考訳(メタデータ) (2025-09-30T19:03:26Z) - Scaling Laws vs Model Architectures: How does Inductive Bias Influence
Scaling? [91.78878523252897]
本稿では,10種類のモデルアーキテクチャのスケーリング挙動の系統的研究を行う。
アーキテクチャはスケーリングを行う上で重要な考慮事項であり、最高のパフォーマンスモデルが異なるスケールで変動可能であることを示す。
論文 参考訳(メタデータ) (2022-07-21T15:50:22Z) - Systematic Evaluation of Causal Discovery in Visual Model Based
Reinforcement Learning [76.00395335702572]
AIと因果関係の中心的な目標は、抽象表現と因果構造を共同で発見することである。
因果誘導を研究するための既存の環境は、複雑なタスク固有の因果グラフを持つため、この目的には適していない。
本研究の目的は,高次変数の学習表現と因果構造の研究を促進することである。
論文 参考訳(メタデータ) (2021-07-02T05:44:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。