論文の概要: Mechanistic Interpretability of Chain-of-Thought Reasoning via Sequential Activation Patching
- arxiv url: http://arxiv.org/abs/2608.22332v1
- Date: Sun, 23 Aug 2026 10:05:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.721713
- Title: Mechanistic Interpretability of Chain-of-Thought Reasoning via Sequential Activation Patching
- Title(参考訳): シークエンシャルアクティベーション・パッチングによるチェーン・オブ・ソート推論の機械論的解釈可能性
- Authors: Murat Dura, Serkan Öztürk, Selma Tekir,
- Abstract要約: 本研究では,CoT(Chain-of-Thought)関連因果効果が生成した推論軌道のどこに現れるかを検討する。
トークン位置をまたいだCoT条件のアテンションヘッドアクティベーションをトレースする逐次アクティベーションパッチフレームワークを導入する。
この結果から,CoT条件の例に付随する分散推論支援サブ回路の証拠が得られた。
- 参考スコア(独自算出の注目度): 0.9940728137241215
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) demonstrate remarkable problem-solving capabilities when guided by Chain-of-Thought (CoT) prompting, yet the internal mechanisms underlying these improvements remain poorly understood. In this work, we investigate where CoT-related causal effects emerge across the generated reasoning trajectory and which attention heads carry signals that contribute to final-answer computation. Because CoT reasoning unfolds over multiple generated tokens, standard activation patching at a single static token position is insufficient to characterize these temporally distributed effects. To address this limitation, we introduce a sequential activation patching framework that traces CoT-conditioned attention-head activations across token positions and aggregates their effects using Part-of-Speech-guided analysis. We further introduce Sequential Multi-Head Patching to evaluate the joint contribution of distributed head sets, together with cross-question and random activation controls. Targeted zero-ablation experiments show that the identified heads are functionally important for successful answer generation and affect several overlapping mechanisms, including reasoning-trajectory maintenance, answer anchoring, exemplar-target separation, and numerical generation. Overall, our results provide evidence for distributed reasoning-support sub-circuits associated with CoT-conditioned computation.
- Abstract(参考訳): 大型言語モデル(LLM)は、CoT(Chain-of-Thought)によって導かれると、目覚ましい問題解決能力を示すが、これらの改善の根底にある内部メカニズムはよく分かっていない。
本研究では,CoT関連因果効果が生成した推論軌道のどこに現れるか,どのアテンションヘッドが最終回答計算に寄与する信号を運ぶかを検討する。
CoT推論は、複数の生成されたトークンに展開するため、1つの静的トークン位置における標準アクティベーションパッチは、これらの時間的分散効果を特徴づけるには不十分である。
この制限に対処するために,トークン位置をまたいだCoT条件のアテンションヘッドアクティベーションをトレースし,その効果をPart-of-Speech-guided解析を用いて集約する,逐次アクティベーションパッチフレームワークを導入する。
さらに、分散ヘッドセットの連立寄与を評価するために、クロスクエストとランダムアクティベーション制御とともに、シークエンシャルマルチヘッドパッチを導入する。
対象のゼロアブレーション実験は、同定された頭部が解答生成に機能的に重要であり、推論軌道維持、解答アンカー、模範的対象分離、数値生成など、複数の重なり合うメカニズムに影響を及ぼすことを示した。
その結果,CoT条件の計算に付随する分散推論支援サブ回路の証拠が得られた。
関連論文リスト
- Unlocking the Black Box of Latent Reasoning: An Interpretability-Guided Approach to Intervention [33.40772052822545]
本稿では,機械的解釈可能性と動作可能な制御のギャップを埋める。
まず,構造的,因果的,幾何学的プローブを用いた系統解析を行った。
次に、これらの解釈可能性に関する洞察を、トレーニングなしのデコードタイムの介入スイートに運用します。
論文 参考訳(メタデータ) (2026-05-31T13:52:24Z) - The Structural Origin of Attention Sink: Variance Discrepancy, Super Neurons, and Dimension Disparity [22.040532283910522]
この研究は、この現象のテクトメカニスティックな説明を提供する。
我々はそのルーツを自己注意に固有の価値集約プロセスに遡る。
概念実証として,事前学習時の値アグリゲーション出力を安定化するアーキテクチャ変更であるtextithead-wise RMSNormを提案する。
論文 参考訳(メタデータ) (2026-05-07T17:28:55Z) - Bypassing the Rationale: Causal Auditing of Implicit Reasoning in Language Models [0.0]
思考の連鎖(CoT)の促進は推論補助として広く用いられ、しばしば透明性のメカニズムとして扱われる。
アクティベーションパッチによるCoT忠実度に関する因果的,階層的な監査を導入する。
私たちは、CoT特有の影響は、通常、狭い「推論窓」に奥行き局所化されていることに気付きました。
論文 参考訳(メタデータ) (2026-02-03T20:27:49Z) - Seeing Through the Chain: Mitigate Hallucination in Multimodal Reasoning Models via CoT Compression and Contrastive Preference Optimization [78.94590726578014]
マルチモーダル推論モデル (Multimodal reasoning model, MLRM) は幻覚の傾向が強く, 効果的な解はいまだ未発見のままである。
textbfCompression と textbfPreference textbfOptimization を組み合わせたトレーニングベースの緩和フレームワーク C3PO を提案する。
論文 参考訳(メタデータ) (2026-02-03T11:00:55Z) - On the Paradoxical Interference between Instruction-Following and Task Solving [50.75960598434753]
次の命令は、大規模言語モデル(LLM)を、タスクの実行方法に関する明示的な制約を指定することで、人間の意図と整合させることを目的としている。
我々は,LLMのタスク解決能力にパラドックス的に干渉する命令に従うという,直感に反する現象を明らかにした。
本稿では,タスク解決に追従する命令の干渉を定量化する指標として,SUSTAINSCOREを提案する。
論文 参考訳(メタデータ) (2026-01-29T17:48:56Z) - Decoupling the Effect of Chain-of-Thought Reasoning: A Human Label Variation Perspective [60.45433515408158]
長いチェーン・オブ・ソート(CoT)がトップオプションの決定的決定要因となるが、あいまいなタスクの粒度分布キャリブレータとして機能しないことを示す。
CoTは分布アライメントを改善するが、CoTの内容によって最終的な精度が決定される。
論文 参考訳(メタデータ) (2026-01-06T16:26:40Z) - Efficient Thought Space Exploration through Strategic Intervention [54.35208611253168]
本稿では,この知見を2つの相乗的コンポーネントを通して操作するHint-Practice Reasoning(HPR)フレームワークを提案する。
フレームワークの中核となる革新は、動的に介入点を識別する分散不整合低減(DIR)である。
算術的および常識的推論ベンチマークによる実験は、HPRの最先端の効率-精度トレードオフを実証している。
論文 参考訳(メタデータ) (2025-11-13T07:26:01Z) - The Curse of CoT: On the Limitations of Chain-of-Thought in In-Context Learning [56.574829311863446]
CoT(Chain-of-Thought)プロンプトは,大規模言語モデル(LLM)における推論能力の向上によって広く認識されている。
我々は、CoTとその推論変異が、様々なモデルスケールやベンチマークの複雑さに対して、直接応答を一貫して過小評価していることを実証する。
パターンベースICLにおけるCoTの性能を駆動する明示的単純推論の基本的なハイブリッド機構を明らかにする。
論文 参考訳(メタデータ) (2025-04-07T13:51:06Z) - Don't Take Things Out of Context: Attention Intervention for Enhancing Chain-of-Thought Reasoning in Large Language Models [32.71672086718058]
CoT (Few-shot Chain-of-Thought) は大規模言語モデル (LLM) の推論能力を著しく向上させる
我々は、COTのデモで分離されたセグメント、単語、トークンが、予期せずLCMの生成過程を乱す可能性があることを観察する。
デモの注意パターンを動的に解析し,これらのトークンを正確に識別するFew-shot Attention Intervention法(FAI)を提案する。
論文 参考訳(メタデータ) (2025-03-14T07:46:33Z) - Fine-Tuning on Diverse Reasoning Chains Drives Within-Inference CoT Refinement in LLMs [63.36637269634553]
本稿では,LLMを微調整し,一つの推論ステップで思考の逆連鎖(DCoT)を生成する手法を提案する。
DCoTの微調整により,モデルファミリおよびスケール間のCoTベースライン上での性能が向上することを示す。
我々の研究は、定量的解析と手動評価の両方で、観測された利益は、最初の推論連鎖を洗練させるモデルの能力に由来することを明らかにしているため、重要である。
論文 参考訳(メタデータ) (2024-07-03T15:01:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。