論文の概要: Final Checkpoints Are Not Enough: Analyzing Latent Reasoning Faithfulness Along Training Trajectories
- arxiv url: http://arxiv.org/abs/2607.06648v1
- Date: Tue, 07 Jul 2026 16:09:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.167944
- Title: Final Checkpoints Are Not Enough: Analyzing Latent Reasoning Faithfulness Along Training Trajectories
- Title(参考訳): 最終チェックポイントは十分ではない:訓練軌道に沿った忠実度の分析
- Abstract要約: 潜在的推論法は、モデルの連続的な隠蔽状態において完全にマルチステップ推論を行う。
これらの潜伏推論ステップが最終回答を因果的に駆動するかどうかを調査する。
- 参考スコア(独自算出の注目度): 7.404380884611409
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Latent reasoning methods perform multi-step inference entirely in the model's continuous hidden states, promising more compact and efficient reasoning. However, these opaque hidden states raise a question of faithfulness: whether these latent reasoning steps causally drive the final answer. Prior work investigates this question at converged checkpoints and reports several unfaithful behaviors, such as latent reasoning steps that can be replaced without changing the answer, but leaves how these behaviors form during training unexamined. We instead track how faithfulness evolves across saved checkpoints for different latent reasoning paradigms, applying a verifiable counterfactual edit on the input and a noise-ablation activation patch on the latent reasoning steps. We find that (i) at the output level, latent reasoning methods can look similarly unfaithful at convergence under counterfactual edits while following qualitatively divergent trajectories; (ii) at the activation level, the causal contribution of latent reasoning steps to the final answer decays across training for both paradigms, with the examples that flip on the output side in (i) also being the examples on which this contribution decays; and (iii) the activation-level trajectory diverges by answer format, decaying on binary choice and rising on open-ended decoding. These findings highlight that latent reasoning faithfulness depends on training stage and answer format.
- Abstract(参考訳): 潜在推論法は、モデルの連続的な隠蔽状態において完全に多段階推論を行い、よりコンパクトで効率的な推論を約束する。
しかし、これらの不透明な隠された状態は、信頼の疑問を提起する。
先行研究では、収束したチェックポイントでこの疑問を調査し、答えを変えることなく置き換えられる潜在的推論ステップなど、いくつかの不誠実な振る舞いを報告しているが、トレーニング中にこれらの振る舞いがどのように形成されるかは未検討のままである。
代わりに、さまざまな遅延推論のパラダイムに対して、保存されたチェックポイント間での忠実さの進化を追跡追跡し、入力に検証可能な偽物編集と、遅延推論のステップにノイズ-アブレーションアクティベーションパッチを適用します。
私たちはそれを見つける。
i) 出力レベルでは,潜伏推論法は,定性的に発散した軌道を辿りながら,反実的編集の下で収束において同様に不誠実に見える。
(二)アクティベーションレベルでは、最終回答に対する潜在推論ステップの因果的寄与は、両方のパラダイムのトレーニングの間に崩壊し、出力側を反転させる例がある。
i) この寄与が崩壊する例であり、(iii)活性化レベル軌道は解形式によって分岐し、二項選択で崩壊し、オープンエンド復号で上昇する。
これらの結果から, 遅滞推論の忠実度は, 学習段階と回答形式に依存することが明らかとなった。
関連論文リスト
- Beyond the Commitment Boundary: Probing Epiphenomenal Chain-of-Thought in Large Reasoning Models [16.372524974789492]
思考の連鎖(CoT)推論は、言語モデルにおける推論時間スケーリングの主要なパラダイムである。
本研究は,複数のモデルファミリーの推理トレースにまたがって,回答がどのように形成されるのかを考察する。
論文 参考訳(メタデータ) (2026-06-11T17:21:16Z) - Early Stopping for Large Reasoning Models via Confidence Dynamics [55.67938134245981]
大きな推論モデルは複雑な問題を解決するために長い連鎖生成に依存している。
重要な課題は、いつモデルが推論を止めて最終回答を生み出すべきかを決定することです。
中間回答の信頼性のダイナミクスを利用して推論をいつ終了するかを判断する早期停止手法であるCoDE-Stopを提案する。
論文 参考訳(メタデータ) (2026-04-06T17:59:45Z) - How Do Latent Reasoning Methods Perform Under Weak and Strong Supervision? [45.11635323173876]
我々は、プロセスにおける潜伏表現の役割と振舞いをよりよく理解するために、潜伏推論手法の包括的な分析を行う。
潜在表現は複数の可能性をエンコードできるが、推論プロセスは構造化検索を忠実に実装していない。
より強い監督はショートカット行動を緩和するが、多種多様な仮説を維持するために潜伏表現の能力を制限する。
論文 参考訳(メタデータ) (2026-02-25T22:00:59Z) - Dynamics Within Latent Chain-of-Thought: An Empirical Study of Causal Structure [58.89643769707751]
表現空間における潜在連鎖を操作可能な因果過程として研究する。
遅延ステップの予算は、均質な余分な深さよりも、非局所的なルーティングを備えたステージ機能のように振る舞う。
これらの結果は、モード条件と安定性を意識した分析を、潜伏推論システムの解釈と改善のための信頼性の高いツールとして動機付けている。
論文 参考訳(メタデータ) (2026-02-09T15:25:12Z) - How Does Unfaithful Reasoning Emerge from Autoregressive Training? A Study of Synthetic Experiments [1.529342790344802]
大型言語モデル(LLM)が生成するチェーン・オブ・シント(CoT)推論は、しばしば不信である。
我々は、忠実なCoT推論を構成するもの、そして自己回帰訓練から不誠実が如何に現れるかを研究する。
トレーニングノイズが臨界しきい値以下である場合にのみ、モデルが基礎となる算術規則に因果的に従うという忠実な推論を学習できることが分かりました。
論文 参考訳(メタデータ) (2026-02-01T04:56:18Z) - Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking [11.763473690046721]
推論の拡張された視覚言語モデルは、より大きな能力と透明性を約束する明確な思考の連鎖を生成する。
モデルは、視覚的に不誠実な中間段階によって正しい答えに達するか、あるいは最終的な予測において、合理的に失敗する。
本稿では, 推論連鎖の知覚段階が画像中に存在するか否かに着目し, 推論鎖の視覚的忠実度を評価次元として紹介する。
論文 参考訳(メタデータ) (2025-12-13T07:04:42Z) - Emergence of Superposition: Unveiling the Training Dynamics of Chain of Continuous Thought [64.43689151961054]
有向グラフ到達性問題に対する簡易な2層変圧器のトレーニング力学を理論的に解析する。
分析の結果,連続的思考を用いたトレーニングでは,まずインデックスマッチングロジットが増加し,その後は軽度な仮定の下で拘束されることがわかった。
論文 参考訳(メタデータ) (2025-09-27T15:23:46Z) - A Survey on Latent Reasoning [100.54120559169735]
大きな言語モデル(LLM)は印象的な推論機能を示している。
中間ステップを言語化するCoT推論は、モデルの表現帯域幅を制限する。
潜在的推論は、モデルの連続的な隠れ状態に完全にマルチステップの推論を実行することで、このボトルネックに対処する。
論文 参考訳(メタデータ) (2025-07-08T17:29:07Z) - How do Transformers Learn Implicit Reasoning? [67.02072851088637]
制御されたシンボリック環境下でトランスフォーマーをスクラッチからトレーニングすることで、暗黙のマルチホップ推論がどのように現れるかを研究する。
原子三重項によるトレーニングは必要ではなく学習を加速し,第2ホップの一般化は特定の構成構造へのクエリレベル露出に依存する。
論文 参考訳(メタデータ) (2025-05-29T17:02:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。