論文の概要: Answer-Distribution Trajectories: A Stochastic-Dynamics View of LLM Reasoning
- arxiv url: http://arxiv.org/abs/2609.09030v1
- Date: Tue, 08 Sep 2026 16:58:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.699707
- Title: Answer-Distribution Trajectories: A Stochastic-Dynamics View of LLM Reasoning
- Title(参考訳): Answer-Distribution Trajectories:Stochastic-Dynamics View of LLM Reasoning
- Authors: Mar Gonzàlez I Català, Haitz Sáez de Ocáriz Borde, Davide Murari, Carola-Bibiane Schönlieb, Pietro Liò, George Montañez,
- Abstract要約: チェーンオブ思考推論は、モデルの入力と最終的な答えの間の構造化された計算を提供する。
エントロピープロファイルは 推論過程を通じて 不確実性がどのように進化するかを 追跡するが 競合する仮説が その不確実性の原因を 明らかにしない
本稿では,モデルが解に対する完全な予測分布を,解の展開として追跡する表現である解分布トラジェクトリを導入する。
- 参考スコア(独自算出の注目度): 29.58875226713171
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Chain-of-thought reasoning provides a structured computation between a model's input and final answer. Yet it is often evaluated through endpoint accuracy, which ignores the path taken to reach that answer. An emerging line of work addresses this limitation using entropy profiles, which track how uncertainty evolves over the reasoning process but do not reveal which competing hypotheses account for that uncertainty. We introduce answer-distribution trajectories, a stochastic-dynamics-inspired representation that tracks the model's full predictive distribution over answers as reasoning unfolds. As a strictly finer representation than endpoint and entropy summaries, answer-distribution trajectories enable us to characterize a trace through a dynamical reasoning profile spanning exploration, revision, motion, and commitment, and to distinguish different dynamical mechanisms of reasoning success and failure. Across sixteen open-weight language models and four reasoning benchmarks, we show that traces with the same endpoint and similar entropy profiles can exhibit substantially different reasoning dynamics. We further find substantial variation in these dynamics both within and across models and tasks, with different objectives favoring different dynamical profiles. Additionally, we show that training and inference choices systematically reshape these profiles. Our results suggest that answer-distribution trajectories provide a rich framework for analysing and evaluating the dynamics of LLM reasoning.
- Abstract(参考訳): チェーンオブ思考推論は、モデルの入力と最終的な答えの間の構造化された計算を提供する。
しかし、エンドポイントの正確性によってしばしば評価されるため、その答えに到達するのに要するパスは無視される。
新たな研究のラインは、エントロピープロファイルを使用してこの制限に対処し、推論プロセスを通じて不確実性がどのように進化するかを追跡するが、どの仮説が不確実性を説明するのかは明らかにしない。
本稿では,確率力学に着想を得た表現である解分布トラジェクトリを導入し,解の完全な予測分布を解の展開として追跡する。
終端とエントロピーの要約よりも厳密な表現として、探索、修正、動き、コミットメントにまたがる動的推論プロファイルを通してトレースを特徴付けることができ、推論の成功と失敗の動的メカニズムを区別することができる。
16のオープンウェイト言語モデルと4つの推論ベンチマークにより、同じエンドポイントと類似のエントロピープロファイルを持つトレースは、かなり異なる推論ダイナミクスを示すことを示す。
さらに、モデルとタスクの内外を問わず、これらのダイナミクスにかなりの変化が見られ、異なる目的が異なる動的プロファイルを好んでいる。
さらに、トレーニングと推論の選択がこれらのプロファイルを体系的に再構築することを示す。
以上の結果から,LLM推論の力学を解析・評価するためのリッチなフレームワークが提案されている。
関連論文リスト
- Learning Structured Reasoning via Tractable Trajectory Control [99.75278337895024]
Ctrl-Rは、トラクタブルな軌道制御を通じて構造化推論を学ぶためのフレームワークである。
Ctrl-Rは,従来達成できなかった推論パターンを効果的に探索し,内部化することができることを示す。
論文 参考訳(メタデータ) (2026-03-02T09:18:19Z) - Dynamics Within Latent Chain-of-Thought: An Empirical Study of Causal Structure [58.89643769707751]
表現空間における潜在連鎖を操作可能な因果過程として研究する。
遅延ステップの予算は、均質な余分な深さよりも、非局所的なルーティングを備えたステージ機能のように振る舞う。
これらの結果は、モード条件と安定性を意識した分析を、潜伏推論システムの解釈と改善のための信頼性の高いツールとして動機付けている。
論文 参考訳(メタデータ) (2026-02-09T15:25:12Z) - Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts [74.47786985522762]
テキスト慣性(textual inertia)と呼ばれる重要な障害モードを特定し、矛盾する視覚的証拠を無視しながら、モデルは間違ったテキストに盲目的に固執する傾向がある。
本稿では,多種多様なLMMの推論連鎖に摂動を構造的に注入するLogicGraph摂動プロトコルを提案する。
その結果,10%未満の症例で自己修正が成功し,主に視覚的テキスト誤りの伝播に寄与することが判明した。
論文 参考訳(メタデータ) (2026-01-07T16:39:34Z) - Variational Reasoning for Language Models [93.08197299751197]
本稿では,思考トレースを潜在変数として扱う言語モデルのための変分推論フレームワークを提案する。
GRPOを含むリジェクションサンプリングとバイナリリワードRLは局所的なフォワードKLの目的と解釈できることを示す。
論文 参考訳(メタデータ) (2025-09-26T17:58:10Z) - Mechanistic Unveiling of Transformer Circuits: Self-Influence as a Key to Model Reasoning [9.795934690403374]
このような課題を解決するために言語モデルでどのような多段階推論機構が使われているのかはいまだ不明である。
回路解析と自己影響関数を用いて、推論過程を通して各トークンの変動の重要性を評価する。
提案手法は,モデルが使用する人間の解釈可能な推論過程を明らかにする。
論文 参考訳(メタデータ) (2025-02-13T07:19:05Z) - On the Reasoning Capacity of AI Models and How to Quantify It [0.0]
大規模言語モデル(LLM)は、その推論能力の基本的な性質に関する議論を激化させている。
GPQAやMMLUのようなベンチマークで高い性能を達成する一方で、これらのモデルはより複雑な推論タスクにおいて制限を示す。
本稿では,モデル行動のメカニズムを解明するために,従来の精度指標を超える新しい現象論的手法を提案する。
論文 参考訳(メタデータ) (2025-01-23T16:58:18Z) - Identifiable Representation and Model Learning for Latent Dynamic Systems [0.0]
本稿では,潜在力学系における表現とモデル学習の問題について検討する。
線形およびアフィン非線形潜時力学系にスパース入力行列を持つ場合、潜時変数をスケーリングまで同定できることを証明した。
論文 参考訳(メタデータ) (2024-10-23T13:55:42Z) - Geometric Analysis of Reasoning Trajectories: A Phase Space Approach to Understanding Valid and Invalid Multi-Hop Reasoning in LLMs [0.0]
本稿では,ハミルトン力学による言語モデルにおけるマルチホップ推論の新たな解析手法を提案する。
我々は、埋め込み空間における推論連鎖をハミルトン系に写像し、問題関連性(ポテンシャルエネルギー)に対する推論進行(運動エネルギー)のバランスをとる関数を定義する。
論文 参考訳(メタデータ) (2024-10-06T09:09:14Z) - Understanding Reasoning Ability of Language Models From the Perspective of Reasoning Paths Aggregation [110.71955853831707]
我々は、LMを、事前学習時に見られる間接的推論経路を集約することで、新たな結論を導出すると考えている。
我々は、推論経路を知識/推論グラフ上のランダムウォークパスとして定式化する。
複数のKGおよびCoTデータセットの実験と分析により、ランダムウォークパスに対するトレーニングの効果が明らかにされた。
論文 参考訳(メタデータ) (2024-02-05T18:25:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。