論文の概要: Latent Thought Credit: Multi-Answer Credit Assignment for Latent Reasoning
- arxiv url: http://arxiv.org/abs/2608.01593v1
- Date: Mon, 03 Aug 2026 01:57:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.296081
- Title: Latent Thought Credit: Multi-Answer Credit Assignment for Latent Reasoning
- Title(参考訳): レイトレント・シンクレット:複数回答のクレディ・アサインメント、レイトレント・レアソン
- Abstract要約: 潜在的推論のための階層的信用割り当てフレームワークである textbfLatent Thought Credit (LTC) を提案する。
各プロンプトに対して、LCCは複数の潜在的思考をサンプリングし、各思考の後にコンテキストを修正し、複数の回答に対する報酬を平均化することによって、思考レベルの期待報酬を見積もる。
GRPO方式のオンライン学習フレームワークでLCCをインスタンス化し、数学的推論やSTEM多重選択タスクで評価する。
- 参考スコア(独自算出の注目度): 22.12796885434858
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Latent reasoning allows language models to carry out intermediate reasoning in continuous latent representations rather than fully externalizing it as discrete chains of thought. However, assigning credit to such latent thoughts from answer-only rewards is difficult: a single final answer mixes thought quality with answer-sampling noise. We propose \textbf{Latent Thought Credit (LTC)}, a hierarchical credit-assignment framework for latent reasoning. For each prompt, LTC samples multiple latent thoughts, fixes the context after each thought, and estimates thought-level expected reward by averaging rewards over multiple answers generated from that fixed context. LTC uses thought-level advantages to optimize the latent-thought phase, answer-level advantages to optimize the answer phase, and an advantage-weighted thought-matching objective that helps the policy reproduce high-credit latent thoughts. We instantiate LTC in a GRPO-style on-policy training framework and evaluate it across mathematical reasoning and STEM multiple-choice tasks. LTC achieves the best average accuracy among the compared methods, while ablations and fixed-context diagnostics show that multi-answer estimation reduces reward-estimation error and mitigates ambiguous or incorrect thought-level credit.
- Abstract(参考訳): 潜在推論は、言語モデルを思考の離散的な連鎖として完全に外部化するのではなく、連続的な潜在表現において中間的推論を実行することを可能にする。
しかし、答えのみの報酬から、そのような潜伏した考えに信用を割り当てることは困難である: 最終的な答えは、思考品質と回答サンプリングノイズを混合する。
本稿では,潜在的推論のための階層的信用割り当てフレームワークである,‘textbf{Latent Thought Credit(LTC)’を提案する。
それぞれのプロンプトに対して、LCCは複数の潜在思考をサンプリングし、各思考の後にコンテキストを修正し、その固定された文脈から生成された複数の回答に対する報酬を平均化することによって、思考レベルの期待報酬を見積もる。
LTCは、潜在思考フェーズを最適化するための思考レベル優位性、回答フェーズを最適化するための回答レベル優位性、そして、政策が高次潜在思考を再現するのに役立つ有利な思考マッチング目標を使用する。
GRPO方式のオンライン学習フレームワークでLCCをインスタンス化し、数学的推論やSTEM多重選択タスクで評価する。
LTCは比較手法の中で最良平均精度を達成し,マルチアンサー推定は報酬推定誤差を低減し,不明瞭あるいは誤った思考レベル信用を緩和することを示した。
関連論文リスト
- WhisperRec: Latent Reasoning for Efficient Foundation Recommendation Models [51.88075626243057]
基礎推薦モデル(FRM)のための効率的な潜在推論フレームワークであるWhisperRecを提案する。
WhisperRecは教師生成のChain-of-Thought(CoT)を学習可能な潜在推論トークンに圧縮する。
WhisperRecは明示的なCoT法と従来のベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-07-29T08:48:35Z) - Latent Thought Flow: Efficient Latent Reasoning in Large Language Models [23.52673819075993]
本稿では,可変長連続軌道をモデルとした潜在思考フロー(LTF)を提案する。
微調整と転写学習による実験では、LTFは明示的なCoTおよび潜在推論基準よりも優れており、精度は9.5%向上し、推論長は平均27.2%低下している。
論文 参考訳(メタデータ) (2026-06-15T05:02:46Z) - SPOT: Span-level Pause-of-Thought for Efficient and Interpretable Latent Reasoning in Large Language Models [15.95627037350657]
CoT (Explicit Chain-of-Thought) 計算はトークンレベルのトレースを内部化することによって高い推論コストを発生させる。
固定応答テンプレートを強制せずに、明示的なCoTをコンパクトなポーズトークンに圧縮するフレキシブルなフレームワークであるSPOTを提案する。
推論ベンチマークの実験では、SPOTは生成したトークンを37.5%削減しながら、平均2.3ポイントの精度を向上している。
論文 参考訳(メタデータ) (2026-03-06T12:34:27Z) - Balancing Faithfulness and Performance in Reasoning via Multi-Listener Soft Execution [79.98699884805636]
Reasoning Execution by Multiple Listeners (REMUL) は多人数の強化学習手法である。
REMULは、推論が他の当事者に従えるかがより忠実になるという仮説に基づいている。
スピーカーは、リスナーにとって明らかな推論を生み出すことで報われます。
論文 参考訳(メタデータ) (2026-02-18T02:55:55Z) - Towards Generalizable Reasoning: Group Causal Counterfactual Policy Optimization for LLM Reasoning [50.352417879912515]
大規模言語モデル(LLM)は推論能力の進歩とともに複雑なタスクに優れる。
一般化可能な推論パターンを学習するために,LLMを明示的に訓練するためのグループ因果政策最適化を提案する。
次に、この報酬からトークンレベルのアドバンテージを構築し、ポリシーを最適化し、LCMにプロセス無効で事実上堅牢な推論パターンを推奨します。
論文 参考訳(メタデータ) (2026-02-06T08:03:11Z) - In-Token Rationality Optimization: Towards Accurate and Concise LLM Reasoning via Self-Feedback [38.915062716409686]
InTROはトークンレベルの探索と,正確かつ簡潔な推論のための自己フィードバックを可能にする,新たなフレームワークである。
InTROは他のベースラインを一貫して上回り、ベースモデルと比較して解の精度を最大20%向上させる。
その思考の連鎖は明らかに簡潔であり、冗長性が低下している。
論文 参考訳(メタデータ) (2025-11-13T01:47:06Z) - Latent Chain-of-Thought for Visual Reasoning [53.541579327424046]
大型視覚言語モデル(LVLM)の解釈可能性および信頼性向上には,チェーン・オブ・シント(CoT)推論が不可欠である
我々は,LVLMにおける推論を後部推論として再構成し,償却変分推論に基づくスケーラブルなトレーニングアルゴリズムを提案する。
提案手法は,7つの推論ベンチマークにおいて,最先端のLVLMを強化することを実証的に実証する。
論文 参考訳(メタデータ) (2025-10-27T23:10:06Z) - Thinking on the Fly: Test-Time Reasoning Enhancement via Latent Thought Policy Optimization [5.674809920704963]
Latent Thought Policy Optimizationは、LLM推論を完全にテスト時に強化する。
実験により、LTPOは標準タスクの強いベースラインに適合または超えるだけでなく、他のタスクが失敗する際、顕著な堅牢性を示すことが示された。
とりわけ、既存の遅延推論ベースラインがほぼゼロに近い精度に崩壊する非常に難しいAIMEベンチマークでは、LTPOが大幅に改善されている。
論文 参考訳(メタデータ) (2025-10-05T12:50:39Z) - Stop Spinning Wheels: Mitigating LLM Overthinking via Mining Patterns for Early Reasoning Exit [114.83867400179354]
オーバーライドは、大きな言語モデル全体のパフォーマンスを低下させる可能性がある。
推論は, 探索段階の不足, 補償推論段階, 推論収束段階の3段階に分類される。
我々は,ルールに基づく軽量なしきい値設定戦略を開発し,推論精度を向上させる。
論文 参考訳(メタデータ) (2025-08-25T03:17:17Z) - PixelThink: Towards Efficient Chain-of-Pixel Reasoning [70.32510083790069]
PixelThinkは、外部から推定されるタスクの難しさと内部で測定されたモデルの不確実性を統合する、シンプルで効果的なスキームである。
シーンの複雑さと予測信頼度に応じて推論の長さを圧縮することを学ぶ。
実験により,提案手法は推論効率と全体セグメンテーション性能の両方を改善した。
論文 参考訳(メタデータ) (2025-05-29T17:55:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。