論文の概要: Latent Recurrent Thoughts: Recurrent Refinement of Proposed Latents for Reasoning with Frozen LLMs
- arxiv url: http://arxiv.org/abs/2609.01117v1
- Date: Tue, 01 Sep 2026 11:56:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.613044
- Title: Latent Recurrent Thoughts: Recurrent Refinement of Proposed Latents for Reasoning with Frozen LLMs
- Title(参考訳): 遅発性再帰的思考:凍結LDMによる推論のための提案された潜伏剤の反復的再分別
- Authors: Zhaoliang Chen, Jie Fu,
- Abstract要約: チェーン・オブ・シント推論は離散トークン空間で展開される。
代わりにモデルの連続表現空間で推論する。
これを遅延リカレント思考とみなす。
- 参考スコア(独自算出の注目度): 16.72007494160683
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Chain-of-thought reasoning unfolds in discrete token space: each step is committed as text, errors propagate, and eliciting good traces presupposes traces to imitate. Reasoning instead in a model's continuous representation space - where intermediate states are vectors rather than words - sidesteps these constraints, but leaves open how those latent states should be computed. We approach this along two axes. First, we keep a large language model (LLM) frozen and use it for what it is already good at - modeling and decoding sequences - while a small auxiliary network supplies continuous latent thoughts as input. Second, we produce those latents by recurrence: a tiny recurrent reasoner refines them over many steps, decoupling the depth of computation from the size of the model, so that the latents are a product of iterative processing rather than a single forward pass. We instantiate this as Latent Recurrent Thoughts (LRT): a task-dedicated proposer supplies base latents, a recurrent reasoner refines them through bounded residual corrections, and the frozen LLM decodes the answer. On symbolic reasoning with answer supervision but no reasoning traces (Countdown-4, Sudoku) and on natural-language reasoning (HumanEval, MBPP, StrategyQA), LRT substantially outperforms prior frozen-decoder continuous-space reasoning methods under an identical decoder, prompt, data, and training budget, and outperforms non-thinking-mode chain-of-thought prompting on the same backbone at a small fraction of its inference compute.
- Abstract(参考訳): 各ステップはテキストとしてコミットされ、エラーは伝播し、良いトレースを引き出す。
その代わりに、モデルの連続表現空間において、中間状態が単語ではなくベクトルであるような推論は、これらの制約を傍受するが、それらの潜在状態がどのように計算されるべきかは明らかにしない。
私たちはこれを2つの軸に沿って近づきます。
まず、大きな言語モデル(LLM)を凍結させ、それがすでに得意としている – シーケンスのモデリングと復号化 – に使用します。
第二に、これらの潜伏剤を繰り返し生成する: 小さな再帰的推論器は、モデルのサイズから計算の深さを分離し、その潜伏剤が単一の前方通過ではなく反復処理の産物となるように、多くのステップでそれらを洗練する。
我々はこれをLRT(Latent Recurrent Thoughts)とインスタンス化し、タスク指定された提案者がベースラテントを供給し、リカレント推論器が有界残差補正によってそれらを洗練し、凍結したLCMが解を復号する。
答えの監督を伴うシンボリック推論では、推論トレース(Countdown-4, Sudoku)や自然言語推論(HumanEval, MBPP, StrategyQA)では、LRTは、同じデコーダ、プロンプト、データ、トレーニング予算の下で、以前のフリーズデコーダの連続空間推論手法を大幅に上回り、推論計算のごく一部で同じバックボーン上で、非思考モードのチェーン・オブ・シークレットを上回ります。
関連論文リスト
- Think Deep, Speak Once: Relit, A Recursive Latent Implicit Transformer Framework [2.007262412327553]
本稿では,暗黙的推論を深く,意味的に基礎づけたハイブリッドフレームワークReLITを紹介する。
ReLITはパラメータ幅ではなく、繰り返しの深さで効率的にスケール可能であることを示す。
これらの結果から,パラメータ幅ではなく再帰的な深さで推論能力を効率的に拡張できることが示唆された。
論文 参考訳(メタデータ) (2026-08-08T12:50:51Z) - Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression [42.15219720606396]
大規模言語モデルは、明示的な連鎖と強化学習を通じて高い推論性能を達成する。
潜在推論は、計算を潜在空間にシフトすることで、このコストを削減する。
連続潜時状態を明示的な離散トークンに変換する最初の方法である textbfDiscrete Latent Reasoning (DLR) を提案する。
論文 参考訳(メタデータ) (2026-06-29T02:34:52Z) - Latent Thought Flow: Efficient Latent Reasoning in Large Language Models [23.52673819075993]
本稿では,可変長連続軌道をモデルとした潜在思考フロー(LTF)を提案する。
微調整と転写学習による実験では、LTFは明示的なCoTおよび潜在推論基準よりも優れており、精度は9.5%向上し、推論長は平均27.2%低下している。
論文 参考訳(メタデータ) (2026-06-15T05:02:46Z) - SPOT: Span-level Pause-of-Thought for Efficient and Interpretable Latent Reasoning in Large Language Models [15.95627037350657]
CoT (Explicit Chain-of-Thought) 計算はトークンレベルのトレースを内部化することによって高い推論コストを発生させる。
固定応答テンプレートを強制せずに、明示的なCoTをコンパクトなポーズトークンに圧縮するフレキシブルなフレームワークであるSPOTを提案する。
推論ベンチマークの実験では、SPOTは生成したトークンを37.5%削減しながら、平均2.3ポイントの精度を向上している。
論文 参考訳(メタデータ) (2026-03-06T12:34:27Z) - Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching [66.39914384073145]
本稿では,安価な拡散サンプリング推論をステップレベル候補の再利用プールに変換する自己整合性フレームワークを提案する。
ステップレベルの再結合は、難しい問題に対して最も有益であることがわかった。
トレーニング不要のフレームワークは、6つの数学およびコーディングタスクの平均精度を最大2倍改善します。
論文 参考訳(メタデータ) (2026-02-26T11:08:39Z) - ReGuLaR: Variational Latent Reasoning Guided by Rendered Chain-of-Thought [49.203970812338916]
明示的な推論連鎖は、かなりの計算冗長性をもたらす。
近年の潜時推論法は、推理過程を潜時空間に圧縮することによりこれを緩和しようとする。
我々はRendered CoT-Guided Variational Latent Reasoning (ReGuLaR)を提案する。
論文 参考訳(メタデータ) (2026-01-30T17:08:06Z) - Latent Chain-of-Thought as Planning: Decoupling Reasoning from Verbalization [9.193078163792427]
CoT(Chain-of-Thought)は、大規模言語モデル(LLM)に複雑な問題に取り組む権限を与える。
最近の潜伏推論手法は、連続した隠蔽状態内で推論を行うことによって効率を最適化しようとする。
PLaTは、潜在推論を言語化から根本的に切り離すことによって計画として再構成するフレームワークである。
論文 参考訳(メタデータ) (2026-01-29T07:38:18Z) - Latent Reasoning in LLMs as a Vocabulary-Space Superposition [80.01651003144282]
大規模言語モデル(LLM)は、チェーン・オブ・シークレット・プロンプトによる強力な推論能力を示すが、明示的な推論は計算上のオーバーヘッドを大幅に引き起こす。
遅延推論に関する最近の研究は、明示的な監督なしに遅延空間を推論することでコストを削減するが、性能は著しく低下する。
この問題に対処するため、LLM語彙の列空間に潜伏空間を制限し、潜伏推論を語彙確率の重ね合わせとして扱う。
後続の推論が終わると、それは最終的な答えを得るために明確な推論の固有状態に崩壊する。
Latent-SFTはGSM8kに新しい状態を設定し、明示的に一致する
論文 参考訳(メタデータ) (2025-10-17T10:51:20Z) - Stop Spinning Wheels: Mitigating LLM Overthinking via Mining Patterns for Early Reasoning Exit [114.83867400179354]
オーバーライドは、大きな言語モデル全体のパフォーマンスを低下させる可能性がある。
推論は, 探索段階の不足, 補償推論段階, 推論収束段階の3段階に分類される。
我々は,ルールに基づく軽量なしきい値設定戦略を開発し,推論精度を向上させる。
論文 参考訳(メタデータ) (2025-08-25T03:17:17Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。