論文の概要: SLPO: Scaling Latent Reasoning via a Surrogate Policy
- arxiv url: http://arxiv.org/abs/2607.19691v2
- Date: Mon, 27 Jul 2026 00:25:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 14:56:47.030915
- Title: SLPO: Scaling Latent Reasoning via a Surrogate Policy
- Title(参考訳): SLPO:サロゲートポリシによる遅延推論のスケーリング
- Authors: Runyang You, Zhiyuan Liu, Yongqi Li, Wenjie Li,
- Abstract要約: 検証可能な報酬を伴う強化学習は、明示的なChain-of-Thought推論においてテスト時間スケーリングを誘発する主要なレシピとなっている。
潜在推論は、中間計算を連続ベクトルとして持つ。
本稿では,自己回帰的潜伏的推論器に結果回帰RLをもたらすために,サロゲート潜伏政策最適化を導入する。
- 参考スコア(独自算出の注目度): 25.465651511203337
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning with verifiable rewards has become the predominant recipe for eliciting test-time scaling in explicit Chain-of-Thought reasoners. Yet this scaling path remains computationally costly, since every intermediate step must be decoded as a language token. Latent reasoning instead carries intermediate computation as continuous vectors and already matches or surpasses explicit CoT at far shorter horizons. Despite this promise, latent reasoners remain largely imitation-bound, while explicit CoT has already moved past imitation via outcome-reward RL. Latent trajectories lack a tractable per-step likelihood and an adaptive stopping interface under fixed thinking budgets, so outcome rewards cannot elicit latent test-time scaling. We introduce Surrogate Latent Policy Optimization (SLPO) to bring outcome-reward RL to autoregressive latent reasoners: an empirical surrogate policy density over latent transitions for trajectory-level credit assignment, and a correctness-supervised stopping head that outcome-reward optimization refines into a variable-horizon policy. Across continuous and soft thinking settings, SLPO improves Pass@$k$ under parallel sampling and allocates longer latent computation to harder instances with higher deterministic accuracy.
- Abstract(参考訳): 検証可能な報酬を伴う強化学習は、明示的なChain-of-Thought推論においてテスト時間スケーリングを誘発する主要なレシピとなっている。
しかし、このスケーリングパスは、すべての中間ステップを言語トークンとしてデコードする必要があるため、計算的にコストがかかるままである。
潜在推論は、中間計算を連続ベクトルとして持ち、より短い地平線で既に明示的なCoTと一致するか、あるいは超えている。
この約束にも拘わらず、潜伏する推論者は殆ど模倣に縛られるままであり、明示的なCoTはすでに結果回帰RLを介して模倣を過去のものにしている。
遅延軌道は、固定された思考予算の下で、牽引可能なステップ毎の確率と適応的な停止インターフェースを欠いているため、結果の報奨は遅延テストタイムスケーリングを引き出すことはできない。
本稿では,自己回帰的潜在的推論子に結果回帰RLをもたらすために,軌道レベルのクレジット代入に対する遅延遷移に対する実証的なサロゲートポリシ密度と,結果回帰最適化が可変ホリゾンポリシーに洗練される正当性制御停止ヘッドを導入する。
連続的およびソフトな思考設定全体で、SLPOは並列サンプリングの下でPass@$k$を改善し、決定論的精度の高いより複雑なインスタンスに遅延計算を割り当てる。
関連論文リスト
- Latent Thought Flow: Efficient Latent Reasoning in Large Language Models [23.52673819075993]
本稿では,可変長連続軌道をモデルとした潜在思考フロー(LTF)を提案する。
微調整と転写学習による実験では、LTFは明示的なCoTおよび潜在推論基準よりも優れており、精度は9.5%向上し、推論長は平均27.2%低下している。
論文 参考訳(メタデータ) (2026-06-15T05:02:46Z) - Demystifying Hidden-State Recurrence: Switchable Latent Reasoning with On-Policy Reinforcement Learning [38.056339518861506]
スイッチ可能な遅延推論フレームワークであるSWITCHを提案する。
The model emits swi> to enter latent mode and /swi> to exit。
SWITCHは、隠れ状態-再帰的推論手法よりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-06-11T09:33:40Z) - Selective Latent Thinking: Adaptive Compression of LLM Reasoning Chains [9.979461886634022]
CoT (Explicit chain-of- Thought) 推論は、大規模言語モデルの推論能力を大幅に向上させる。
既存の潜在的推論法は、推論を一様圧縮可能であるとして扱い、精度クリティカルな中間段階を過度に圧縮する。
SLT(Selective Latent Thinking)は、冗長な推論スパンを潜在表現に選択的に圧縮するフレームワークである。
論文 参考訳(メタデータ) (2026-05-25T11:57:09Z) - From $\boldsymbol{\logπ}$ to $\boldsymbolπ$: Taming Divergence in Soft Clipping via Bilateral Decoupled Decay of Probability Gradient Weight [6.07556923512707]
Reinforcement Learning with Verifiable Rewards (RLVR)は、Large Language Model (LLM)推論の飛躍を触媒しているが、その最適化のダイナミクスは脆弱である。
GRPOのような標準的なアルゴリズムはハードクリッピングを通じて安定性を強制する。
本稿では,重要サンプリング比に基づくデカップリング崩壊機構を用いたデカップリング・グラディエント・ポリシー・最適化(DGPO)を提案する。
論文 参考訳(メタデータ) (2026-03-15T14:00:48Z) - Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning [66.22060690012512]
大規模な推論モデルは、より多くのテストタイム計算で改善されるが、しばしば過大評価され、正確さを向上することなくコストを上昇させる必要のない長い連鎖を生み出す。
本研究は,本質的な貢献に基づいて,ステップ間の長さ短縮を割り当てる,きめ細かいフレームワークであるSWAPを提案する。
論文 参考訳(メタデータ) (2026-02-27T20:23:59Z) - Step Potential Advantage Estimation: Harnessing Intermediate Confidence and Correctness for Efficient Mathematical Reasoning [25.562101968892833]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデル(LLM)における長い連鎖推論を導く
既存のアプローチでは、トークンレベルのエントロピーやシーケンスレベルの長さ制御を通じてRLVRを改善するが、推論の進捗を意味的に基礎づけたステップレベルの尺度は欠如している。
本研究では,潜在的利得を増幅し,潜在的利得をペナルティ化し,飽和後のペナルティを適用してタイムリーな終了を促す,詳細な信用割当手法であるステップ電位アドバンテージ推定(SPAE)を提案する。
論文 参考訳(メタデータ) (2026-01-07T11:36:01Z) - Arbitrage: Efficient Reasoning via Advantage-Aware Speculation [71.45710345765528]
投機的復号化は、高速だが不正確なドラフトモデルを用いて推論を加速し、自動回帰的にトークンを提案する。
しかし、意味論的に等価なステップにおけるトークンミスマッチによる不要な拒絶のため、従来のトークンレベルの投機的デコーディングは、タスクの推論に苦労する。
提案するArbitrageは,ドラフトモデルとターゲットモデルとの相対的優位性に基づいて動的に生成をルーティングする,新しいステップレベルの投機生成フレームワークである。
論文 参考訳(メタデータ) (2025-12-04T17:50:53Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。