論文の概要: It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches
- arxiv url: http://arxiv.org/abs/2607.16205v1
- Date: Thu, 07 May 2026 13:16:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.031054
- Title: It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches
- Title(参考訳): 8トン必要。補助支店経由のオフ・ポリティクスRLの弱弱化
- Abstract要約: 検証可能な報酬を伴う強化学習は、大規模言語モデルにおける推論を強化するための標準的なアプローチとして現れている。
本稿では、この制限を、より弱いが計算効率のよい補助モデルによって、ポリシーの探索が通知される、弱いから強い学習パラダイムによって克服することを提案する。
W2SPOは、短い補助セグメントを8個のトークンで中間ターゲットモデル軌道に注入し、ターゲットモデルがこれらの分岐状態から推論パスを完了させる、オフポリシーRL法である。
- 参考スコア(独自算出の注目度): 8.39540138414135
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with verifiable rewards has emerged as a standard approach for enhancing reasoning in large language models, which typically optimizes the policy by contrasting multiple self generated rollouts. However, we identify a critical support limited bottleneck in this paradigm: on challenging reasoning tasks, the target model's samples often exhibit semantic redundancy, converging into the same erroneous "reasoning basins" that offer negligible reward contrast for policy updates. In this paper, we propose to overcome this limitation through a weak to strong learning paradigm, where a policy's exploration is informed by a weaker but computationally efficient auxiliary model. We introduce W2SPO, an off policy RL method that injects short auxiliary segments often as brief as 8 tokens into intermediate target model trajectories and the target model then completes the reasoning path from these diverted states. Policy updates are restricted to these short inserted segments based on final verifiable rewards. Empirically, W2SPO achieves superior performance among evaluated 4B scale models on mathematical reasoning benchmarks, outperforming evaluated post trained baselines. Compared with vanilla GRPO under the same sampling budget, W2SPO improves Pass@1 from 62.3% to 64.2% while achieving a 3.55 times training speedup. These results suggest that weak auxiliary branches can induce stronger target reasoning policies by expanding local exploration support.
- Abstract(参考訳): 検証可能な報酬を伴う強化学習は、大規模言語モデルにおける推論を強化するための標準的なアプローチとして現れ、通常は複数の自己生成ロールアウトを対比してポリシーを最適化する。
しかし、このパラダイムにおける重要なサポートは限定的なボトルネックである:挑戦的推論タスクでは、ターゲットモデルのサンプルは、しばしば意味的な冗長性を示し、ポリシー更新に対して無視可能な報酬コントラストを提供する、同じ誤った「推論盆地」に収束する。
本稿では、この制限を、より弱いが計算効率のよい補助モデルによって、ポリシーの探索が通知される弱い、強い学習パラダイムによって克服することを提案する。
W2SPOは、短い補助セグメントを8個のトークンで中間ターゲットモデル軌道に注入し、ターゲットモデルがこれらの分岐状態から推論パスを完了させる、オフポリシーRL法である。
ポリシー更新は、最終的な検証可能な報酬に基づいて、これらの短い挿入セグメントに制限される。
W2SPOは、数学的推論ベンチマークにおいて評価された4Bスケールモデルよりも優れた性能を達成し、評価されたトレーニング後のベースラインよりも優れていた。
同じサンプリング予算でバニラGRPOと比較すると、W2SPOはPass@1を62.3%から64.2%に改善し、訓練速度は3.55倍に向上した。
これらの結果から, 弱補助枝は, 局所探査支援を拡大することにより, より強力な目標推理政策を導出できる可能性が示唆された。
関連論文リスト
- VeriGate: Verifier-Gated Step-Level Supervision for GRPO [51.26100506256885]
グループ相対政策最適化は、検証者に基づく結果報酬を伴う推論モデルをトレーニングするための効果的なレシピである。
GRPO の検証子付き拡張である VeriGate を提案し,これらの制限を3つの設計選択で解決する。
We show that VeriGate improves average accuracy around 20% and 12% for 1.5B and 7B models respectively。
論文 参考訳(メタデータ) (2026-05-28T18:20:32Z) - GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning [48.32628338889922]
グループ相対政策最適化は中間段階の無差別な信用割当に苦しむ。
モデルフリーで検証可能なプロセス監視を,モデルが正しい回答を信じているかどうかを判断することによって導入する。
このアプローチにより、よりターゲット的でサンプル効率の良いポリシー更新が可能になる。
論文 参考訳(メタデータ) (2026-04-22T15:08:58Z) - Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities [10.235183326885794]
RLVR(Reinforcement Learning with Verifiable Rewards)は、Large Language Models(LLMs)における推論の強化に欠かせないパラダイムとして登場した。
我々は、この問題をサンプリング確率力学の観点から分析し、標準目的が高次様相の経路を不均等に強化することを特定する。
提案手法は,すべての応答に対する信頼度を平衡化するための新しいアドバンテージ再重み付け機構 (ARM) を提案する。
論文 参考訳(メタデータ) (2026-02-05T04:06:55Z) - IIB-LPO: Latent Policy Optimization via Iterative Information Bottleneck [20.113524065146674]
イテレーティブ・インフォメーション・ボトルネック(IIB-LPO)は、トークンの統計的摂動から推論軌道のトポロジカル分岐へと探索を移す新しいアプローチである。
IIB-LPOは最先端のパフォーマンスを達成し、従来の手法を最大5.3%の精度と7.4%の多様性で上回っている。
論文 参考訳(メタデータ) (2026-01-09T15:46:40Z) - From Harm to Help: Turning Reasoning In-Context Demos into Assets for Reasoning LMs [58.02809208460186]
デモとしてDeepSeek-R1の高品質なトレースを使って、このパラドックスを再検討する。
デモが最適であっても、より多くの例を加えることで、常に精度が低下することがわかった。
デモを明示的で再利用可能な洞察に変換するシーケンシャルなテストタイム手順であるInsight-to-solve(I2S)を紹介します。
論文 参考訳(メタデータ) (2025-09-27T08:59:31Z) - GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning [53.894789613838654]
我々は、複雑な実世界のビデオにバランスの取れた知覚と推論を必要とするベンチマークであるSEED-Bench-R1を紹介する。
SEED-Bench-R1を用いて、標準GRPOは解の精度を向上する一方で、推論ステップと解の論理的コヒーレンスを57.9%の一貫性で減少させる。
応答の正しさと推論コヒーレンスの両方を明示的な監督なしに最適化する整合性を考慮したRLフレームワークGRPO-CAREを提案する。
論文 参考訳(メタデータ) (2025-06-19T08:49:13Z) - DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization [50.91849555841057]
グループ相対政策最適化は大規模推論モデル(LRM)の強化学習手法である
差別学習の原則を基礎として, LRMの強化のための新たな差別的制約付き最適化フレームワークを導入する。
DisCO は GRPO と DAPO などの改良型を著しく上回り、GRPO の7%、DAPO の6% を平均的に上回っている。
論文 参考訳(メタデータ) (2025-05-18T11:08:32Z) - S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models [2.9925837108958864]
テスト時間スケーリングは、大規模な言語モデルコミュニティに活発な研究対象として現れます。
最近の研究では、推論モデル(Qwen3でさえも過度の思考冗長性を示すことが示されている。
本稿では,新たな強化学習パラダイムであるS-GRPO(Serial-Group Decaying-Reward Policy Optimization)を紹介する。
論文 参考訳(メタデータ) (2025-05-12T15:50:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。