論文の概要: Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.22002v1
- Date: Fri, 24 Jul 2026 06:04:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.056237
- Title: Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning
- Title(参考訳): 推論としての学習: 効率的な強化学習のための段階的なロールアウトアロケーション
- Abstract要約: 可変ガイドオンラインロールアウトアロケーション(VIGOR)
可変ガイドオンラインロールアウトアロケーション(VIGOR)
可変ガイドオンラインロールアウトアロケーション(VIGOR)
- 参考スコア(独自算出の注目度): 23.987185167160117
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) has emerged as a highly effective framework for improving LLM reasoning, with methods such as GRPO among its most successful instantiations. However, GRPO relies on repeated generation of long chain-of-thought rollouts. Training time scales with the number of rollouts, a large fraction of which are uninformative. Thus, GRPO is computationally expensive and unstable. To mitigate this, existing approaches either generate a larger pool of rollouts and filter the most informative prompts, or leverage historical signals for filtering at later stages of training. These strategies offer modest performance gains, but slow down the overall process. To address this, we propose VarIance Guided Online Rollout allocation (VIGOR) which instead of allocating a fixed rollout budget per example, begins with a small number of rollouts for all examples in a batch and iteratively allocates additional rollouts to those with the highest group reward variance until a fixed total rollout budget is reached. Theoretically, we show that under RLVR, reward variance controls the gradient magnitude, and derive VIGOR's closed-form speedup ratio over GRPO, which grows with refinement rounds under Pareto-distributed reward variance. Experiments on mathematical reasoning and coding tasks show that VIGOR reaches target accuracy with up to 2.3$\times$ fewer rollouts on math, reaches GRPO's final coding full pass rate with 1.49$\times$ fewer rollouts, and improves the coding average test pass rate by 3.4 points.
- Abstract(参考訳): 検証可能な報酬付き強化学習(RLVR)は、GRPOなどの手法を最も成功したインスタンス化として、LLM推論を改善するための非常に効果的なフレームワークとして登場した。
しかし、GRPOは長いチェーン・オブ・シークレット・ロールアウトの繰り返し発生に依存している。
トレーニング時間はロールアウトの数とともにスケールします。
したがって、GRPOは計算コストが高く不安定である。
これを軽減するために、既存のアプローチでは、ロールアウトの大きなプールを生成し、最も情報性の高いプロンプトをフィルタリングするか、トレーニングの後期の段階で履歴信号を利用してフィルタリングする。
これらの戦略は、控えめなパフォーマンス向上を提供するが、全体のプロセスは遅くなる。
これを解決するために、VarIance Guided Online Rollout allocation(VIGOR)を提案する。これは、例えば、固定されたロールアウト予算を割り当てる代わりに、バッチ内のすべてのサンプルに対して少数のロールアウトから始まり、固定された総ロールアウト予算に到達するまで、最大グループ報酬の分散を反復的に追加的なロールアウトを割り当てる。
理論的には、RLVR下では報酬分散が勾配の程度を制御し、パレート分布の報酬分散の下で改良ラウンドで成長するGRPOよりもVIGORの閉形式スピードアップ比を導出する。
数学的推論とコーディングタスクの実験では、VIGORが目標精度に到達し、最大2.3$\times$数学のロールアウトを減らし、GRPOの最終コーディング完全パスレートを1.49$\times$より減らし、コーディング平均テストパスレートを3.4ポイント改善した。
関連論文リスト
- When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO [25.979415525596007]
検証可能な報酬(RLVR)を用いた強化学習
我々は、この挙動を多重性による構造レベルの信用集中として定式化する。
Cue-GRPOは補助モデル推論でこのルールをインスタンス化する。
論文 参考訳(メタデータ) (2026-08-04T11:02:26Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Cross-Epoch Adaptive Rollout Optimization for RL Post-Training [5.459625245330074]
LLMポストトレーニングは、しばしばプロンプト毎に複数のロールアウトをサンプリングする強化学習手法に依存している。
既存のほとんどのアプローチでは、トレーニング信号に大きな違いがあるにも関わらず、すべてのプロンプトに対して固定的なロールアウト予算を使用している。
我々は、固定されたグローバル予算の下でのアダプティブ・ロールアウト・アロケーションについて検討し、即時還元リターンを伴うオンラインリソースアロケーションとして問題を定式化する。
論文 参考訳(メタデータ) (2026-06-04T02:27:51Z) - Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training [34.81218483901967]
強化学習は、大規模言語モデルの訓練後において支配的なパラダイムである。
グループベースのポリシー最適化手法は、プロンプト毎に複数のロールアウトから利点を計算する。
Pilot-Commitは、グループベースのRLポストトレーニングのための、予算対応のロールアウトアロケーションフレームワークである。
論文 参考訳(メタデータ) (2026-05-26T06:41:13Z) - Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning [53.42577591449649]
グループ協力政策最適化は、トレーニングパラダイムをロールアウト競争からチーム協力へとシフトさせる。
GCPOは独立したロールアウトスコアをチームレベルのクレジット割り当てに置き換える。
チームへの平均的な限界貢献に従って、各ロールアウトに対して、グループチームの報酬を再分配する。
論文 参考訳(メタデータ) (2026-05-12T03:20:24Z) - Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization [60.87651283510059]
Group Relative Policy Optimization (GRPO) はLLM推論を効果的にスケールするが、計算コストは禁じている。
本研究では,非バイアス勾配推定を保ちながら動的プルーニングを可能にする動的プルーニングポリシー最適化(DPPO)を提案する。
刈り込みによって引き起こされるデータの空間性を軽減するため,ウィンドウベースの欲求戦略であるDense Prompt Packingを導入する。
論文 参考訳(メタデータ) (2026-03-04T14:48:53Z) - WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning [67.45237332694025]
グループ相対政策最適化は、複雑な推論に基づいて言語モデルを訓練するのに効果的である。
Weakly Supervised GRPOを提案し、端末報酬を正当性を考慮したガイダンスに変換することにより、ロールアウト効率を向上させる。
論文 参考訳(メタデータ) (2026-02-19T02:43:35Z) - Jackpot: Optimal Budgeted Rejection Sampling for Extreme Actor-Policy Mismatch Reinforcement Learning [31.843129392507716]
Jackpotは、ポリシーとロールアウトモデルを共同で更新する統合トレーニング目標を統合するフレームワークである。
我々の理論的分析は、OBRSが制御可能な受理予算の下で、目標分布に近いロールアウト分布を一貫して移動していることを示している。
論文 参考訳(メタデータ) (2026-02-05T18:57:01Z) - Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards [26.5011687714416]
既存のグループベースのポリシー最適化手法は、すべてのトレーニングプロンプトに対して一定数のロールアウトを割り当てる。
この均一な割り当ては全てのプロンプトを等しく情報的扱いし、非効率的な計算予算の使用と訓練の進捗を妨げる可能性がある。
本稿では、既存のバッチのプロンプトに所定のロールアウト予算を割り当て、ポリシー更新のグラデーションのばらつきを最小限に抑える可変インフォームド予測割当戦略であるVIPを紹介する。
論文 参考訳(メタデータ) (2026-02-02T03:50:01Z) - FlowRL: Matching Reward Distributions for LLM Reasoning [69.88820066093798]
大規模言語モデル(LLM)強化学習(RL)において、報酬を最大化する代わりに、フローバランシングによる全報酬分布をマッチングするフローRLを提案する。
我々はスカラー報酬を学習可能な分割関数を用いて正規化対象分布に変換し、その後、ポリシーと対象分布との逆KL分散を最小化する。
論文 参考訳(メタデータ) (2025-09-18T17:56:36Z) - BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models [57.304411396229035]
BranchGRPOは、ロールアウトプロセスを分岐木に再構成する手法である。
HPDv2.1イメージアライメントでは、BranchGRPOはDanceGRPOよりも最大でtextbf16%のアライメントスコアを改善する。
ハイブリッド版であるBranchGRPO-MixはDanceGRPOよりも4.7倍の速度でトレーニングを加速する。
論文 参考訳(メタデータ) (2025-09-07T12:53:06Z) - Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning [55.15106182268834]
検証可能な報奨付き強化学習(RLVR)が,大規模言語モデルにおける推論能力向上のための主要なアプローチとして登場した。
ロールアウト生成は恥ずかしく並列であり、メモリライトであるのに対して、ポリシー更新は通信量が多く、メモリ集約的である。
PODS(Policy Optimization with Down-Sampling)を導入し、戦略的に選択されたロールアウトサブセットでのみトレーニングすることで、ポリシー更新からロールアウト生成を分離する。
論文 参考訳(メタデータ) (2025-04-18T17:49:55Z) - CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models [77.16976971950785]
本稿では、推論モデルの学習を高速化するために、CPPO(Completion Pruning Policy Optimization)を提案する。
CPPOは絶対的なアドバンテージを低く保ち、勾配計算や更新に必要な数を大幅に削減する。
実験の結果、CPPOはGSM8Kで最大7.98タイム、Mathで3.48タイムで最大7.48タイム、オリジナルのGRPOと比較して精度を保っている。
論文 参考訳(メタデータ) (2025-03-28T11:30:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。