論文の概要: RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2606.26997v1
- Date: Thu, 25 Jun 2026 13:14:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.290466
- Title: RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning
- Title(参考訳): RolloutPipe: 重複するパイプラインロールアウトと分散オンポリシィLLM強化学習のトレーニング
- Abstract要約: RLVRシステムのためのポストトレーニングフレームワークであるRolloutPipeを提案する。
固定重量のロールアウトを完全なグループパイプラインに変換し、トレーニング可能なグループがトレーナーに移動し、後続のグループが生成する。
ロールアウトパイプはロールアウト・トゥ・トレイン・エンド時間を30.7%-42.3%短縮し、トレーナーの待機率をスライムに比べて37%-76%下げる。
- 参考スコア(独自算出の注目度): 3.44773596043964
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) post-training for reasoning increasingly relies on reinforcement learning with verifiable rewards (RLVR), where models learn from ground-truth feedback on mathematical, logical, and scientific tasks. To enable flexible resource allocation and support heterogeneous training setups, modern RLVR systems adopt disaggregated architectures that decouple rollout generation and policy training across independent GPU pools. However, existing synchronous on-policy GRPO (Group Relative Policy Optimization) RLVR systems finish an entire rollout before starting training, leaving the trainer GPU pool idle while rollout is still ongoing. Asynchronous RL pipelines overlap the two stages, but at the cost of training on stale data. To address these challenges, we propose RolloutPipe, a post-training framework for disaggregated RLVR systems, which turns the fixed-weight rollout into a complete-group pipeline where trainable groups move to the trainer while later groups are still being generated. RolloutPipe achieves this through two techniques including complete-group pipelining (CGP) and frontier-group dispatch (FGD). CGP dispatches each trainable complete group to the trainer FIFO as soon as group materialization finishes, and FGD is an admission policy on the Rollout node that first admits requests for the frontier groups needed to form the next training batch, so that trainer-ready groups arrive earlier and more steadily. The design starts training before the rollout completes while maintaining on-policy correctness. Evaluated on Qwen3-1.7B across four reasoning and science benchmarks and twelve rollout settings, RolloutPipe shortens the rollout-to-train-end time by 30.7%-42.3%, and lowers the trainer waiting ratio by 37%-76% compared to Slime, a state-of-the-art rollout and training system.
- Abstract(参考訳): 推論のための大規模言語モデル(LLM)のポストトレーニングは、数学的、論理的、科学的タスクに関する基礎的なフィードバックから学習する、検証可能な報酬を伴う強化学習(RLVR)にますます依存している。
柔軟なリソース割り当てと異種トレーニングセットアップのサポートを実現するため、現代のRLVRシステムは、独立GPUプール間のロールアウト生成とポリシートレーニングを分離する分離アーキテクチャを採用している。
しかし、既存の同期型オンラインGRPO (Group Relative Policy Optimization) RLVRシステムは、トレーニングを開始する前にロールアウトを完了し、ロールアウト中にトレーナーのGPUプールがアイドル状態になる。
非同期RLパイプラインは2つのステージをオーバーラップするが、古いデータのトレーニングにはコストがかかる。
これらの課題に対処するために,RLVRシステムを非集約化するための後トレーニングフレームワークであるRolloutPipeを提案する。
RolloutPipeは、完全グループパイプライン(CGP)とフロンティアグループディスパッチ(FGD)という2つのテクニックによってこれを実現している。
CGPは、グループ実体化が終了するとすぐに、各トレーニング可能な完全グループをトレーナーFIFOにディスパッチし、FGDは、次のトレーニングバッチを形成するために必要なフロンティアグループに対する要求を最初に認めるロールアウトノードの入場ポリシーである。
このデザインは、ロールアウトが完了する前に、政治上の正確性を維持しながらトレーニングを開始する。
Qwen3-1.7Bを4つの推論と科学ベンチマークと12のロールアウト設定で評価し、RolloutPipeはランニング・ツー・トレイン・エンドの時間を30.7%-42.3%短縮し、最先端のロールアウト・トレーニングシステムであるSlimeと比較してトレーナーの待機率を37%-76%下げた。
関連論文リスト
- Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training [28.12666966542811]
本研究では,将来的な再サンプリングのために,ゼロ分散グループを可変プールに返却するクエリリサイクルを提案する。
本稿では, リサイクルクエリが, 学習終了までに有効バッチの約4分の3を供給していることを示す。
論文 参考訳(メタデータ) (2026-06-09T11:12:58Z) - Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training [34.81218483901967]
強化学習は、大規模言語モデルの訓練後において支配的なパラダイムである。
グループベースのポリシー最適化手法は、プロンプト毎に複数のロールアウトから利点を計算する。
Pilot-Commitは、グループベースのRLポストトレーニングのための、予算対応のロールアウトアロケーションフレームワークである。
論文 参考訳(メタデータ) (2026-05-26T06:41:13Z) - SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling [54.276306194000405]
SortedRLを提案する。SortedRLは、強化学習をスケールするためのオンライン長対応スケジューリング戦略である。
SortedRLは、出力長に基づいてロールアウトサンプルをリオーダーし、短いサンプルが早期更新のためにグループを形成することを優先順位付けする。
LLaMA-3.1-8BとQwen-2.5-32Bを論理パズルを含む様々なタスクで実験した結果、SortedRLはRLトレーニングバブル比を50%以上削減することが示された。
論文 参考訳(メタデータ) (2026-03-24T16:48:31Z) - ReMiT: RL-Guided Mid-Training for Iterative LLM Evolution [49.496216822640974]
トレーニングのダイナミクスを分析し,中間学習フェーズをモデル能力の重要な転換点として同定する。
本稿では,ReMiT(Reinforcement Learning-Guided Mid-Training)を導入する。
論文 参考訳(メタデータ) (2026-02-03T04:04:41Z) - On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models [73.10315509190623]
最近の強化学習技術は、言語モデルにおいて顕著な推論改善をもたらした。
ポストトレーニングが、事前トレーニング中に取得したものを超えて、モデルの推論能力を真に拡張するかどうかは不明だ。
プレトレーニング,ミッドトレーニング,およびRLベースのポストトレーニングの因果的貢献を分離する,完全に制御された実験フレームワークを開発した。
論文 参考訳(メタデータ) (2025-12-08T18:12:10Z) - CoPRIS: Efficient and Stable Reinforcement Learning via Concurrency-Controlled Partial Rollout with Importance Sampling [11.252930904797]
重要サンプリングを用いた並列制御部分ロールアウト(CoPRIS)を提案する。
CoPRISは、一定数の同時ロールアウトを維持し、十分なサンプルが収集されたら早期終了し、その後のロールアウトで未完成のトラジェクトリを再利用することで、長いテールの非効率を緩和する。
実験の結果、CoPRISは同期RLシステムに匹敵する性能を維持しながら、最大1.94倍高速なトレーニングを実現している。
論文 参考訳(メタデータ) (2025-11-05T11:39:32Z) - RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs [48.94639777633359]
RLBoostは、プリエンプティブルGPUリソースを抽出するコスト効率のよいRLトレーニングのための体系的なソリューションである。
RLBoostはトレーニングのスループットを1.51x-1.97x向上し、オンデマンドGPUリソースのみを使用する場合に比べてコスト効率は28%-49%向上した。
論文 参考訳(メタデータ) (2025-10-22T04:19:37Z) - Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation [65.3648667980258]
視覚言語モデル(VLM)に基づくGUIエージェントは複雑なタスクの自動化を約束するが、強化学習(RL)の適用において大きな課題に直面している。
異種モジュールを高度に非結合的に協調するGUIエージェントのための非結合エージェントRLトレーニングフレームワークであるDARTを提案する。
OSWorldのベンチマークでは、DART-GUI-7Bは42.13%のタスク成功率、14.61%の絶対ゲイン、オープンソースSOTAよりも7.34%高い。
論文 参考訳(メタデータ) (2025-09-28T13:19:20Z) - RollPacker: Mitigating Long-Tail Rollouts for Fast, Synchronous RL Post-Training [19.00988498482758]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)の推論能力を高めるための重要なポストトレーニング手法である。
多くのRLシステムは同期を緩和することでこの問題を緩和しようとするが、これは精度のトレーニングを損なう可能性がある。
同期RLのための新しいロールアウトスケジューリング戦略であるtailを導入し,ロールアウトステップの小さなサブセット(ロングラウンド)に長いテール応答をもたらすプロンプトを体系的に統合する。
RollPackerは、veRLと比較して2.03x-2.56xのトレーニング時間を短縮し、Qwen2.5のRLHFuseよりも最大2.24倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2025-09-25T11:13:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。