論文の概要: WAR: Workload-Aware Rollouts for Synchronous Agentic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.17299v1
- Date: Sun, 19 Jul 2026 15:31:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.42387
- Title: WAR: Workload-Aware Rollouts for Synchronous Agentic Reinforcement Learning
- Title(参考訳): WAR: 同期エージェント強化学習のためのワークロード対応ロールアウト
- Abstract要約: WARは、同期エージェントRLトレーニングを大幅に高速化する、ワークロード対応のロールアウトシステムである。
低負荷下では、WARはSuffixDecodingでモデルフリーの投機的デコーディングを可能にする。
高負荷下では、WARは最適化の焦点をキャッシュ対応スケジューリングにシフトする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon rollout generation has become the dominant systems bottleneck in agentic reinforcement learning (RL). As agents interact with environments over many turns, trajectories rapidly grow to tens of thousands of tokens, making synchronous RL training increasingly constrained by rollout. We propose WAR, a workload-aware rollout system that substantially accelerates synchronous agentic RL by jointly optimizing decoding and scheduling. WAR is built on a key observation: the optimal rollout optimization strategy depends on runtime load: (1) Under low load, WAR enables model-free speculative decoding with SuffixDecoding, which reuses suffix patterns from previously completed trajectories as speculative drafts for future rollouts. Unlike model-based drafters, SuffixDecoding introduces no additional draft model and avoids GPU contention with rollout generation. (2) Under high load, where saturated batched decoding leaves limited room for speculative speedup, WAR shifts the optimization focus to cache-aware scheduling. A global scheduler places requests across rollout replicas based on cache locality, trajectory progress and server load, reducing redundant KV-cache recomputation and mitigating load imbalance. By combining decoding-level suffix reuse with system-level rollout scheduling, WAR delivers robust throughput improvements across workload regimes without changing the underlying RL algorithm. WAR improves long-context agentic rollout throughput by 1.4x under low load and up to 1.6x under high load. These results show that WAR removes a major rollout bottleneck in synchronous agentic RL and provides a practical path toward scalable long-context agent training.
- Abstract(参考訳): エージェント強化学習(RL)において,長期水平ロールアウト生成が支配的なシステムボトルネックとなっている。
エージェントが多くのターンで環境と対話するにつれて、トラジェクトリは急速に数万のトークンへと成長し、ロールアウトによって同期RLトレーニングがますます制限される。
本稿では,同期エージェントRLを協調的に最適化し,同期エージェントRLを大幅に高速化する作業負荷対応ロールアウトシステムWARを提案する。
1) 低負荷下では、WARはSuffixDecodingでモデルフリーの投機的デコーディングを可能にします。
モデルベースのドラフトラとは異なり、SuffixDecodingは追加のドラフトモデルを導入せず、ロールアウト生成によるGPU競合を回避する。
2) 高負荷下では,飽和バッチデコードでは投機速度が制限されるため,WARは最適化の焦点をキャッシュ対応スケジューリングにシフトする。
グローバルスケジューラは、キャッシュローカリティ、トラジェクトリプログレス、サーバ負荷に基づいて、ロールアウトレプリカにリクエストを配置し、冗長なKV-cache再計算を削減し、負荷不均衡を軽減する。
デコードレベルのサフィックス再利用とシステムレベルのロールアウトスケジューリングを組み合わせることで、WARは、基盤となるRLアルゴリズムを変更することなく、ワークロードレシシシ間で堅牢なスループット向上を実現する。
WARは、低負荷で1.4倍、高負荷で1.6倍の長時間コンテキストエージェントのロールアウトスループットを改善する。
これらの結果から,WARは同期エージェントRLの大きなロールアウトボトルネックを排除し,拡張性のある長文エージェントトレーニングへの実践的な道筋を提供することがわかった。
関連論文リスト
- EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts [20.460789503141466]
本稿では、RLロールアウトにおけるこのギャップに対処するために設計されたシステム対応セルフSDフレームワークであるEfficientRolloutを紹介する。
EfficientRolloutは、ARロールアウトベースラインを高速化することで、ロールアウトとエンドツーエンドのレイテンシをそれぞれ19.6%、12.7%削減する。
論文 参考訳(メタデータ) (2026-06-17T11:51:06Z) - Libra: Efficient Resource Management for Agentic RL Post-Training [11.701871372256205]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)を有能なエージェントに変換するための訓練後の標準パラダイムとして登場した。
エージェントRLでは、ロールアウトステージはツールを呼び出しながら軌道を生成し、長い尾と静止しないワークロードを生成する。
両課題に対処するリソース管理システムLibraについて,2つのコアメカニズムを用いて紹介する。
論文 参考訳(メタデータ) (2026-06-02T03:09:13Z) - Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding [8.43502622452414]
RLロールアウトにおけるアクセラレーションプリミティブとしての投機的復号化について検討する。
VLLMバックエンドでNeMo-RLの投機的復号化を実装した。
投機的デコーディングと非同期RLを組み合わせることで,最大2.5倍のエンドツーエンドのトレーニングスピードアップを235Bスケールで達成する。
論文 参考訳(メタデータ) (2026-04-29T15:11:48Z) - Heddle: A Distributed Orchestration System for Agentic RL Rollout [26.439654927366163]
Heddleはエージェントロールアウトの実行を最適化するトラジェクトリ中心のシステムである。
Heddleは、長時間のボトルネックを効果的に中和し、最大2.5$times$高いエンドツーエンドのロールアウトスループットを実現します。
論文 参考訳(メタデータ) (2026-03-30T07:01:32Z) - SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling [54.276306194000405]
SortedRLを提案する。SortedRLは、強化学習をスケールするためのオンライン長対応スケジューリング戦略である。
SortedRLは、出力長に基づいてロールアウトサンプルをリオーダーし、短いサンプルが早期更新のためにグループを形成することを優先順位付けする。
LLaMA-3.1-8BとQwen-2.5-32Bを論理パズルを含む様々なタスクで実験した結果、SortedRLはRLトレーニングバブル比を50%以上削減することが示された。
論文 参考訳(メタデータ) (2026-03-24T16:48:31Z) - RollArt: Scaling Agentic RL Training via Disaggregated Infrastructure [49.88201789074532]
エージェント強化学習(RL)は、大規模言語モデル(LLM)が自律的な意思決定と長期計画を行うことを可能にする。
分散インフラストラクチャ上でマルチタスクエージェントRLのスループットを最大化する分散システムであるRollArcを提案する。
論文 参考訳(メタデータ) (2025-12-27T11:14:23Z) - Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive Drafter [52.111923076688505]
強力な推論能力を持つ大規模言語モデル(LLM)のトレーニングは、複雑な問題解決において新たなフロンティアを解放する重要なマイルストーンとなる。
本稿では,適応的投機的復号化を組み込むことで,RL学習の無作為に推論を高速化するシステムであるTLTを提案する。
論文 参考訳(メタデータ) (2025-11-20T18:59:25Z) - Beat the long tail: Distribution-Aware Speculative Decoding for RL Training [75.75462952580796]
モデル出力を変更することなくRLロールアウトを高速化する分散Aware Speculativeデコーディングフレームワークを提案する。
数学とコード推論タスクの実験は、DASが同一のトレーニング曲線を保ちながらロールアウト時間を最大50%短縮することを示している。
論文 参考訳(メタデータ) (2025-11-17T19:02:12Z) - RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs [48.94639777633359]
RLBoostは、プリエンプティブルGPUリソースを抽出するコスト効率のよいRLトレーニングのための体系的なソリューションである。
RLBoostはトレーニングのスループットを1.51x-1.97x向上し、オンデマンドGPUリソースのみを使用する場合に比べてコスト効率は28%-49%向上した。
論文 参考訳(メタデータ) (2025-10-22T04:19:37Z) - Laminar: A Scalable Asynchronous RL Post-Training Framework [20.127034898123508]
RL軌道生成における長い尾の歪みは、重いGPU不使用を引き起こす。
現在のRLシステムはアクターとロールアウト間のグローバルな重量同期に依存しており、厳密なモデル更新スケジュールを生成する。
完全に分離されたアーキテクチャ上に構築されたスケーラブルで堅牢なRLポストトレーニングシステムであるLaminarを提案する。
論文 参考訳(メタデータ) (2025-10-14T15:29:14Z) - StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation [55.75008325187133]
強化学習(RL)は,大規模言語モデル(LLM)の学習後のコアとなる。
StreamRLは、最初の原則から分離して、2種類のパフォーマンスボトルネックに対処するように設計されている。
実験により、StreamRLは既存の最先端システムと比較してスループットを最大2.66倍改善することが示された。
論文 参考訳(メタデータ) (2025-04-22T14:19:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。