論文の概要: Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.07508v1
- Date: Wed, 08 Jul 2026 15:02:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.432094
- Title: Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
- Title(参考訳): エージェント強化学習のためのシングルロール非同期最適化
- Authors: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong,
- Abstract要約: 本稿では,非同期RLの安定性と非政治的課題に対処するため,単一ロールアウト非同期最適化(SAO)を提案する。
SAOはグループワイドサンプリングを単一ロールアウトサンプリングに置き換える。
SAOは、オープンなGLM-5.2モデルをトレーニングするために、エージェントRLパイプラインにうまくデプロイされる。
- 参考スコア(独自算出の注目度): 47.00572734047258
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning (RL) is becoming increasingly important for post-training large language models (LLMs). Previous RL pipelines for LLMs were mostly synchronous and batch-interleaved, which is inefficient for long-horizon agentic tasks. Recently, asynchronous RL has emerged as a more efficient alternative by updating the model as rollouts arrive. However, existing asynchronous RL systems often emphasize throughput, while leaving training stability and task effectiveness largely underexplored. For example, a key challenge is that group-wise sampling in the widely-used GRPO framework does not naturally fit asynchronous agentic training. In this paper, we present Single-rollout Asynchronous Optimization (SAO) to address the stability and off-policy challenges in asynchronous RL. To reduce off-policy effects and improve generalization, we replace group-wise sampling with single-rollout sampling, that is, using one rollout per prompt. We further improve this single-rollout strategy with practical value-model training designs. To improve optimization stability, we introduce a strict double-side token-level clipping strategy. SAO is able to train stably for one thousand steps and consistently outperform GRPO and its variants on agentic coding and reasoning benchmarks, such as SWE-Bench Verified, BeyondAIME, and IMOAnswerBench. We also demonstrate that single-rollout RL is particularly effective in a simulated online learning setting, where the model must adapt to changing evolving environments. To this end, SAO is successfully deployed in the agentic RL pipeline for training the open GLM-5.2 model (750B-A40B).
- Abstract(参考訳): 強化学習(RL)は、大規模言語モデル(LLM)の訓練後においてますます重要になりつつある。
LLMの以前のRLパイプラインは、主に同期的でバッチインターリーブドであり、長時間のエージェントタスクでは非効率であった。
最近、非同期RLは、ロールアウトが到着するにつれてモデルを更新することで、より効率的な代替手段として登場した。
しかし、既存の非同期RLシステムはスループットを重視し、トレーニングの安定性とタスクの有効性はほとんど未検討のままである。
例えば、広く使われているGRPOフレームワークにおけるグループワイドサンプリングは、非同期エージェントトレーニングに自然に適合しない。
本稿では,非同期RLの安定性と非政治的課題に対処するため,SAO(Single-rollout Asynchronous Optimization)を提案する。
政策外の効果を低減し、一般化を改善するため、グループワイドサンプリングを単一ロールアウトサンプリング、すなわち1プロンプト当たりのロールアウトに置き換える。
実用的価値モデルトレーニング設計により、このシングルロールアウト戦略をさらに改善する。
最適化の安定性を向上させるため、厳格な両面トークンレベルのクリッピング戦略を導入する。
SWE-Bench Verified、BeyondAIME、IMOAnswerBenchなどのエージェントコーディングおよび推論ベンチマークにおいて、SAOは安定して1000ステップのトレーニングを行え、GRPOとその変種を一貫して上回ります。
また,モデルが変化する環境に適応する必要があるオンライン学習環境において,シングルロールアウトRLが特に有効であることを示す。
この目的のために、SAOはオープンなGLM-5.2モデル(750B-A40B)をトレーニングするためにエージェントRLパイプラインに配備される。
関連論文リスト
- DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training [30.35748518368946]
非同期トレーニングは、トレーニングで生成を重複させることによって自然な改善を提供する。
既存のアプローチは、本質的に長い尾の軌道問題に対処できない。
本稿では,アルゴリズム・システムの共同設計を通じてこの問題に対処するDORAを提案する。
論文 参考訳(メタデータ) (2026-04-29T03:25:36Z) - RL-VLA$^3$: Reinforcement Learning VLA Accelerating via Full Asynchronism [42.27384804295299]
VLA(Vision-Language-Action)モデルは、一般的なインボディードインテリジェンスへの重要な経路として登場した。
本稿では,環境相互作用からアクタポリシー更新に至るまで,パイプライン全体を包含する完全に非同期なポリシートレーニングフレームワークを提案し,実装する。
LIBEROベンチマークでは、既存の同期戦略と比較して59.25%のスループット向上を実現している。
論文 参考訳(メタデータ) (2026-02-05T15:30:23Z) - Stable and Efficient Single-Rollout RL for Multimodal Reasoning [66.53652874617217]
$textbfMSSR$ (Multimodal Stabilized Single-Rollout)はグループフリーのRLVRフレームワークで、安定した最適化と効果的なマルチモーダル推論性能を実現する。
分散評価では、MSSRはトレーニングの効率が良く、トレーニングの歩数の半分でグループベースベースラインに類似した検証精度を達成できる。
論文 参考訳(メタデータ) (2025-12-20T05:07:53Z) - Scaling Agent Learning via Experience Synthesis [100.42712232390532]
強化学習は、対話を通じて自己改善を行うことで、自律的なエージェントに力を与えることができる。
しかし、コストのかかるロールアウト、タスクの多様性の制限、信頼性の低い報奨信号、インフラストラクチャの複雑さによって、その実践的採用は依然として困難である。
私たちはDreamGymを紹介します。DreamGymはスケーラビリティを念頭において多様なエクスペリエンスを合成するために設計された最初の統合フレームワークです。
論文 参考訳(メタデータ) (2025-11-05T18:58:48Z) - Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs [51.21041884010009]
Ring-liteは、強化学習(RL)により最適化されたMixture-of-Experts(MoE)ベースの大規模言語モデルである
我々のアプローチは、挑戦的なベンチマーク上でのSOTA(State-of-the-art)の小規模推論モデルの性能と一致する。
論文 参考訳(メタデータ) (2025-06-17T17:12:34Z) - Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models [11.624678008637623]
RLHFにおける生成と学習の分離を提案する。
オンラインDPOは、政治以外のデータに対して最も堅牢である。
非同期トレーニングは、オンラインだが非政治的なRLHFという未調査の制度に依存している。
論文 参考訳(メタデータ) (2024-10-23T19:59:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。