論文の概要: ThunderSyncRL: Lossless Acceleration of Agentic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.05935v1
- Date: Mon, 05 Oct 2026 07:51:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 03:04:42.340281
- Title: ThunderSyncRL: Lossless Acceleration of Agentic Reinforcement Learning
- Title(参考訳): ThunderSyncRL: エージェント強化学習のロスレス加速
- Abstract要約: 非同期トレーニングは、ロールアウトとアップデート間の学習を重複させるが、ポリシーの安定が犠牲になる。
我々はThunderSyncRLを導入し、必要な入力がすべて固定された時点で、ポリシーの安定化なしにグラデーション計算を開始する。
我々は、グラデーションストリーミングが、どちらの目的も変更することなく、バッチ同期トレーニングと同じGRPOとOPD更新を生成することを証明した。
- 参考スコア(独自算出の注目度): 21.02743214738046
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models are moving beyond generating answers to pursuing long-horizon goals in interactive environments. Post-training these agents requires long, heterogeneous trajectories, and synchronous systems leave learner engines idle until rollout and verification finish. To squeeze out these pipeline bubbles, asynchronous training overlaps rollout and learning across updates, but comes at the cost of policy staleness. We introduce ThunderSyncRL, which starts gradient computation as soon as all required inputs are fixed, without policy staleness. For group relative policy optimization (GRPO), ThunderSyncRL computes each trajectory's score gradient as soon as the reward for that trajectory arrives, without waiting for the group. For on-policy distillation (OPD), it computes gradients for each completed agentic turn's teacher-scored actions while tool calls run in the sandbox. We prove that gradient streaming produces the same GRPO and OPD updates as batch-synchronous training, without changing either objective. On SWE-bench Verified and Terminal Bench 4.0, we train models to the same performance up to $1.9 \times$ faster than synchronous training. With zero policy staleness, ThunderSyncRL also outperforms asynchronous training at a fixed budget by up to $2.47$ percentage points.
- Abstract(参考訳): 言語モデルは、回答を生み出すことを超えて、対話的な環境で長期の目標を追求している。
トレーニング後、これらのエージェントは長い異種軌道を必要とするため、同期システムはロールアウトと検証が完了するまで学習エンジンをアイドル状態にしておく。
これらのパイプラインバブルを絞り出すために、非同期トレーニングはロールアウトと更新間の学習を重複させるが、ポリシーの安定が犠牲になる。
我々はThunderSyncRLを導入し、必要な入力がすべて固定された時点で、ポリシーの安定化なしにグラデーション計算を開始する。
グループ相対ポリシー最適化 (GRPO) では、ThunderSyncRL はグループを待つことなく各軌道のスコア勾配を計算する。
オンライン蒸留(OPD)では、サンドボックス内でツールコールが実行されている間に、完了したエージェントターン毎の教師対応アクションの勾配を計算する。
我々は、グラデーションストリーミングが、どちらの目的も変更することなく、バッチ同期トレーニングと同じGRPOとOPD更新を生成することを証明した。
SWE-bench Verified と Terminal Bench 4.0 では、同期トレーニングよりも1.9 \times$で、同じパフォーマンスでモデルをトレーニングします。
ThunderSyncRLは、ポリシーの安定性を損なうことなく、固定予算での非同期トレーニングを最大2.47ドルのパーセンテージで上回っている。
関連論文リスト
- Asynchronous Is Nearly Free for Evolution Strategies on Long-Horizon Agentic Tasks [8.572241655978404]
進化戦略(ES)は、LLMポストトレーニングのバックプロパゲーションフリーな代替手段を提供する。
ESは、緩やかな政策の不安定さを限定的に許容する。
我々の知る限りでは、端末スタイルのエージェントコーディングタスクにおける同期と非同期ESの有効性を最初に示す。
論文 参考訳(メタデータ) (2026-10-03T01:18:02Z) - Where Does Staleness Accumulate? Pool Aware Effective Staleness Control for Asynchronous RL in LLM Post-Training [23.686508189372685]
我々は,ラグが軌道の生涯にわたってどのように蓄積するか,また非同期実行によるウォールクロックの利点を犠牲にすることなく,どのように制御できるかを検討する。
PACE (Pool-Aware Control of Effective Staleness) を導入する。
PACEは、過剰プール占有率を適応的拒絶予算に変換し、有効安定度スコアを用いて軌道の完成度をランク付けする。
論文 参考訳(メタデータ) (2026-09-29T06:38:31Z) - TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents [51.523913302114266]
TRACE(Turn-level Reward Assignment via Credit Estimation)は、エージェント強化学習のための高密度クレジットアサインメント手法である。
ツールコール境界における状態遷移としてロールアウトを表現し、凍結参照モデルからゴールド・アンサー・ログ確率を取得し、それらをログ比の状態値に変換し、それらの値の時間差変化としてアクション毎の報酬を導出する。
純粋なRLを用いたベースモデルツール使用能力を大幅に向上させ、冷間開始制御された微調整ステージ、エージェント訓練ステージ、ライブWebデータによるトレーニングを不要とした。
論文 参考訳(メタデータ) (2026-07-15T16:16:42Z) - AsyncWebRL: Efficient Multi-Step RL for Visual Web Agents [41.23725821297827]
マルチステップRLを用いた視覚言語Webエージェントのトレーニングは計算集約的である。
本稿では、同期RLにおけるアイドルGPUに対処するAsyncWebRLと、必要以上に多くのステップとトークンを使用するトラジェクトリを提案する。
論文 参考訳(メタデータ) (2026-06-04T02:18:44Z) - Demystifying Pipeline Parallelism: First Theory for PipeDream [53.657104889705856]
本稿では、PDスタイルの手法に対して、クリーンな非収束性をもたらす固定ブロック-SGD抽象化としてランダム化PipeDream(PD)を導入する。
定常PDによって引き起こされる遅延は、$S2 - S/2 + O(1)$ for $S$として増大するので、スタイルリードのコントリビューションは、チューナレート形式で$(2S4)$、同等に$(S4/K)$としてスケールする。
論文 参考訳(メタデータ) (2026-06-02T11:14:57Z) - DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors [57.944744187489185]
外部修正をネイティブなアンマスクに置き換えるDiscreteRTCを提案する。
DiscreteRTCは、非同期のインペインティングのために0行のコードを実装するのが簡単で、スクラッチから生成したアクションに比べてわずか0.7倍の計算速度で推論が高速で、フローベースのRTCに比べて実世界の動的ピックタスクの成功率が50%向上した。
論文 参考訳(メタデータ) (2026-04-27T23:04:03Z) - Near-Future Policy Optimization [51.760544033045726]
検証可能な報酬(RLVR)による強化学習は、学習後の中核的なレシピとなっている。
textbfNear-Future textbfPolicy textbfOptimization (textbfNPO)を提案する。
論文 参考訳(メタデータ) (2026-04-22T16:20:41Z) - RollArt: Scaling Agentic RL Training via Disaggregated Infrastructure [49.88201789074532]
エージェント強化学習(RL)は、大規模言語モデル(LLM)が自律的な意思決定と長期計画を行うことを可能にする。
分散インフラストラクチャ上でマルチタスクエージェントRLのスループットを最大化する分散システムであるRollArcを提案する。
論文 参考訳(メタデータ) (2025-12-27T11:14:23Z) - GBA: A Tuning-free Approach to Switch between Synchronous and
Asynchronous Training for Recommendation Model [19.65557684234458]
パラメータサーバ(PS)上のグローバルバッチ勾配集約(GBA)を提案する。
トークン制御プロセスは、勾配を組み立て、厳密な安定度で勾配を減衰させる。
3つの産業規模のレコメンデーション・タスクの実験から、GBAはスイッチングのための効果的なチューニング不要なアプローチであることが示された。
論文 参考訳(メタデータ) (2022-05-23T05:22:42Z) - High-Throughput Synchronous Deep RL [132.43861715707905]
HTS-RL(High-Throughput Synchronous Deep Reinforcement Learning)の提案
私たちは同時に学習とロールアウトを行い、古いポリシーを避けるシステム設計を考案します。
我々は,アタリゲームとGoogle Research Football環境に対するアプローチを評価した。
論文 参考訳(メタデータ) (2020-12-17T18:59:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。