論文の概要: Where Does Staleness Accumulate? Pool Aware Effective Staleness Control for Asynchronous RL in LLM Post-Training
- arxiv url: http://arxiv.org/abs/2609.36830v1
- Date: Tue, 29 Sep 2026 06:38:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.243895
- Title: Where Does Staleness Accumulate? Pool Aware Effective Staleness Control for Asynchronous RL in LLM Post-Training
- Title(参考訳): 定常性はどこで蓄積されるか? LLM後トレーニングにおける非同期RLの有効定常性制御をプールが認識する
- Abstract要約: 我々は,ラグが軌道の生涯にわたってどのように蓄積するか,また非同期実行によるウォールクロックの利点を犠牲にすることなく,どのように制御できるかを検討する。
PACE (Pool-Aware Control of Effective Staleness) を導入する。
PACEは、過剰プール占有率を適応的拒絶予算に変換し、有効安定度スコアを用いて軌道の完成度をランク付けする。
- 参考スコア(独自算出の注目度): 23.686508189372685
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fully asynchronous reinforcement learning (RL) improves resource utilization in large language model post-training by overlapping rollout generation with policy optimization, but it also introduces policy lag as trajectories are generated and queued while the trainer continues to update. We study how this lag accumulates over a trajectory's lifetime and how it can be controlled without sacrificing the wall-clock benefits of asynchronous execution. We decompose trajectory staleness into Generation Staleness, accumulated before rollout completion, and Waiting Staleness, accumulated after a completed trajectory enters the pool. Motivated by this decomposition, we introduce PACE (Pool-Aware Control of Effective Staleness). PACE converts excess pool occupancy into an adaptive rejection budget and ranks completed trajectories using an effective-staleness score that combines Waiting Staleness with prefix-aware Generation Staleness. This avoids penalizing long or interrupted rollouts solely because they span multiple policy versions. In single-turn mathematical reasoning, PACE improves the six-benchmark average validation accuracy by 18.7\% over unfiltered asynchronous RL at the same wall-clock budget and matches synchronous RL performance with 47.1\% less GPU time. PACE also improves validation performance in multi-turn tool-integrated reasoning, outperforming both synchronous and unfiltered asynchronous RL. Further experiments with the mixture-of-experts model and an alternative RL algorithm support its applicability across model architectures and training algorithms.
- Abstract(参考訳): フル非同期強化学習(RL)は、ポリシー最適化と重複するロールアウト生成によって、大規模言語モデルの後トレーニングにおけるリソース利用を改善するが、トレーナーが更新を続ける間に、トラジェクトリが生成され、キューされるため、ポリシーラグも導入する。
このラグが軌道の寿命を通してどのように蓄積するか、非同期実行によるウォールクロックの利点を犠牲にすることなく、どのように制御できるかを考察する。
我々は,軌道の安定度を,ロールアウト完了前に蓄積したジェネレーション・ステールネスと,完了した軌道がプールに入った後に蓄積したウェイティング・ステールネスに分解する。
PACE(Pool-Aware Control of Effective Staleness)を導入する。
PACEは、過剰プール占有率を適応的拒絶予算に変換し、待ち時間とプレフィックス認識生成時間を組み合わせた有効安定スコアを用いて、完了軌道をランク付けする。
これにより、複数のポリシーバージョンにまたがるため、長期または中断されたロールアウトのペナルティを回避することができる。
シングルターンの数学的推論において、PACEは6ベンチマーク平均検証の精度を、同じ壁面でフィルタされていない非同期RLに対して18.7\%改善し、同期RLのパフォーマンスを47.1\%GPU時間で一致させる。
PACEはまた、マルチターンツール統合推論におけるバリデーション性能を改善し、同期RLとアンフィルタ非同期RLの両方のパフォーマンスを向上する。
実験モデルと代替RLアルゴリズムによるさらなる実験は、モデルアーキテクチャとトレーニングアルゴリズムをまたいだ適用性をサポートする。
関連論文リスト
- SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling [54.276306194000405]
SortedRLを提案する。SortedRLは、強化学習をスケールするためのオンライン長対応スケジューリング戦略である。
SortedRLは、出力長に基づいてロールアウトサンプルをリオーダーし、短いサンプルが早期更新のためにグループを形成することを優先順位付けする。
LLaMA-3.1-8BとQwen-2.5-32Bを論理パズルを含む様々なタスクで実験した結果、SortedRLはRLトレーニングバブル比を50%以上削減することが示された。
論文 参考訳(メタデータ) (2026-03-24T16:48:31Z) - LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning [38.04066732299875]
Diffusion Large Language Models (dLLMs) は、並列トークン生成のための有望なパラダイムとして登場した。
その可能性にもかかわらず、既存のdLLMは通常、厳格な精度パラレルのトレードオフに悩まされる。
我々は,事前学習したdLLMの速度品質フロンティアを直接最適化するポストトレーニングフレームワークLightningRLを提案する。
論文 参考訳(メタデータ) (2026-03-04T11:43:19Z) - Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards [69.74686029941881]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論能力を改善するための効果的なパラダイムである。
トレーニングを通して高価値ロールアウトを適応的に選択する統合型ニューラルネットワークスケジューリングフレームワークを提案する。
6つの数学的推論ベンチマークの実験では、複数のRLVR最適化手法で性能と訓練効率が一貫した向上を示した。
論文 参考訳(メタデータ) (2026-02-09T10:51:58Z) - HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning [78.12979615107564]
HeaPAは精度を継続的に改善し、少ない計算で目標性能に達する。
分析の結果、これらの上昇はフロンティアに焦点を当てたサンプリングとオン政治プールの成長によるものであることが示唆された。
論文 参考訳(メタデータ) (2026-01-30T01:31:17Z) - DiRL: An Efficient Post-Training Framework for Diffusion Language Models [54.405206032785706]
Diffusion Language Models (dLLMs) はAuto-Regressive(AR)モデルに代わる有望な代替品として登場した。
既存の手法は、訓練と推論の間の計算の非効率性と客観的なミスマッチに悩まされている。
我々は,FlexAttention-accelerated blockwise trainingとLMDeploy-timized inferenceを密接に統合した,効率的なポストトレーニングフレームワークであるDiRLを紹介した。
論文 参考訳(メタデータ) (2025-12-23T08:33:19Z) - Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive Drafter [52.111923076688505]
強力な推論能力を持つ大規模言語モデル(LLM)のトレーニングは、複雑な問題解決において新たなフロンティアを解放する重要なマイルストーンとなる。
本稿では,適応的投機的復号化を組み込むことで,RL学習の無作為に推論を高速化するシステムであるTLTを提案する。
論文 参考訳(メタデータ) (2025-11-20T18:59:25Z) - CoPRIS: Efficient and Stable Reinforcement Learning via Concurrency-Controlled Partial Rollout with Importance Sampling [11.252930904797]
重要サンプリングを用いた並列制御部分ロールアウト(CoPRIS)を提案する。
CoPRISは、一定数の同時ロールアウトを維持し、十分なサンプルが収集されたら早期終了し、その後のロールアウトで未完成のトラジェクトリを再利用することで、長いテールの非効率を緩和する。
実験の結果、CoPRISは同期RLシステムに匹敵する性能を維持しながら、最大1.94倍高速なトレーニングを実現している。
論文 参考訳(メタデータ) (2025-11-05T11:39:32Z) - AReaL-Hex: Accommodating Asynchronous RL Training over Heterogeneous GPUs [24.96730768606278]
異種対応非同期RLトレーニングシステムであるAReaL-Hexを提案する。
ヘテロジニアスGPU上でロールアウト生成とポリシモデルのトレーニングを実行する方法を、効果的にスケジュールする。
最大1.50倍のトレーニングスループットと1.46倍のトレーニングコストの削減を提供する。
論文 参考訳(メタデータ) (2025-11-02T04:17:30Z) - Laminar: A Scalable Asynchronous RL Post-Training Framework [20.127034898123508]
RL軌道生成における長い尾の歪みは、重いGPU不使用を引き起こす。
現在のRLシステムはアクターとロールアウト間のグローバルな重量同期に依存しており、厳密なモデル更新スケジュールを生成する。
完全に分離されたアーキテクチャ上に構築されたスケーラブルで堅牢なRLポストトレーニングシステムであるLaminarを提案する。
論文 参考訳(メタデータ) (2025-10-14T15:29:14Z) - AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning [23.24949857136035]
強化学習(RL)は、大規模言語モデル(LLM)の訓練において支配的なパラダイムとなっている。
本稿では,完全非同期RLシステムであるAReaLについて述べる。
論文 参考訳(メタデータ) (2025-05-30T07:18:25Z) - Trajectory Balance with Asynchrony: Decoupling Exploration and Learning for Fast, Scalable LLM Post-Training [71.16258800411696]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)のポストトレーニングにおいて重要な要素である。
ポストトレーニングに使われている既存のオンラインアルゴリズムは、経験的リプレイバッファの使用と本質的に相容れない。
本稿では,TBA(Trajectory Balance with Asynchrony)によるバッファの再生を効率よく行うことを提案する。
論文 参考訳(メタデータ) (2025-03-24T17:51:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。