論文の概要: Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.18722v2
- Date: Wed, 22 Jul 2026 14:40:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 16:42:31.671578
- Title: Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning
- Title(参考訳): 安定だが安定:非同期強化学習のための安定度適応信頼領域
- Authors: Junyao Yang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Ruhan Wang, Xiangxin Zhou, Kishan Panaganti, Haitao Mi, Leowei Liang,
- Abstract要約: 非同期強化学習は、最適化からロールアウト生成を分離することでスループットを向上させる。
しかし、老朽化は、政策遅延、エンジン遅延、およびエキスパートの混成ルーティングが混在する必然的な副産物である。
本稿では,分割されたサンプルログ比を実用的な安定化プロキシとして利用するStaleness-Adaptive Trust Region (SAT)を紹介した。
- 参考スコア(独自算出の注目度): 33.56197101721029
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Asynchronous reinforcement learning improves throughput by decoupling rollout generation from optimization, but staleness is an inevitable byproduct compounded by policy lag, engine delays, and mixture-of-experts routing. From a trust-region perspective, this mismatch is critical: training-inference divergence governs approximation error in finite-horizon bounds, whereas PPO clipping only gates sampled outward updates, acting as a sampled surrogate rather than a full-policy constraint. As a result, high-staleness updates remain weakly controlled in the asynchronous regime where stale rollouts matter most. We introduce the Staleness-Adaptive Trust Region (SAT), which uses the detached sampled log-ratio as a practical staleness proxy, identifies high-mismatch tails within each batch via staleness-based kernel scaling, and contracts only the sign-selected endpoint of the nominal PPO interval. This preserves baseline behavior on ordinary tokens while enforcing more conservative updates on newly intercepted outward bands. We prove local interval containment and pointwise pessimism relative to PPO, showing how the adaptive rule reshapes update geometry under heterogeneous staleness. We evaluate SAT in a decoupled asynchronous RL setup built on Qwen3-30B-A3B-Base, using SGLang as the inference engine and Megatron for training. In this setting, SAT-GSPO w/ R3 achieves the best observed AIME24 avg@8, reaching 35.83 at lag 1 and 34.79 at lag 8, while SAT-GSPO reaches 34.17 at lag 1. Adaptive clipping and routing replay act as complementary stabilizers targeting mismatch tails and routing inconsistency, respectively. Overall, aligning clip intervals with staleness heterogeneity effectively stabilizes asynchronous RL.
- Abstract(参考訳): 同期強化学習は、最適化からロールアウト生成を分離することでスループットを向上させるが、安定度は、ポリシーラグ、エンジン遅延、およびエキスパートの混合ルーティングが混在する必然的な副産物である。
訓練-推論のばらつきは有限水平境界における近似誤差を支配し、一方PPOクリッピングは外向き更新でサンプリングされたゲートのみを切断し、完全な政治的制約ではなくサンプリングされたサロゲートとして機能する。
その結果、古いロールアウトが最も重要となる非同期な状態において、高安定性の更新は依然として弱く制御されている。
我々は,分割されたサンプルログ比を実用的な安定化プロキシとして使用し,スタネスベースのカーネルスケーリングを通じて各バッチ内の高ミスマッチテールを識別し,名目PPO間隔の符号選択エンドポイントのみを契約するStaleness-Adaptive Trust Region (SAT)を紹介した。
これは通常のトークンのベースライン動作を保ちつつ、新たにインターセプトされた外部バンドのより保守的な更新を強制する。
PPOと比較して局所的間隔の包含と点方向の悲観性を証明し、適応規則が不均一な安定化の下での幾何の更新にどう影響するかを示した。
SATをQwen3-30B-A3B-Base上に構築し,SGLangを推論エンジンとし,Megatronをトレーニングに用いる。
この設定では、SAT-GSPO w/R3は最もよく観測されたAIME24 avg@8に達し、ラグ1で35.83、ラグ8で34.79となり、SAT-GSPOはラグ1で34.17に達する。
アダプティブ・クリッピングとルーティング・リプレイは、それぞれミスマッチ・テールとルーティングの不整合をターゲットとした補完的な安定化器として機能する。
全体として、クリップ間隔を不均一性と整合させることは、非同期RLを効果的に安定化させる。
関連論文リスト
- Staleness-Learning Rate Scaling Laws for Asynchronous RLHF [18.98349589222509]
S は最大ロールアウトラグを示し,eta は学習率を示す。
このことは、地平線に制限された体制において、最大の安定学習率が不安定性に依存しているように見える理由を説明する。
論文 参考訳(メタデータ) (2026-07-01T15:40:12Z) - Rethinking the Divergence Regularization in LLM RL [56.952725733148746]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)の訓練後において重要な要素となっている。
そこで本稿では,ハードマスクをスムーズなアドバンテージ重み付き二次正規化器に置き換える多変量正規化政策最適化(DRPO)を提案する。
DRPOはDPPOと同じ信頼領域を保ちながら、有界で連続的な勾配重みを誘導する。
論文 参考訳(メタデータ) (2026-06-08T17:58:23Z) - Adaptive Patching Is Harder Than It Looks For Time-Series Forecasting [11.469701541304737]
条件下では、コンテンツ適応型パッチ演算子は、チューニングされた均一な演算よりもパフォーマンスがよい。
適応パッチは、調整された均一なベースラインに対して評価されるべきである。
論文 参考訳(メタデータ) (2026-06-02T15:49:06Z) - Recovering Physical Dynamics from Discrete Observations via Intrinsic Differential Consistency [12.266189649117003]
我々は地域の監督をグローバルな構造的制約に置き換える。
この特性からの偏差が2つの目的に作用する時間条件のセカント速度場を訓練する。
トレーニング正則化器として、時間スケールで一貫して構成されるフローに仮説空間を限定する。
論文 参考訳(メタデータ) (2026-05-08T20:24:32Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - Shuffle the Context: RoPE-Perturbed Self-Distillation for Long-Context Adaptation [86.62036852878354]
大規模言語モデル(LLM)は、信頼性の高い長文理解を必要とする設定でますます運用される。
位置ロバスト性を向上させるトレーニングレギュレータであるRoPE-Perturbed Self-Distillationを提案する。
Llama-3-8BとQwen-3-4Bの長文適応実験は、長文ベンチマークにおいて一貫した利得を示す。
論文 参考訳(メタデータ) (2026-04-15T18:46:35Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Adaptive Deadline and Batch Layered Synchronized Federated Learning [66.93447103966439]
フェデレートラーニング(FL)は、データプライバシを保持しながら、分散エッジデバイス間で協調的なモデルトレーニングを可能にする。
我々は,レイヤワイドアグリゲーションのために,ラウンド単位の期限とユーザ固有のバッチサイズを共同で最適化する新しいフレームワークADEL-FLを提案する。
論文 参考訳(メタデータ) (2025-05-29T19:59:18Z) - Aggregation on Learnable Manifolds for Asynchronous Federated Optimization [3.8208848658169763]
曲線学習としてアグリゲーションを取り入れた幾何学的枠組みを導入する。
そこで我々は,線形アグリゲーションを低次曲率成分に置き換えたAsyncBezierを提案する。
これらの利得は、他の方法がより高いローカルな計算予算に割り当てられた場合でも維持されることを示す。
論文 参考訳(メタデータ) (2025-03-18T16:36:59Z) - Minibatch vs Local SGD with Shuffling: Tight Convergence Bounds and
Beyond [63.59034509960994]
シャッフルに基づく変種(ミニバッチと局所ランダムリシャッフル)について検討する。
ポリアック・ロジャシエヴィチ条件を満たす滑らかな函数に対して、これらのシャッフル型不変量(英語版)(shuffling-based variants)がそれらの置換式よりも早く収束することを示す収束境界を得る。
我々は, 同期シャッフル法と呼ばれるアルゴリズムの修正を提案し, ほぼ均一な条件下では, 下界よりも収束速度が速くなった。
論文 参考訳(メタデータ) (2021-10-20T02:25:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。