論文の概要: Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.18722v3
- Date: Fri, 24 Jul 2026 17:06:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 14:08:30.882706
- Title: Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning
- Title(参考訳): 安定だが安定:非同期強化学習のための安定度適応信頼領域
- Abstract要約: 非同期強化学習は、最適化からロールアウト生成を分離することでスループットを向上させる。
結果として生じる不安定さは必然的な副産物であり、ポリシーラグ、エンジン遅延、およびエキスパートの混合ルーティングによって共同で合成される。
本稿では,分割されたサンプルログ比を実用的な安定化プロキシとして利用するStaleness-Adaptive Trust Region (SAT)を紹介した。
- 参考スコア(独自算出の注目度): 33.56197101721029
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Asynchronous reinforcement learning improves throughput by decoupling rollout generation from optimization, but the resulting staleness is an inevitable byproduct, compounded jointly by policy lag, engine delays, and mixture-of-experts routing. From a trust-region perspective, this mismatch is critical: in the finite-horizon improvement bound, training-inference divergence governs the approximation error, whereas PPO clipping only gates sampled outward updates and therefore acts as a sampled surrogate rather than a full-policy constraint. As a result, the high-staleness update can remain weakly controlled in exactly the asynchronous regime where stale rollouts matter most. We introduce the Staleness-Adaptive Trust Region (SAT), which uses the detached sampled log-ratio as a practical staleness proxy, identifies the high-mismatch tail within each batch through Staleness-based kernel function scaling, and contracts only the sign-selected endpoint of the nominal PPO interval using Effective contraction factors. This design preserves the baseline behavior on ordinary tokens, while making the update more conservative exactly on newly intercepted outward bands. We evaluate SAT in a fully decoupled asynchronous reinforcement learning setup built on Qwen3-30B-A3B-Base, leveraging SGLang as the inference engine and Megatron as the training pipeline. In this setting, SAT-GSPO w/ R3 attains the best observed AIME24 avg@8, reaching 35.83 at lag 1 and 34.79 at lag 8, while SAT-GSPO reaches 34.17 at lag 1. More broadly, the results indicate that aligning the clip interval with observed staleness heterogeneity is an effective way to stabilize the reported asynchronous regime.
- Abstract(参考訳): 非同期強化学習は、最適化からロールアウト生成を分離することでスループットを向上させるが、結果として生じる不安定さは必然的な副産物であり、ポリシーラグ、エンジン遅延、およびエキスパートの混成ルーティングによって結合される。
有限水平改善バウンダリでは、トレーニングと推論のばらつきが近似誤差を制御し、一方PPOは、サンプリングされたゲートのみを外向きに切断することで、完全な政治的制約ではなくサンプリングされたサロゲートとして機能する。
その結果、古いロールアウトが最も重要となる非同期な状態において、高安定性の更新は弱い制御を保ち続けることができる。
本稿では,Staleness-Adaptive Trust Region (SAT)を紹介した。これは,分割されたサンプルログ比を実用的な安定化プロキシとして使用し,Stalenessベースのカーネル関数スケーリングを通じて各バッチ内の高ミスマッチテールを特定し,有効収縮係数を用いて名目PPO間隔の符号選択エンドポイントのみを契約する。
この設計は通常のトークンのベースライン動作を保ちつつ、更新を新しくインターセプトされた外付けバンドで正確に保守的にする。
SATをQwen3-30B-A3B-Base上に構築し,SGLangを推論エンジンとし,Megatronをトレーニングパイプラインとして利用する。
この設定では、SAT-GSPO w/R3は最も観測されたAIME24 avg@8に達し、ラグ1で35.83、ラグ8で34.79、ラグ1で34.17に達する。
より広範に, 報告された非同期状態を安定化させる有効な方法として, クリップ間隔と観察された安定度の不均一性との整合性が示唆された。
関連論文リスト
- One Step, One Lead: Mitigating Higher-Order Interference in Multi-Domain Reinforcement Learning via Cross-Step Control [62.82372407840088]
同点領域勾配は、連続的な更新が出力空間で部分的に逆転する場合においても、ほぼ一定であることを示す。
トークンレベルのリバウンドリスクをランク付けするために,各イテレーションでフォーカスドメインを指定するOSOLを提案する。
OSOLは0.4822のドメイン-マクロ平均に達し、最強の比較ベースラインよりも5.7%向上した。
論文 参考訳(メタデータ) (2026-09-06T08:32:59Z) - Simultaneous Coverage and Efficiency Guarantee in Online Conformal Prediction [5.533296779866529]
GibbsとCandsの適応共形推論(ACI)とその変種は、分散シフトの下でのオンライン共形予測に対する標準的なアプローチである。
既存の保証は予測セットのサイズについて何も言及しないので、不完全な予測セットのコストで、妥当性は自明に達成できる。
絶対的かつ最適でないカバレッジ違反と予測セット効率を同時に制御する統合オンライン学習フレームワークを検討する。
論文 参考訳(メタデータ) (2026-07-29T07:56:59Z) - Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning [6.667218294299622]
非同期強化学習(RL)は、ポリシー最適化と重複するロールアウト生成によって、大規模言語モデル(LLM)の訓練後を加速する。
既存の方法では、トークンの重要度のみに基づいてトークンを保管または廃棄するのが一般的である。
本研究では,各トークンの局所的なエントロピーによるオフ・ポリティクスの偏差を拡大するエントロピー・スケール・トラスト・リージョン(ESTR)を提案する。
論文 参考訳(メタデータ) (2026-07-24T10:55:42Z) - Staleness-Learning Rate Scaling Laws for Asynchronous RLHF [18.98349589222509]
S は最大ロールアウトラグを示し,eta は学習率を示す。
このことは、地平線に制限された体制において、最大の安定学習率が不安定性に依存しているように見える理由を説明する。
論文 参考訳(メタデータ) (2026-07-01T15:40:12Z) - SATB-VR: Training Few-Step Video Restoration Diffusion Model using SNR-Aware Trajectory Blending [55.764018145256216]
本稿では,補助予測器を介してデノナイジングプロセスを開始する数ステップのパラダイムであるSATB-VRを提案する。
我々は,SATB-VRが,合成,実世界,AIGCベンチマークにおける既存のアプローチに対して良好に動作することを示す。
論文 参考訳(メタデータ) (2026-06-27T01:32:16Z) - Rethinking the Divergence Regularization in LLM RL [56.952725733148746]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)の訓練後において重要な要素となっている。
そこで本稿では,ハードマスクをスムーズなアドバンテージ重み付き二次正規化器に置き換える多変量正規化政策最適化(DRPO)を提案する。
DRPOはDPPOと同じ信頼領域を保ちながら、有界で連続的な勾配重みを誘導する。
論文 参考訳(メタデータ) (2026-06-08T17:58:23Z) - Adaptive Patching Is Harder Than It Looks For Time-Series Forecasting [11.469701541304737]
条件下では、コンテンツ適応型パッチ演算子は、チューニングされた均一な演算よりもパフォーマンスがよい。
適応パッチは、調整された均一なベースラインに対して評価されるべきである。
論文 参考訳(メタデータ) (2026-06-02T15:49:06Z) - Unveiling the Entropy Dynamics of Chain-of-Thought Reasoning [81.57028614960576]
1)信頼性の高い -- 信頼性の高い -- 信頼性の高い領域での回答は高度に正確で安定したものになり、2)高冗長性 -- モデルは正しい回答に達した後ずっと経ってから不必要なトークンを生成する。
これらの特性はより効率的で信頼性の高い推論戦略を解き放つ。
論文 参考訳(メタデータ) (2026-06-01T10:11:14Z) - PairDropGS: Paired Dropout-Induced Consistency Regularization for Sparse-View Gaussian Splatting [81.95709983545666]
ドロップアウトに基づくスパースビュー3DGS法は、トレーニング中にガウス原始体をランダムに抑制することで過度な適合を緩和する。
PairDropGS, Paired Dropout-induced Consistency Regularization framework for sparse-view Gaussian splattingを提案する。
PairDropGSはトレーニングの安定性が向上し、既存のドロップアウトベースの3DGS手法よりも再現性が高いことが、広く使用されているスパースビューベンチマークで実証された。
論文 参考訳(メタデータ) (2026-05-12T13:00:39Z) - Recovering Physical Dynamics from Discrete Observations via Intrinsic Differential Consistency [12.266189649117003]
我々は地域の監督をグローバルな構造的制約に置き換える。
この特性からの偏差が2つの目的に作用する時間条件のセカント速度場を訓練する。
トレーニング正則化器として、時間スケールで一貫して構成されるフローに仮説空間を限定する。
論文 参考訳(メタデータ) (2026-05-08T20:24:32Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - Shuffle the Context: RoPE-Perturbed Self-Distillation for Long-Context Adaptation [86.62036852878354]
大規模言語モデル(LLM)は、信頼性の高い長文理解を必要とする設定でますます運用される。
位置ロバスト性を向上させるトレーニングレギュレータであるRoPE-Perturbed Self-Distillationを提案する。
Llama-3-8BとQwen-3-4Bの長文適応実験は、長文ベンチマークにおいて一貫した利得を示す。
論文 参考訳(メタデータ) (2026-04-15T18:46:35Z) - Taming the Instability: A Robust Second-Order Optimizer for Federated Learning over Non-IID Data [77.19117648492104]
We present Federated Robust Curvature Optimization (FedRCO), a novel second-order optimization framework designed to improve convergence speed and reduce communication cost。
FedRCOは、効率的な近似曲率と証明可能な安定性メカニズムを統合することで、これらの課題に対処する。
我々は,FedRCOが,最先端の1次法と2次法のどちらよりも高い精度と高速な収束を実現しつつ,多種多様な非IIDシナリオに対して優れたロバスト性を実現することを示す。
論文 参考訳(メタデータ) (2026-03-30T11:37:46Z) - Baguan-TS: A Sequence-Native In-Context Learning Model for Time Series Forecasting with Covariates [31.296823831987748]
Baguan-TSは、3Dトランスフォーマーによってインスタンス化されるICLと生系列表現学習を統合している。
i) キャリブレーションとトレーニング安定性, 特徴に依存しない目標空間検索に基づく局所キャリブレーション, および (ii) コンテクストオーバーフィッティング戦略によって緩和された出力過スムージングの2つの主要なハードルに対処する。
論文 参考訳(メタデータ) (2026-03-18T07:24:19Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Generalizing GNNs with Tokenized Mixture of Experts [75.8310720413187]
安定性の向上には,変化に敏感な特徴への依存を低減し,既約最悪の一般化フロアを残す必要があることを示す。
本研究では,STEM-GNNを提案する。STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN。
9つのノード、リンク、グラフのベンチマークで、STEM-GNNはより強力な3方向バランスを実現し、クリアグラフ上での競争力を維持しながら、次数/ホモフィリーシフトや特徴/エッジの破損に対する堅牢性を改善している。
論文 参考訳(メタデータ) (2026-02-09T22:48:30Z) - Adaptive Deadline and Batch Layered Synchronized Federated Learning [66.93447103966439]
フェデレートラーニング(FL)は、データプライバシを保持しながら、分散エッジデバイス間で協調的なモデルトレーニングを可能にする。
我々は,レイヤワイドアグリゲーションのために,ラウンド単位の期限とユーザ固有のバッチサイズを共同で最適化する新しいフレームワークADEL-FLを提案する。
論文 参考訳(メタデータ) (2025-05-29T19:59:18Z) - Aggregation on Learnable Manifolds for Asynchronous Federated Optimization [3.8208848658169763]
曲線学習としてアグリゲーションを取り入れた幾何学的枠組みを導入する。
そこで我々は,線形アグリゲーションを低次曲率成分に置き換えたAsyncBezierを提案する。
これらの利得は、他の方法がより高いローカルな計算予算に割り当てられた場合でも維持されることを示す。
論文 参考訳(メタデータ) (2025-03-18T16:36:59Z) - Minibatch vs Local SGD with Shuffling: Tight Convergence Bounds and
Beyond [63.59034509960994]
シャッフルに基づく変種(ミニバッチと局所ランダムリシャッフル)について検討する。
ポリアック・ロジャシエヴィチ条件を満たす滑らかな函数に対して、これらのシャッフル型不変量(英語版)(shuffling-based variants)がそれらの置換式よりも早く収束することを示す収束境界を得る。
我々は, 同期シャッフル法と呼ばれるアルゴリズムの修正を提案し, ほぼ均一な条件下では, 下界よりも収束速度が速くなった。
論文 参考訳(メタデータ) (2021-10-20T02:25:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。