論文の概要: Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.18722v1
- Date: Tue, 21 Jul 2026 05:27:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.316756
- Title: Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning
- Title(参考訳): 安定だが安定:非同期強化学習のための安定度適応信頼領域
- Abstract要約: 非同期強化学習は、最適化からロールアウト生成を分離することでスループットを向上させる。
しかし、老朽化は、政策遅延、エンジン遅延、およびエキスパートの混成ルーティングが混在する必然的な副産物である。
本稿では,分割されたサンプルログ比を実用的な安定化プロキシとして利用するStaleness-Adaptive Trust Region (SAT)を紹介した。
- 参考スコア(独自算出の注目度): 33.56197101721029
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Asynchronous reinforcement learning improves throughput by decoupling rollout generation from optimization, but staleness is an inevitable byproduct compounded by policy lag, engine delays, and mixture-of-experts routing. From a trust-region perspective, this mismatch is critical: training-inference divergence governs approximation error in finite-horizon bounds, whereas PPO clipping only gates sampled outward updates, acting as a sampled surrogate rather than a full-policy constraint. As a result, high-staleness updates remain weakly controlled in the asynchronous regime where stale rollouts matter most. We introduce the Staleness-Adaptive Trust Region (SAT), which uses the detached sampled log-ratio as a practical staleness proxy, identifies high-mismatch tails within each batch via staleness-based kernel scaling, and contracts only the sign-selected endpoint of the nominal PPO interval. This preserves baseline behavior on ordinary tokens while enforcing more conservative updates on newly intercepted outward bands. We prove local interval containment and pointwise pessimism relative to PPO, showing how the adaptive rule reshapes update geometry under heterogeneous staleness. We evaluate SAT in a decoupled asynchronous RL setup built on Qwen3-30B-A3B-Base, using SGLang as the inference engine and Megatron for training. In this setting, SAT-GSPO w/ R3 achieves the best observed AIME24 avg@8, reaching 35.83 at lag 1 and 34.79 at lag 8, while SAT-GSPO reaches 34.17 at lag 1. Adaptive clipping and routing replay act as complementary stabilizers targeting mismatch tails and routing inconsistency, respectively. Overall, aligning clip intervals with staleness heterogeneity effectively stabilizes asynchronous RL.
- Abstract(参考訳): 同期強化学習は、最適化からロールアウト生成を分離することでスループットを向上させるが、安定度は、ポリシーラグ、エンジン遅延、およびエキスパートの混合ルーティングが混在する必然的な副産物である。
訓練-推論のばらつきは有限水平境界における近似誤差を支配し、一方PPOクリッピングは外向き更新でサンプリングされたゲートのみを切断し、完全な政治的制約ではなくサンプリングされたサロゲートとして機能する。
その結果、古いロールアウトが最も重要となる非同期な状態において、高安定性の更新は依然として弱く制御されている。
我々は,分割されたサンプルログ比を実用的な安定化プロキシとして使用し,スタネスベースのカーネルスケーリングを通じて各バッチ内の高ミスマッチテールを識別し,名目PPO間隔の符号選択エンドポイントのみを契約するStaleness-Adaptive Trust Region (SAT)を紹介した。
これは通常のトークンのベースライン動作を保ちつつ、新たにインターセプトされた外部バンドのより保守的な更新を強制する。
PPOと比較して局所的間隔の包含と点方向の悲観性を証明し、適応規則が不均一な安定化の下での幾何の更新にどう影響するかを示した。
SATをQwen3-30B-A3B-Base上に構築し,SGLangを推論エンジンとし,Megatronをトレーニングに用いる。
この設定では、SAT-GSPO w/R3は最もよく観測されたAIME24 avg@8に達し、ラグ1で35.83、ラグ8で34.79となり、SAT-GSPOはラグ1で34.17に達する。
アダプティブ・クリッピングとルーティング・リプレイは、それぞれミスマッチ・テールとルーティングの不整合をターゲットとした補完的な安定化器として機能する。
全体として、クリップ間隔を不均一性と整合させることは、非同期RLを効果的に安定化させる。
関連論文リスト
- One Step, One Lead: Mitigating Higher-Order Interference in Multi-Domain Reinforcement Learning via Cross-Step Control [62.82372407840088]
同点領域勾配は、連続的な更新が出力空間で部分的に逆転する場合においても、ほぼ一定であることを示す。
トークンレベルのリバウンドリスクをランク付けするために,各イテレーションでフォーカスドメインを指定するOSOLを提案する。
OSOLは0.4822のドメイン-マクロ平均に達し、最強の比較ベースラインよりも5.7%向上した。
論文 参考訳(メタデータ) (2026-09-06T08:32:59Z) - Simultaneous Coverage and Efficiency Guarantee in Online Conformal Prediction [5.533296779866529]
GibbsとCandsの適応共形推論(ACI)とその変種は、分散シフトの下でのオンライン共形予測に対する標準的なアプローチである。
既存の保証は予測セットのサイズについて何も言及しないので、不完全な予測セットのコストで、妥当性は自明に達成できる。
絶対的かつ最適でないカバレッジ違反と予測セット効率を同時に制御する統合オンライン学習フレームワークを検討する。
論文 参考訳(メタデータ) (2026-07-29T07:56:59Z) - Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning [6.667218294299622]
非同期強化学習(RL)は、ポリシー最適化と重複するロールアウト生成によって、大規模言語モデル(LLM)の訓練後を加速する。
既存の方法では、トークンの重要度のみに基づいてトークンを保管または廃棄するのが一般的である。
本研究では,各トークンの局所的なエントロピーによるオフ・ポリティクスの偏差を拡大するエントロピー・スケール・トラスト・リージョン(ESTR)を提案する。
論文 参考訳(メタデータ) (2026-07-24T10:55:42Z) - Staleness-Learning Rate Scaling Laws for Asynchronous RLHF [18.98349589222509]
S は最大ロールアウトラグを示し,eta は学習率を示す。
このことは、地平線に制限された体制において、最大の安定学習率が不安定性に依存しているように見える理由を説明する。
論文 参考訳(メタデータ) (2026-07-01T15:40:12Z) - SATB-VR: Training Few-Step Video Restoration Diffusion Model using SNR-Aware Trajectory Blending [55.764018145256216]
本稿では,補助予測器を介してデノナイジングプロセスを開始する数ステップのパラダイムであるSATB-VRを提案する。
我々は,SATB-VRが,合成,実世界,AIGCベンチマークにおける既存のアプローチに対して良好に動作することを示す。
論文 参考訳(メタデータ) (2026-06-27T01:32:16Z) - Rethinking the Divergence Regularization in LLM RL [56.952725733148746]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)の訓練後において重要な要素となっている。
そこで本稿では,ハードマスクをスムーズなアドバンテージ重み付き二次正規化器に置き換える多変量正規化政策最適化(DRPO)を提案する。
DRPOはDPPOと同じ信頼領域を保ちながら、有界で連続的な勾配重みを誘導する。
論文 参考訳(メタデータ) (2026-06-08T17:58:23Z) - Adaptive Patching Is Harder Than It Looks For Time-Series Forecasting [11.469701541304737]
条件下では、コンテンツ適応型パッチ演算子は、チューニングされた均一な演算よりもパフォーマンスがよい。
適応パッチは、調整された均一なベースラインに対して評価されるべきである。
論文 参考訳(メタデータ) (2026-06-02T15:49:06Z) - Unveiling the Entropy Dynamics of Chain-of-Thought Reasoning [81.57028614960576]
1)信頼性の高い -- 信頼性の高い -- 信頼性の高い領域での回答は高度に正確で安定したものになり、2)高冗長性 -- モデルは正しい回答に達した後ずっと経ってから不必要なトークンを生成する。
これらの特性はより効率的で信頼性の高い推論戦略を解き放つ。
論文 参考訳(メタデータ) (2026-06-01T10:11:14Z) - PairDropGS: Paired Dropout-Induced Consistency Regularization for Sparse-View Gaussian Splatting [81.95709983545666]
ドロップアウトに基づくスパースビュー3DGS法は、トレーニング中にガウス原始体をランダムに抑制することで過度な適合を緩和する。
PairDropGS, Paired Dropout-induced Consistency Regularization framework for sparse-view Gaussian splattingを提案する。
PairDropGSはトレーニングの安定性が向上し、既存のドロップアウトベースの3DGS手法よりも再現性が高いことが、広く使用されているスパースビューベンチマークで実証された。
論文 参考訳(メタデータ) (2026-05-12T13:00:39Z) - Recovering Physical Dynamics from Discrete Observations via Intrinsic Differential Consistency [12.266189649117003]
我々は地域の監督をグローバルな構造的制約に置き換える。
この特性からの偏差が2つの目的に作用する時間条件のセカント速度場を訓練する。
トレーニング正則化器として、時間スケールで一貫して構成されるフローに仮説空間を限定する。
論文 参考訳(メタデータ) (2026-05-08T20:24:32Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - Shuffle the Context: RoPE-Perturbed Self-Distillation for Long-Context Adaptation [86.62036852878354]
大規模言語モデル(LLM)は、信頼性の高い長文理解を必要とする設定でますます運用される。
位置ロバスト性を向上させるトレーニングレギュレータであるRoPE-Perturbed Self-Distillationを提案する。
Llama-3-8BとQwen-3-4Bの長文適応実験は、長文ベンチマークにおいて一貫した利得を示す。
論文 参考訳(メタデータ) (2026-04-15T18:46:35Z) - Taming the Instability: A Robust Second-Order Optimizer for Federated Learning over Non-IID Data [77.19117648492104]
We present Federated Robust Curvature Optimization (FedRCO), a novel second-order optimization framework designed to improve convergence speed and reduce communication cost。
FedRCOは、効率的な近似曲率と証明可能な安定性メカニズムを統合することで、これらの課題に対処する。
我々は,FedRCOが,最先端の1次法と2次法のどちらよりも高い精度と高速な収束を実現しつつ,多種多様な非IIDシナリオに対して優れたロバスト性を実現することを示す。
論文 参考訳(メタデータ) (2026-03-30T11:37:46Z) - Baguan-TS: A Sequence-Native In-Context Learning Model for Time Series Forecasting with Covariates [31.296823831987748]
Baguan-TSは、3Dトランスフォーマーによってインスタンス化されるICLと生系列表現学習を統合している。
i) キャリブレーションとトレーニング安定性, 特徴に依存しない目標空間検索に基づく局所キャリブレーション, および (ii) コンテクストオーバーフィッティング戦略によって緩和された出力過スムージングの2つの主要なハードルに対処する。
論文 参考訳(メタデータ) (2026-03-18T07:24:19Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Generalizing GNNs with Tokenized Mixture of Experts [75.8310720413187]
安定性の向上には,変化に敏感な特徴への依存を低減し,既約最悪の一般化フロアを残す必要があることを示す。
本研究では,STEM-GNNを提案する。STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN。
9つのノード、リンク、グラフのベンチマークで、STEM-GNNはより強力な3方向バランスを実現し、クリアグラフ上での競争力を維持しながら、次数/ホモフィリーシフトや特徴/エッジの破損に対する堅牢性を改善している。
論文 参考訳(メタデータ) (2026-02-09T22:48:30Z) - Adaptive Deadline and Batch Layered Synchronized Federated Learning [66.93447103966439]
フェデレートラーニング(FL)は、データプライバシを保持しながら、分散エッジデバイス間で協調的なモデルトレーニングを可能にする。
我々は,レイヤワイドアグリゲーションのために,ラウンド単位の期限とユーザ固有のバッチサイズを共同で最適化する新しいフレームワークADEL-FLを提案する。
論文 参考訳(メタデータ) (2025-05-29T19:59:18Z) - Aggregation on Learnable Manifolds for Asynchronous Federated Optimization [3.8208848658169763]
曲線学習としてアグリゲーションを取り入れた幾何学的枠組みを導入する。
そこで我々は,線形アグリゲーションを低次曲率成分に置き換えたAsyncBezierを提案する。
これらの利得は、他の方法がより高いローカルな計算予算に割り当てられた場合でも維持されることを示す。
論文 参考訳(メタデータ) (2025-03-18T16:36:59Z) - Minibatch vs Local SGD with Shuffling: Tight Convergence Bounds and
Beyond [63.59034509960994]
シャッフルに基づく変種(ミニバッチと局所ランダムリシャッフル)について検討する。
ポリアック・ロジャシエヴィチ条件を満たす滑らかな函数に対して、これらのシャッフル型不変量(英語版)(shuffling-based variants)がそれらの置換式よりも早く収束することを示す収束境界を得る。
我々は, 同期シャッフル法と呼ばれるアルゴリズムの修正を提案し, ほぼ均一な条件下では, 下界よりも収束速度が速くなった。
論文 参考訳(メタデータ) (2021-10-20T02:25:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。