論文の概要: Staleness-Learning Rate Scaling Laws for Asynchronous RLHF
- arxiv url: http://arxiv.org/abs/2607.01083v2
- Date: Thu, 02 Jul 2026 05:48:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 15:16:32.264518
- Title: Staleness-Learning Rate Scaling Laws for Asynchronous RLHF
- Title(参考訳): 非同期RLHFの定常学習速度スケーリング則
- Abstract要約: S は最大ロールアウトラグを示し,eta は学習率を示す。
このことは、地平線に制限された体制において、最大の安定学習率が不安定性に依存しているように見える理由を説明する。
- 参考スコア(独自算出の注目度): 18.98349589222509
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: High-throughput RLHF systems often decouple rollout generation from policy optimization, leading to the use of stale rollouts during learner updates. In this work, we study the effect of such staleness in asynchronous GRPO. We make the behavior policy explicit in the GRPO surrogate objective and distinguish between the surrogate-gradient mapping used by the learner and the true total derivative of a distribution-dependent population objective. Under assumptions of local boundedness, distributional smoothness, and behavior-policy smoothness, we show that stale rollouts introduce a per-step surrogate-gradient bias of order O(S * eta), where S denotes the maximum rollout lag and eta denotes the learning rate. We further derive a conditional collapse-time scaling law: when within-cycle drift remains below a batch-level clipping radius, collapse is governed primarily by cumulative learner drift T * eta; when the stale-rollout constraint is active, stability instead depends explicitly on S * eta. This yields a two-constraint stability condition eta << min{R_batch / (S * G_upd), R_crit / (T * G_upd)}, explaining why the maximum stable learning rate may appear weakly dependent on staleness in the horizon-limited regime.
- Abstract(参考訳): 高スループットのRLHFシステムは、しばしばポリシー最適化からロールアウト生成を分離し、学習者の更新時に古いロールアウトを使用する。
本研究では,非同期GRPOにおけるこのような安定化の効果について検討する。
本研究では,GRPOサロゲート対象の行動ポリシーを明確にし,学習者が使用するサロゲート・グラディエントマッピングと分布依存型人口目標の真の全微分とを区別する。
局所的有界性, 分布的滑らか性, 行動-政治的滑らか性の仮定により, スタイルロールアウトは, S が最大ロールアウトラグ, eta が学習率を表す順序 O(S * eta) のステップごとのサロゲート勾配バイアスをもたらすことを示した。
さらに, サイクル内ドリフトがバッチレベルクリッピング半径以下である場合, 崩壊は主に累積学習者ドリフトT * etaによって制御される。
これにより、二拘束安定性条件 eta <<< min{R_batch / (S * G_upd), R_crit / (T * G_upd)} が得られる。
関連論文リスト
- LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction [59.32834240526981]
フローベース生成モデルは典型的には、決定論的常微分方程式(ODE)を解くことによってサンプリングされる
既存の流れモデルのためのGRPO法は、訓練中にオイラー時間ODEを非等方微分方程式(SDE)に置き換える。
本稿では,フローベースGRPOフレームワークであるLC-GRPOを紹介する。
論文 参考訳(メタデータ) (2026-08-06T04:47:57Z) - RELTA-SGLD: Relative-Growth Localized Taming for Nonconvex Stochastic-Gradient Langevin Learning [10.599439539657785]
RELTA-SGLDは,過線形の漸進的な更新を安定化し,元の学習の不要な抑制を低減させるテーキング方式である。
閾値はテーミングのオン位置を決定するが、一方1段階のリャプノフ条件に由来する相対成長原理はテーミング強度を決定する。
論文 参考訳(メタデータ) (2026-07-21T19:43:54Z) - SGD at the Edge of Stability: Stochastic Stabilization with Large Learning Rates [2.104588729923885]
現代のディープラーニングは、安定性の端で機能することが示されている。
マルチクラスクロスエントロピー損失に適用したグラディエント・ディキセント(SGD)の収束保証を提供する。
実験は、我々の理論的な知見を検証し、大規模体制におけるSGDの利点を実証する。
論文 参考訳(メタデータ) (2026-06-29T21:32:58Z) - Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - Recovering Physical Dynamics from Discrete Observations via Intrinsic Differential Consistency [12.266189649117003]
我々は地域の監督をグローバルな構造的制約に置き換える。
この特性からの偏差が2つの目的に作用する時間条件のセカント速度場を訓練する。
トレーニング正則化器として、時間スケールで一貫して構成されるフローに仮説空間を限定する。
論文 参考訳(メタデータ) (2026-05-08T20:24:32Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training [18.849117699859622]
訓練安定性は、大規模言語モデルの強化学習における中心的な課題である。
変動周波数レベルのソフトポリシー最適化(VESPO)を提案する。
数学的推論ベンチマークの実験では、VESPOは安定なトレーニングを64倍の安定度と完全な非同期実行で維持している。
論文 参考訳(メタデータ) (2026-02-11T09:48:08Z) - Stability as a Liability:Systematic Breakdown of Linguistic Structure in LLMs [5.96875296117642]
安定なパラメータトラジェクトリが定常解を導出し、経験的分布へのKLの分岐を最小化することを示す。
制御されたフィードバックベースのトレーニングフレームワークを用いて,この効果を実証的に検証する。
これは、最適化の安定性と生成的表現性は本質的に一致していないことを示し、安定性のみが生成的品質の指標として不十分であることを示している。
論文 参考訳(メタデータ) (2026-01-26T15:34:50Z) - Distributed Stochastic Gradient Descent with Staleness: A Stochastic Delay Differential Equation Based Framework [56.82432591933544]
分散勾配降下(SGD)は、計算リソースのスケーリング、トレーニング時間の短縮、マシンラーニングにおけるユーザのプライバシ保護の支援などにより、近年注目されている。
本稿では,遅延微分方程式(SDDE)と勾配到着の近似に基づく分散SGDの実行時間と安定化について述べる。
活性化作業員の増加は, 安定度による分散SGDを必ずしも加速させるものではないことが興味深い。
論文 参考訳(メタデータ) (2024-06-17T02:56:55Z) - Distributionally Time-Varying Online Stochastic Optimization under
Polyak-{\L}ojasiewicz Condition with Application in Conditional Value-at-Risk
Statistical Learning [9.749745086213215]
オンライン最適化のレンズによる時間変化分布に続き、一連の最適化問題を考察する。
本研究では,CVaR学習問題に適用可能であることを示す。
論文 参考訳(メタデータ) (2023-09-18T00:47:08Z) - Fine-Grained Analysis of Stability and Generalization for Stochastic
Gradient Descent [55.85456985750134]
我々は,SGDの反復的リスクによって制御される新しい境界を開発する,平均モデル安定性と呼ばれる新しい安定性尺度を導入する。
これにより、最良のモデルの振舞いによって一般化境界が得られ、低雑音環境における最初の既知の高速境界が導かれる。
我々の知る限りでは、このことはSGDの微分不能な損失関数でさえも初めて知られている安定性と一般化を与える。
論文 参考訳(メタデータ) (2020-06-15T06:30:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。