論文の概要: Predictable GRPO: A Closed-Form Model of Training Dynamics
- arxiv url: http://arxiv.org/abs/2606.30789v2
- Date: Wed, 01 Jul 2026 14:28:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.07166
- Title: Predictable GRPO: A Closed-Form Model of Training Dynamics
- Title(参考訳): 予測可能なGRPO:トレーニングダイナミクスのクローズドフォームモデル
- Authors: Rajat Ghosh, Datta Nimmaturi, Aryan Singhal, Vaishnavi Bhargava, Henry Wong, Johnu George, Debojyoti Dutta,
- Abstract要約: 我々はこれらの力学の第一原理還元次モデルを開発する。
グループサイズは、ノイズ温度として、先行順に入力される。
3つのモデルと2つのグループサイズで、クローズドフォームの軌道はトレーニング報酬をR2 geq 0.91$に適合させる。
- 参考スコア(独自算出の注目度): 1.0537323885285492
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We develop a first-principles reduced-order model of these dynamics. Under a single mean-field assumption that summarizes the policy by its expected reward, we reduce the GRPO update to a stochastically-forced damped oscillator whose mass, damping, and stiffness are fixed in closed form by the optimizer hyperparameters together with a single measured curvature scale -- momentum supplies the inertia, off-policy lag erodes the damping, and the group size enters, to leading order, as a noise temperature. The reduction has three consequences. First, it subsumes the empirical single-exponential saturation law as its overdamped limit, recasting the fitted plateau, timescale, and size exponent as the fixed point, inverse stiffness, and curvature-scaling exponent of the underlying potential, and adding, through the retained inertial term, the slow-start phase the single exponential cannot represent. Second, it yields predictions tied to independently measurable quantities rather than fitted ones: group-size invariance of the deterministic trajectory with a $1/G$ stationary fluctuation, a sharp stability threshold in the refresh interval, and an overdamped-to-oscillatory transition. Third, it furnishes diagnostics that separate failure modes a reward curve alone conflates -- reward hacking, advantage degeneracy, policy concentration, and dynamical instability. Across three models and two group sizes, the closed-form trajectory fits training reward to $R^2 \geq 0.91$ and the mean trajectory is group-size invariant to leading order -- on both the reward curve and out-of-distribution transfer to eight math benchmarks -- while the within-group reward spread retains a residual $G$-dependence that the leading-order temperature picture does not capture.
- Abstract(参考訳): 我々はこれらの力学の第一原理還元次モデルを開発する。
期待される報酬によってポリシーを要約する1つの平均場仮定の下で、GRPO更新を1つの測定された曲率スケールとともにオプティマイザハイパーパラメータによって閉じた形に固定した確率的に強化された減衰発振器に還元し、その運動量によって慣性、非政治ラグが減衰を侵食し、グループサイズが先頭の順に進入する。
削減には3つの結果がある。
まず、経験的単指数飽和法則を過大な限界として仮定し、固定された台地、時間スケール、サイズ指数を固定点、逆剛性、および下層のポテンシャルの曲率スケーリング指数として再キャストし、維持された慣性項を通じて単指数が表せないスロースタート位相を追加する。
第二に、決定論的軌道の集団サイズの不変度と1/G$の定常変動、リフレッシュ間隔の鋭い安定性閾値、過大な破壊から振動遷移という、適合量よりも独立に測定可能な量に結びついた予測が得られる。
第三に、障害モードの分離は、報酬のハッキング、有利な優越性、ポリシーの集中、ダイナミックな不安定性といった、報酬の曲線のみを膨らませる、という診断を提供する。
3つのモデルと2つのグループサイズで、クローズドフォームの軌道はトレーニング報酬をR^2 \geq 0.91$に適合させ、平均軌道は、報酬曲線と8つの数学ベンチマークへのアウト・オブ・ディストリビューション転送の両方に基づいて、先頭の順にグループサイズ不変である。
関連論文リスト
- A Mean-Field Analysis of Multi-Head Self-Attention under Cross-Entropy Training [0.0]
本稿では,クロスエントロピー最小化により学習した単一層因果多頭部自己注意モデルの平均場理論について述べる。
無限の上限において、平均的な注意ログは確率測度上のリスク関数を定義し、その最初の変動は非線形ワッサーシュタイン勾配流方程式を生成する。
我々は,PDEの長期的挙動について検討する:エネルギー散逸,コンパクト性の下での定常集合への収束,トポロジカルあるいはクルディカ-オジャシエヴィチ仮定の下での1つの定常測度への収束,勾配支配条件下での明示的な収束率。
論文 参考訳(メタデータ) (2026-06-09T06:38:27Z) - Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models [56.67321805551389]
Reinforcement Learning (RL) は, 拡散・流れマッチングジェネレータにおいて, 迅速なアライメントと知覚品質の向上に有効な方法となっている。
探索行動の制御と力学のデノベーションを行うサンプルは、この方針の一部である。
有効探査と安定性のバランスをとる新しいサンプリング器を提案する。
論文 参考訳(メタデータ) (2026-05-22T11:37:22Z) - Recovering Physical Dynamics from Discrete Observations via Intrinsic Differential Consistency [12.266189649117003]
我々は地域の監督をグローバルな構造的制約に置き換える。
この特性からの偏差が2つの目的に作用する時間条件のセカント速度場を訓練する。
トレーニング正則化器として、時間スケールで一貫して構成されるフローに仮説空間を限定する。
論文 参考訳(メタデータ) (2026-05-08T20:24:32Z) - Momentum Further Constrains Sharpness at the Edge of Stochastic Stability [0.5405981353784005]
最近の研究は(確率的な)勾配降下が不安定な境界付近で自己組織化し、最適化と解の両方を形作ることを示唆している。
運動量を持つSGDは、バッチサイズ依存の挙動を持つ安定性のエッジ(EoSS)のような状態を示す。
論文 参考訳(メタデータ) (2026-04-15T17:28:46Z) - Non-Equilibrium Stochastic Dynamics as a Unified Framework for Insight and Repetitive Learning: A Kramers Escape Approach to Continual Learning [0.0]
ニューラルネットワークにおける連続学習は、安定性-塑性ジレンマによって根本的に制限される。
両問題が非平衡統計物理学における共通解であることを示す。
論文 参考訳(メタデータ) (2026-04-05T15:42:23Z) - A Generative Sampler for distributions with possible discrete parameter based on Reversibility [9.349846971147256]
本稿では,多種多様な状態空間にまたがって適用可能な,統一的かつ段階的な目標自由な生成サンプリングフレームワークを提案する。
我々は,前方と後方のマルコフ軌道の関節分布の最大平均差 (MMD) を最小化する。
実験により,本フレームワークは熱力学観測器を正確に再現し,すべてのレシエーションでモードスイッチング動作を捉えていることがわかった。
論文 参考訳(メタデータ) (2026-03-10T06:32:51Z) - Forecasting as Rendering: A 2D Gaussian Splatting Framework for Time Series Forecasting [79.37674445572462]
時系列予測(TSF)は、周期内変動と周期間トレンドの複雑な絡み合いのため、依然として困難な問題である。
形状変化テンソルを静止画像として扱うと、トポロジカルミスマッチが発生する。
均一な固定サイズの表現に依存することは、モデリング能力を非効率に割り当てる。
TimeGSは、予測パラダイムをレグレッションから2D生成レンダリングに根本的にシフトする、新しいフレームワークである。
論文 参考訳(メタデータ) (2026-02-10T14:13:36Z) - ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving [64.42138266293202]
ResADは正規化された残留軌道モデリングフレームワークである。
学習タスクを再編成し、慣性参照からの残留偏差を予測する。
NAVSIMベンチマークでは、ResADはバニラ拡散ポリシーを用いて最先端のPDMS 88.6を達成している。
論文 参考訳(メタデータ) (2025-10-09T17:59:36Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - Broadening Target Distributions for Accelerated Diffusion Models via a Novel Analysis Approach [49.97755400231656]
本研究では,新しいDDPMサンプリング器が,これまで考慮されていなかった3種類の分散クラスに対して高速化性能を実現することを示す。
この結果から, DDPM型加速サンプリング器におけるデータ次元$d$への依存性が改善された。
論文 参考訳(メタデータ) (2024-02-21T16:11:47Z) - Beyond the Edge of Stability via Two-step Gradient Updates [49.03389279816152]
Gradient Descent(GD)は、現代の機械学習の強力な仕事場である。
GDが局所最小値を見つける能力は、リプシッツ勾配の損失に対してのみ保証される。
この研究は、2段階の勾配更新の分析を通じて、単純だが代表的でありながら、学習上の問題に焦点をあてる。
論文 参考訳(メタデータ) (2022-06-08T21:32:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。