論文の概要: A Solvable Model of Adaptive Learning Rate Rescaling: Acceleration, Stability & Scaling
- arxiv url: http://arxiv.org/abs/2610.06701v1
- Date: Mon, 05 Oct 2026 17:00:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 23:32:01.415518
- Title: A Solvable Model of Adaptive Learning Rate Rescaling: Acceleration, Stability & Scaling
- Title(参考訳): 適応学習率再スケーリングの解法モデル:加速度,安定性,スケーリング
- Abstract要約: 固定ノルム更新は、勾配が縮むにつれて成長する効果的な学習率をもたらすかを検討する。
我々は、幅制限、エッジ・オブ・ストイスタビリティ(EoSS)および決定論的エッジ・オブ・ストイスタビリティ(EoS)レギュレーションを定量化する。
これらの結果は、正規化誘起加速度、EoS効果、可溶性および幅-バッチ割り当てを動的理論内で結合する。
- 参考スコア(独自算出の注目度): 32.14411517198524
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A recurring design principle in modern optimizers is to decouple update magnitude from the raw gradient norm, yet its consequences for learning-curve and resource scaling remain unclear. We isolate this mechanism by studying normalized SGD in a random-feature model with power-law teacher and data covariance. Fixed-norm updates induce an effective learning rate that grows as gradients shrink. We derive a dynamical mean-field theory (DMFT) describing the joint dependence of the loss on training time, model width and batch size. Normalization initially accelerates SGD, mapping the power-law exponent $r_{\rm SGD}<1$ to $2r_{\rm SGD}/(1-r_{\rm SGD})$, with exponential convergence at $r_{\rm SGD}=1$ and formal finite-time convergence for $r_{\rm SGD}>1$. At finite step size, however, the same feedback ultimately breaks the acceleration and leads to marginal stability. The late-time theory yields width-limited, edge-of-stochastic-stability (EoSS), and deterministic edge-of-stability (EoS) regimes. These phases determine when larger batches or wider models reduce serial training time at comparable compute. We quantify in which of these phases increased batch size or width can compensate the excess compute use per step by fewer optimization steps to target loss. Linearized ResNet experiments on CIFAR-5M support the predicted acceleration, breakdown, and resource-scaling trends. Together, these results connect normalization-induced acceleration, EoS effects, and width--batch allocation within a solvable theory.
- Abstract(参考訳): 現代のオプティマイザにおける繰り返し発生する設計原則は、更新の規模を生の勾配基準から切り離すことであるが、学習曲線やリソーススケーリングの結果は不明確である。
我々はこのメカニズムを,教師とデータ共分散を考慮したランダムなモデルを用いて,正規化されたSGDを研究することによって分離する。
固定ノルム更新は、勾配が縮むにつれて成長する効果的な学習率をもたらす。
トレーニング時間,モデル幅,バッチサイズに対する損失の連関依存性を記述した動的平均場理論(DMFT)を導出する。
正規化は最初 SGD を加速し、パワーロー指数 $r_{\rm SGD}<1$ を $r_{\rm SGD}/(1-r_{\rm SGD})$ にマッピングする。
しかし、有限のステップサイズでは、同じフィードバックが最終的に加速を破り、限界安定性をもたらす。
遅延時間理論は、幅制限、確率的安定性(EoSS)、決定論的安定性(EoS)のレギュレーションをもたらす。
これらのフェーズは、より大きなバッチまたはより広いモデルが、同等の計算でシリアルトレーニング時間を短縮するタイミングを決定する。
これらのフェーズのどちらがバッチサイズや幅を増すかは、損失を目標とする最適化ステップを減らして、ステップごとの過剰な計算使用を補うことができるのかを定量化します。
CIFAR-5Mにおける線形化されたResNet実験は、予測加速、分解、リソーススケーリングのトレンドをサポートする。
これらの結果は、正規化誘起加速度、EoS効果、および可解理論における幅バッチ割り当てを結合する。
関連論文リスト
- LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction [59.32834240526981]
フローベース生成モデルは典型的には、決定論的常微分方程式(ODE)を解くことによってサンプリングされる
既存の流れモデルのためのGRPO法は、訓練中にオイラー時間ODEを非等方微分方程式(SDE)に置き換える。
本稿では,フローベースGRPOフレームワークであるLC-GRPOを紹介する。
論文 参考訳(メタデータ) (2026-08-06T04:47:57Z) - The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL [39.23942538769713]
大規模言語モデルのための強化学習(LLMs)は、勾配のばらつきが爆発的に広がるため、長い水平タスクのトレーニング崩壊に悩まされることが多い。
我々は、最適トークンベースライン(OTB)を第一原理から導出し、勾配更新が累積勾配ノルムに逆向きに重み付けされるべきであることを証明した。
提案手法はトレーニングの安定性を達成し,N=32$の大規模グループサイズとの性能を一致させ,シングルターンおよびツール統合推論タスクにおけるトークン消費量を65%以上削減する。
論文 参考訳(メタデータ) (2026-02-06T03:16:04Z) - Functional Scaling Laws in Kernel Regression: Loss Dynamics and Learning Rate Schedules [9.332823269318842]
スケーリング法則は、大きな言語モデルのトレーニングを理解し、導くための統一レンズとして登場した。
我々は任意のLSSの下で全損失軌跡を捕捉する機能スケーリング法を確立した。
データ制限と計算制限の両方で明示的なスケーリング関係を導出する。
論文 参考訳(メタデータ) (2025-09-23T16:05:16Z) - Flow-GRPO: Training Flow Matching Models via Online RL [80.62659379624867]
本稿では,オンライン政策強化学習をフローマッチングモデルに統合する最初の方法であるFlow-GRPOを提案する。
提案手法では,(1)決定論的正規微分方程式を同値な微分方程式に変換するODE-to-SDE変換と,(2)推論ステップの数を維持しながらトレーニングの段階を短縮するDenoising Reduction戦略の2つの主要な戦略を用いる。
論文 参考訳(メタデータ) (2025-05-08T17:58:45Z) - Decentralized Nonconvex Composite Federated Learning with Gradient Tracking and Momentum [78.27945336558987]
分散サーバ(DFL)はクライアント・クライアント・アーキテクチャへの依存をなくす。
非滑らかな正規化はしばしば機械学習タスクに組み込まれる。
本稿では,これらの問題を解決する新しいDNCFLアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-04-17T08:32:25Z) - Implicit Bias of Gradient Descent for Logistic Regression at the Edge of
Stability [69.01076284478151]
機械学習の最適化において、勾配降下(GD)はしばしば安定性の端(EoS)で動く
本稿では,EoS系における線形分離可能なデータに対するロジスティック回帰のための定数段差GDの収束と暗黙バイアスについて検討する。
論文 参考訳(メタデータ) (2023-05-19T16:24:47Z) - Flatter, faster: scaling momentum for optimal speedup of SGD [0.0]
ニューラルネットワークのトレーニングにおいて、勾配降下(SGD)とラベルノイズと運動量との相互作用から生じるトレーニングダイナミクスについて検討した。
運動量ハイパーパラメータ1-NISTbeta$を学習率で2/3$にスケーリングすると、一般化を犠牲にすることなく、最大で2/3$のトレーニングが加速することがわかった。
論文 参考訳(メタデータ) (2022-10-28T20:41:48Z) - Direction Matters: On the Implicit Bias of Stochastic Gradient Descent
with Moderate Learning Rate [105.62979485062756]
本稿では,中等度学習におけるSGDの特定の正規化効果を特徴付けることを試みる。
SGDはデータ行列の大きな固有値方向に沿って収束し、GDは小さな固有値方向に沿って収束することを示す。
論文 参考訳(メタデータ) (2020-11-04T21:07:52Z) - Balancing Rates and Variance via Adaptive Batch-Size for Stochastic
Optimization Problems [120.21685755278509]
本研究は,ステップサイズの減衰が正確な収束に必要であるという事実と,一定のステップサイズがエラーまでの時間でより速く学習するという事実のバランスをとることを目的とする。
ステップサイズのミニバッチを最初から修正するのではなく,パラメータを適応的に進化させることを提案する。
論文 参考訳(メタデータ) (2020-07-02T16:02:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。