論文の概要: Optimizer-dependent training dynamics converge to the same one-third optimal data scaling
- arxiv url: http://arxiv.org/abs/2609.37745v1
- Date: Tue, 29 Sep 2026 14:58:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.655255
- Title: Optimizer-dependent training dynamics converge to the same one-third optimal data scaling
- Title(参考訳): 最適化に依存したトレーニングダイナミクスは、同じ3分の1の最適データスケーリングに収束する
- Abstract要約: 私たちは2つの指数を区別し、$1/3$のアカウントは区別しません。
第1の動的指数は崩壊特異であり、第2の最適データ指数は1/3$に収束する。
- 参考スコア(独自算出の注目度): 4.024850952459758
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Neural scaling, in which loss falls as a power law with training, is central to large language models, and one recent proposal is that a $1/3$ exponent emerges from learning peaked distributions. That account describes SGD, but models in practice are trained with adaptive optimizers. Here we separate two exponents the $1/3$ account does not distinguish: how fast the loss falls with training steps along a single run, and how fast the optimally tuned loss falls with dataset size $D$. We show that the first, a dynamic exponent, is optimizer-specific while the second, an optimal data exponent, converges to $1/3$ across optimizers. In an online teacher-student model we decompose the loss into norm growth (radial) and alignment toward the teacher direction (tangential), each decaying as a power law with dynamic exponents $α_{r}$ and $α_{t}$. Under SGD, both are close to $1/3$, so the data exponent is also $1/3$ across different learning rates. Under Adam the two separate: $α_{r} \simeq 0.48$ but $α_{t} \simeq 0.08$. Since the total loss is minimized when these two parts are balanced, the optimal learning rate is optimizer-dependent: $D$-independent for SGD but falls with $D$ for Adam. Yet tuned to that optimum, the loss returns to $D^{-1/3}$ for both. A stochastic-dynamics analysis explains why: the optimizers can trade decay speed between the two channels, but they all fall on a single dynamic exponent relation, $2α_{r}+ α_{t} = 1$, which fixes the optimal data exponent at $1/3$. Across seven optimizers, including Muon, the measured exponents are consistent with this relation, and the optimal-loss envelopes agree with $D^{-1/3}$ across them. The optimizer sets how fast a model learns per step; tuned optimally, it changes the prefactor but not the rate at which loss falls per sample.
- Abstract(参考訳): ニューラルネットワークのスケーリングは、トレーニングによるパワールールとして失われるが、大きな言語モデルの中心であり、最近の1つの提案では、ピーク分布の学習から1/3$指数が出現する。
その説明にはSGDが書かれているが、実際にはモデルが適応オプティマイザで訓練されている。
ここでは、$1/3$アカウントの2つの指数を区別します: 損失が単一の実行でトレーニングステップでどれだけ速く、最適に調整された損失がデータセットサイズ$D$で落ちるか。
第1の動的指数はオプティマイザ固有であり,第2の最適データ指数はオプティマイザ全体にわたって1/3ドルに収束することを示す。
オンライン教師学生モデルでは、損失を標準成長(半径)と教師方向(接点)に分解し、それぞれが動的指数 $α_{r}$ と $α_{t}$ の力法則として崩壊する。
SGDでは、どちらも1/3ドルに近いので、データ指数は異なる学習率に対して1/3ドルである。
アダムの下では、$α_{r} \simeq 0.48$だが$α_{t} \simeq 0.08$である。
これら2つの部分のバランスが取れた場合、総損失は最小化されるため、最適学習率はオプティマイザに依存している: SGD は$D$非依存だが、Adam は$D$ に依存しない。
しかし、その最適条件に合わせると、損失は両方とも$D^{-1/3}$に返される。
確率力学解析では、最適化器は2つのチャネル間で減衰速度を交換できるが、これらは全て1つの動的指数関係、2α_{r}+α_{t} = 1$に該当し、最適なデータ指数を1/3$で固定する。
ミューオンを含む7つのオプティマイザのうち、測定された指数はこの関係と一致しており、最適損失エンベロープはそれらの間の$D^{-1/3}$と一致する。
最適化者は、モデルがステップ毎にどれだけの速さで学習するかを設定します。
関連論文リスト
- Linear RNN Scaling Laws: When Longer Sequences Beat More Sequences [17.927451930317197]
自己回帰言語モデルの実証的なスケーリング法則は、予測損失をモデルサイズ、データサイズ、最適化計算に関連付ける。
本研究では,安定な潜在線形RNNが軌道を発生し,スケッチされた線形リカレント学習者は,次の予測に基づいて,安全でフルバッチなWSD勾配勾配で学習する,学習可能な教師-学生モデルを用いて検討する。
論文 参考訳(メタデータ) (2026-08-23T13:37:15Z) - Data Predictability Shapes Weibull Weight-Scale Growth in Transformer Training [0.0]
学習条件付き法則を定める前に計算した学習自由統計法則が得られた。
トレーニングの前に$D$が計算されるので、この法則はフォワード予測器である。
クロスコーパス予測 オーバー予測コード、冗長性はより広い$(D,R,A,H)$データ・ツー・ウェイト・フレームワークの第2軸を意味する。
論文 参考訳(メタデータ) (2026-06-27T12:26:39Z) - On the Optimizer Dependence of Neural Scaling Laws [0.8594140167290097]
スケーリング指数$$は、ニューラルスケーリング法則において$L(N)propto N-$は、一般にアーキテクチャとデータによって固定定数として扱われる。
我々は$が体系的にスケールに依存するという証拠を提示する。
論文 参考訳(メタデータ) (2026-05-28T05:41:36Z) - How Neural Reward Models Learn Features for Policy Optimization: A Single-Index Analysis [53.063298916923976]
r*(x) = *(langle *, xrangle)$ と $x sim N(0, I_d)$ でガウスの単一インデックスモデルでフィードバックを研究する。
まず、報酬重み付きサンプルから隠れた方向を*$で学習し、次に重み付きリッジ回帰により読み出し層に適合する2段階のニューラル報酬モデルを分析する。
論文 参考訳(メタデータ) (2026-05-23T22:00:38Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - Optimal Learning-Rate Schedules under Functional Scaling Laws: Power Decay and Warmup-Stable-Decay [9.371921537573346]
機能的スケーリング法則の下で、最適学習率スケジュール(LRS)について検討する。
LRSは線形回帰と大規模言語モデル(LLM)の事前学習の損失ダイナミクスを正確にモデル化する。
我々は,ピーク学習率のみを調整した最適な形状固定スケジュールを解析する。
論文 参考訳(メタデータ) (2026-02-06T15:52:30Z) - Proving the Limited Scalability of Centralized Distributed Optimization via a New Lower Bound Construction [57.93371273485736]
我々は、すべての労働者が同一の分布にアクセスする均質な(すなわちd.d.)場合であっても、すべての労働者が非バイアス付き境界 LDeltaepsilon2,$$$$$ のポリ対数的により良いポリ対数を求める集中型分散学習環境を考える。
論文 参考訳(メタデータ) (2025-06-30T13:27:39Z) - Learning Orthogonal Multi-Index Models: A Fine-Grained Information Exponent Analysis [54.57279006229212]
情報指数は、オンライン勾配降下のサンプルの複雑さを予測する上で重要な役割を担っている。
本研究では,2次項と高次項の両方を考慮することで,まず2次項を用いて関連する空間を学習できることを示す。
オンラインSGDの全体サンプルと複雑さは$tildeO(d PL-1 )$である。
論文 参考訳(メタデータ) (2024-10-13T00:14:08Z) - Time Transfer: On Optimal Learning Rate and Batch Size In The Infinite Data Limit [1.8337746049048673]
事前トレーニングトークンの予算である$T$,$B$と、クリティカルバッチサイズである$B_mathrmcrit$との関係に、最適な$eta$スケーリングの複雑な依存性を示す。
驚くべきことに、観測された最適$eta$と$B$Dynamicsは、$mu$Pモデルスケーリングで保存されている。
論文 参考訳(メタデータ) (2024-10-08T09:06:34Z) - Sharper Convergence Guarantees for Asynchronous SGD for Distributed and
Federated Learning [77.22019100456595]
通信周波数の異なる分散計算作業者のトレーニングアルゴリズムを示す。
本研究では,より厳密な収束率を$mathcalO!!(sigma2-2_avg!)とする。
また,不均一性の項は,作業者の平均遅延によっても影響されることを示した。
論文 参考訳(メタデータ) (2022-06-16T17:10:57Z) - Private Stochastic Convex Optimization: Optimal Rates in $\ell_1$
Geometry [69.24618367447101]
対数要因まで $(varepsilon,delta)$-differently private の最適過剰人口損失は $sqrtlog(d)/n + sqrtd/varepsilon n.$ です。
損失関数がさらなる滑らかさの仮定を満たすとき、余剰損失は$sqrtlog(d)/n + (log(d)/varepsilon n)2/3で上界(対数因子まで)であることが示される。
論文 参考訳(メタデータ) (2021-03-02T06:53:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。