論文の概要: A Boundary-Layer Mechanism for One-Third Scaling in Online Softmax Classification
- arxiv url: http://arxiv.org/abs/2605.22341v1
- Date: Thu, 21 May 2026 11:26:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:42.228529
- Title: A Boundary-Layer Mechanism for One-Third Scaling in Online Softmax Classification
- Title(参考訳): オンラインソフトマックス分類におけるワンサードスケーリングのための境界層機構
- Authors: Marcel Kühn, Yoon Thelge, Bernd Rosenow,
- Abstract要約: ハードラベル分類は通常、スムーズな代理損失、特にソフトマックスのクロスエントロピーで訓練される。
我々は、このスムーズなサロゲートと離散ラベルのミスマッチが、パワーローラー学習曲線を生成するメカニズムを分離する。
学習速度のスケジュールは、$_g sim -1/2$の電力法則に対する一般化誤差を改善することができることを示す。
- 参考スコア(独自算出の注目度): 3.058685580689604
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hard-label classification is usually trained with smooth surrogate losses, most prominently softmax cross-entropy. We isolate an asymptotic mechanism by which this mismatch between smooth surrogate and discrete labels produces power-law learning curves in an online teacher-student model. After subtracting the mean logit, the thermodynamic-limit dynamics close in centered variables: a growing centered student-teacher alignment $D$ and the residual student variance $Δ$. At late times, examples away from teacher decision boundaries are already classified confidently and contribute exponentially little. Only boundary layers of width $O(D^{-1})$ remain active, while the noise of fixed-learning-rate online gradient descent maintains a nonzero $Δ$. As a function of the training time $α$ the late-time solution yields a $α^{-1/3}$ power law not only for the test loss but also for the generalization error $ε_g$, i.e., one minus test accuracy. This is much slower than the $α^{-1}$ Bayes-optimal reference for the same model. We further show that learning-rate schedules can improve the generalization error towards a $ε_g \sim α^{-1/2}$ power law. Simulations support the predicted order parameter dynamics and learning curves. Controlled experiments with correlated Gaussian inputs and whitened pretrained features show that data structure can dominate transients. Therefore, our result is an asymptotic, complementary mechanism rather than an alternative to spectral explanations of neural scaling laws.
- Abstract(参考訳): ハードラベル分類は通常、スムーズな代理損失、特にソフトマックスのクロスエントロピーで訓練される。
そこで我々は,このスムーズなサロゲートと離散ラベルのミスマッチが,オンライン教師学生モデルにおいて,ゆるやかな学習曲線を生じさせる漸近的メカニズムを分離した。
平均ロジットを減算した後、熱力学リミット力学は中心変数に近づき、中心教師のアライメントは$D$、残学生の分散は$Δ$となる。
最近では、教師の意思決定境界から離れた例は、すでに自信を持って分類されており、指数関数的にはほとんど貢献していない。
幅$O(D^{-1})$の境界層のみがアクティブであり、固定学習レートのオンライン勾配勾配のノイズは非ゼロの$Δ$を維持している。
訓練時間$α$の関数として、潜時解は、テスト損失だけでなく、一般化誤差$ε_g$、すなわち1つのテスト精度に対して、$α^{-1/3}$の電力法則をもたらす。
これは同じモデルに対する$α^{-1}$ベイズ最適参照よりもはるかに遅い。
さらに、学習速度スケジュールは、$ε_g \sim α^{-1/2}$パワー則に対する一般化誤差を改善することができることを示す。
シミュレーションは予測順序パラメータのダイナミクスと学習曲線をサポートする。
相関したガウス入力とホワイト付き事前訓練された特徴を用いた制御実験は、データ構造が過渡性を支配することを示す。
したがって、この結果は、ニューラルスケーリング法則のスペクトル説明に代わるものではなく、漸近的で相補的なメカニズムである。
関連論文リスト
- The Spectral Edge Thesis: A Mathematical Framework for Intra-Signal Phase Transitions in Neural Network Training [0.0]
ニューラルネットワークトレーニングにおける位相遷移は,パラメータ更新の回転ウィンドウグラム行列のスペクトルギャップによって制御されることを示す。
adiabatic parameter $mathcalA = |G|_F / (, g2)$ control circuit stability: $mathcalA ll 1$ (plateau), $mathcalA sim 1$ (phase transition), $mathcalA gg 1$ (forgetting)
論文 参考訳(メタデータ) (2026-03-30T20:10:22Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - Learning Shrinks the Hard Tail: Training-Dependent Inference Scaling in a Solvable Linear Model [2.7074235008521246]
ニューラルネットワークのスケーリング法則を最終層微細チューニングの解法モデルで解析する。
学習がエラー分布の「ハードテール」を小さくすることを示す。
論文 参考訳(メタデータ) (2026-01-07T10:00:17Z) - INC: An Indirect Neural Corrector for Auto-Regressive Hybrid PDE Solvers [61.84396402100827]
本稿では,学習した補正を支配方程式に統合する間接ニューラルコレクタ(mathrmINC$)を提案する。
$mathrmINC$は、$t-1 + L$の順番でエラー増幅を減らし、$t$はタイムステップ、$L$はリプシッツ定数である。
大規模なベンチマークで$mathrmINC$をテストし、1Dカオスシステムから3D乱流まで、多くの異なる解法、神経バックボーン、テストケースをカバーした。
論文 参考訳(メタデータ) (2025-11-16T20:14:28Z) - Linear regression with overparameterized linear neural networks: Tight upper and lower bounds for implicit $\ell^1$-regularization [3.4540258577108776]
過パラメータ線形回帰問題に対する深度Dge 2$の対角線形ニューラルネットワークの暗黙正則化について検討した。
D ge 3$ の場合、誤差は$alpha$ で線形的に減少するが、$D=2$ の場合、$alpha1-varrho$ で減少する。
数値実験は、我々の理論的な発見を裏付け、より深いネットワーク、すなわち$D ge 3$がより良い一般化をもたらすことを示唆している。
論文 参考訳(メタデータ) (2025-06-01T19:55:31Z) - Gradient dynamics for low-rank fine-tuning beyond kernels [9.275532709125242]
学生-教師設定における低ランク微調整について検討する。
基本モデルにおける行列であり,オンライン勾配勾配で訓練された学生モデルが,教師に収束する,という軽微な仮定の下で証明する。
論文 参考訳(メタデータ) (2024-11-23T00:00:28Z) - Scaling Laws in Linear Regression: Compute, Parameters, and Data [86.48154162485712]
無限次元線形回帰セットアップにおけるスケーリング法則の理論について検討する。
テストエラーの再現可能な部分は$Theta(-(a-1) + N-(a-1)/a)$であることを示す。
我々の理論は経験的ニューラルスケーリング法則と一致し、数値シミュレーションによって検証される。
論文 参考訳(メタデータ) (2024-06-12T17:53:29Z) - Locality defeats the curse of dimensionality in convolutional
teacher-student scenarios [69.2027612631023]
学習曲線指数$beta$を決定する上で,局所性が重要であることを示す。
我々は、自然の仮定を用いて、トレーニングセットのサイズに応じて減少するリッジでカーネルレグレッションを実行すると、リッジレスの場合と同じような学習曲線指数が得られることを証明して結論付けた。
論文 参考訳(メタデータ) (2021-06-16T08:27:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。