論文の概要: A Spectral Theory of Grokking: Weight Decay induces Feature Learning
- arxiv url: http://arxiv.org/abs/2609.26679v1
- Date: Tue, 22 Sep 2026 16:38:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.747811
- Title: A Spectral Theory of Grokking: Weight Decay induces Feature Learning
- Title(参考訳): グローキングのスペクトル理論:重量減少が特徴学習を誘導する
- Abstract要約: トレーニングデータに対する初期の適合性は、ずっと後の一般化の改善とは別物である。
この遅延学習からリッチラーニングへの移行が遅れた一般化をいかに生み出すかの定量的理論を提供する。
- 参考スコア(独自算出の注目度): 4.700135553010459
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In grokking an early fit to the training data separates from a much later improvement in generalization. During this delay, training can move from a fixed neural tangent kernel (NTK) regime to one in which task-relevant kernel eigendirections continue to evolve. We provide a quantitative theory for how this transition from lazy to rich learning can produce delayed generalization. For homogeneous networks trained with squared loss and $L_2$ weight decay, we show that a finite residual remains after memorization, with larger residual fractions in target components associated with smaller NTK eigenvalues. These residuals feed back into the dynamics of the NTK itself, and projecting the resulting dynamics onto task-relevant spectral directions yields a reduced system in which residual-driven kernel growth competes with weight decay. This system predicts that the grokking timescale is controlled by the product of learning rate and weight decay, that feature learning slows logarithmically near a critical decay above which task-aligned NTK structure can no longer support generalization, and that stronger decay can prevent fitting altogether. We test these predictions in modular addition. In a homogeneous MLP, task-aligned Fourier structure continues to emerge in the NTK after training accuracy has saturated, and an 84$\times$90-grid of trained networks across varying learning rate and weight decay recovers the predicted phase geometry and inverse-product scaling of the generalization time with learning rate and weight decay. A one-block Transformer shows similar macroscopic phase structure in a 42$\times$45-grid, as well as the same transition-time scaling despite violating exact homogeneity. Together, these results provide a mechanistic derivation connecting post-fit feature learning to both the onset of generalization and its phase structure in the learning rate and weight decay plane.
- Abstract(参考訳): トレーニングデータに対する初期の適合性は、ずっと後の一般化の改善とは別物である。
この遅延の間、トレーニングは、固定されたニューラル・タンジェント・カーネル(NTK)体制から、タスク関連カーネルの固有方向が進化し続ける状態に移行することができる。
この遅延学習からリッチラーニングへの移行が遅れた一般化をいかに生み出すかの定量的理論を提供する。
2乗損失と$L_2$の重み減衰を訓練した同次ネットワークの場合、暗記後の有限残差が、より小さいNTK固有値に関連付けられたターゲット成分の残差が大きいことを示す。
これらの残留物はNTK自体のダイナミクスにフィードバックし、結果のダイナミクスをタスク関連スペクトル方向へ投影すると、残留駆動の核成長が重量減衰と競合する還元系が得られる。
本システムでは, 学習速度と重み劣化の積によってグルーキング時間スケールが制御され, タスク整列NTK構造が一般化を支持できない臨界崩壊付近で, 特徴学習が対数的に遅くなり, 強い減衰が完全に適合するのを防ぐことを予測した。
これらの予測をモジュール追加でテストします。
均質なMLPでは、トレーニング精度が飽和した後、タスク整列されたフーリエ構造がNTK内に出現し続け、84$\times$90-gridのトレーニングネットワークが、学習速度と重み劣化によって予測された位相幾何学と逆積スケーリングを回復する。
1ブロック変換器は42$\times$45-gridで同様のマクロな位相構造を示し、全く均一性に反するにもかかわらず、同じ遷移時間スケーリングを示す。
これらの結果は, 一般化の開始と, 学習速度および重み劣化面における位相構造の両方に, ポストフィット特徴学習を接続する機械的導出を提供する。
関連論文リスト
- Grokking on the Weight-Decay Clock: A Rate Hierarchy from Softly Broken Symmetries [11.824913874212802]
遅延一般化(英: Delayed generalization, 英: grokking)は、広範な実証研究にもかかわらず、いまだに理解されていない。
フルバッチ重ボール最適化と重み減衰を訓練した線形モデルにおいて、グルーキングの正確な解答可能な遅延緩和機構を同定する。
論文 参考訳(メタデータ) (2026-07-27T03:30:44Z) - Grokking and epoch-wise double descent in quantum neural networks [0.08739101659113156]
2量子量子ニューラルネットワーク(QNN)におけるグラッキング遷移とエポックワイド二重降下の実証観測を報告する。
後期訓練における一般化崩壊は,訓練損失が停滞しているにもかかわらず,テスト誤差が著しく増大する。
解析の結果, この崩壊は, 平らで相整合な調和解から遠ざかる, 重みノルムの非拘束的な増加と相関していることがわかった。
論文 参考訳(メタデータ) (2026-07-09T10:55:16Z) - Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks [59.552873049024775]
計算最適化モデルでは, 極めて高精度な普遍性を示すことを示す。
学習速度が減衰すると、崩壊は非常に厳しくなり、モデル間の正規化曲線の差はノイズフロアより下になる。
これらの現象は、典型的なニューラルスケーリング法則において、崩壊とパワー・ロー構造を結びつけることによって説明される。
論文 参考訳(メタデータ) (2025-07-02T20:03:34Z) - Machine learning in and out of equilibrium [58.88325379746631]
我々の研究は、統計物理学から適応したフォッカー・プランク法を用いて、これらの平行線を探索する。
我々は特に、従来のSGDでは平衡が切れている長期的限界におけるシステムの定常状態に焦点を当てる。
本稿では,ミニバッチの置き換えを伴わない新しいランゲヴィンダイナミクス(SGLD)を提案する。
論文 参考訳(メタデータ) (2023-06-06T09:12:49Z) - Neural Networks with Sparse Activation Induced by Large Bias: Tighter Analysis with Bias-Generalized NTK [86.45209429863858]
ニューラル・タンジェント・カーネル(NTK)における一層ReLUネットワークのトレーニングについて検討した。
我々は、ニューラルネットワークが、テクティトビア一般化NTKと呼ばれる異なる制限カーネルを持っていることを示した。
ニューラルネットの様々な特性をこの新しいカーネルで研究する。
論文 参考訳(メタデータ) (2023-01-01T02:11:39Z) - PathProx: A Proximal Gradient Algorithm for Weight Decay Regularized
Deep Neural Networks [25.114642281756495]
ウェイト崩壊(Weight decay)は、ディープラーニングにおいて最も広く使われている正規化形式の一つである。
本稿では、勾配勾配勾配は、この目的に対して非効率なアルゴリズムであると主張している。
ReLUアクティベーションを持つニューラルネットワークの場合、重み劣化対象に対する解は異なる目的の解と等価である。
論文 参考訳(メタデータ) (2022-10-06T17:22:40Z) - Neural networks with late-phase weights [66.72777753269658]
学習後期に重みのサブセットを組み込むことで,SGDの解をさらに改善できることを示す。
学習の終わりに、重み空間における空間平均を取ることにより、1つのモデルを取得する。
論文 参考訳(メタデータ) (2020-07-25T13:23:37Z) - Revisiting Initialization of Neural Networks [72.24615341588846]
ヘッセン行列のノルムを近似し, 制御することにより, 層間における重みのグローバルな曲率を厳密に推定する。
Word2Vec と MNIST/CIFAR 画像分類タスクの実験により,Hessian ノルムの追跡が診断ツールとして有用であることが確認された。
論文 参考訳(メタデータ) (2020-04-20T18:12:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。