論文の概要: Grokking on the Weight-Decay Clock: A Rate Hierarchy from Softly Broken Symmetries
- arxiv url: http://arxiv.org/abs/2607.23967v1
- Date: Mon, 27 Jul 2026 03:30:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.297194
- Title: Grokking on the Weight-Decay Clock: A Rate Hierarchy from Softly Broken Symmetries
- Title(参考訳): ウェイト・デカイ・クロックのグラッキング:ソフト・ブローク・シンメトリーによるレート階層
- Abstract要約: 遅延一般化(英: Delayed generalization, 英: grokking)は、広範な実証研究にもかかわらず、いまだに理解されていない。
フルバッチ重ボール最適化と重み減衰を訓練した線形モデルにおいて、グルーキングの正確な解答可能な遅延緩和機構を同定する。
- 参考スコア(独自算出の注目度): 11.824913874212802
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Delayed generalization, or grokking, remains poorly understood despite extensive empirical study. We identify an exactly solvable late-time relaxation mechanism for grokking in linear models trained with full-batch heavy-ball optimization and weight decay, together with a locally quadratic extension to nonlinear neural networks. Our analysis reveals a distinguished population-active component of the empirical null space, which we call the grokking subspace. Along this subspace, the training predictions remain unchanged, leaving weight decay as the sole restoring force and giving rise to a slow dissipative relaxation governed by an exact discrete-time and continuous-time law. We show that only this subspace contributes to the slow asymptotic decay of the population risk and derive explicit iteration-scale predictions for the grokking time, recovering the familiar $(1-β)/(ηλ)$ scaling in the weak-regularization regime. The theory further predicts distinct effects of optimizer choice, distinguishing coupled $L_2$ regularization from decoupled weight decay, and yields causal predictions for interventions that modify the grokking component. We verify all theoretical identities without fitted parameters in a synthetic model where every subspace and relaxation rate is computable in closed form. We further observe genuine delayed generalization in modular addition, where the measured delay follows the predicted scaling and the late-time relaxation agrees closely with the theoretical clock.
- Abstract(参考訳): 遅延一般化(英: Delayed generalization, 英: grokking)は、広範な実証研究にもかかわらず、いまだに理解されていない。
フルバッチ重ボール最適化と重み減衰を訓練した線形モデルにおけるグルーキングの正確な解答可能な遅延緩和機構と、非線形ニューラルネットワークへの局所的な二次的拡張を同定する。
解析の結果,経験的ヌル空間の集団活性成分が明らかになり,これをグルーキング部分空間 (Groking subspace) と呼ぶ。
この部分空間に沿って、トレーニング予測は変わらず、唯一の回復力として減量し、正確な離散時間法則と連続時間法則によって支配される緩やかな放散緩和を引き起こす。
この部分空間だけが、人口リスクの緩やかな漸近的崩壊に寄与し、グルーキング時間に対する明示的な反復スケールの予測を導出し、弱正則化体制における1-β/(ηλ)$スケールを回復することを示した。
この理論はオプティマイザ選択の異なる効果を予測し、結合された$L_2$正規化とデカップリングウェイト崩壊を区別し、グルーキング成分を変更する介入に対する因果予測を与える。
我々は,すべての部分空間と緩和速度が閉じた形で計算可能な合成モデルにおいて,パラメータを組み込まない理論的アイデンティティを検証した。
さらに, 測定遅延が予測スケーリングに追従し, 遅延緩和が理論クロックと密接に一致するモジュール加法における真の遅延一般化を観察する。
関連論文リスト
- When Does Scale-Invariant Optimization Become Unstable? An Exact Schedule Law with Weight Decay [6.625270757109195]
標準成長は、反対の幾何学的自己整合効果を誘導する一方、1つの量で全てのスケジュールと崩壊の強制を捉えていることを示す。
これは、収縮と拡張が支配する効果的な学習率体制をきれいに分離する鋭い境界をもたらす。
論文 参考訳(メタデータ) (2026-09-08T17:46:17Z) - Across the Loss Landscape with Progressive Growth [51.366966420881646]
成長を漸進的緩和と見なして、より平坦な地域に向けての訓練戦略がいかに成長・最適化されるかを示す。
制御されたおもちゃの流域や現実的なResNet/CI-100環境でこれらの予測を実証的に検証する。
プログレッシブな部分空間成長は、より平坦な解を確実に生成するが、曲率の低減は、普遍的にテスト性能の向上に変換されず、平坦性一般化接続における微妙さを強調している。
論文 参考訳(メタデータ) (2026-08-25T13:50:48Z) - From Atoms to Entropy: Optimal Noise Allocation for Diffusion Training in the Convex Regime [52.459513910242485]
拡散訓練における最適な雑音レベルアロケーションを研究するための一般統計フレームワークを開発する。
最適化されたトレーニングスケジュールは、有限個のノイズレベルに集中した原子最小値を持つことを示す。
次に,大規模実験におけるエントロピック・スケジュールの評価を行った。
論文 参考訳(メタデータ) (2026-07-10T20:59:06Z) - A Stochastic--Geometric Theory of Scaling Laws in Grokking [6.109217901547081]
遅延一般化(delayed generalization、egrokking)とは、ニューラルネットワークがトレーニングの初期にトレーニングデータに適合するが、長い遅延の後のみ一般化を開始する現象である。
まず、Adamの最適化力学と重み収縮正則化により誘導される到達可能な解空間のシェルコア位相構成を理論的に特徴づける。
次に、この位相配置の幾何学と最適化軌道が記憶多様体から逃れる解遷移時間を分析する。
論文 参考訳(メタデータ) (2026-06-29T14:43:02Z) - A Mechanism Study of Delayed Loss Spikes in Batch-Normalized Linear Models [28.92895415506565]
神経ネットワークトレーニングでは遅延損失スパイクが報告されている。
既存の理論は主に、過度に大きな固定学習率によって引き起こされた初期の非単調な振る舞いを説明する。
正規化は、有効学習率を徐々に増加させることで不安定を遅らせることができる。
論文 参考訳(メタデータ) (2026-04-18T03:42:05Z) - Stability and Generalization of Push-Sum Based Decentralized Optimization over Directed Graphs [55.77845440440496]
プッシュベースの分散通信は、情報交換が非対称である可能性のある通信ネットワークの最適化を可能にする。
我々は、グラディエント・プッシュ(SGP)アルゴリズムのための統一的な一様安定性フレームワークを開発する。
重要な技術的要素は、2つの量に束縛された不均衡認識の一般化である。
論文 参考訳(メタデータ) (2026-02-24T05:32:03Z) - The Procrustean Bed of Time Series: The Optimization Bias of Point-wise Loss [53.542743390809356]
本稿では,最適化バイアス(EOB)の期待に関する第一原理解析を提案する。
時間列が決定論的で構造化されるほど、ポイントワイドの損失関数によるバイアスがより厳しくなる。
本稿では,DFTとDWTの両原理を同時に実現する具体的ソリューションを提案する。
論文 参考訳(メタデータ) (2025-12-21T06:08:22Z) - The Geometry of Grokking: Norm Minimization on the Zero-Loss Manifold [5.076419064097734]
暗記後の学習は、制約付き最適化のレンズを通して理解することができると論じる。
勾配降下は、零損失多様体上の重みノルムを効果的に最小化することを示す。
実験により,予測勾配を用いた学習過程のシミュレーションは,グルーキングの遅延一般化と表現学習特性の両方を再現することを確認した。
論文 参考訳(メタデータ) (2025-11-02T18:44:42Z) - Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks [59.552873049024775]
計算最適化モデルでは, 極めて高精度な普遍性を示すことを示す。
学習速度が減衰すると、崩壊は非常に厳しくなり、モデル間の正規化曲線の差はノイズフロアより下になる。
これらの現象は、典型的なニューラルスケーリング法則において、崩壊とパワー・ロー構造を結びつけることによって説明される。
論文 参考訳(メタデータ) (2025-07-02T20:03:34Z) - Beyond Progress Measures: Theoretical Insights into the Mechanism of Grokking [50.465604300990904]
グロキング(Grokking)とは、オーバーフィッティングの拡張後のテスト精度の急激な改善を指す。
本研究では、素数演算のタスクにおいて、Transformerの基盤となるグルーキング機構について検討する。
論文 参考訳(メタデータ) (2025-04-04T04:42:38Z) - Accelerated Decay due to Operator Spreading in Bulk-Dissipated Quantum Systems [4.604003661048267]
定常状態における自己相関関数の集合緩和ダイナミクスについて述べる。
我々の理論は、バルク散逸した系が一般に、作用素の拡散に伴う量子情報のばらつきにより、政権前に加速した崩壊を示すことを予測している。
論文 参考訳(メタデータ) (2023-09-07T05:35:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。