論文の概要: A Stochastic--Geometric Theory of Scaling Laws in Grokking
- arxiv url: http://arxiv.org/abs/2606.30388v2
- Date: Mon, 06 Jul 2026 12:33:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 17:33:48.615056
- Title: A Stochastic--Geometric Theory of Scaling Laws in Grokking
- Title(参考訳): 農業におけるスケーリング法則の確率幾何学理論
- Abstract要約: 遅延一般化(delayed generalization、egrokking)とは、ニューラルネットワークがトレーニングの初期にトレーニングデータに適合するが、長い遅延の後のみ一般化を開始する現象である。
まず、Adamの最適化力学と重み収縮正則化により誘導される到達可能な解空間のシェルコア位相構成を理論的に特徴づける。
次に、この位相配置の幾何学と最適化軌道が記憶多様体から逃れる解遷移時間を分析する。
- 参考スコア(独自算出の注目度): 6.109217901547081
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Delayed generalization (\ie~grokking) refers to the phenomenon in which a neural network fits its training data early in training but only begins to generalize after a prolonged delay, often through an abrupt transition. Despite extensive empirical study, its underlying mechanism remains poorly understood. In this work, we first theoretically characterize a shell--core topological configuration of the reachable solution space induced by Adam's optimization dynamics with weight-shrinkage regularization, supported by empirical evidence. This optimization-induced topological configuration gives rise to grokking. In model's parameter space, random initialization solutions concentrate on a thin outer spherical shell, enclosing another spherical shell of memorization solutions, which in turn contains a core corresponding to the generalization solutions. Leveraging stopping-time theory, we then analyze the geometry of this topological configuration and the solution transition time at which optimization trajectories escape the memorization manifold and first reach the boundary of the generalization manifold. Our theoretical analysis derives grokking scaling laws for the learning rate, batch size, and $\ell_2$ regularization coefficient, which are further validated through experiments and shown to recover results from prior literature.
- Abstract(参考訳): 遅延一般化(英: Delayed generalization)とは、ニューラルネットワークがトレーニングの初期にトレーニングデータに適合するが、しばしば急激な遷移によって、長い遅れの後のみ一般化を始める現象である。
広範な実証研究にもかかわらず、その基盤となるメカニズムはいまだに理解されていない。
本研究では,Adamの最適化力学と加重収縮正則化により誘導される到達可能な解空間のシェルコア位相構成を,経験的証拠により理論的に特徴づける。
この最適化によって引き起こされるトポロジカルな構成は、グラッキングを引き起こす。
モデルのパラメータ空間では、ランダム初期化解は薄い外球状シェルに集中し、別の球状シェルの記憶解を囲み、一般化解に対応するコアを含む。
停止時間理論を利用して、この位相構成の幾何と最適化軌跡が記憶多様体から逃れ、まず一般化多様体の境界に達する解遷移時間を分析する。
我々の理論解析は,学習速度,バッチサイズ,および$\ell_2$正規化係数のスケーリング法則を導出する。
関連論文リスト
- A Theoretical Analysis of Generalization Dynamics in Neural Networks under Gradient Descent with Weight Decay [32.27793372712302]
重み劣化を伴う勾配降下(GD)による損失$ell2$でトレーニングされたニューラルネットワークのクラスについて検討した。
集団誤差をデータ誤差、最適化誤差、予測変動誤差に分解し、それらを分離して有界化する。
予測変動誤差に対しては,(局所)近似等質性を提案し,セルワイドおよび層ワイド境界を導出する。
論文 参考訳(メタデータ) (2026-09-07T16:59:16Z) - Grokking on the Weight-Decay Clock: A Rate Hierarchy from Softly Broken Symmetries [11.824913874212802]
遅延一般化(英: Delayed generalization, 英: grokking)は、広範な実証研究にもかかわらず、いまだに理解されていない。
フルバッチ重ボール最適化と重み減衰を訓練した線形モデルにおいて、グルーキングの正確な解答可能な遅延緩和機構を同定する。
論文 参考訳(メタデータ) (2026-07-27T03:30:44Z) - Grokking and epoch-wise double descent in quantum neural networks [0.08739101659113156]
2量子量子ニューラルネットワーク(QNN)におけるグラッキング遷移とエポックワイド二重降下の実証観測を報告する。
後期訓練における一般化崩壊は,訓練損失が停滞しているにもかかわらず,テスト誤差が著しく増大する。
解析の結果, この崩壊は, 平らで相整合な調和解から遠ざかる, 重みノルムの非拘束的な増加と相関していることがわかった。
論文 参考訳(メタデータ) (2026-07-09T10:55:16Z) - On Higher-Order Geometric Refinements of Classical Covariance Asymptotics: An Approach via Intrinsic and Extrinsic Information Geometry [0.0]
混合、曲線指数族、潜在変数モデル、多様体-ルートパラメータ空間を含む曲線モデルでは、有限サンプルの振る舞いは予測から体系的に逸脱することができる。
我々は、正規パラメトリック族をフィッシャー制約ラオ計量の((,g))として見ることにより、座標不変な曲率対応の洗練を開発する。
本稿では,学習速度と後進平均二乗誤差における実対数正準しきい値の役割,および正規理論を特殊ケースとして回復する解空間上の曲率に基づく共分散展開について述べる。
論文 参考訳(メタデータ) (2026-04-14T13:40:13Z) - Beyond Perturbation Theory: A Resolvent-Based Framework for Strongly Correlated Many-Body Systems [1.4824891788575416]
従来の摂動理論は指数的に小さなエネルギーギャップと強い相互作用を持つ多体系では失敗する。
この研究は、2つの中核原理に基づいて構築された代替の方法論的枠組みを示す。
これは、非可積分多体系の大域的性質の定量的解析に適用できる。
論文 参考訳(メタデータ) (2026-04-01T08:11:58Z) - On Multi-Step Theorem Prediction via Non-Parametric Structural Priors [50.16583672681106]
本研究では,インコンテキスト学習(ICL)のレンズによる学習自由な定理予測について検討する。
本稿では,過去の解の時間的依存関係を有向グラフとしてエンコードし,推論中に探索空間を効果的に引き起こす明示的なトポロジ的制約を課すTheorem Precedence Graphsを提案する。
FormalGeo7kベンチマークの実験から,本手法は89.29%の精度を実現し,ICLベースラインを著しく上回り,最先端の教師付きモデルに適合することがわかった。
論文 参考訳(メタデータ) (2026-03-05T06:08:50Z) - The Procrustean Bed of Time Series: The Optimization Bias of Point-wise Loss [53.542743390809356]
本稿では,最適化バイアス(EOB)の期待に関する第一原理解析を提案する。
時間列が決定論的で構造化されるほど、ポイントワイドの損失関数によるバイアスがより厳しくなる。
本稿では,DFTとDWTの両原理を同時に実現する具体的ソリューションを提案する。
論文 参考訳(メタデータ) (2025-12-21T06:08:22Z) - The Geometry of Grokking: Norm Minimization on the Zero-Loss Manifold [5.076419064097734]
暗記後の学習は、制約付き最適化のレンズを通して理解することができると論じる。
勾配降下は、零損失多様体上の重みノルムを効果的に最小化することを示す。
実験により,予測勾配を用いた学習過程のシミュレーションは,グルーキングの遅延一般化と表現学習特性の両方を再現することを確認した。
論文 参考訳(メタデータ) (2025-11-02T18:44:42Z) - Beyond Progress Measures: Theoretical Insights into the Mechanism of Grokking [50.465604300990904]
グロキング(Grokking)とは、オーバーフィッティングの拡張後のテスト精度の急激な改善を指す。
本研究では、素数演算のタスクにおいて、Transformerの基盤となるグルーキング機構について検討する。
論文 参考訳(メタデータ) (2025-04-04T04:42:38Z) - On the Dynamics Under the Unhinged Loss and Beyond [104.49565602940699]
我々は、閉形式力学を解析するための数学的機会を提供する、簡潔な損失関数であるアンヒンジド・ロスを導入する。
アンヒンジされた損失は、時間変化学習率や特徴正規化など、より実践的なテクニックを検討することができる。
論文 参考訳(メタデータ) (2023-12-13T02:11:07Z) - Stochastic parameter optimization analysis of dynamical quantum critical phenomena in long-range transverse-field Ising chain [0.0]
一次元長次元逆場イジングモデルの量子相転移について検討する。
シミュレーションでは, 臨界点と普遍性に関する事前知識がなくても, サンプリング対象のパラメータを自動的に決定する。
後者の2つの普遍性境界として$sigma = 7/4$を支持する数値的な証拠を得ることに成功した。
論文 参考訳(メタデータ) (2023-05-23T14:46:16Z) - Understanding the Generalization Ability of Deep Learning Algorithms: A
Kernelized Renyi's Entropy Perspective [11.255943520955764]
本稿では,Renyiのエントロピーをカーネル化した新しい情報理論尺度を提案する。
我々は,Renyiエントロピーのカーネル化の下で,勾配/ランジュバン降下(SGD/SGLD)学習アルゴリズムの一般化誤差境界を確立する。
我々の情報理論的境界は勾配の統計に依存しており、現在のSOTA(State-of-the-art)結果よりも厳密であることを示す。
論文 参考訳(メタデータ) (2023-05-02T01:17:15Z) - Stability and Generalization Analysis of Gradient Methods for Shallow
Neural Networks [59.142826407441106]
本稿では,アルゴリズム安定性の概念を活用して,浅層ニューラルネットワーク(SNN)の一般化挙動について検討する。
我々は、SNNを訓練するために勾配降下(GD)と勾配降下(SGD)を考慮する。
論文 参考訳(メタデータ) (2022-09-19T18:48:00Z) - Fractal Structure and Generalization Properties of Stochastic
Optimization Algorithms [71.62575565990502]
最適化アルゴリズムの一般化誤差は、その一般化尺度の根底にあるフラクタル構造の複雑性'にバウンドできることを示す。
さらに、特定の問題(リニア/ロジスティックレグレッション、隠れ/層ニューラルネットワークなど)とアルゴリズムに対して、結果をさらに専門化します。
論文 参考訳(メタデータ) (2021-06-09T08:05:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。