論文の概要: How to Tame Grokking: Representation Geometry as a Control Signal
- arxiv url: http://arxiv.org/abs/2607.11666v1
- Date: Mon, 13 Jul 2026 15:09:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.523288
- Title: How to Tame Grokking: Representation Geometry as a Control Signal
- Title(参考訳): トレーサグラキングの方法:制御信号としての表現幾何学
- Authors: Maksim A Kazanskii,
- Abstract要約: グロキング(Grokking)は、ニューラルネットワークがトレーニングデータを記憶し、長い最適化後に強い一般化を示す現象である。
本稿では,隠れ表現の効果的な次元性を変化させる簡易なスペクトル正規化器GeomDRについて紹介する。
いくつかの設定では、グラッキングは標準のAdamW訓練と比較して最大52倍加速される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Grokking is a phenomenon in which neural networks initially memorize training data and only later exhibit strong generalization after prolonged optimization. Despite extensive recent study, the factors influencing the emergence and timing of grokking remain incompletely understood. We investigate the relationship between representation geometry and delayed generalization. We find that dimensionality collapse consistently precedes the onset of grokking in all evaluated settings. Motivated by these observations, we introduce Geometric Dimensionality Regularization (GeomDR), a simple spectral regularizer that modifies the effective dimensionality of hidden representations during training. Across modular addition, modular division, and permutation composition tasks, GeomDR consistently alters grokking dynamics and can substantially accelerate the onset of generalization depending on the intervention schedule and target dimensionality. In several settings, grokking is accelerated by up to 52 times relative to standard AdamW training. Similar qualitative effects are observed in both multilayer perceptrons and transformers. Together, these results suggest that representation geometry can serve as an effective control signal for grokking and provide evidence that geometric interventions offer a practical approach for studying and influencing delayed generalization in neural networks.
- Abstract(参考訳): グロキング(Grokking)は、ニューラルネットワークが最初トレーニングデータを記憶し、後に最適化が長引いた後に強力な一般化を示す現象である。
近年の広範な研究にもかかわらず、グルーキングの出現とタイミングに影響を及ぼす要因は未解明のままである。
表現幾何学と遅延一般化の関係について検討する。
評価されたすべての設定において、次元の崩壊はグルーキングの開始に一貫して先行していることがわかった。
これらの観測から得られた幾何学的次元規則化(GeomDR)は、トレーニング中に隠蔽表現の有効次元を変更する単純なスペクトル正規化器である。
モジュラー加算、モジュラー分割、置換合成タスク全体にわたって、GeomDRはグラッキングダイナミクスを一貫して変更し、介入スケジュールとターゲット次元性に応じて一般化の開始を著しく加速することができる。
いくつかの設定では、グラッキングは標準のAdamW訓練と比較して最大52倍加速される。
同様の定性的効果は多層パーセプトロンと変圧器の両方で観察される。
これらの結果は、表現幾何学がグルーキングの効果的な制御信号となり得ることを示唆し、幾何学的介入がニューラルネットワークの遅延一般化を研究・影響を与えるための実践的なアプローチであることを示す。
関連論文リスト
- General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling [48.559681359374146]
GAM(Generalized Action Manifold)フレームワークは、構造的ゆがみを通じて一般的な共分散を強制する。
GAMは、ジオメトリーに依存しないベースラインよりも優れた転送能力とロバスト性を実現する。
論文 参考訳(メタデータ) (2026-05-27T03:38:15Z) - Monitoring Neural Training with Topology: A Footprint-Predictable Collapse Index [51.56484100374058]
我々は,MHM(Modular Morse Homology maintenance)とCI(Composite Collapse Index)を併用したオンライントポロジ対応型神経表現モニタを提案する。
コンプレックスを再構築する代わりに、スパース編集を一定のスケールで適用し、離散的なモースマッチングを維持し、高速でインクリメンタルな更新をもたらす。
論文 参考訳(メタデータ) (2026-04-28T19:21:21Z) - A Systematic Empirical Study of Grokking: Depth, Architecture, Activation, and Regularization [0.0]
暗記からニューラルネットワークの一般化への遅れた遷移をグロッキングすることは、まだ理解されていない。
モジュラー加算に関する因子を系統的に分散させる制御された研究(mod 97)を提案する。
我々の中心的な発見は、グラッキングダイナミクスはアーキテクチャーによって決定されるのではなく、安定性と正規化の間の相互作用によって決定されることである。
論文 参考訳(メタデータ) (2026-03-26T04:16:01Z) - The Geometric Inductive Bias of Grokking: Bypassing Phase Transitions via Architectural Topology [0.0]
巡回加法(Zp)を訓練した変圧器のグルーキング-遅れ一般化に関する研究
標準変圧器における2つの独立した構造因子:表現の大きさとデータ依存型アテンションルーティングを同定する。
論文 参考訳(メタデータ) (2026-03-05T14:41:01Z) - GeoGNN: Quantifying and Mitigating Semantic Drift in Text-Attributed Graphs [59.61242815508687]
テキスト分散グラフ(TAG)上のグラフニューラルネットワーク(GNN)は、事前訓練された言語モデル(PLM)を使用してノードテキストを符号化し、これらの埋め込みを線形近傍アグリゲーションを通じて伝播する。
本研究は,意味的ドリフトの度合いを計測する局所PCAベースの計量を導入し,異なる凝集機構が多様体構造にどのように影響するかを解析するための最初の定量的枠組みを提供する。
論文 参考訳(メタデータ) (2025-11-12T06:48:43Z) - GeoAda: Efficiently Finetune Geometric Diffusion Models with Equivariant Adapters [61.51810815162003]
制御された生成タスクに対してフレキシブルかつパラメータ効率の良い微調整を可能にするSE(3)-equivariant Adapter framework(GeoAda)を提案する。
GeoAdaは、過剰適合と破滅的な忘れを緩和しながら、モデルの幾何的一貫性を保っている。
我々は、フレーム制御、グローバル制御、サブグラフ制御、広範囲のアプリケーションドメインを含む多様な幾何学的制御タイプにまたがるGeoAdaの適用性を実証する。
論文 参考訳(メタデータ) (2025-07-02T18:44:03Z) - Beyond Progress Measures: Theoretical Insights into the Mechanism of Grokking [50.465604300990904]
グロキング(Grokking)とは、オーバーフィッティングの拡張後のテスト精度の急激な改善を指す。
本研究では、素数演算のタスクにおいて、Transformerの基盤となるグルーキング機構について検討する。
論文 参考訳(メタデータ) (2025-04-04T04:42:38Z) - Bridging Lottery Ticket and Grokking: Understanding Grokking from Inner Structure of Networks [27.020990219204343]
内部ネットワーク構造がグラッキングに与える影響について検討する。
一般化段階での宝くじの利用は,遅延一般化を著しく減少させることを示す。
グルーク付きチケットは,周期的な重みパターン,有益なグラフ特性を示し,急激な構造変化を呈する。
論文 参考訳(メタデータ) (2023-10-30T11:58:44Z) - On the geometry of generalization and memorization in deep neural
networks [15.250162344382051]
本研究では,深層ネットワークにおいて,いつ,どこで暗記が起こるかという構造について検討する。
すべてのレイヤは、機能を共有する例から優先的に学び、この振る舞いを一般化のパフォーマンスにリンクする。
我々は,物体の半径と寸法を減少させるため,より深い層に暗記が顕著に起こることを見出した。
論文 参考訳(メタデータ) (2021-05-30T19:07:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。