論文の概要: Structure-Specific Representational Priors Causally Control the Grokking Delay
- arxiv url: http://arxiv.org/abs/2607.04333v3
- Date: Tue, 14 Jul 2026 13:00:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 12:51:44.244912
- Title: Structure-Specific Representational Priors Causally Control the Grokking Delay
- Title(参考訳): 造粒遅延を因果的に制御する構造特異的表現前駆体
- Authors: Gunner Levi Howe,
- Abstract要約: グローキングは、トレーニングセットからずっと後の一般化であり、構造に依存しない介入によって加速されている。
ラベルではなく機能レベルで決定された、適切な表現構造を形成するのは慎重なタイミングであることを示す。
加速度はウェイトノームのサイドエフェクトによって促進されるので、トレーニング中にノルムをクランプすると、信頼できるスタンドアロンの加速器が得られる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Grokking -- generalization long after training-set interpolation -- has been accelerated by structure-agnostic interventions (gradient filtering, weight-norm clamping, geometric penalties). Whether the delay specifically measures the time to form task-structured representations has remained observational. We test it causally by injecting representational priors of varying content into a one-layer transformer learning modular addition, via a supervised-contrastive loss whose positives encode (i) the task's true structure ($(a+b) \bmod p$), (ii) a coherent-but-wrong sibling ($(a-b) \bmod p$), or (iii) a random partition -- all with identical loss form, strength, class sizes, and geometry. Whether generalization occurs follows a clean gradation: true 22/30 runs, sibling (same periodic features, wrong combination) 14/15, random (only memorizable) 0/20 (Fisher $p=1.3\times10^{-7}$). A weight-norm-matched control replaying the norm trajectory onto plain cross-entropy generalizes 0/15, ruling out the norm as mediator. Probes show structure formation precedes and predicts generalization in all runs. Only the true structure also accelerates grokking (up to $2.75\times$), but this is dose-dependent and bimodal. We then confirm the mechanism by prediction: because the acceleration is gated by a weight-norm side-effect, clamping the norm during training yields a reliable, standalone accelerator with a median $8.6\times$ speedup (up to $22\times$ on the fastest seeds, under 1000 epochs), growing monotonically as the norm is held lower; the residual stalls also vanish, though significant only pooled over the two mitigations run at both strengths ($0/40$ vs $6/20$, $p=7.7\times10^{-4}$), not per method. The grokking delay is, causally, the time to form the right representational structure -- decided at the level of features, not labels.
- Abstract(参考訳): グロキング(Grokking) - トレーニングセットの補間から長い一般化 - は、構造に依存しない介入(段階的なフィルタリング、ウェイトノームのクランプ、幾何学的な罰則)によって加速されている。
遅延が特にタスク構造化表現を形成する時間を測定するかどうかは、まだ観察的のままである。
我々は,モジュール付加を学習する一層トランスフォーマーに,正の符号を符号化した教師付きコントラスト損失を用いて,異種コンテンツの表現先を注入することによって,因果的に検証する。
(i)タスクの真の構造((a+b) \bmod p$)
(二 兄弟姉妹((a-b) \bmod p$)又は
(iii) ランダムなパーティション -- すべて同じ損失形式、強度、クラスサイズ、幾何を持つ。
真の 22/30 個の実行、シブリング(同じ周期的特徴、間違った組み合わせ) 14/15 個のランダムな(記憶可能なだけ) 0/20 (Fisher $p=1.3\times10^{-7}$)である。
標準軌道を平らなクロスエントロピーにリプレイするウェイトノーム整合制御は、標準をメディエータとして除外する0/15を一般化する。
プローブは構造の形成に先行し、全ての実行において一般化を予測する。
真の構造のみがグルーキングを加速する(最大2.75\times$)が、これは線量依存的でバイモーダルである。
加速度がウェイトノームのサイドエフェクトによって促進されるので、トレーニング中のノルムをクランプすると、中央値の8.6\times$スピードアップ(最高22.6\times$、1000 epochs以下)で、標準が低く保たれるにつれて単調に成長し、残りのストールも消滅するが、両方の強度で動く2つの緩和に重きをあてる(0/40$対6/20$、$p=7.7\times10^{-4}$)。
ゆるやかな遅延は、慎重には、適切な表現構造を形成するための時間 -- ラベルではなく、機能のレベルで決定されるものです。
関連論文リスト
- Grokking as Structural Inference: Transformers Need Bayesian Lottery Tickets [0.0]
トレーニングセットを記憶したトランスフォーマーが一般化する前に数千ステップ待つ理由を考察する。
我々は,KLに基づく構造的介入によって,この説明の遅れを回避できることを証明した。
アルゴリズムシークエンスタスクの実験では、構造をキャパシティから分離し、このベイズチケットが抽選チケットの転送にマッチするか、性能を上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-15T09:46:36Z) - Deep Reasoning in General Purpose Agents via Structured Meta-Cognition [58.185853639335896]
構造化メタ推論を用いてタスク固有の足場を構築するための推論時アプローチを提案する。
我々は、より制御された推論スレッドに複雑なタスクを分散する汎用エージェントでこのアプローチをインスタンス化する。
論文 参考訳(メタデータ) (2026-05-12T01:21:37Z) - Faster 3D Gaussian Splatting Convergence via Structure-Aware Densification [52.517763621139956]
3Dガウススプラッティングは、リアルタイムのノベルビュー合成のための強力なシーン表現として登場した。
標準適応密度制御は画面空間の位置勾配に依存する。
本稿では,3次元ガウススプラッティングのための構造認識型密度化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-30T15:37:20Z) - A Systematic Empirical Study of Grokking: Depth, Architecture, Activation, and Regularization [0.0]
暗記からニューラルネットワークの一般化への遅れた遷移をグロッキングすることは、まだ理解されていない。
モジュラー加算に関する因子を系統的に分散させる制御された研究(mod 97)を提案する。
我々の中心的な発見は、グラッキングダイナミクスはアーキテクチャーによって決定されるのではなく、安定性と正規化の間の相互作用によって決定されることである。
論文 参考訳(メタデータ) (2026-03-26T04:16:01Z) - The Geometric Inductive Bias of Grokking: Bypassing Phase Transitions via Architectural Topology [0.0]
巡回加法(Zp)を訓練した変圧器のグルーキング-遅れ一般化に関する研究
標準変圧器における2つの独立した構造因子:表現の大きさとデータ依存型アテンションルーティングを同定する。
論文 参考訳(メタデータ) (2026-03-05T14:41:01Z) - Rational Transductors [30.916600771560933]
EmphRational Transductorsは,行列値の繰り返しでトランスフォーマーを増強するデュアルストリームアーキテクチャである。
EmphDeep Rational Injection スキームにより,有理状態情報をアテンション機構に注入することにより,トランスフォーマーの表現力を厳密に一般化する。
論文 参考訳(メタデータ) (2026-02-07T16:01:10Z) - Understanding and Constructing Latent Modality Structures in Multi-modal
Representation Learning [53.68371566336254]
優れたパフォーマンスの鍵は、完全なモダリティアライメントではなく、有意義な潜在モダリティ構造にある、と我々は主張する。
具体的には,1)モダリティ内正規化のための深い特徴分離損失,2)モダリティ間正規化のためのブラウン橋損失,3)モダリティ内正規化およびモダリティ間正規化のための幾何学的整合損失を設計する。
論文 参考訳(メタデータ) (2023-03-10T14:38:49Z) - DepGraph: Towards Any Structural Pruning [68.40343338847664]
我々は、CNN、RNN、GNN、Transformersのような任意のアーキテクチャの一般的な構造解析について研究する。
本稿では,階層間の依存関係を明示的にモデル化し,包括的にグループ化してプルーニングを行う汎用かつ完全自動な手法であるemphDependency Graph(DepGraph)を提案する。
本研究では,画像用ResNe(X)t,DenseNet,MobileNet,Vision Transformer,グラフ用GAT,3Dポイントクラウド用DGCNN,言語用LSTMなど,さまざまなアーキテクチャやタスクに関する手法を広範囲に評価し,言語用LSTMと並行して示す。
論文 参考訳(メタデータ) (2023-01-30T14:02:33Z) - Coarsening the Granularity: Towards Structurally Sparse Lottery Tickets [127.56361320894861]
ロッテリーチケット仮説 (LTH) は、密集したモデルには厳密なスパースワーク(すなわち当選チケット)が含まれており、完全な正確性に合わせるために単独で訓練できることを示した。
本稿では,構造的にスパースな入賞券が一般に有効に発見できるという,最初の肯定的な結果を示す。
具体的には、まず、重要と考えられるいくつかのチャネルで「再充填」された要素を返却し、次に非ゼロ要素を「再群」して、柔軟なグループ単位の構造パターンを作成します。
論文 参考訳(メタデータ) (2022-02-09T21:33:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。