論文の概要: Structure-Specific Representational Priors Causally Control the Grokking Delay
- arxiv url: http://arxiv.org/abs/2607.04333v2
- Date: Thu, 09 Jul 2026 13:20:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.253021
- Title: Structure-Specific Representational Priors Causally Control the Grokking Delay
- Title(参考訳): 造粒遅延を因果的に制御する構造特異的表現前駆体
- Abstract要約: 遅延は、ラベルではなく、機能レベルで決定された正しい表現構造を形成するための時間であることを示す。
加速度はウェイトノームのサイドエフェクトによって促進されるので、トレーニング中にノルムをクランプすると、信頼できるスタンドアロンの加速器が得られる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Grokking -- generalization long after training-set interpolation -- has been accelerated by structure-agnostic interventions (gradient filtering, weight-norm clamping, geometric penalties). Whether the delay specifically measures the time to form task-structured representations has remained observational. We test it causally by injecting representational priors of varying content into a one-layer transformer learning modular addition, via a supervised-contrastive loss whose positives encode (i) the task's true structure ($(a+b) \bmod p$), (ii) a coherent-but-wrong sibling ($(a-b) \bmod p$), or (iii) a random partition -- all with identical loss form, strength, class sizes, and geometry. Whether generalization occurs follows a clean gradation: true 22/30 runs, sibling (same periodic features, wrong combination) 14/15, random (only memorizable) 0/20 (Fisher $p=1.3\times10^{-7}$). A weight-norm-matched control replaying the norm trajectory onto plain cross-entropy generalizes 0/15, ruling out the norm as mediator. Probes show structure formation precedes and predicts generalization in all runs. Only the true structure also accelerates grokking (up to $2.75\times$), but this is dose-dependent and bimodal. We then confirm the mechanism by prediction: because the acceleration is gated by a weight-norm side-effect, clamping the norm during training yields a reliable, standalone accelerator with a median $8.6\times$ speedup (up to $22\times$ on the fastest seeds, under 1000 epochs), growing monotonically as the norm is held lower; the residual stalls also vanish, though significant only pooled across methods ($0/40$ vs $6/20$, $p=7.7\times10^{-4}$), not per method. The grokking delay is, causally, the time to form the right representational structure -- decided at the level of features, not labels.
- Abstract(参考訳): グロキング(Grokking) - トレーニングセットの補間から長い一般化 - は、構造に依存しない介入(段階的なフィルタリング、ウェイトノームのクランプ、幾何学的な罰則)によって加速されている。
遅延が特にタスク構造化表現を形成する時間を測定するかどうかは、まだ観察的のままである。
我々は,モジュール付加を学習する一層トランスフォーマーに,正の符号を符号化した教師付きコントラスト損失を用いて,異種コンテンツの表現先を注入することによって,因果的に検証する。
(i)タスクの真の構造((a+b) \bmod p$)
(二 兄弟姉妹((a-b) \bmod p$)又は
(iii) ランダムなパーティション -- すべて同じ損失形式、強度、クラスサイズ、幾何を持つ。
真の 22/30 個の実行、シブリング(同じ周期的特徴、間違った組み合わせ) 14/15 個のランダムな(記憶可能なだけ) 0/20 (Fisher $p=1.3\times10^{-7}$)である。
標準軌道を平らなクロスエントロピーにリプレイするウェイトノーム整合制御は、標準をメディエータとして除外する0/15を一般化する。
プローブは構造の形成に先行し、全ての実行において一般化を予測する。
真の構造のみがグルーキングを加速する(最大2.75\times$)が、これは線量依存的でバイモーダルである。
加速度がウェイトノームのサイドエフェクトによって促進されるので、トレーニング中のノルムをクランプすると、中央値の8.6\times$スピードアップ(最高2.2\times$、1000 epochs以下)で信頼性の高いスタンドアロンアクセラレータが生成される。
ゆるやかな遅延は、慎重には、適切な表現構造を形成するための時間 -- ラベルではなく、機能のレベルで決定されるものです。
関連論文リスト
- Quantifying the Memorization-to-Generalization Transition: Scaling Laws and Phase Structure in Grokking [0.0]
モジュラー算術上の 2 つの隠れた一般化の 384 構成に対して、0.8-to- Generalization 境界を写像する。
データ複雑性は、モデルキャパシティではなく、政権移行の主要な要因である。
論文 参考訳(メタデータ) (2026-09-09T16:47:03Z) - Intrinsic Structure: Spectral Identifiability for Mechanistic Interpretability [51.56484100374058]
機械論的解釈可能性プリミティブに対する最初の識別可能性定理を証明した。
スペクトルは、正当性分解ではなく、記述されたエラーバーを持つ識別可能なモデル固有の指紋である。
論文 参考訳(メタデータ) (2026-08-10T19:42:01Z) - What Makes a Representational Prior Work? Feature Families, Label-Free Invariances, and Critical Windows in Grokking [0.0]
我々は、4つの軸にまたがって、188の新たなランで、そのような先行的な作業を特徴付ける。
間違ったフィーチャーファミリから構築された一貫性のある学習可能な事前ビルドは、ランダムパーティションのように一般化をブロックする。
前者は早期に必要であり、最初の2000年代のみにのみ適用される。
論文 参考訳(メタデータ) (2026-07-14T13:06:44Z) - Attention is Just Another Name for Coupling?: A Fast-Slow ODE Perspective on Hierarchical Pretraining [0.0]
本稿では,ゼロ初期化ゲート補間により,時間的に遅い第2のカップリングが高速経路にフィードバックされるかどうかを問う。
本論文は、高速スローODE形式を具体的なニューラルネットワークとしてインスタンス化する。
論文 参考訳(メタデータ) (2026-06-15T13:54:15Z) - Transformers Provably Learn to Internalize Chain-of-Thought [65.41010769606844]
Implicit Chain-of-Thought (ICoT) は、隠れた状態の中で中間段階を内部化するモデルを訓練する。
Log-ICoTはシンキングトークンを一度に削除し、$k$のリニアから対数へのステージ数を削減します。
多層変圧器の実験により理論が確認され、より深い層に段階的に推論がどのように吸収されるかが可視化される。
論文 参考訳(メタデータ) (2026-05-27T15:17:06Z) - Prism: Structural Symmetry Scanning via Duality-Constrained Laplacian Projection [0.0]
複雑なネットワークにおける構造対称性診断のためのフレームワークである textbfPrism を導入する。
Prismは、ネットワークが構造的自己整合性からどのくらい離れているかを測定するスカラーである。
論文 参考訳(メタデータ) (2026-05-18T04:20:05Z) - Grokking as Structural Inference: Transformers Need Bayesian Lottery Tickets [0.0]
トレーニングセットを記憶したトランスフォーマーが一般化する前に数千ステップ待つ理由を考察する。
我々は,KLに基づく構造的介入によって,この説明の遅れを回避できることを証明した。
アルゴリズムシークエンスタスクの実験では、構造をキャパシティから分離し、このベイズチケットが抽選チケットの転送にマッチするか、性能を上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-15T09:46:36Z) - Deep Reasoning in General Purpose Agents via Structured Meta-Cognition [58.185853639335896]
構造化メタ推論を用いてタスク固有の足場を構築するための推論時アプローチを提案する。
我々は、より制御された推論スレッドに複雑なタスクを分散する汎用エージェントでこのアプローチをインスタンス化する。
論文 参考訳(メタデータ) (2026-05-12T01:21:37Z) - Faster 3D Gaussian Splatting Convergence via Structure-Aware Densification [52.517763621139956]
3Dガウススプラッティングは、リアルタイムのノベルビュー合成のための強力なシーン表現として登場した。
標準適応密度制御は画面空間の位置勾配に依存する。
本稿では,3次元ガウススプラッティングのための構造認識型密度化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-30T15:37:20Z) - A Systematic Empirical Study of Grokking: Depth, Architecture, Activation, and Regularization [0.0]
暗記からニューラルネットワークの一般化への遅れた遷移をグロッキングすることは、まだ理解されていない。
モジュラー加算に関する因子を系統的に分散させる制御された研究(mod 97)を提案する。
我々の中心的な発見は、グラッキングダイナミクスはアーキテクチャーによって決定されるのではなく、安定性と正規化の間の相互作用によって決定されることである。
論文 参考訳(メタデータ) (2026-03-26T04:16:01Z) - The Geometric Inductive Bias of Grokking: Bypassing Phase Transitions via Architectural Topology [0.0]
巡回加法(Zp)を訓練した変圧器のグルーキング-遅れ一般化に関する研究
標準変圧器における2つの独立した構造因子:表現の大きさとデータ依存型アテンションルーティングを同定する。
論文 参考訳(メタデータ) (2026-03-05T14:41:01Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - Rational Transductors [30.916600771560933]
EmphRational Transductorsは,行列値の繰り返しでトランスフォーマーを増強するデュアルストリームアーキテクチャである。
EmphDeep Rational Injection スキームにより,有理状態情報をアテンション機構に注入することにより,トランスフォーマーの表現力を厳密に一般化する。
論文 参考訳(メタデータ) (2026-02-07T16:01:10Z) - Latency and Ordering Effects in Online Decisions [0.0]
オンライン意思決定システムは遅延フィードバックと順序に敏感なダイナミクスの下で動作している。
ヘテロジニアスレイテンシ、非可換性、実装ギャップ効果を1つの下界ステートメントにパッケージ化する。
論文 参考訳(メタデータ) (2025-11-17T07:08:05Z) - INC: An Indirect Neural Corrector for Auto-Regressive Hybrid PDE Solvers [61.84396402100827]
本稿では,学習した補正を支配方程式に統合する間接ニューラルコレクタ(mathrmINC$)を提案する。
$mathrmINC$は、$t-1 + L$の順番でエラー増幅を減らし、$t$はタイムステップ、$L$はリプシッツ定数である。
大規模なベンチマークで$mathrmINC$をテストし、1Dカオスシステムから3D乱流まで、多くの異なる解法、神経バックボーン、テストケースをカバーした。
論文 参考訳(メタデータ) (2025-11-16T20:14:28Z) - Robust Layerwise Scaling Rules by Proper Weight Decay Tuning [50.11170157029911]
現代のスケール不変アーキテクチャでは、トレーニングは急速に劣化したグラデーション状態に入る。
我々は,AdamWに対して,幅をまたいだサブ層ゲインを保ったウェイトデカイスケーリングルールを導入する。
この結果は,パラメータが設定した定常スケールを明示的に制御することにより,ほぼ入出力体制を超えて$mu$Pを拡大する。
論文 参考訳(メタデータ) (2025-10-17T02:58:35Z) - Understanding and Constructing Latent Modality Structures in Multi-modal
Representation Learning [53.68371566336254]
優れたパフォーマンスの鍵は、完全なモダリティアライメントではなく、有意義な潜在モダリティ構造にある、と我々は主張する。
具体的には,1)モダリティ内正規化のための深い特徴分離損失,2)モダリティ間正規化のためのブラウン橋損失,3)モダリティ内正規化およびモダリティ間正規化のための幾何学的整合損失を設計する。
論文 参考訳(メタデータ) (2023-03-10T14:38:49Z) - DepGraph: Towards Any Structural Pruning [68.40343338847664]
我々は、CNN、RNN、GNN、Transformersのような任意のアーキテクチャの一般的な構造解析について研究する。
本稿では,階層間の依存関係を明示的にモデル化し,包括的にグループ化してプルーニングを行う汎用かつ完全自動な手法であるemphDependency Graph(DepGraph)を提案する。
本研究では,画像用ResNe(X)t,DenseNet,MobileNet,Vision Transformer,グラフ用GAT,3Dポイントクラウド用DGCNN,言語用LSTMなど,さまざまなアーキテクチャやタスクに関する手法を広範囲に評価し,言語用LSTMと並行して示す。
論文 参考訳(メタデータ) (2023-01-30T14:02:33Z) - Coarsening the Granularity: Towards Structurally Sparse Lottery Tickets [127.56361320894861]
ロッテリーチケット仮説 (LTH) は、密集したモデルには厳密なスパースワーク(すなわち当選チケット)が含まれており、完全な正確性に合わせるために単独で訓練できることを示した。
本稿では,構造的にスパースな入賞券が一般に有効に発見できるという,最初の肯定的な結果を示す。
具体的には、まず、重要と考えられるいくつかのチャネルで「再充填」された要素を返却し、次に非ゼロ要素を「再群」して、柔軟なグループ単位の構造パターンを作成します。
論文 参考訳(メタデータ) (2022-02-09T21:33:51Z) - Towards Defending Multiple $\ell_p$-norm Bounded Adversarial
Perturbations via Gated Batch Normalization [120.99395850108422]
既存の敵防衛は、個々の摂動に対するモデル堅牢性を改善するのが一般的である。
最近の手法では、複数の$ell_p$球における敵攻撃に対するモデルロバスト性を改善するが、各摂動型に対するそれらの性能は、まだ十分ではない。
我々は,複数の$ell_pの有界摂動を守るために,摂動不変予測器を逆向きに訓練するGated Batch Normalization (GBN)を提案する。
論文 参考訳(メタデータ) (2020-12-03T02:26:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。