論文の概要: Circuit Synchronization Precedes Generalization: Causal Evidence from Fourier Structure in Grokking Transformers
- arxiv url: http://arxiv.org/abs/2606.12966v1
- Date: Thu, 11 Jun 2026 06:52:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-12 15:55:27.6225
- Title: Circuit Synchronization Precedes Generalization: Causal Evidence from Fourier Structure in Grokking Transformers
- Title(参考訳): 回路同期化が一般化に先行する:グロキング変圧器のフーリエ構造からの因果証拠
- Authors: Achyuthan Sivasankar,
- Abstract要約: グロキングは、モジュラー演算の変圧器が突然、近チャンスからほぼ完璧な検証精度に遷移する場所である。
本稿では、フーリエ回路同期のための周波数同期デグレ(FSD: Frequency Synchronization Degree)について述べる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Grokking -- where a transformer on modular arithmetic suddenly transitions from near-chance to near-perfect validation accuracy -- is attributed to a Fourier circuit, but its timing, causal structure, and controllability remain poorly understood. We introduce the Frequency Synchronization Degree (FSD), a normalised, permutation-tested metric for Fourier circuit synchronisation requiring no prior circuit knowledge. Across nine modular addition configurations (primes p in {53, 71, 97, 113, 131}, three seeds), FSD synchronises 500-3,000 steps before grokking (mean lead +1,722 steps; all nine positive, sign-test p~0.004), and precedes a restricted-logit loss baseline (Nanda et al.'s excluded loss) in all nine cases, making it the earliest available predictor. We provide direct causal evidence that the inter-phase gap is a regularisation phenomenon: forking training at the FSD-ceiling step and varying weight decay lambda produces strictly monotone earlier grokking, with Delta_t proportional to 1/lambda. This law replicates across three primes (p in {53,97,131}; R^2=1.00 and R^2=0.99 for two clean cases), captured as Delta_t ~ C/lambda, consistent with (1/lambda)*log(||W_mem||/tau). Architecture ablations show an attention-only model groks with a strong FSD precursor; an MLP-only model never groks; a single-layer model's FSD lags, confirming the precursor is a multi-block circuit property.
- Abstract(参考訳): モジュラー演算の変圧器が突然近チャンスからほぼ完璧な検証精度に遷移するグロキングは、フーリエ回路によるものであるが、そのタイミング、因果構造、制御性はいまだによく分かっていない。
本稿では、フーリエ回路同期のための正規化・置換試験法である周波数同期デグレ(FSD)を導入する。
9つのモジュラー加算構成(主にp in {53, 71, 97, 113, 131}, three seed)にまたがって、FSDはグルーキングの前に500-3,000ステップを同期させる(平均リード+1,722ステップ、全ての9つの正の符号テストp~0.004)。
相間ギャップが正則化現象であることを示す直接的な因果的証拠を与える: FSD-シーリングステップでのトレーニングと異なる重み付け崩壊ラムダは、Delta_tを1/lambdaに比例して、より厳密な単調なモノトンを生成する。
この法則は、3つの素数 (p in {53,97,131}; R^2=1.00 and R^2=0.99 for two clean case) を複製し、Delta_t ~ C/lambda として取得され、(1/lambda)*log(||W_mem||/tau) と一致する。
アーキテクチャの進歩は、強いFSD前駆体を持つ注目のみのモデルグルーク、MLPのみのモデルがグルーク、単層モデルのFSDラグ、そして前駆体がマルチブロック回路特性であることを確認している。
関連論文リスト
- PTL-Diffusion: Manifold-Aware Diffusion with Periodic Terminal Laws [11.320692310389122]
PTL拡散は相構造を直接フォワード雑音力学に埋め込む。
トーラスおよびシリンダー・ポイントクラウド・ベンチマークとオリベッティ・フェース・データセットの実験により、PTL拡散は多様体レベルの分布マッチングを改善することが示された。
論文 参考訳(メタデータ) (2026-06-08T17:56:16Z) - Transformers Can Learn Rules They've Never Seen: Proof of Computation Beyond Interpolation [0.0]
2つの制御された設定で強みのみの仮説をテストする。
実験1では、純粋なXOR遷移規則を持つセルオートマトンを用いる。
実験2では、整数上のシンボリック作用素鎖を1つの作用素対が持ち上がった状態で研究する。
論文 参考訳(メタデータ) (2026-03-17T18:02:28Z) - Why Grokking Takes So Long: A First-Principles Theory of Representational Phase Transitions [0.0]
グロッキング(Grokking)は、モデルがトレーニングデータを記憶してから長く経った突然の記憶である。
正規化学習力学におけるノルム駆動表現相転移からグラッキングが生じることを示す第一原理理論を提案する。
論文 参考訳(メタデータ) (2026-03-05T17:28:39Z) - Early-Warning Signals of Grokking via Loss-Landscape Geometry [0.0]
SCAN合成一般化とDyck-1深さ予測の2つのシーケンスラーニングベンチマークについて検討した。
タスクと幅広い学習率の双方において、通勤者欠陥は一般化される前に大きく上昇する。
これらの結果から, コンバータの欠陥は, コンバータの遅延一般化のための, 頑健でアーキテクチャに依存しない, 因果的に早期警戒信号であることがわかった。
論文 参考訳(メタデータ) (2026-02-19T00:14:36Z) - Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders [48.68968421120471]
標準拡散変換器は直接表現に収束しないことを示す。
我々は幾何学的干渉を根本原因とみなす。
我々の手法RJFは、標準のDiT-Bアーキテクチャを効果的に収束させ、3.37のFIDを実現する。
論文 参考訳(メタデータ) (2026-02-10T18:58:04Z) - Parallel Complex Diffusion for Scalable Time Series Generation [50.01609741902786]
PaCoDiは周波数領域における生成モデリングを分離するスペクトルネイティブアーキテクチャである。
本研究では,PaCoDiが生成品質と推論速度の両方において,既存のベースラインを上回っていることを示す。
論文 参考訳(メタデータ) (2026-02-10T14:31:53Z) - Closed-Loop Transformers: Autoregressive Modeling as Iterative Latent Equilibrium [0.6820746164515952]
閉ループ予測の原理を導入し、自己整合平衡に達するまで、モデルが反復的に潜在表現を洗練することを要求する。
この原理をEquilibrium Transformerとしてインスタンス化し,標準トランス層をEquilibrium Refinement Moduleで拡張する。
バイナリパリティタスクに関する予備実験では、チャレンジシーケンスの平均改善率は+3.28%で、標準トランスフォーマーがランダムなパフォーマンスに近づくと+8.07%に達する。
論文 参考訳(メタデータ) (2025-11-26T20:02:59Z) - INC: An Indirect Neural Corrector for Auto-Regressive Hybrid PDE Solvers [61.84396402100827]
本稿では,学習した補正を支配方程式に統合する間接ニューラルコレクタ(mathrmINC$)を提案する。
$mathrmINC$は、$t-1 + L$の順番でエラー増幅を減らし、$t$はタイムステップ、$L$はリプシッツ定数である。
大規模なベンチマークで$mathrmINC$をテストし、1Dカオスシステムから3D乱流まで、多くの異なる解法、神経バックボーン、テストケースをカバーした。
論文 参考訳(メタデータ) (2025-11-16T20:14:28Z) - FFT-Accelerated Auxiliary Variable MCMC for Fermionic Lattice Models: A Determinant-Free Approach with $O(N\log N)$ Complexity [52.3171766248012]
量子多体系のシミュレーションを劇的に高速化するマルコフ連鎖モンテカルロ(MCMC)アルゴリズムを導入する。
我々は,量子物理学のベンチマーク問題に対するアルゴリズムの有効性を検証し,既知の理論結果を正確に再現する。
我々の研究は、大規模確率的推論のための強力なツールを提供し、物理学に着想を得た生成モデルのための道を開く。
論文 参考訳(メタデータ) (2025-10-13T07:57:21Z) - KPZ scaling from the Krylov space [83.88591755871734]
近年,Cardar-Parisi-Zhangスケーリングをリアルタイムの相関器や自動相関器に示す超拡散が報告されている。
これらの結果から着想を得て,Krylov演算子に基づく相関関数のKPZスケーリングについて検討する。
論文 参考訳(メタデータ) (2024-06-04T20:57:59Z) - Structural aspects of FRG in quantum tunnelling computations [68.8204255655161]
一次元の4次元高調波発振器とダブルウェルポテンシャルの両方を探索する。
ポテンシャルV_k(varphi)と波動関数再正規化Z_k(varphi)の2つの偏微分方程式について検討した。
論文 参考訳(メタデータ) (2022-06-14T15:23:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。