論文の概要: Thermodynamic Weight Decay: Exploring Grokking Acceleration via Attention Specific Heat
- arxiv url: http://arxiv.org/abs/2607.20552v1
- Date: Wed, 15 Jul 2026 09:25:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.162693
- Title: Thermodynamic Weight Decay: Exploring Grokking Acceleration via Attention Specific Heat
- Title(参考訳): 熱力学的重量減少 : 留意比熱によるグロキング加速の探索
- Authors: Chitraansh Pandey,
- Abstract要約: ニューラルネットワークの遅れた一般化であるGrokkingは、トレーニングデータを記憶してからずっと経ち、何千ものトレーニングエポックを浪費し、予測不可能なほど悪名高い。
CvAdamWは、Cvをオンラインでモニターし、相転移が検出されたときに動的に重量減衰をスケーリングすることによって熱エネルギーを注入するAdamW変種である。
その結果、ニューラルネットワークは、差し迫った一般化遷移の前駆体を検知でき、物理的に動機付けられた比例的介入は、固定された計算予算内での一般化を促進することが示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Grokking -- the delayed generalization of neural networks long after they have memorized their training data -- wastes thousands of training epochs and is notoriously unpredictable. Building on the recent result that Transformer attention is formally isomorphic to a thermodynamic system, we treat the variance of attention logits as a specific heat Cv and show that its peak reliably precedes the generalization transition. We introduce CvAdamW, a drop-in AdamW variant that monitors Cv online and injects thermal energy by dynamically scaling weight decay when a phase transition is detected. Through a strictly iterative development process we identify three failure modes -- initialization noise, mini-batch micro-ripples, and slingshot blinding -- and resolve them with a memorization gate and an exponential-moving-average shock absorber. On modular arithmetic (a+b mod 97), CvAdamW enables grokking at epoch 2802 in a 4000-epoch budget where the baseline never groks. We further propose a scale-invariant z-score reformulation that removes task-specific hyperparameters, and evaluate it across 10 paired seeds. A paired analysis shows the cold-start variant reduces mean grokking latency by 257 epochs (6.0%; median 166 epochs; Wilcoxon p=0.049, Cohen's d=0.68, bootstrap 95% CI [53,489]), improving 8 of 10 seeds; on this single task Cv peaks before grokking in all 10 seeds. Our results indicate that neural networks may expose detectable precursors of impending generalization transitions, and that a physically motivated, proportional intervention can facilitate generalization within a fixed compute budget. Code and data are public.
- Abstract(参考訳): ニューラルネットワークの遅れた一般化であるGrokkingは、トレーニングデータを記憶してからずっと経ち、何千ものトレーニングエポックを浪費し、予測不可能なほど悪名高い。
トランスフォーマー・アテンションが正式に熱力学系に同型である最近の結果に基づいて、アテンション・ロジットの分散を特定の熱Cvとして扱い、そのピークが一般化遷移に確実に先行していることを示す。
CvAdamWは、Cvをオンラインでモニターし、相転移が検出されたときに動的に重量減衰をスケーリングすることによって熱エネルギーを注入するAdamW変種である。
厳密に反復的な開発プロセスを通じて、初期化ノイズ、ミニバッチマイクロリップ、スリングショットブラインドという3つの障害モードを特定し、記憶ゲートと指数移動平均衝撃吸収器で解決する。
モジュラー算術(a+b mod 97)では、CvAdamWは、ベースラインが決してグラックスしない4000エポック予算において、エポック2802でのグラッキングを可能にする。
さらに,タスク固有のハイパーパラメータを除去し,10対の種子で評価するスケール不変なzスコア再構成を提案する。
コールドスタート変種は平均グルーキング遅延を257 epochs(中央値166 epochs; Wilcoxon p=0.049, Cohen's d=0.68, bootstrap 95% CI [53,489])減少させ、10種のうち8種を改良する。
その結果、ニューラルネットワークは、差し迫った一般化遷移の前駆体を検知でき、物理的に動機付けられた比例的介入は、固定された計算予算内での一般化を促進することが示唆された。
コードとデータは公開されています。
関連論文リスト
- Grokking Is Conditional and Fragile: A Fully-Tractable, Multi-Seed Study at 12K Parameters [0.0]
グルーキングは単一の結果ではなく、マルチシードレートとして研究する。
この完全に牽引可能な状態グルーキングは条件付き、脆弱な相転移である。
論文 参考訳(メタデータ) (2026-07-06T13:58:31Z) - Neuromorphic Continual Learning for Sequential Deployment of Nuclear Plant Monitoring Systems [1.2744523252873352]
核ICSのための連続学習を用いた最初のスパイクニューラルネットワーク(SNN)を用いた異常検出システムを提案する。
我々は,連続的な微調整,弾性重み強化(EWC),シナプスインテリジェンス(SI),体験リプレイ,ハイブリッドEWC+リプレイの5つの継続的学習戦略を評価する。
ハイブリッドEWC+Replay法は平均F1スコアが0.979であり, ほぼゼロ平均を忘れる。
論文 参考訳(メタデータ) (2026-04-13T21:25:22Z) - Stochastic Attention via Langevin Dynamics on the Modern Hopfield Energy [0.0]
本研究では,Langevinサンプリングが注目され,単一温度で制御される無トレーニングサンプルが注目されることを示す。
エネルギー勾配はアテンションマップと等しいため、スコアネットワーク、トレーニングループ、学習モデルを必要としない。
論文 参考訳(メタデータ) (2026-03-06T20:50:30Z) - Learning-to-Cache: Accelerating Diffusion Transformer via Layer Caching [56.286064975443026]
拡散変圧器内の多数の層をキャッシュ機構で計算することで、モデルパラメータを更新しなくても容易に除去できる。
本稿では,拡散変圧器の動的手法でキャッシングを学習するL2C(Learningto-Cache)を提案する。
実験の結果,L2C は DDIM や DPM-r など,キャッシュベースの従来の手法と同等の推論速度で性能を向上することがわかった。
論文 参考訳(メタデータ) (2024-06-03T18:49:57Z) - Resilience of Entropy Model in Distributed Neural Networks [7.6340310234573465]
エントロピー符号化は、通信オーバーヘッドをさらに減らすために導入された。
本稿では,エントロピーモデルの意図的干渉と意図的干渉に対するレジリエンスについて検討する。
本研究では,攻撃入力の送信オーバーヘッドを約9%削減できる新しい防御機構を提案する。
論文 参考訳(メタデータ) (2024-03-01T19:39:19Z) - CARD: Channel Aligned Robust Blend Transformer for Time Series
Forecasting [50.23240107430597]
本稿では,CARD(Channel Aligned Robust Blend Transformer)という特殊なトランスを設計する。
まず、CARDはチャネルに沿ったアテンション構造を導入し、信号間の時間的相関をキャプチャする。
第二に、マルチスケール知識を効率的に活用するために、異なる解像度のトークンを生成するトークンブレンドモジュールを設計する。
第3に,潜在的な過度な問題を軽減するため,時系列予測のためのロバストな損失関数を導入する。
論文 参考訳(メタデータ) (2023-05-20T05:16:31Z) - Continuous time recurrent neural networks: overview and application to
forecasting blood glucose in the intensive care unit [56.801856519460465]
連続時間自己回帰リカレントニューラルネットワーク(Continuous Time Autoregressive Recurrent Neural Network, CTRNN)は、不規則な観測を考慮に入れたディープラーニングモデルである。
重篤なケア環境下での血糖値の確率予測へのこれらのモデルの適用を実証する。
論文 参考訳(メタデータ) (2023-04-14T09:39:06Z) - Superiority of Simplicity: A Lightweight Model for Network Device
Workload Prediction [58.98112070128482]
本稿では,歴史観測に基づく時系列予測のための軽量な解を提案する。
ニューラルネットワークと平均予測器という2つのモデルからなる異種アンサンブル法で構成されている。
利用可能なFedCSIS 2020チャレンジデータセットの総合的なR2$スコア0.10を達成している。
論文 参考訳(メタデータ) (2020-07-07T15:44:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。