論文の概要: Broken Ergodicity and the Violation of the Fluctuation-Dissipation Theorem Lead to Generalization Beyond Overfitting in Machine Learning
- arxiv url: http://arxiv.org/abs/2607.04135v1
- Date: Sun, 05 Jul 2026 06:33:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.254427
- Title: Broken Ergodicity and the Violation of the Fluctuation-Dissipation Theorem Lead to Generalization Beyond Overfitting in Machine Learning
- Title(参考訳): 破壊的エルゴディディティとゆらぎ散逸理論の違反は、機械学習におけるオーバーフィッティングを超えた一般化につながる
- Abstract要約: 現代のニューラルネットワークの一般化能力は,ネットワーク容量の増加とともに向上することを示す。
二重降下相転移の臨界指数とスケーリング関数を計算する。
対応する応答関数は超伝導転移の単純なロンドンモデルと同じ機能を持つ。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The remarkable ability of modern neural networks to generalize improves with increasing network capacity, even when the number of model parameters or effective degrees of freedom exceeds the number of training data points. This phenomenon is all the more surprising given that generalization error diverges when the number of model parameters approaches a critical value from below. Here we use dynamical mean field theory to show that this so-called "double descent" behavior is the outcome of a phase transition in the stochastic field theory describing the training process. We calculate the critical exponents and scaling function of the double descent phase transition, and show that it is marked by a breakdown of the fluctuation-dissipation theorem associated with broken ergodicity. The corresponding response function has the same functional form as the simple London model of the superconducting transition, with the rigidity of the wave function corresponding to the neural network's ability to generalize accurately.
- Abstract(参考訳): 現代のニューラルネットワークが一般化する顕著な能力は、モデルパラメータの数や効果的な自由度がトレーニングデータポイントの数を超えた場合でも、ネットワーク容量の増加によって改善される。
この現象は、モデルパラメータの数が下から臨界値に近づくと一般化誤差が分岐するので、より驚くべきものである。
ここでは、力学平均場理論を用いて、このいわゆる「二重降下」挙動が、トレーニング過程を記述する確率場理論における相転移の結果であることを示す。
二重降下相転移の臨界指数とスケーリング関数を計算し, 破壊エルゴディディティに関連するゆらぎ散逸定理の分解によって特徴付けられることを示す。
対応する応答関数は、超伝導転移の単純なロンドンモデルと同じ機能形式を持ち、ニューラルネットワークが正確に一般化する能力に対応する波動関数の剛性を持つ。
関連論文リスト
- On the Mechanism and Dynamics of Modular Addition: Fourier Features, Lottery Ticket, and Grokking [49.1352577985191]
本稿では,2層ニューラルネットワークがモジュール追加タスクを解くために,機能をどのように学習するかを包括的に分析する。
我々の研究は、学習したモデルの完全な機械論的解釈と、その訓練力学の理論的説明を提供する。
論文 参考訳(メタデータ) (2026-02-18T20:25:13Z) - Random-Matrix-Induced Simplicity Bias in Over-parameterized Variational Quantum Circuits [72.0643009153473]
本稿では,観測可能な期待値とパラメータ勾配の両方がシステムサイズに指数関数的に集中するHaar型普遍性クラスに,表現的変分アンサーゼが入ることを示す。
その結果、そのような回路によって誘導される仮説クラスは、近点関数の狭い族に高い確率で崩壊する。
テンソル-ネットワークベースおよびテンソル-ハイパーネットワークパラメータ化を含むテンソル構造VQCは、ハール型普遍性クラスの外にある。
論文 参考訳(メタデータ) (2026-01-05T08:04:33Z) - The Spectral Bias of Shallow Neural Network Learning is Shaped by the Choice of Non-linearity [0.7499722271664144]
非線形活性化関数がニューラルネットワークの暗黙バイアスの形成にどのように寄与するかを考察する。
局所的動的誘引器は、ニューロンの活性化関数への入力がゼロとなる超平面のクラスターの形成を促進することを示す。
論文 参考訳(メタデータ) (2025-03-13T17:36:46Z) - Non-asymptotic Convergence of Training Transformers for Next-token Prediction [48.9399496805422]
トランスフォーマーは、シーケンシャルなデータを扱う優れた能力のために、現代の機械学習において驚くべき成功を収めています。
本稿では, 単層変圧器のトレーニング力学の微細な非漸近解析を行う。
トレーニングされたトランスフォーマーは,データセットシフトによる非トーケン予測能力を示すことを示す。
論文 参考訳(メタデータ) (2024-09-25T20:22:06Z) - A Non-negative VAE:the Generalized Gamma Belief Network [49.970917207211556]
ガンマ信念ネットワーク(GBN)は、テキストデータ中の多層解釈可能な潜在表現を明らかにする可能性を実証している。
本稿では、一般化ガンマ信念ネットワーク(Generalized GBN)を導入し、元の線形生成モデルをより表現力のある非線形生成モデルに拡張する。
また、潜伏変数の後方分布を近似する上向きのワイブル推論ネットワークを提案する。
論文 参考訳(メタデータ) (2024-08-06T18:18:37Z) - Scaling and renormalization in high-dimensional regression [72.59731158970894]
リッジ回帰に関する最近の結果について統一的な視点を提示する。
我々は、物理とディープラーニングの背景を持つ読者を対象に、ランダム行列理論と自由確率の基本的なツールを使用する。
我々の結果は拡張され、初期のスケーリング法則のモデルについて統一的な視点を提供する。
論文 参考訳(メタデータ) (2024-05-01T15:59:00Z) - The twin peaks of learning neural networks [3.382017614888546]
近年の研究では、ニューラルネットワークの一般化誤差に対する二重発光現象の存在が示されている。
この現象とニューラルネットワークで表される関数の複雑さと感度の増大との関係について検討する。
論文 参考訳(メタデータ) (2024-01-23T10:09:14Z) - On the Dynamics Under the Unhinged Loss and Beyond [104.49565602940699]
我々は、閉形式力学を解析するための数学的機会を提供する、簡潔な損失関数であるアンヒンジド・ロスを導入する。
アンヒンジされた損失は、時間変化学習率や特徴正規化など、より実践的なテクニックを検討することができる。
論文 参考訳(メタデータ) (2023-12-13T02:11:07Z) - Dynamical transition in controllable quantum neural networks with large depth [7.22617261255808]
2次損失関数を持つ量子ニューラルネットワークのトレーニング力学は、一般化されたロトカ・ボルテラ方程式によって説明できることを示す。
凍結エラー力学における2次損失関数は、トレーニング収束の高速化を可能にすることを示す。
この理論はIBMの量子デバイスで実験的に検証されている。
論文 参考訳(メタデータ) (2023-11-29T23:14:33Z) - Multi-scale Feature Learning Dynamics: Insights for Double Descent [71.91871020059857]
一般化誤差の「二重降下」現象について検討する。
二重降下は、異なるスケールで学習される異なる特徴に起因する可能性がある。
論文 参考訳(メタデータ) (2021-12-06T18:17:08Z) - Constructing Tensor Network Influence Functionals for General Quantum
Dynamics [0.0]
我々は、影響関数の時空テンソルネットワーク表現を使用し、その近似性を結合次元と時間的絡み合いの観点から検討する。
我々は、その構造に係わる影響関数と中間体は、ある力学系における低結合次元テンソルネットワークによって効率的に近似できることを示した。
浴槽を反復的に一体化するので、影響関数の相関は低下する前に最初に増大し、非自明なキャンセルによって影響関数の最終的な圧縮性が達成されることを示す。
論文 参考訳(メタデータ) (2021-01-14T05:42:25Z) - Driven-dissipative Ising Model: An exact field-theoretical analysis [0.0]
駆動散逸多体系は、非平衡力学、散逸、多体相互作用により解析的に解析することが困難である。
我々は、単純な散乱図から理解可能な、正確な場の理論解析とスピンモデルの図式表現を開発する。
論文 参考訳(メタデータ) (2021-01-13T19:00:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。