論文の概要: Weight-norm Criticality: A Mechanism for Loss Spikes Induced by the Normalization and Weight Decay
- arxiv url: http://arxiv.org/abs/2607.21005v1
- Date: Thu, 23 Jul 2026 07:39:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.312018
- Title: Weight-norm Criticality: A Mechanism for Loss Spikes Induced by the Normalization and Weight Decay
- Title(参考訳): 重量ノルム臨界 : 正常化と重量減少による損失スパイクのメカニズム
- Abstract要約: 私たちは、実践的なディープニューラルネットワークトレーニングでは、追加で見落とされ、しばしば見過ごされるエフェミット-ノルム臨界がある、と論じます。
この臨界性は、正規化(スケール不変成分を導入する)と重み減衰の相互作用によって引き起こされる。
我々の研究は、エルフウェイト-ノーム臨界レンズによる損失スパイクの新しい力学的理解を提供する
- 参考スコア(独自算出の注目度): 12.529130624059597
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most explanations of training instability focus on \emph{learning-rate criticality}, typically characterized by the Edge of Stability, beyond which optimization becomes unstable. We argue that, in practical deep neural network training, there is an additional and often overlooked \emph{weight-norm criticality}. This criticality is induced by the interaction between normalization (which introduces scale-invariant components) and weight decay (which persistently shrinks parameter norms). As the weight decay coefficient increases, the norms of scale-invariant weights are progressively driven toward zero. Meanwhile, the sharpness of the loss landscape increases rapidly, destabilizing the optimization dynamics and resulting in abrupt loss spikes. This perspective provides a rationale for why weight penalties can improve generalization yet cannot be made arbitrarily strong: excessive decay drives scale-invariant weight norms past a critical boundary and destabilizes training. Our work provides a new mechanistic understanding of loss spikes through the lens of \emph{weight-norm criticality}. Moreover, \emph{weight-norm criticality} yields testable predictions that we validate empirically in networks with scale-invariant components, providing empirical support for the proposed mechanism.
- Abstract(参考訳): トレーニング不安定性のほとんどの説明は、最適化が不安定になる安定性のエッジを特徴とする「emph{learning-rate criticality」に焦点を当てている。
私たちは、実践的なディープニューラルネットワークトレーニングでは、追加され、しばしば見過ごされる 'emph{weight-norm criticality} が存在します。
この臨界性は、正規化(スケール不変成分を導入する)と重み減衰(パラメータノルムを持続的に縮める)の間の相互作用によって引き起こされる。
重み劣化係数が増加するにつれて、スケール不変の重みのノルムは徐々にゼロに向かって駆動される。
一方、損失ランドスケープの鋭さは急速に増加し、最適化のダイナミクスが不安定になり、突然の損失スパイクが発生する。
この観点は、ウェイト・ペナルティが一般化を改善できるが、任意に強いものにすることはできない理由の理論的根拠を与える:過剰な崩壊は、臨界境界を越えてスケール不変のウェイト・ノルムを駆動し、訓練を不安定にする。
我々の研究は、'emph{weight-norm criticality} のレンズによる損失スパイクの新しい機械的理解を提供する。
さらに、'emph{weight-norm criticality' は、スケール不変成分を持つネットワークにおいて経験的に検証できる検証可能な予測を導き、提案機構を実証的に支持する。
関連論文リスト
- When Does Scale-Invariant Optimization Become Unstable? An Exact Schedule Law with Weight Decay [6.625270757109195]
標準成長は、反対の幾何学的自己整合効果を誘導する一方、1つの量で全てのスケジュールと崩壊の強制を捉えていることを示す。
これは、収縮と拡張が支配する効果的な学習率体制をきれいに分離する鋭い境界をもたらす。
論文 参考訳(メタデータ) (2026-09-08T17:46:17Z) - Does Weight Decay Enhance Training Stability? [0.5799785223420272]
重量減衰がパラメータ空間力学と損失シャープネスにどのように影響するかを検討する。
パラメータベクトルとシャープネス勾配のグローバルアライメントを相転移の機械的ドライバとして同定する。
このことは、凸・四角形から得られた曲率しきい値が、正則化下での信頼性の高い安定性診断にはならないことを示している。
論文 参考訳(メタデータ) (2026-05-15T20:43:26Z) - Relative Kinetic Utility for Reasoning-Aware Structural Pruning in Large Language Models [0.0]
モデルの深さ多様体上での連続的な運動積分に離散的なプルーニングを高める新しい枠組みを提案する。
Qwen-2.5-7B と LLaMA-3-8B の試験により、高スパーシティのシステムの性能は40%向上した。
RKUはGSM8Kで40%の精度で13.34%の精度を達成し、最強のベースラインを上回った。
論文 参考訳(メタデータ) (2026-05-09T15:47:53Z) - Random-Matrix-Induced Simplicity Bias in Over-parameterized Variational Quantum Circuits [72.0643009153473]
本稿では,観測可能な期待値とパラメータ勾配の両方がシステムサイズに指数関数的に集中するHaar型普遍性クラスに,表現的変分アンサーゼが入ることを示す。
その結果、そのような回路によって誘導される仮説クラスは、近点関数の狭い族に高い確率で崩壊する。
テンソル-ネットワークベースおよびテンソル-ハイパーネットワークパラメータ化を含むテンソル構造VQCは、ハール型普遍性クラスの外にある。
論文 参考訳(メタデータ) (2026-01-05T08:04:33Z) - On the Dynamics Under the Unhinged Loss and Beyond [104.49565602940699]
我々は、閉形式力学を解析するための数学的機会を提供する、簡潔な損失関数であるアンヒンジド・ロスを導入する。
アンヒンジされた損失は、時間変化学習率や特徴正規化など、より実践的なテクニックを検討することができる。
論文 参考訳(メタデータ) (2023-12-13T02:11:07Z) - Non-Singular Adversarial Robustness of Neural Networks [58.731070632586594]
小さな入力摂動に対する過敏性のため、アドリヤルロバスト性はニューラルネットワークにとって新たな課題となっている。
我々は,データ入力とモデル重みの共振レンズを用いて,ニューラルネットワークの非特異な対角性の概念を定式化する。
論文 参考訳(メタデータ) (2021-02-23T20:59:30Z) - Explicit regularization and implicit bias in deep network classifiers
trained with the square loss [2.8935588665357077]
平方損失で訓練された深いReLUネットワークは分類の仕事でよく機能するために観察されました。
正規化法を重み決定法とともに用いる場合,絶対最小ノルムの解への収束が期待できることを示す。
論文 参考訳(メタデータ) (2020-12-31T21:07:56Z) - On the Overlooked Pitfalls of Weight Decay and How to Mitigate Them: A Gradient-Norm Perspective [90.39123717733334]
そこで本研究では,Shduled Weight Decay (SWD) 法と呼ばれる,減量のための最初の実用的なスケジューラを提案する。
我々の実験は、SWDが実際に大きな勾配ノルムを緩和し、適応モーメント推定(Adam)の従来の定重崩壊戦略を著しく上回っていることも裏付けている。
論文 参考訳(メタデータ) (2020-11-23T00:39:49Z) - Improve Generalization and Robustness of Neural Networks via Weight
Scale Shifting Invariant Regularizations [52.493315075385325]
重み劣化を含む正則化器の族は、均質な活性化関数を持つネットワークに対する本質的な重みのノルムをペナルティ化するのに有効でないことを示す。
そこで我々は,ニューラルネットワークの本質的な規範を効果的に制約する改良型正規化器を提案する。
論文 参考訳(メタデータ) (2020-08-07T02:55:28Z) - Revisiting Initialization of Neural Networks [72.24615341588846]
ヘッセン行列のノルムを近似し, 制御することにより, 層間における重みのグローバルな曲率を厳密に推定する。
Word2Vec と MNIST/CIFAR 画像分類タスクの実験により,Hessian ノルムの追跡が診断ツールとして有用であることが確認された。
論文 参考訳(メタデータ) (2020-04-20T18:12:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。