論文の概要: Explaining Near-Zero Hessian Eigenvalues Through Approximate Symmetries in Neural Networks
- arxiv url: http://arxiv.org/abs/2607.07845v1
- Date: Wed, 08 Jul 2026 18:27:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.315018
- Title: Explaining Near-Zero Hessian Eigenvalues Through Approximate Symmetries in Neural Networks
- Title(参考訳): ニューラルネットワークにおける近似対称性による近ゼロヘッセン固有値の説明
- Authors: Marcel Kühn, Bernd Rosenow,
- Abstract要約: トレーニング損失のヘシアン(Hessian)は、ロスランドスケープの局所的な幾何学を統治する。
このバルクは、ネットワークパラメトリゼーションの連続対称性の弱い持ち上げされた擬ゴールドストーンモードから成り立っていると論じる。
- 参考スコア(独自算出の注目度): 3.437656066916039
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The Hessian of the training loss governs the local geometry of the loss landscape, yet despite existing explanations for its largest eigenvalues, the origin of the vast multitude of vanishingly small eigenvalues remains elusive. We argue that the bulk consists of the weakly lifted pseudo-Goldstone modes of the continuous symmetries of the network parametrization. In deep linear networks these symmetries are exact: they generate flat directions and hence exact zero modes, whose eigenvectors we construct explicitly. Introducing a ReLU nonlinearity as a perturbation, we show that it breaks these symmetries weakly and explicitly. Resolving the spectrum at the level of eigenvectors, we find that the high-curvature directions are orthogonal to the symmetry subspace, while the bulk lies almost entirely within it. We demonstrate the mechanism in a two-layer ReLU student--teacher model and in a network trained on CIFAR-10. A convolutional example demonstrates that the same diagnostic extends beyond fully connected layers. Together, these results link the Hessian bulk to weakly broken symmetries and clarify the origin of near-zero modes.
- Abstract(参考訳): トレーニング損失のヘシアンは、失われた風景の局所的な幾何学を支配しているが、最大の固有値に関する既存の説明にもかかわらず、膨大な数の消滅する小さな固有値の起源は解明されていない。
このバルクは、ネットワークパラメトリゼーションの連続対称性の弱い持ち上げされた擬ゴールドストーンモードから成り立っていると論じる。
深い線形ネットワークでは、これらの対称性は正確なものであり、それらは平坦な方向を生成し、従ってその固有ベクトルが明示的に構成するゼロモードを生成する。
摂動としてReLU非線形性を導入することで,これらの対称性を弱く明示的に破ることを示す。
固有ベクトルのレベルでのスペクトルを解くと、高曲率方向は対称性部分空間と直交し、バルクはそのほとんど全体がその内側にある。
CIFAR-10で学習した教師モデルとネットワーク上で,このメカニズムを実証する。
畳み込みの例は、同じ診断が完全に接続された層を超えて広がることを示している。
これらの結果はヘッセン・バルクを弱破壊対称性に結び付け、近ゼロモードの起源を明らかにする。
関連論文リスト
- The Inductive Bias of Convolutional Neural Networks: Locality and Weight Sharing Reshape Implicit Regularization [57.37943479039033]
本研究では,勾配降下における安定性現象によって引き起こされる暗黙の正則化に,アーキテクチャ的帰納バイアスがどう影響するかを考察する。
局所性と重量共有が根本的に変化していることが示されています。
論文 参考訳(メタデータ) (2026-03-05T04:50:51Z) - Nonlinear Dynamics In Optimization Landscape of Shallow Neural Networks with Tunable Leaky ReLU [3.2063364612188416]
平均二乗損失とリークReLU活性化を訓練した浅部ニューラルネットワークの非線形ダイナミクスについて検討した。
リークパラメータ $alpha$ が変化するにつれて, 関連する対称性を持つ臨界点の分岐を世界最小値から検出する。
論文 参考訳(メタデータ) (2025-10-29T01:00:07Z) - Trading Mathematical for Physical Simplicity: Bialgebraic Structures in Matrix Product Operator Symmetries [20.76275069383104]
物理的興味を持つ単純な量子スピン鎖は、融合圏や弱いホップ代数の厳密な枠組みには含まれないことを示す。
我々の研究は、よく理解されたトポロジカルな欠陥対称性と、より現実的なモデルで生じるものとの間に橋渡しを提供することを示している。
論文 参考訳(メタデータ) (2025-09-03T18:01:22Z) - Generalized Linear Mode Connectivity for Transformers [87.32299363530996]
驚くべき現象はリニアモード接続(LMC)であり、独立に訓練されたモデルを低損失またはゼロ損失の経路で接続することができる。
以前の研究は主に置換によるニューロンの並べ替えに焦点を合わせてきたが、そのようなアプローチは範囲に限られている。
我々は、4つの対称性クラス(置換、半置換、変換、一般可逆写像)をキャプチャする統一的なフレームワークを導入する。
この一般化により、独立に訓練された視覚変換器とGPT-2モデルの間の低障壁とゼロバリア線形経路の発見が可能となった。
論文 参考訳(メタデータ) (2025-06-28T01:46:36Z) - A Signed Graph Approach to Understanding and Mitigating Oversmoothing in GNNs [54.62268052283014]
署名されたグラフの枠組みに基づく統一的な理論的視点を示す。
既存の戦略の多くは、メッセージパッシングを変えて過度な操作に抵抗する負のエッジを暗黙的に導入している。
本稿では,ラベルや特徴の類似性に基づいて署名されたエッジを割り当てるプラグイン・アンド・プレイ方式であるStructure Balanced Propagation (SBP)を提案する。
論文 参考訳(メタデータ) (2025-02-17T03:25:36Z) - Black Boxes and Looking Glasses: Multilevel Symmetries, Reflection Planes, and Convex Optimization in Deep Networks [46.337104465755075]
絶対値アクティベーションと任意の入力次元を持つディープニューラルネットワーク(DNN)のトレーニングは,等価凸ラッソ問題として定式化可能であることを示す。
この定式化は、ニューラルネットワークの対称性をコードする幾何学的構造を明らかにする。
論文 参考訳(メタデータ) (2024-10-05T20:09:07Z) - Localization with non-Hermitian off-diagonal disorder [0.0]
我々は,非エルミート系を,ランダムに近接する近傍トンネルが支配するシステムについて論じる。
完全に実固有スペクトルの物理的状況は、ハミルトニアンの三対角行列構造によって生じる。
対角線外障害は、非エルミート系を有限系における非局在化-局在化クロスオーバーへと導く。
論文 参考訳(メタデータ) (2023-10-20T18:02:01Z) - Symmetry Induces Structure and Constraint of Learning [0.0]
機械学習モデルの学習行動に影響を及ぼすか、決定しないかにかかわらず、損失関数対称性の重要性を明らかにする。
ディープラーニングにおけるミラー対称性の一般的な例としては、再スケーリング、回転、置換対称性がある。
ニューラルネットワークにおける可塑性の喪失や様々な崩壊現象などの興味深い現象を理論的枠組みで説明できることを示す。
論文 参考訳(メタデータ) (2023-09-29T02:21:31Z) - Boundary theories of critical matchgate tensor networks [59.433172590351234]
AdS/CFT対応の重要な側面は、双曲格子上のテンソルネットワークモデルの観点から捉えることができる。
マッチゲート制約を満たすテンソルに対しては、これらは以前、乱れた境界状態を生成することが示されている。
これらのハミルトニアンは、解析的な玩具モデルによって捉えられたマルチスケールの準周期対称性を示す。
論文 参考訳(メタデータ) (2021-10-06T18:00:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。