論文の概要: Dynamics of Gradient Descent with Large Step Size Near a Manifold of Flat Minima
- arxiv url: http://arxiv.org/abs/2607.08380v1
- Date: Thu, 09 Jul 2026 11:58:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.515996
- Title: Dynamics of Gradient Descent with Large Step Size Near a Manifold of Flat Minima
- Title(参考訳): 平板ミニマのマニフォールド近傍における大きなステップサイズを有するグラディエントDescentのダイナミクス
- Abstract要約: 勾配降下理論(GD)における重要な量は、目標ヘッセンの最大の固有値として定義されるエンフシャープ性である。
最近の作業は、エンフィングルスカラー出力を持つオーバーパラメータ最小二乗の設定におけるこのギャップを橋渡しする
本研究の枠組みは軽微な仮定の下での深い行列分解に適用され, 新たな構造的結果が得られた。
- 参考スコア(独自算出の注目度): 39.50927136881194
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: An important quantity in the theory of gradient descent (GD) is the \emph{sharpness}, defined as the largest eigenvalue of the objective Hessian. Classical analyses typically require the step size to be uniformly smaller than twice the reciprocal of the sharpness, but this condition is frequently violated in the training of deep neural networks. Recent work bridges this gap in the setting of overparametrised least-squares with a \emph{single scalar output}, providing a normal form for large-step GD in a neighbourhood of an \emph{isolated} flat minimum and establishing three corresponding convergence results. In this paper, we extend this theory in two directions: (1) to overparametrised least-squares with \emph{vector-valued outputs} (including regression with arbitrarily many observations), and (2) to a neighbourhood of a \emph{manifold} of flat minima (which we show is essential for applications such as matrix factorisation). We generalise both the normal form and all three convergence theorems of \cite{macdonaldeos} to this broader setting, overcoming several technical challenges, including the solution of a singular partial differential equation via a novel method that may be of independent interest. We further show that our framework applies to deep matrix factorisation under mild assumptions, yielding several new structural results. In particular, we prove that the set of flat minima forms a fibre bundle over a product of spheres, and that the sharpness is Morse-Bott along this manifold.
- Abstract(参考訳): 勾配降下理論(GD)における重要な量は、目的ヘッセンの最大の固有値として定義される 'emph{sharpness} である。
古典的な分析では、ステップサイズはシャープネスの2倍の反動よりも均一に小さくする必要があるが、この条件はディープニューラルネットワークのトレーニングにおいて頻繁に破られる。
最近の研究は、このギャップを \emph{single scalar output} でオーバーパラメトリ化された最小二乗の設定に橋渡しし、 \emph{isolated} 平坦な最小値の近傍における大きなステップ GD の正規形式を提供し、3つの対応する収束結果を確立する。
本稿では,この理論を2つの方向に拡張する: (1) \emph{vector-valued outputs} (任意に多くの観測値を持つ回帰を含む) と (2) 平面ミニマの \emph{manifold} の近傍(行列分解のような応用に欠かせない)である。
我々は、通常の形式と、他の3つの収束定理をこのより広い設定に一般化し、独立性のある新しい方法による特異偏微分方程式の解を含むいくつかの技術的課題を克服する。
さらに,本フレームワークは軽微な仮定の下での深い行列分解に適用され,いくつかの構造的結果が得られた。
特に、平坦なミニマの集合が球面の積上のファイバー束を形成し、鋭さはこの多様体に沿ってモースボットであることが証明される。
関連論文リスト
- Dimension Reduction for Curves: Simplified and Generalized [56.23281156053955]
我々は高次元多角曲線の次元を減少させるためにランダムな射影を再考する。
我々は、既知の$O(varepsilon-2log(nm))$がランダム射影のターゲット次元に有界であることの簡単な証明を与える。
我々の証明はスパース・オブリビラスな部分空間埋め込みの概念に基づいている。
論文 参考訳(メタデータ) (2026-07-03T08:48:35Z) - Closed-Form Steepest Descent Direction toward Flat Minima: Reducing Upper Bounds on the Loss Hessian Eigenspectrum in Neural Networks [3.011579195399507]
我々は、WS上界の勾配を解析的に導出し、平坦なミニマへと導く方向を特徴付ける。
実験により、HSR正則化はヘッセン固有値スペクトルを狭め、鋭いミニマ点やサドル点を避け、平坦なミニマへの収束を促進することが示されている。
論文 参考訳(メタデータ) (2026-06-27T00:47:03Z) - Fitting Unknown Number of Hyperplanes with Manifold Optimization [57.48093263119306]
未知数の線形平面をデータに適合させることは、機械学習の根本的な課題である。
既存のアプローチはしばしば最適な最適化に苦しむか、幾何的整合性に欠ける。
論文 参考訳(メタデータ) (2026-05-27T14:02:20Z) - The Magnitude of Dominated Sets: A Pareto Compliant Indicator Grounded in Metric Geometry [0.0]
マグニチュード(Magnitude)は、コンパクトな距離空間に対する大きさや点内容の概念である。
el_1)ボックス設定における支配領域の場合、等級は超体積に近い。
超体積とは異なり、等級は1つ以上の座標をアンカー点と共有する境界点に正の値を割り当てる。
論文 参考訳(メタデータ) (2026-04-20T12:10:12Z) - Stable Minima of ReLU Neural Networks Suffer from the Curse of Dimensionality: The Neural Shattering Phenomenon [25.998397575754865]
平坦さ/低(ロス)曲率の暗黙バイアスとそのReLUネットワークの一般化への影響について検討する。
平坦性は一般化を示唆するが, 入力次元が大きくなるにつれて収束速度は指数関数的に低下する。
論文 参考訳(メタデータ) (2025-06-25T19:10:03Z) - Geometric Meta-Learning via Coupled Ricci Flow: Unifying Knowledge Representation and Quantum Entanglement [7.410691988131121]
本稿では,3つの基礎的革新を通じて,幾何学的フローと深層学習を統合した統一的な枠組みを確立する。
まず,パラメータ空間の幾何を動的に適用し,景観トポロジーを損なう熱力学的に結合したリッチフローを提案する。
第2に、曲率の爆発解析により、明示的な位相遷移閾値と臨界学習率を導出する。
第3に、ニューラルネットワークと共形場理論のAdS/CFT型ホログラフィック双対性(Theoremrefthm:ads)を確立する。
論文 参考訳(メタデータ) (2025-03-25T17:32:31Z) - Pushing the Limits of Large Language Model Quantization via the Linearity Theorem [71.3332971315821]
本稿では,階層的$ell$再構成誤差と量子化によるモデルパープレキシティ増加との直接的な関係を確立する「線形定理」を提案する。
この知見は,(1)アダマール回転とHIGGSと呼ばれるMSE最適格子を用いた単純なデータフリーLCM量子化法,(2)非一様層ごとの量子化レベルを求める問題に対する最適解の2つの新しい応用を可能にする。
論文 参考訳(メタデータ) (2024-11-26T15:35:44Z) - The Dynamics of Sharpness-Aware Minimization: Bouncing Across Ravines
and Drifting Towards Wide Minima [41.961056785108845]
我々は、ディープネットワークの勾配に基づく最適化手法であるシャープネス認識最小化について検討する。
SAM に凸2次対象を施すと、最も大きい曲率で最小方向の両辺の間で振動するサイクルに収束することを示す。
非二次的の場合、そのような振動は、ヘッセンのスペクトルノルムに基づいて、より小さなステップサイズで勾配降下を効果的に実行することを示す。
論文 参考訳(メタデータ) (2022-10-04T10:34:37Z) - Lifting the Convex Conjugate in Lagrangian Relaxations: A Tractable
Approach for Continuous Markov Random Fields [53.31927549039624]
断片的な離散化は既存の離散化問題と矛盾しないことを示す。
この理論を2つの画像のマッチング問題に適用する。
論文 参考訳(メタデータ) (2021-07-13T12:31:06Z) - Differentiating through the Fr\'echet Mean [51.32291896926807]
フレット平均(Fr'echet mean)はユークリッド平均の一般化である。
任意のリーマン多様体に対して Fr'echet 平均を微分する方法を示す。
これにより、Fr'echet平均を双曲型ニューラルネットワークパイプラインに完全に統合する。
論文 参考訳(メタデータ) (2020-02-29T19:49:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。