論文の概要: Understanding the Subspace Stabilization of the Hessian and Gradient Covariance Matrix
- arxiv url: http://arxiv.org/abs/2609.31983v1
- Date: Fri, 25 Sep 2026 20:40:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 04:07:21.038128
- Title: Understanding the Subspace Stabilization of the Hessian and Gradient Covariance Matrix
- Title(参考訳): ヘッセン及びグラディエント共分散行列の部分空間安定化の理解
- Abstract要約: ヘシアンの上部分空間は、ステップワイズ・ヘシアンの上部分空間の間の重なりを測定することで安定化する。
同定近似の緩やかな進化は、ヘッセン行列の外れ値とバルク固有値の分離によるものであることを示す。
- 参考スコア(独自算出の注目度): 11.437368205968573
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The phenomenon of the top subspace stabilization of the Hessian matrix is an surprising and critical aspect in study of the second-order information of neural network training. Prior work argues that the top subspace of the Hessian stabilizes by measuring the overlap between the top subspaces of the step-wise Hessian, and explains this stabilization with diminishing parameter change in the late phase of training. In this paper, we define a new instability metric for the subspace evolution, and use it to detect subspace stabilization that is independent of the magnitude of parameter change. In the meantime, we observe that the gradient covariance matrix has a similar property of its top subspace to the Hessian. By using a between-class and within-class decomposition of the gradient covariance matrix, we identify an explicit form that gives a near-perfect approximation of the top-$(C-1)$ subspace of the Hessian and the gradient covariance matrix. In the gradient flow set-up, we show that the slow evolution of the idenfied approximation is due to the separation between the outlier and the bulk eigenvalues of the Hessian matrix, thus providing an explanation to the phenomenon of the top subspace stabilization of the Hessian matrix.
- Abstract(参考訳): ヘッセン行列の上位部分空間安定化現象は、ニューラルネットワークトレーニングの2次情報の研究において驚きかつ重要な側面である。
以前の研究は、ヘシアンの上部分空間はステップワイズヘシアンの上部分空間間の重なりを測定することで安定化し、この安定化は訓練の後期のパラメータ変化を減少させる。
本稿では、サブスペース進化のための新しい不安定度基準を定義し、それを用いてパラメータ変化の大きさに依存しないサブスペース安定化を検出する。
一方、勾配共分散行列はその上部分空間のヘッセン部分空間に類似した性質を持つ。
勾配共分散行列のクラス間およびクラス内分解を用いて、ヘッセン行列と勾配共分散行列の位相-$(C-1)$部分空間のほぼ完全な近似を与える明示形式を同定する。
勾配流のセットアップにおいて、同定された近似の緩やかな進化は、ヘッセン行列の外れ値とバルク固有値の分離によるものであることが示され、ヘッセン行列の上部部分空間安定化現象を説明できる。
関連論文リスト
- The Road Taken: The Role of Optimizers at the Edge of Stability [53.81268610971847]
安定性のエッジ(Edge of stability)とは、古典的な降下が不安定であると予測されるしきい値より上のヘッセンの固有値が安定である深層学習における現象を指す。
それまでの研究は、最大ヘッセン固有値と学習率に関して安定性の端を定式化していた。
我々は、勾配降下を含む多くの一階法が、これらの理論によって予測される安定性を21.1ドルという大きな因子で著しく破っていることを観察した。
論文 参考訳(メタデータ) (2026-08-19T01:03:34Z) - Rethinking Bregman Divergences in Kronecker-Factored Optimizers [9.141684114595433]
Frobenius, von Neumann, LogDet の発散は避けられない Kronecker 近似誤差が異なることを示している。
上部分空間に固有値に基づくプレコンディショニングを適用し,下部分空間に適応等方的加速度定数を用いる部分空間対応Kroneckerを提案する。
論文 参考訳(メタデータ) (2026-05-30T05:17:48Z) - On the Convergence of Gradient Descent for Large Learning Rates [55.33626480243135]
固定ステップサイズを使用すると収束が不可能であることを示す。
正方形損失を持つ線形ニューラルネットワークの場合,これを証明した。
また、勾配に対するリプシッツ連続性のような強い仮定を必要とせず、より一般的な損失に対する収束の不可能性も証明する。
論文 参考訳(メタデータ) (2024-02-20T16:01:42Z) - The Algebra for Stabilizer Codes [0.0]
スタビライザー形式主義の言語では、フルランクスタビライザー・タドーはちょうどアフィンラグランジアン部分空間の基底である。
安定化器符号のプロジェクタを分割することにより,エラー検出プロトコルとエラー訂正プロトコルをアフィン古典的な処理能力で復元することを示す。
論文 参考訳(メタデータ) (2023-04-20T18:16:17Z) - Learning and Concentration for High Dimensional Linear Gaussians: an
Invariant Subspace Approach [0.0]
安定線形系の2つの時間的実現と等方的ガウス雑音の相関に関する非漸近境界について検討する。
本分析は,ランダム力学系における学習と集中の複雑さについて,まず解釈可能な幾何学的説明を提供する。
論文 参考訳(メタデータ) (2023-04-04T11:11:26Z) - Decomposed Diffusion Sampler for Accelerating Large-Scale Inverse
Problems [64.29491112653905]
本稿では, 拡散サンプリング法とクリロフ部分空間法を相乗的に組み合わせた, 新規で効率的な拡散サンプリング手法を提案する。
具体的には、ツイーディの公式による分母化標本における接空間がクリロフ部分空間を成すならば、その分母化データによるCGは、接空間におけるデータの整合性更新を確実に維持する。
提案手法は,従来の最先端手法よりも80倍以上高速な推論時間を実現する。
論文 参考訳(メタデータ) (2023-03-10T07:42:49Z) - Shape And Structure Preserving Differential Privacy [70.08490462870144]
正方形距離関数の勾配がラプラス機構よりも感度をよりよく制御できることを示す。
また,2乗距離関数の勾配を用いることで,ラプラス機構よりも感度を制御できることを示す。
論文 参考訳(メタデータ) (2022-09-21T18:14:38Z) - Beyond the Edge of Stability via Two-step Gradient Updates [49.03389279816152]
Gradient Descent(GD)は、現代の機械学習の強力な仕事場である。
GDが局所最小値を見つける能力は、リプシッツ勾配の損失に対してのみ保証される。
この研究は、2段階の勾配更新の分析を通じて、単純だが代表的でありながら、学習上の問題に焦点をあてる。
論文 参考訳(メタデータ) (2022-06-08T21:32:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。