論文の概要: Curvature-Weighted Gradient Diversity: A Noise Measure for Geometry-Adaptive SGD Schedules
- arxiv url: http://arxiv.org/abs/2606.30455v1
- Date: Mon, 29 Jun 2026 15:22:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.302225
- Title: Curvature-Weighted Gradient Diversity: A Noise Measure for Geometry-Adaptive SGD Schedules
- Title(参考訳): 曲率重み付き勾配ダイバーシティ:幾何適応型SGDスケジューリングのためのノイズ測定
- Authors: Muhammad Hamza, Ayush Goel,
- Abstract要約: ヘッセンの逆平方根による勾配毎の重み付けを幾何学的に認識した勾配測度である曲率-重み付きダイバーシティ(CWGD)を導入する。
CWGD-Cosineは、標準コサインよりも約20%低い最終最適化誤差を達成する。
これらの結果は、CWGDを最適化ノイズの原理的幾何認識尺度として確立し、より一般的な学習問題への将来の拡張を動機付けている。
- 参考スコア(独自算出の注目度): 1.1602089225841632
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The standard convergence analysis of mini-batch stochastic gradient descent (SGD) models gradient noise using a single variance term that treats all parameter directions equally, ignoring the fact that noise in high-curvature directions has less impact because learning rates are already constrained there. We introduce Curvature-Weighted Gradient Diversity (CWGD), a geometry-aware measure that weights per-sample gradient diversity by the inverse square root of the Hessian, providing a tighter proxy for the effective optimization noise. For strongly convex quadratic objectives with diagonal Hessians and isotropic noise, we prove that a CWGD-modulated cosine learning-rate schedule can reduce the asymptotic optimization error floor by up to a factor of two compared with standard cosine annealing. We implement this idea as CWGD-Cosine using a Hutchinson-based diagonal Hessian estimator that is exact for quadratic objectives. Across a range of condition numbers, batch sizes, and noise structures, CWGD-Cosine consistently achieves approximately 20% lower final optimization error than standard cosine annealing while incurring negligible overhead in the quadratic setting. We also identify and correct a degenerate curvature estimator, analyze the robustness of the proposed estimator, and explicitly discuss the limitations of the method, including Hessian staleness in non-convex optimization. These results establish CWGD as a principled geometry-aware measure of optimization noise and motivate future extensions to more general learning problems.
- Abstract(参考訳): 最小バッチ確率勾配勾配勾配(SGD)の標準収束解析は、全てのパラメータ方向を等しく扱う単一の分散項を用いて勾配雑音をモデル化する。
本稿では,Hessian の逆二乗根によるサンプルごとの勾配の多様性を重み付けする幾何学的手法である Curvature-Weighted Gradient Diversity (CWGD) を紹介する。
対角ヘシアンと等方性雑音の強い凸2次目標に対して、CWGD変調コサイン学習率のスケジュールが、標準的なコサインアニールと比較して最大2倍の漸近的最適化誤差フロアを減少させることができることを証明した。
我々はこのアイデアを、ハッチンソンをベースとした2次目的に対して正確な対角 Hessian 推定器を用いて、CWGD-Cosine として実装する。
CWGD-Cosineは、条件数、バッチサイズ、ノイズ構造の範囲で、通常のコサインアニールよりも約20%低い最終最適化誤差を連続的に達成し、二次的な設定では無視できないオーバーヘッドを発生させる。
また、縮退曲率推定器を同定し、提案した推定器のロバスト性を解析し、非凸最適化におけるヘッセン安定化を含む手法の限界を明示的に議論する。
これらの結果は、CWGDを最適化ノイズの原理的幾何認識尺度として確立し、より一般的な学習問題への将来の拡張を動機付けている。
関連論文リスト
- Estimation of Toeplitz Covariance Matrices using Overparameterized Gradient Descent [1.7188280334580195]
単純降下レンズ(GD)によるToeplitz共分散推定の再検討
K = P$ のとき、GD は準最適解に収束する。
本稿では,振幅と周波数の学習率の異なる高速なGD変種を提案する。
論文 参考訳(メタデータ) (2025-11-03T14:07:53Z) - Revisiting Zeroth-Order Optimization: Minimum-Variance Two-Point Estimators and Directionally Aligned Perturbations [57.179679246370114]
乱摂動の分布は, 摂動段差がゼロになる傾向にあるため, 推定子の分散を最小限に抑える。
以上の結果から, 一定の長さを維持するのではなく, 真の勾配に方向を合わせることが可能であることが示唆された。
論文 参考訳(メタデータ) (2025-10-22T19:06:39Z) - Gradient Normalization Provably Benefits Nonconvex SGD under Heavy-Tailed Noise [60.92029979853314]
重み付き雑音下でのグラディエントDescence(SGD)の収束を確実にする上での勾配正規化とクリッピングの役割について検討する。
我々の研究は、重尾雑音下でのSGDの勾配正規化の利点を示す最初の理論的証拠を提供する。
我々は、勾配正規化とクリッピングを取り入れた加速SGD変種を導入し、さらに重み付き雑音下での収束率を高めた。
論文 参考訳(メタデータ) (2024-10-21T22:40:42Z) - Accelerated stochastic approximation with state-dependent noise [7.4648480208501455]
勾配観測における2次雑音に対する一般仮定の下での滑らかな凸最適化問題を考察する。
このような問題は、統計学におけるよく知られた一般化された線形回帰問題において、様々な応用において自然に発生する。
SAGDとSGEは、適切な条件下で、最適収束率を達成することを示す。
論文 参考訳(メタデータ) (2023-07-04T06:06:10Z) - Optimizing Information-theoretical Generalization Bounds via Anisotropic
Noise in SGLD [73.55632827932101]
SGLDにおけるノイズ構造を操作することにより,情報理論の一般化を最適化する。
低経験的リスクを保証するために制約を課すことで、最適なノイズ共分散が期待される勾配共分散の平方根であることを証明する。
論文 参考訳(メタデータ) (2021-10-26T15:02:27Z) - Differentiable Annealed Importance Sampling and the Perils of Gradient
Noise [68.44523807580438]
Annealed importance sample (AIS) と関連するアルゴリズムは、限界推定のための非常に効果的なツールである。
差別性は、目的として限界確率を最適化する可能性を認めるため、望ましい性質である。
我々はメトロポリス・ハスティングスのステップを放棄して微分可能アルゴリズムを提案し、ミニバッチ計算をさらに解き放つ。
論文 参考訳(メタデータ) (2021-07-21T17:10:14Z) - On the Convergence of Stochastic Extragradient for Bilinear Games with
Restarted Iteration Averaging [96.13485146617322]
本稿では, ステップサイズが一定であるSEG法の解析を行い, 良好な収束をもたらす手法のバリエーションを示す。
平均化で拡張した場合、SEGはナッシュ平衡に確実に収束し、スケジュールされた再起動手順を組み込むことで、その速度が確実に加速されることを証明した。
論文 参考訳(メタデータ) (2021-06-30T17:51:36Z) - Balancing Rates and Variance via Adaptive Batch-Size for Stochastic
Optimization Problems [120.21685755278509]
本研究は,ステップサイズの減衰が正確な収束に必要であるという事実と,一定のステップサイズがエラーまでの時間でより速く学習するという事実のバランスをとることを目的とする。
ステップサイズのミニバッチを最初から修正するのではなく,パラメータを適応的に進化させることを提案する。
論文 参考訳(メタデータ) (2020-07-02T16:02:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。