論文の概要: Convergence of Steepest Descent and Adam under Non-Uniform Smoothness
- arxiv url: http://arxiv.org/abs/2605.30648v1
- Date: Thu, 28 May 2026 23:05:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.283247
- Title: Convergence of Steepest Descent and Adam under Non-Uniform Smoothness
- Title(参考訳): 非均一な平滑化下における最深度明度とアダムの収束
- Authors: Sharan Vaswani, Yifan Sun, Reza Babanezhad,
- Abstract要約: 分離可能なデータに対するロジスティック回帰では、RMSPropとAdamは線形収束し、GDよりも確実に高速であることを示す。
また、分離可能なデータ上の2層ニューラルネットワークのクラスに対して、RMSPropとAdamは定数のステップサイズと運動量パラメータで線形速度で収束可能であることを示す。
- 参考スコア(独自算出の注目度): 9.95160888054888
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent work has analyzed the convergence of first-order methods under non-uniform smoothness assumptions that better model the loss landscape in machine learning tasks. We generalize this assumption to objectives whose curvature is an affine function of the objective value. This property is satisfied by a broad class of problems, including logistic regression, generalized linear models with a logistic link function, softmax policy gradient in reinforcement learning, and a class of neural networks. Under this assumption and gradient domination conditions, we establish a general convergence rate for the steepest descent method, and deterministic, diagonal variants of RMSProp and Adam. Our results imply that for logistic regression on separable data and the softmax policy gradient objective, sign GD converges linearly and is provably faster than GD. Furthermore, we show that for a class of two-layer neural networks on separable data, RMSProp and Adam can converge at a linear rate with a constant step-size and momentum parameter. Finally, we present a lower bound demonstrating that, under our assumption, RMSProp and Adam are provably faster than AdaGrad, AMSGrad, gradient descent, and heavy-ball momentum.
- Abstract(参考訳): 最近の研究は、機械学習タスクにおける損失景観をより良くモデル化する不均一な滑らか性仮定の下で、一階法の収束を分析している。
我々はこの仮定を、曲率が目的値のアフィン関数である対象に一般化する。
この性質は、ロジスティック回帰、ロジスティックリンク関数を持つ一般化線形モデル、強化学習におけるソフトマックスポリシー勾配、ニューラルネットワークのクラスなど、幅広いクラスで満たされている。
この仮定と勾配支配条件の下で、最も急勾配な降下法に対する一般的な収束速度を確立し、RMSPropとAdamの決定論的、対角的な変種を定式化する。
以上の結果から,分離可能なデータに対するロジスティック回帰とソフトマックス政策勾配目標に対して,符号GDは線形収束し,GDよりも確実に高速であることが示唆された。
さらに、分離可能なデータ上の2層ニューラルネットワークのクラスにおいて、RMSPropとAdamは定数のステップサイズと運動量パラメータで線形速度で収束可能であることを示す。
最後に, RMSPropとAdamはAdaGrad, AMSGrad, 勾配勾配, 重球運動量よりも確実に高速であることを示す。
関連論文リスト
- A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models [6.734175048463699]
正方形損失を学習した2層線形ニューラルネットワークの勾配降下に対する線形収束率を導出した。
我々の収束分析は、事前の結果を改善するだけでなく、ステップサイズに対するより良い選択を示唆している。
論文 参考訳(メタデータ) (2025-05-16T19:57:22Z) - Convergence Analysis of Natural Gradient Descent for Over-parameterized Physics-Informed Neural Networks [4.554284689395686]
2層$textReLU3$ Physics-Informed Neural Networks (PINNs) のトレーニングにおいて、学習率は $mathcalO(lambda_0)$から $mathcalO (1/|bmHinfty|_2)$に改善可能であることを示す。
このような改善にもかかわらず、収束速度は依然としてグラム行列の最小固有値と結び付けられ、収束が遅くなる。
論文 参考訳(メタデータ) (2024-08-01T14:06:34Z) - A Mean-Field Analysis of Neural Stochastic Gradient Descent-Ascent for Functional Minimax Optimization [90.87444114491116]
本稿では,超パラメトリック化された2層ニューラルネットワークの無限次元関数クラス上で定義される最小最適化問題について検討する。
i) 勾配降下指数アルゴリズムの収束と, (ii) ニューラルネットワークの表現学習に対処する。
その結果、ニューラルネットワークによって誘導される特徴表現は、ワッサーシュタイン距離で測定された$O(alpha-1)$で初期表現から逸脱することが許された。
論文 参考訳(メタデータ) (2024-04-18T16:46:08Z) - Implicit Bias and Fast Convergence Rates for Self-attention [26.766649949420746]
本稿では,変圧器の定義機構である自己注意の基本的な最適化原理について考察する。
線形分類におけるデコーダを用いた自己アテンション層における勾配ベースの暗黙バイアスを解析する。
論文 参考訳(メタデータ) (2024-02-08T15:15:09Z) - Max-affine regression via first-order methods [7.12511675782289]
最大アフィンモデルは信号処理と統計学の応用においてユビキタスに現れる。
最大アフィン回帰に対する勾配降下(GD)とミニバッチ勾配降下(SGD)の非漸近収束解析を行った。
論文 参考訳(メタデータ) (2023-08-15T23:46:44Z) - Convergence of Adam Under Relaxed Assumptions [72.24779199744954]
我々は、アダムがより現実的な条件下で、$O(epsilon-4)$勾配複雑性で$epsilon$-定常点に収束することを示している。
また、Adamの分散還元版を$O(epsilon-3)$の加速勾配複雑性で提案する。
論文 参考訳(メタデータ) (2023-04-27T06:27:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。