論文の概要: Vanilla SGD with Momentum Survives Heavy-Tailed Noise: Convergence Analysis without Gradient Clipping or Normalization
- arxiv url: http://arxiv.org/abs/2607.08104v1
- Date: Thu, 09 Jul 2026 04:43:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.413449
- Title: Vanilla SGD with Momentum Survives Heavy-Tailed Noise: Convergence Analysis without Gradient Clipping or Normalization
- Title(参考訳): 重音を持続するバニラSGD:緩やかなクリップや正規化を伴わない収束解析
- Abstract要約: 我々は、バニラ勾配SGDは、特に運動量で、重み付き雑音の中でどのように機能するかを調査する。
本結果は,SGDのクリッピングあるいは正規化により達成される最適速度よりも収束率が劣っていることを示す。
- 参考スコア(独自算出の注目度): 9.711326718689493
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Stochastic gradient descent (SGD) is a cornerstone of modern optimization. While its performance under heavy-tailed noise is often addressed through specialized modifications such as gradient clipping or normalization, we investigate a more fundamental question: how does vanilla SGD, particularly with momentum, perform in the presence of heavy-tailed noise? In this paper, we refine existing convergence results for vanilla SGD and, more importantly, provide the first comprehensive convergence analysis of vanilla SGD with momentum for strongly convex, convex, and nonconvex objectives, without employing any gradient control mechanisms. Our results demonstrate that the obtained convergence rates are inferior to the optimal rates achieved by clipped or normalized variants of SGD, thereby revealing inherent limitations of vanilla methods under heavy-tailed noise. The theoretical findings are supported by experiments on synthetic functions.
- Abstract(参考訳): 確率勾配降下(SGD)は現代最適化の基盤となっている。
バニラSGDは、特に運動量のある場合、重音の存在下ではどのように機能するかという、より根本的な問題について検討する。
本稿では,バニラSGDに対する既存の収束結果を精査し,より重要なことは,バニラSGDに対して,勾配制御機構を使わずに,凸,凸,非凸の運動量を持つ最初の総合収束解析を行うことである。
その結果, 得られた収束速度は, SGDの切断あるいは正規化された変種によって達成される最適速度よりも劣っていることが明らかとなり, 重尾雑音下でのバニラ法固有の限界が明らかとなった。
理論的な発見は合成機能の実験によって裏付けられている。
関連論文リスト
- The Role of Gradient Modification in Heavy-Tailed Nonconvex Stochastic Min-Max Optimization [50.59470683896735]
min-max最適化は、現代の機械学習に応用されているため、注目を集めている。
我々は、勾配降下(SGDA)の包括的理論を提供する。
我々は,Stoc-GDAMとStoc-TRmaxという新たなクリッピングフリーアルゴリズムを開発し,グラディエントクリッピングを使わずに,目標精度への最適依存を実現する。
論文 参考訳(メタデータ) (2026-09-05T12:49:28Z) - Robust Stochastic Gradient Posterior Sampling with Lattice Based Discretisation [20.44428092865608]
MCMC法は拡張性のある後方サンプリングを可能にするが、しばしばミニバッチサイズや勾配ノイズに対する感度に悩まされる。
格子ランダムウォークの離散化の拡張であるグラディエントランダムウォーク(SGLRW)を提案する。
論文 参考訳(メタデータ) (2026-02-17T18:09:49Z) - Convergence of Clipped-SGD for Convex $(L_0,L_1)$-Smooth Optimization with Heavy-Tailed Noise [65.40001744848615]
Clip-SGDのようなクリッピングを持つ一階法は、$(L_$1)$-smoothnessの仮定の下でSGDよりも強い収束保証を示す。
Clip-SGD の高確率収束バウンダリを凸 $(L_$1)$-smooth の重み付き雑音による最適化に適用した最初の高確率収束バウンダリを確立する。
論文 参考訳(メタデータ) (2025-05-27T07:23:42Z) - Gradient Normalization Provably Benefits Nonconvex SGD under Heavy-Tailed Noise [60.92029979853314]
重み付き雑音下でのグラディエントDescence(SGD)の収束を確実にする上での勾配正規化とクリッピングの役割について検討する。
我々の研究は、重尾雑音下でのSGDの勾配正規化の利点を示す最初の理論的証拠を提供する。
我々は、勾配正規化とクリッピングを取り入れた加速SGD変種を導入し、さらに重み付き雑音下での収束率を高めた。
論文 参考訳(メタデータ) (2024-10-21T22:40:42Z) - High-probability Convergence Bounds for Nonlinear Stochastic Gradient Descent Under Heavy-tailed Noise [59.25598762373543]
重み付き雑音の存在下でのストリーミングデータにおける学習の精度保証について検討した。
解析的に、与えられた問題に対する設定の選択に$ta$を使うことができることを実証する。
論文 参考訳(メタデータ) (2023-10-28T18:53:41Z) - Doubly Stochastic Models: Learning with Unbiased Label Noises and
Inference Stability [85.1044381834036]
勾配降下のミニバッチサンプリング設定におけるラベル雑音の暗黙的正則化効果について検討した。
そのような暗黙的正則化器は、パラメータの摂動に対してモデル出力を安定化できる収束点を好んでいる。
我々の研究は、SGDをオルンシュタイン-ウレンベック類似の過程とはみなせず、近似の収束によってより一般的な結果を得る。
論文 参考訳(メタデータ) (2023-04-01T14:09:07Z) - Implicit Regularization or Implicit Conditioning? Exact Risk
Trajectories of SGD in High Dimensions [26.782342518986503]
勾配降下(SGD)は現代の機械学習の柱であり、様々な問題に対するゴート最適化アルゴリズムとして機能している。
HSGD形式をストリーミングSGDに適合させる方法を示し、ストリーミングSGDと比較してマルチパスSGDの過大なリスクを正確に予測できることを示す。
論文 参考訳(メタデータ) (2022-06-15T02:32:26Z) - Clipped Stochastic Methods for Variational Inequalities with
Heavy-Tailed Noise [64.85879194013407]
単調なVIPと非単調なVIPの解法における信頼度に対数的依存を持つ最初の高確率結果が証明された。
この結果は光尾の場合で最もよく知られたものと一致し,非単調な構造問題に新鮮である。
さらに,多くの実用的な定式化の勾配雑音が重く,クリッピングによりSEG/SGDAの性能が向上することを示す。
論文 参考訳(メタデータ) (2022-06-02T15:21:55Z) - On the Double Descent of Random Features Models Trained with SGD [78.0918823643911]
勾配降下(SGD)により最適化された高次元におけるランダム特徴(RF)回帰特性について検討する。
本研究では, RF回帰の高精度な非漸近誤差境界を, 定常および適応的なステップサイズSGD設定の下で導出する。
理論的にも経験的にも二重降下現象を観察する。
論文 参考訳(メタデータ) (2021-10-13T17:47:39Z) - Noisy Truncated SGD: Optimization and Generalization [27.33458360279836]
近年のsgdに関する実証研究により、エポックのほとんどの勾配成分は極めて小さいことが示されている。
このような研究に触発され、雑音SGD(NT-SGD)の特性を厳格に研究する。
我々は,NT-SGDがサドルポイントから確実に脱出でき,従来と比べノイズの少ないことを証明した。
論文 参考訳(メタデータ) (2021-02-26T22:39:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。