Fugu-MT 論文翻訳(概要): AdaSAM: Boosting Sharpness-Aware Minimization with Adaptive Learning Rate and Momentum for Training Deep Neural Networks

論文の概要: AdaSAM: Boosting Sharpness-Aware Minimization with Adaptive Learning Rate and Momentum for Training Deep Neural Networks

arxiv url: http://arxiv.org/abs/2303.00565v1
Date: Wed, 1 Mar 2023 15:12:42 GMT
ステータス: 翻訳完了
システム内更新日: 2023-03-02 14:31:33.333407
Title: AdaSAM: Boosting Sharpness-Aware Minimization with Adaptive Learning Rate and Momentum for Training Deep Neural Networks
Title（参考訳）: AdaSAM: 深層ニューラルネットワーク学習のための適応学習率とモーメントを用いたシャープネス認識最小化
Authors: Hao Sun, Li Shen, Qihuang Zhong, Liang Ding, Shixiang Chen, Jingwei Sun, Jing Li, Guangzhong Sun, Dacheng Tao
Abstract要約: シャープネス認識(SAM)は、ディープニューラルネットワークのトレーニングにおいて、より一般的なものにするため、広範囲に研究されている。 AdaSAMと呼ばれる適応的な学習摂動と運動量加速度をSAMに統合することはすでに検討されている。いくつかのNLPタスクにおいて,SGD,AMS,SAMsGradと比較して,AdaSAMが優れた性能を発揮することを示す実験を行った。
参考スコア（独自算出の注目度）: 76.90477930208982
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Sharpness aware minimization (SAM) optimizer has been extensively explored as it can generalize better for training deep neural networks via introducing extra perturbation steps to flatten the landscape of deep learning models. Integrating SAM with adaptive learning rate and momentum acceleration, dubbed AdaSAM, has already been explored empirically to train large-scale deep neural networks without theoretical guarantee due to the triple difficulties in analyzing the coupled perturbation step, adaptive learning rate and momentum step. In this paper, we try to analyze the convergence rate of AdaSAM in the stochastic non-convex setting. We theoretically show that AdaSAM admits a $\mathcal{O}(1/\sqrt{bT})$ convergence rate, which achieves linear speedup property with respect to mini-batch size $b$. Specifically, to decouple the stochastic gradient steps with the adaptive learning rate and perturbed gradient, we introduce the delayed second-order momentum term to decompose them to make them independent while taking an expectation during the analysis. Then we bound them by showing the adaptive learning rate has a limited range, which makes our analysis feasible. To the best of our knowledge, we are the first to provide the non-trivial convergence rate of SAM with an adaptive learning rate and momentum acceleration. At last, we conduct several experiments on several NLP tasks, which show that AdaSAM could achieve superior performance compared with SGD, AMSGrad, and SAM optimizers.
Abstract（参考訳）: シャープネス認識最小化(sam)オプティマイザは、ディープラーニングモデルのランドスケープをフラットにする余分な摂動ステップを導入することによって、ディープニューラルネットワークのトレーニングをより一般化できるため、広く研究されている。 SAMと適応学習速度と運動量加速度を統合するAdaSAMは、結合された摂動ステップ、適応学習速度、運動量ステップを分析するのに3つの困難があるため、理論的保証なく大規模ディープニューラルネットワークをトレーニングするために実験的に研究されている。本稿では,確率的非凸条件下でのAdaSAMの収束速度の解析を試みる。理論的には、AdaSAMは$\mathcal{O}(1/\sqrt{bT})$収束率を認め、ミニバッチサイズ$b$に対して線形スピードアップ特性を達成する。具体的には,適応学習率と摂動勾配で確率的勾配ステップを分離するために,遅延した2次運動量項を導入し,解析中に期待値を取りながらそれらを独立的に分解する。そして、適応学習率に限界があることを示すことによって、それらを束縛し、分析を可能とした。我々の知る限りでは、SAMの非自明な収束率と適応学習率と運動量加速度を初めて提供する。 AdaSAMはSGD, AMSGrad, SAMオプティマイザに比べて優れた性能が得られることを示す。

関連論文リスト

LightSAM: Parameter-Agnostic Sharpness-Aware Minimization [92.17866492331524]
シャープネス・アウェアの最小化(SAM)は、重量摂動を通して平らなミニマランドスケープを探索することにより、機械学習モデルの能力を高める。 SAMはさらなるハイパーパラメータ、摂動半径を導入し、SAMの感度を誘導する。本稿では,SAMの摂動半径と学習速度を適応的に設定するアルゴリズムLightSAMを提案する。
論文参考訳（メタデータ） (2025-05-30T09:28:38Z)
$\boldsymbolμ\mathbf{P^2}$: Effective Sharpness Aware Minimization Requires Layerwise Perturbation Scaling [49.25546155981064]
シャープネス認識最小化(SAM)を用いたニューラルネットワークの無限幅限界について検討する。この結果から, SAMのダイナミクスは, 広範なニューラルネットワークにおいて, 最後の層のみにSAMを適用することで効果的に低下することが判明した。対照的に、階層的にスケールする摂動を伴う安定したパラメータ化を識別し、それを $textitMaximal Update and Perturbation $$mu$P$2$ と呼びます。
論文参考訳（メタデータ） (2024-10-31T16:32:04Z)
SAMPa: Sharpness-aware Minimization Parallelized [51.668052890249726]
シャープネス認識(SAM)はニューラルネットワークの一般化を改善することが示されている。 SAMの更新には2つの勾配を瞬時に計算する必要がある。我々は,SAMPaと呼ばれるSAMの簡単な修正を提案し,この2つの勾配計算を完全に並列化することができる。
論文参考訳（メタデータ） (2024-10-14T16:21:23Z)
Sharpness-Aware Minimization Efficiently Selects Flatter Minima Late in Training [47.25594539120258]
Sharpness-Aware Minimization (SAM) はトレーニングの遅滞時に効率よくフラットなミニマを選択する。 SAMの訓練の終わりに応用されたいくつかのエポックでさえ、完全なSAMトレーニングとほぼ同じ一般化と解のシャープネスをもたらす。我々は、最終解の物性を形作る上で、最終相で選択した最適化法がより重要であると推測する。
論文参考訳（メタデータ） (2024-10-14T10:56:42Z)
Asymptotic Unbiased Sample Sampling to Speed Up Sharpness-Aware Minimization [17.670203551488218]
シャープネス認識最小化(AUSAM)を加速する漸近的アンバイアスサンプリングを提案する。 AUSAMはモデルの一般化能力を維持しながら、計算効率を大幅に向上させる。プラグアンドプレイでアーキテクチャに依存しない手法として、我々のアプローチはSAMを様々なタスクやネットワークで継続的に加速させる。
論文参考訳（メタデータ） (2024-06-12T08:47:44Z)
Stabilizing Sharpness-aware Minimization Through A Simple Renormalization Strategy [12.050160495730381]
SAM ( sharpness-aware generalization) は性能向上に驚くべき効果があることから注目されている。本稿では, 安定SAM (SSAM) と呼ばれる単純な再正規化戦略を提案する。我々の戦略は実装が容易で、SAMとその変種と統合するのに十分な柔軟性があり、ほとんど計算コストがかからない。
論文参考訳（メタデータ） (2024-01-14T10:53:36Z)
Systematic Investigation of Sparse Perturbed Sharpness-Aware Minimization Optimizer [158.2634766682187]
ディープニューラルネットワークは、複雑で非構造的なロスランドスケープのため、しばしば一般化の貧弱さに悩まされる。 SharpnessAware Minimization (SAM) は、摂動を加える際の景観の変化を最小限に抑えることで損失を平滑化するポピュラーなソリューションである。本稿では,二元マスクによる摂動を効果的かつ効果的に行う訓練手法であるスパースSAMを提案する。
論文参考訳（メタデータ） (2023-06-30T09:33:41Z)
Towards Efficient and Scalable Sharpness-Aware Minimization [81.22779501753695]
内部勾配の上昇を周期的に計算する新しいアルゴリズム LookSAM を提案する。 LookSAMはSAMと同じような精度を実現し、非常に高速である。 Vision Transformer(ViTs)のトレーニングでバッチサイズのスケールアップに成功したのは,私たちが初めてです。
論文参考訳（メタデータ） (2022-03-05T11:53:37Z)
Stochastic Anderson Mixing for Nonconvex Stochastic Optimization [12.65903351047816]
Anderson Mixing (AM) は固定点反復の加速法である。非適応最適化問題の解法として,Mixing (SAM) 方式を提案する。
論文参考訳（メタデータ） (2021-10-04T16:26:15Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。