論文の概要: AdaSAM: Boosting Sharpness-Aware Minimization with Adaptive Learning
Rate and Momentum for Training Deep Neural Networks
- arxiv url: http://arxiv.org/abs/2303.00565v1
- Date: Wed, 1 Mar 2023 15:12:42 GMT
- ステータス: 処理完了
- システム内更新日: 2023-03-02 14:31:33.333407
- Title: AdaSAM: Boosting Sharpness-Aware Minimization with Adaptive Learning
Rate and Momentum for Training Deep Neural Networks
- Title(参考訳): AdaSAM: 深層ニューラルネットワーク学習のための適応学習率とモーメントを用いたシャープネス認識最小化
- Authors: Hao Sun, Li Shen, Qihuang Zhong, Liang Ding, Shixiang Chen, Jingwei
Sun, Jing Li, Guangzhong Sun, Dacheng Tao
- Abstract要約: シャープネス認識(SAM)は、ディープニューラルネットワークのトレーニングにおいて、より一般的なものにするため、広範囲に研究されている。
AdaSAMと呼ばれる適応的な学習摂動と運動量加速度をSAMに統合することはすでに検討されている。
いくつかのNLPタスクにおいて,SGD,AMS,SAMsGradと比較して,AdaSAMが優れた性能を発揮することを示す実験を行った。
- 参考スコア(独自算出の注目度): 76.90477930208982
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sharpness aware minimization (SAM) optimizer has been extensively explored as
it can generalize better for training deep neural networks via introducing
extra perturbation steps to flatten the landscape of deep learning models.
Integrating SAM with adaptive learning rate and momentum acceleration, dubbed
AdaSAM, has already been explored empirically to train large-scale deep neural
networks without theoretical guarantee due to the triple difficulties in
analyzing the coupled perturbation step, adaptive learning rate and momentum
step. In this paper, we try to analyze the convergence rate of AdaSAM in the
stochastic non-convex setting. We theoretically show that AdaSAM admits a
$\mathcal{O}(1/\sqrt{bT})$ convergence rate, which achieves linear speedup
property with respect to mini-batch size $b$. Specifically, to decouple the
stochastic gradient steps with the adaptive learning rate and perturbed
gradient, we introduce the delayed second-order momentum term to decompose them
to make them independent while taking an expectation during the analysis. Then
we bound them by showing the adaptive learning rate has a limited range, which
makes our analysis feasible. To the best of our knowledge, we are the first to
provide the non-trivial convergence rate of SAM with an adaptive learning rate
and momentum acceleration. At last, we conduct several experiments on several
NLP tasks, which show that AdaSAM could achieve superior performance compared
with SGD, AMSGrad, and SAM optimizers.
- Abstract(参考訳): シャープネス認識最小化(sam)オプティマイザは、ディープラーニングモデルのランドスケープをフラットにする余分な摂動ステップを導入することによって、ディープニューラルネットワークのトレーニングをより一般化できるため、広く研究されている。
SAMと適応学習速度と運動量加速度を統合するAdaSAMは、結合された摂動ステップ、適応学習速度、運動量ステップを分析するのに3つの困難があるため、理論的保証なく大規模ディープニューラルネットワークをトレーニングするために実験的に研究されている。
本稿では,確率的非凸条件下でのAdaSAMの収束速度の解析を試みる。
理論的には、AdaSAMは$\mathcal{O}(1/\sqrt{bT})$収束率を認め、ミニバッチサイズ$b$に対して線形スピードアップ特性を達成する。
具体的には,適応学習率と摂動勾配で確率的勾配ステップを分離するために,遅延した2次運動量項を導入し,解析中に期待値を取りながらそれらを独立的に分解する。
そして、適応学習率に限界があることを示すことによって、それらを束縛し、分析を可能とした。
我々の知る限りでは、SAMの非自明な収束率と適応学習率と運動量加速度を初めて提供する。
AdaSAMはSGD, AMSGrad, SAMオプティマイザに比べて優れた性能が得られることを示す。
関連論文リスト
- Stabilizing Sharpness-aware Minimization Through A Simple
Renormalization Strategy [12.927965934262847]
シャープネス・アウェア(SAM)を用いたニューラルネットワークのトレーニングは非常に不安定である。
そこで我々は、StableSAMと呼ばれる単純な再正規化戦略を提案し、従順勾配のノルムが正確な勾配のノルムを維持する。
本稿は,StableSAMが学習率のこの仕組みをどのように拡張し,SAMを微調整で一貫した性能を実現できるかを示す。
論文 参考訳(メタデータ) (2024-01-14T10:53:36Z) - Analyzing Sharpness-aware Minimization under Overparameterization [13.460372481500368]
パラメータ化の超過により,シャープネスを意識した最小化(SAM)が有効であることを示す。
また,2層ネットワークの解析により,パラメータ化によるSAMの一般化が向上することを示す。
論文 参考訳(メタデータ) (2023-11-29T11:19:50Z) - Why Does Sharpness-Aware Minimization Generalize Better Than SGD? [102.40907275290891]
シャープネス・アウェアの最小化(SAM)がデータモデルや2層畳み込みReLUネットワークに対してグラディエントDescent(SGD)よりも優れていることを示す。
その結果,SAMの利点,特に早期の雑音学習を防止し,特徴のより効果的な学習を容易にする能力について解説した。
論文 参考訳(メタデータ) (2023-10-11T07:51:10Z) - Systematic Investigation of Sparse Perturbed Sharpness-Aware
Minimization Optimizer [158.2634766682187]
ディープニューラルネットワークは、複雑で非構造的なロスランドスケープのため、しばしば一般化の貧弱さに悩まされる。
SharpnessAware Minimization (SAM) は、摂動を加える際の景観の変化を最小限に抑えることで損失を平滑化するポピュラーなソリューションである。
本稿では,二元マスクによる摂動を効果的かつ効果的に行う訓練手法であるスパースSAMを提案する。
論文 参考訳(メタデータ) (2023-06-30T09:33:41Z) - Make Sharpness-Aware Minimization Stronger: A Sparsified Perturbation
Approach [132.37966970098645]
人気のソリューションの1つがSAM(Sharpness-Aware Minimization)であり、摂動を加える際の体重減少の変化を最小限に抑える。
本稿では,Sparse SAM (SSAM) とよばれる効率的な学習手法を提案する。
さらに、S が同じSAM、すなわち $O(log T/sqrtTTTTTTTTTTTTTTTTTTTTTTTTTTTTTTTTT で収束できることを理論的に証明する。
論文 参考訳(メタデータ) (2022-10-11T06:30:10Z) - Towards Efficient and Scalable Sharpness-Aware Minimization [81.22779501753695]
内部勾配の上昇を周期的に計算する新しいアルゴリズム LookSAM を提案する。
LookSAMはSAMと同じような精度を実現し、非常に高速である。
Vision Transformer(ViTs)のトレーニングでバッチサイズのスケールアップに成功したのは,私たちが初めてです。
論文 参考訳(メタデータ) (2022-03-05T11:53:37Z) - Efficient Sharpness-aware Minimization for Improved Training of Neural
Networks [146.2011175973769]
本稿では,SAM s の効率を高コストで向上する高効率シャープネス認識最小化器 (M) を提案する。
Mには、Stochastic Weight PerturbationとSharpness-Sensitive Data Selectionという、2つの新しい効果的なトレーニング戦略が含まれている。
我々は、CIFARとImageNetデータセットの広範な実験を通して、ESAMはSAMよりも100%余分な計算を40%のvis-a-visベースに必要とせずに効率を向上させることを示した。
論文 参考訳(メタデータ) (2021-10-07T02:20:37Z) - Stochastic Anderson Mixing for Nonconvex Stochastic Optimization [12.65903351047816]
Anderson Mixing (AM) は固定点反復の加速法である。
非適応最適化問題の解法として,Mixing (SAM) 方式を提案する。
論文 参考訳(メタデータ) (2021-10-04T16:26:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。