論文の概要: Mini-batch Noise Lowers Sharpness via Dominant-Subspace Fluctuations
- arxiv url: http://arxiv.org/abs/2607.23012v1
- Date: Sat, 25 Jul 2026 03:06:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.966658
- Title: Mini-batch Noise Lowers Sharpness via Dominant-Subspace Fluctuations
- Title(参考訳): ミニバッチノイズは支配空間変動によるシャープネスを低下させる
- Authors: Junho So, Dongwook Shin,
- Abstract要約: 支配方向のゆらぎによって勾配が平均化され,シャープネス補正項が生じることを示す。
支配方向のミニバッチノイズによって誘導されるシャープネス補正項を導出する。
実験の結果, GD に補正項を付加することで, GD のシャープネス進化が SGD のシャープネス進化に近づくことが示された。
- 参考スコア(独自算出の注目度): 0.08594140167290099
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: During SGD training, the gradients often align strongly with the dominant subspace spanned by the top-$k$ eigenvectors of the Hessian of the loss. While this seems to naturally imply that loss reduction mainly occurs within this space, prior work has shown that updates within this dominant subspace make no meaningful progress in reducing the loss. In this work, we argue that the dominant subspace is better understood not as the main space for loss reduction, but as a key subspace for explaining the sharpness dynamics of mini-batch SGD. To explain the role of the dominant subspace in reducing top-$k$ sharpness, we show how the averaged gradient over fluctuations in the dominant directions produces a sharpness correction term, and derive a sharpness correction term induced by mini-batch noise in the dominant directions. Experimental results show that adding the derived correction term to GD brings the sharpness evolution of GD closer to that of SGD.
- Abstract(参考訳): SGDトレーニングの間、勾配はしばしば、損失のヘシアンの上位$k$固有ベクトルによって広がる支配部分空間と強く一致する。
このことは、主にこの空間内で損失の減少が起こることを暗示しているように思われるが、先行研究により、この支配的な部分空間内の更新は損失の減少に有意義な進展を示さないことが示されている。
この研究において、支配部分空間は損失低減の主空間ではなく、ミニバッチSGDのシャープネスダイナミクスを説明するための重要な部分空間として理解されている。
トップ$kのシャープネスの低減における支配部分空間の役割を説明するために,支配方向のゆらぎに対する平均勾配が,支配方向のミニバッチノイズによって誘導されるシャープネス補正項を導出することを示す。
実験の結果, GD に補正項を付加することで, GD のシャープネス進化が SGD のシャープネス進化に近づくことが示された。
関連論文リスト
- SDS-LoRA: Overcoming Anisotropic Gradient Scaling in Low-Rank Adaptation [64.33799467286265]
Low-Rank Adaptation (LoRA)は、大規模な事前訓練されたモデルの下流タスクへの効率的な適応を可能にする。
完全な微調整勾配が低ランク行列に逆伝播すると,その特異値によって誘導される異方性スケーリングを受けることを示す。
本稿では,後方パスから特異値を構造的に分離する新しい低ランクパラメータ化SDS-LoRAを提案する。
論文 参考訳(メタデータ) (2026-06-15T09:27:50Z) - Suspicious Alignment of SGD: A Fine-Grained Step Size Condition Analysis [30.6120085647449]
本稿では,不調な最適化条件下での勾配降下(SGD)における不審なアライメント現象について検討する。
具体的には、SGD更新の初期段階では、勾配と支配部分空間のアライメントが減少する傾向にある。
十分な条件下では、SGD更新をバルク空間に投影すると損失が減少し、支配空間に投影すると損失が増大するステップサイズ間隔が存在することを示す。
論文 参考訳(メタデータ) (2026-01-16T21:32:48Z) - Accelerating Neural Network Training Along Sharp and Flat Directions [6.576051895863941]
本研究では、Dminant部分空間の補集合への更新を制限するSGDの変種であるBulk-SGDについて検討する。
損失ランドスケープにおける平坦な方向に対応するバルク部分空間に沿った更新は収束を加速するが、安定性を損なう可能性があることを示す。
本研究は,曲率認識設計における原則的アプローチを示唆するものである。
論文 参考訳(メタデータ) (2025-05-17T12:13:05Z) - Does SGD really happen in tiny subspaces? [18.283839252425803]
近年の研究では、トレーニング軌道に沿って、勾配がトレーニング損失 Hessian の低ランクトップ固有空間と整合していることが示されている。
本稿では,ニューラルネットワークが支配的な部分空間内でトレーニング可能かどうかを考察し,より効率的なトレーニング手法を提案する。
論文 参考訳(メタデータ) (2024-05-25T01:44:35Z) - Risk Bounds of Accelerated SGD for Overparameterized Linear Regression [75.27846230182885]
加速度勾配降下(ASGD)は、深層学習におけるワークホースである。
既存の最適化理論は、ASGDのより高速な収束を説明することしかできないが、より優れた一般化を説明することはできない。
論文 参考訳(メタデータ) (2023-11-23T23:02:10Z) - Butterfly Effects of SGD Noise: Error Amplification in Behavior Cloning
and Autoregression [70.78523583702209]
深層ニューラルネットワークを用いた行動クローニングの訓練不安定性について検討した。
トレーニング中のSGD更新の最小化は,長期的報奨の急激な振動をもたらすことが観察された。
論文 参考訳(メタデータ) (2023-10-17T17:39:40Z) - Implicit Bias of Gradient Descent for Logistic Regression at the Edge of
Stability [69.01076284478151]
機械学習の最適化において、勾配降下(GD)はしばしば安定性の端(EoS)で動く
本稿では,EoS系における線形分離可能なデータに対するロジスティック回帰のための定数段差GDの収束と暗黙バイアスについて検討する。
論文 参考訳(メタデータ) (2023-05-19T16:24:47Z) - Direction Matters: On the Implicit Bias of Stochastic Gradient Descent
with Moderate Learning Rate [105.62979485062756]
本稿では,中等度学習におけるSGDの特定の正規化効果を特徴付けることを試みる。
SGDはデータ行列の大きな固有値方向に沿って収束し、GDは小さな固有値方向に沿って収束することを示す。
論文 参考訳(メタデータ) (2020-11-04T21:07:52Z) - The Break-Even Point on Optimization Trajectories of Deep Neural
Networks [64.7563588124004]
この軌道上の「破滅的な」点の存在を論じる。
トレーニングの初期段階での大きな学習率を用いることで、勾配のばらつきが軽減されることを示す。
また, バッチ正規化層を有するニューラルネットワークにおいても, 低学習率を用いることで損失面の条件が悪くなることを示す。
論文 参考訳(メタデータ) (2020-02-21T22:55:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。