論文の概要: Mind the Drift: Diagonal Linear Networks Under Large Learning Rates
- arxiv url: http://arxiv.org/abs/2610.06120v1
- Date: Mon, 05 Oct 2026 10:50:11 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:29:49.162575
- Title: Mind the Drift: Diagonal Linear Networks Under Large Learning Rates
- Title(参考訳): Mind the Drift: 大規模学習率下での対角線ネットワーク
- Abstract要約: 大規模な学習はスパース解の回復を普遍的に妨げないことを示す。
我々は、よりシャープでスペーサーなソリューションを回復するために、ゲインを積極的に操縦する介入を導入する。
それとは対照的に、トレーニングの暗黙のバイアスを制御するために使用できる。
- 参考スコア(独自算出の注目度): 25.77033634039941
- License:
- Abstract: Large learning rates can qualitatively change the trajectory of neural network training, often pushing optimization into regimes far from classical gradient-flow behavior. The Edge of Stability (EoS) offers a valuable lens on the dynamics such learning rates induce. We study corresponding dynamics in diagonal linear networks, where we uncover a competition between two distinct implicit biases that jointly determine the sparsity of the recovered solution in regression settings. Complementary to the Gain, which captures the average discretization error accumulated by Gradient Descent relative to Gradient Flow, we derive a closely associated but overlooked quantity: the Drift. Under large learning rates, it describes an imbalance between different discretization errors and represents a systematic shift in the optimization trajectory. While the Gain grows monotonically in certain regimes, and can bias towards denser, flatter interpolators, the impact of the Drift depends on its alignment with potential solutions, which can either counteract or reinforce the effect of the Gain. Consequently, its behavior drives model selection, particularly during early training epochs. To validate our theoretical insights, we introduce an intervention that actively steers the Gain to recover sharper, sparser solutions. Thus, our analysis reveals that large learning rates do not universally hinder the recovery of sparse solutions. On the contrary, they can be harnessed to control the implicit bias of training.
- Abstract(参考訳): 大規模な学習速度は、ニューラルネットワークトレーニングの軌道を質的に変えることができ、しばしば古典的な勾配流の振る舞いから遠く離れた状況に最適化をプッシュする。
安定性のエッジ(EoS)は、学習率の誘導のようなダイナミクスに価値のあるレンズを提供する。
対角線ネットワークにおける対応するダイナミクスについて検討し、回帰設定における解の空間性を決定する2つの異なる暗黙バイアスの競合を明らかにする。
グラディエントフローに対してグラディエントDescentによって蓄積される平均的な離散化誤差をキャプチャするゲインの補完として、我々は密接に関連しているが見過ごされた量であるドリフトを導出する。
大きな学習率の下では、異なる離散化誤差の不均衡を記述し、最適化軌道の体系的なシフトを表す。
ゲインは特定の状態において単調に成長し、より密度が高く平坦な補間子に偏りを持つが、ドリフトの影響は、ゲインの効果を反作用または補強する潜在的な溶液との整合に依存する。
結果として、その行動はモデル選択、特に初期の訓練エポックの間を駆動する。
理論的知見を検証するために,よりシャープでスペーサーな解を回収するために,ゲインを積極的に操縦する介入を導入する。
そこで本研究では,大規模な学習がスパース解の回復を普遍的に妨げないことを示す。
それとは対照的に、トレーニングの暗黙のバイアスを制御するために使用できる。
関連論文リスト
- A Journey to the Edge of Stability [53.81268610971847]
深層学習は、最大ヘッセン固有値モデルが学習率と相反する値で安定化される「安定性の端」(EoS)でしばしば起こる。
深層学習問題を解き、深層学習率のスイープで一階最適化法を変化させる。
次に、学習軌跡の特徴量、すなわち損失、鋭さ、連続的な勾配間のアライメントを追跡する。
論文 参考訳(メタデータ) (2026-09-26T06:28:18Z) - Teacher Forcing as Generalized Bayes: Optimization Geometry Mismatch in Switching Surrogates for Chaotic Dynamics [13.429086216170552]
アイデンティティ教師強制(ITF)は,カオス力学系に対する決定論的再帰的サロゲートの安定した訓練を可能にする。
AL-RNNの確率的スイッチング増強における客観的なIFFの曲率と限界率の比較を行った。
論文 参考訳(メタデータ) (2026-04-28T17:50:37Z) - The Butterfly Effect: Neural Network Training Trajectories Are Highly Sensitive to Initial Conditions [51.68215326304272]
たとえ小さな摂動であっても、同じ訓練軌跡を確実に引き起こすことで、トレーニング時間とともに急速に減少する効果が発散することを示します。
この結果から,ニューラルネットワークのトレーニング安定性,微調整,モデルマージ,モデルアンサンブルの多様性の実践的意味が示唆された。
論文 参考訳(メタデータ) (2025-06-16T08:35:16Z) - Hallmarks of Optimization Trajectories in Neural Networks: Directional Exploration and Redundancy [75.15685966213832]
最適化トラジェクトリのリッチな方向構造をポイントワイズパラメータで解析する。
トレーニング中のスカラーバッチノルムパラメータは,ネットワーク全体のトレーニング性能と一致していることを示す。
論文 参考訳(メタデータ) (2024-03-12T07:32:47Z) - Adaptive Federated Learning Over the Air [108.62635460744109]
オーバー・ザ・エア・モデル・トレーニングの枠組みの中で,適応勾配法,特にAdaGradとAdamの連合バージョンを提案する。
解析の結果,AdaGrad に基づくトレーニングアルゴリズムは $mathcalO(ln(T) / T 1 - frac1alpha の速度で定常点に収束することがわかった。
論文 参考訳(メタデータ) (2024-03-11T09:10:37Z) - On the Dynamics Under the Unhinged Loss and Beyond [104.49565602940699]
我々は、閉形式力学を解析するための数学的機会を提供する、簡潔な損失関数であるアンヒンジド・ロスを導入する。
アンヒンジされた損失は、時間変化学習率や特徴正規化など、より実践的なテクニックを検討することができる。
論文 参考訳(メタデータ) (2023-12-13T02:11:07Z) - A Theoretical Analysis of the Learning Dynamics under Class Imbalance [0.10231119246773925]
本研究では,少数クラスと多数クラスの学習曲線が,勾配に基づく学習において,準最適軌跡に従うことを示す。
この減速は不均衡比に関連しており、異なるクラスの最適化の競合に遡ることができる。
GDはクラスごとの損失を減らすことは保証されていないが、勾配のクラスごとの正規化を行うことでこの問題に対処できる。
論文 参考訳(メタデータ) (2022-07-01T12:54:38Z) - A Loss Curvature Perspective on Training Instability in Deep Learning [28.70491071044542]
学習力学における損失の曲率の影響を理解するため,多くの分類課題における損失ヘッセンの進化について検討した。
条件付けの観点から,学習率のウォームアップはバッチ正規化と同じくらいのトレーニング安定性を向上できることを示した。
論文 参考訳(メタデータ) (2021-10-08T20:25:48Z) - Implicit Bias of SGD for Diagonal Linear Networks: a Provable Benefit of
Stochasticity [24.428843425522107]
直交線形ネットワーク上の勾配降下の力学を,その連続時間,すなわち勾配流を用いて研究する。
トレーニング損失の収束速度がバイアス効果の大きさを制御することを示し,収束速度が遅くなるほどバイアスが良くなることを示した。
論文 参考訳(メタデータ) (2021-06-17T14:16:04Z) - A Random Matrix Theory Approach to Damping in Deep Learning [0.7614628596146599]
深層学習における適応的勾配法と非適応的勾配法との違いは推定ノイズの増加に起因すると推測する。
線形縮退推定にインスパイアされた2次オプティマイザのためのランダム行列理論に基づくダンピング学習器を開発した。
論文 参考訳(メタデータ) (2020-11-15T18:19:42Z) - On Learning Rates and Schr\"odinger Operators [105.32118775014015]
本稿では,学習率の影響に関する一般的な理論的分析を行う。
学習速度は、幅広い非ニューラルクラス関数に対してゼロとなる傾向にある。
論文 参考訳(メタデータ) (2020-04-15T09:52:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。