論文の概要: Same Loss, Same Noise, Opposite Schedules: Noise Structure and Optimizer Normalization Jointly Determine Whether Learning-Rate Cooldown Helps
- arxiv url: http://arxiv.org/abs/2607.12360v1
- Date: Tue, 14 Jul 2026 05:21:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.04191
- Title: Same Loss, Same Noise, Opposite Schedules: Noise Structure and Optimizer Normalization Jointly Determine Whether Learning-Rate Cooldown Helps
- Title(参考訳): 同一損失, 同一騒音, オポポジットスケジューリング: 騒音構造と最適化正規化が学習水準の冷却に寄与するか否かを共同決定する
- Authors: Subham Singh, Ashutosh Mishra, Subha Raut,
- Abstract要約: 本稿では,大規模モデル事前学習の既定であるウォームアップ安定度学習スケジュール(WSD)の段階について検討する。
提案手法は, 勾配雑音の構造と勾配雑音の構造が正規化するか否かという2つの特性を同時に有する。
- 参考スコア(独自算出の注目度): 4.422349568747053
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The cooldown phase of a warmup-stable-decay (WSD) learning-rate schedule, now a default in large-model pretraining, lowers the final training loss in some settings and does nothing in others. We give a provable account of which case obtains, and it turns on two properties together: the structure of the gradient noise and whether the optimizer normalizes its update. On a strongly convex objective with multiplicative (gradient-proportional) noise, stochastic gradient descent contracts geometrically at a constant learning rate, so cooldown has nothing to improve. Under the same objective and noise, sign-based and normalized methods, the standard surrogates for adaptive optimizers, settle on a noise floor of order $η^2$ and reach the minimizer only as the learning rate is driven to zero; any additive noise then reinstates a floor for every method. The mechanism is elementary: an SGD step shrinks in proportion to the gradient and so anneals itself, whereas a normalized step keeps unit scale and cannot. We solve the signSGD stationary law on the quadratic exactly and obtain the floor constant in closed form, prove a local form of the dissociation under $(L_0,L_1)$-smoothness, extend the floor to normalized SGD in dimension d>1 by a scale-invariance argument, and establish robustness to momentum and heavy-tailed noise. Simulation confirms every prediction, and we demonstrate the resulting noise-regime diagnostic on a real classification task with directly measured gradient noise. The mechanism explains whether cooldown helps; the interior cooldown fraction used at scale lies outside stationary landscape-and-noise geometry.
- Abstract(参考訳): ウォームアップstable-decay(WSD)学習スケジュールの冷却フェーズは、大規模なモデルの事前トレーニングでデフォルトとなり、いくつかの設定で最終的なトレーニング損失を低減し、その他は何もしない。
我々は、どのケースが得られるかの証明可能な説明を行い、勾配雑音の構造と最適化器がその更新を正規化するかどうかの2つの特性をまとめる。
乗算的(漸進的な)雑音を伴う強い凸対象では、確率勾配降下は幾何的に一定の学習速度で収縮するので、冷却は改善することはない。
同じ目的と雑音、符号ベースおよび正規化法の下で、適応オプティマイザの標準的なサロゲートは、$η^2$のノイズフロアに落ち着き、学習速度がゼロになるときにのみ最小値に達する。
メカニズムは基本的なもので、SGDステップは勾配に比例して縮み、それ自身は鎮痛するが、正規化ステップは単位スケールを保持し、不可能である。
四角形上の符号SGD定常法則を正確に解き、閉じた形の床定数を求め、$(L_0,L_1)$-smoothnessの下で解離の局所形式を証明し、スケール不変の議論により床を次元d>1の正規化SGDに拡張し、運動量や重み付き雑音に対するロバスト性を確立する。
シミュレーションにより全ての予測が確定し、直接測定された勾配雑音を用いた実分類課題におけるノイズ-レジームの診断結果を示す。
このメカニズムは冷却が有効かどうかを説明しており、スケールで使用される内部の冷却率は静止した風景とノイズの幾何学外にある。
関連論文リスト
- Curvature-Weighted Gradient Diversity: A Noise Measure for Geometry-Adaptive SGD Schedules [1.1602089225841632]
ヘッセンの逆平方根による勾配毎の重み付けを幾何学的に認識した勾配測度である曲率-重み付きダイバーシティ(CWGD)を導入する。
CWGD-Cosineは、標準コサインよりも約20%低い最終最適化誤差を達成する。
これらの結果は、CWGDを最適化ノイズの原理的幾何認識尺度として確立し、より一般的な学習問題への将来の拡張を動機付けている。
論文 参考訳(メタデータ) (2026-06-29T15:22:32Z) - On the Learning Dynamics of Two-layer Linear Networks with Label Noise SGD [93.70725920710208]
ラベル雑音による勾配降下の学習力学について検討する。
遅延からリッチな体制への移行を駆動する上で,ラベルノイズが重要な役割を担っていることを強調する。
これらの知見をSAM(Sharpness-Aware Minimization)に拡張し、ラベルノイズSGDを規定する原理がより広範な最適化アルゴリズムにも適用可能であることを示す。
論文 参考訳(メタデータ) (2026-03-11T04:26:54Z) - Designing Preconditioners for SGD: Local Conditioning, Noise Floors, and Basin Stability [38.75338802679837]
SGD(Gradient Descent)は、異方性曲率と勾配雑音により訓練後期に遅くなることが多い。
対称正行列$mathbfM$により誘導される幾何学におけるSGDを解析し、収束率とノイズフロアの両方が$mathbfM$依存量でバウンドされる境界を導出する。
診断と3つのSciMLベンチマークの実験は、予測フロアの挙動を検証する。
論文 参考訳(メタデータ) (2025-11-24T21:24:40Z) - Accelerated zero-order SGD under high-order smoothness and overparameterized regime [79.85163929026146]
凸最適化問題を解くための新しい勾配のないアルゴリズムを提案する。
このような問題は医学、物理学、機械学習で発生する。
両種類の雑音下で提案アルゴリズムの収束保証を行う。
論文 参考訳(メタデータ) (2024-11-21T10:26:17Z) - Gradient Normalization Provably Benefits Nonconvex SGD under Heavy-Tailed Noise [60.92029979853314]
重み付き雑音下でのグラディエントDescence(SGD)の収束を確実にする上での勾配正規化とクリッピングの役割について検討する。
我々の研究は、重尾雑音下でのSGDの勾配正規化の利点を示す最初の理論的証拠を提供する。
我々は、勾配正規化とクリッピングを取り入れた加速SGD変種を導入し、さらに重み付き雑音下での収束率を高めた。
論文 参考訳(メタデータ) (2024-10-21T22:40:42Z) - Sparse is Enough in Fine-tuning Pre-trained Large Language Models [98.46493578509039]
我々はSparse Increment Fine-Tuning (SIFT) という勾配に基づくスパース微調整アルゴリズムを提案する。
GLUE Benchmark や Instruction-tuning などのタスクで有効性を検証する。
論文 参考訳(メタデータ) (2023-12-19T06:06:30Z) - Latent Class-Conditional Noise Model [54.56899309997246]
本稿では,ベイズ的枠組みの下での雑音遷移をパラメータ化するためのLatent Class-Conditional Noise Model (LCCN)を提案する。
次に、Gibs sampler を用いて遅延真のラベルを効率的に推測できる LCCN の動的ラベル回帰法を導出する。
提案手法は,サンプルのミニバッチから事前の任意チューニングを回避するため,ノイズ遷移の安定な更新を保護している。
論文 参考訳(メタデータ) (2023-02-19T15:24:37Z) - The effective noise of Stochastic Gradient Descent [9.645196221785694]
Gradient Descent (SGD) は、ディープラーニング技術のワークホースアルゴリズムである。
SGDのパラメータと最近導入された変種である永続型SGDをニューラルネットワークモデルで特徴づける。
よりノイズの多いアルゴリズムは、対応する制約満足度問題のより広い決定境界につながる。
論文 参考訳(メタデータ) (2021-12-20T20:46:19Z) - On regularization of gradient descent, layer imbalance and flat minima [9.08659783613403]
我々は、解の平坦性を定義する新しい計量-不均衡-を用いて、ディープ線形ネットワークのトレーニングダイナミクスを解析する。
重み付け減衰や雑音データ増大などの異なる正規化手法も同様に振る舞うことを実証する。
論文 参考訳(メタデータ) (2020-07-18T00:09:14Z) - Shape Matters: Understanding the Implicit Bias of the Noise Covariance [76.54300276636982]
勾配降下のノイズはパラメータ化モデルに対するトレーニングにおいて重要な暗黙の正則化効果をもたらす。
ミニバッチやラベルの摂動によって引き起こされるパラメータ依存ノイズはガウスノイズよりもはるかに効果的であることを示す。
分析の結果,パラメータ依存ノイズは局所最小値に偏りを生じさせるが,球状ガウス雑音は生じないことがわかった。
論文 参考訳(メタデータ) (2020-06-15T18:31:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。