論文の概要: WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training
- arxiv url: http://arxiv.org/abs/2607.10959v1
- Date: Sun, 12 Jul 2026 23:24:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.287774
- Title: WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training
- Title(参考訳): WSqD:大規模モデルトレーニングのための水平自由学習率スケジュール
- Authors: Jianhao Ma, Yuxin Chen,
- Abstract要約: 最終線形を維持しつつ,WSDの定相を逆2乗根基に置き換える学習率スケジュールであるWSqDを提案する。
経験的に、WSqDは複数のトレーニング地平線をまたいだWSDや他のベースラインを注意深く調整し、1つのピーク学習率を再利用する。
- 参考スコア(独自算出の注目度): 18.733838876040537
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Standard learning rate schedules such as cosine annealing are tied to a fixed training horizon, limiting their ability to accommodate post hoc horizon extension. Warmup-stable-decay (WSD) partially addresses this issue by maintaining a long constant-rate phase before a short linear cooldown, allowing training to resume from a pre-decay checkpoint. However, its peak learning rate is still tuned based on the original training horizon and can become suboptimal when training is extended. Motivated by stochastic convex optimization, we propose WSqD (Warmup with Square-root base and linear Decay), a learning rate schedule that replaces WSD's constant stable phase with a shifted inverse-square-root base while retaining the final linear cooldown. In the stochastic convex setting, WSqD provably attains the minimax-optimal $O(1/\sqrt{T})$ last-iterate convergence rate. Importantly, its base learning rate schedule is horizon-independent, and the training horizon is needed only to determine when to begin the final cooldown. Empirically, on language-model pretraining using the SlimPajama corpus, WSqD matches or outperforms carefully tuned WSD and other baselines across multiple training horizons while reusing a single peak learning rate.
- Abstract(参考訳): cosine annealingのような標準学習率スケジュールは、固定された訓練地平線に結び付けられ、ホック後の地平線拡張に対応する能力を制限する。
Warmup-stable-decay (WSD) はこの問題に部分的に対処し、短い線形冷却前に長い定格フェーズを保ち、事前のチェックポイントからトレーニングを再開することができる。
しかし、そのピーク学習速度は、元のトレーニング地平線に基づいて調整され、トレーニングが拡張されたときに最適以下になる可能性がある。
確率的凸最適化によって動機づけられたWSqD(Warmup with Square-root base and linear Decay)は、最終線形冷却を保ちながら、WSDの定常安定位相を逆2乗根基に置き換える学習率スケジュールである。
確率凸設定では、WSqD は minimax-optimal $O(1/\sqrt{T})$ last-iterate convergence rate を証明可能である。
重要なことは、そのベース学習率のスケジュールは地平線に依存しておらず、トレーニングの地平線は最終冷却開始時期を決定するためにのみ必要である。
経験的に、SlimPajamaコーパスを用いた言語モデル事前トレーニングでは、WSqDのマッチや性能は、複数のトレーニング地平線をまたいだWSDや他のベースラインを注意深く調整し、単一のピーク学習率を再利用する。
関連論文リスト
- Learning to Solve Generative ODEs Beyond the Linear Span [50.13853710831612]
空間残留演算子を用いてスカラー係数更新を増強する軽量ニューラルソルバであるSpanLiftを提案する。
SpanLiftは、ピクセル空間の拡散、潜水流のマッチング、降水は今、最先端の数ステップのサンプリングを実現している。
論文 参考訳(メタデータ) (2026-06-07T15:22:13Z) - TempoFit: Plug-and-Play Layer-Wise Temporal KV Memory for Long-Horizon Vision-Language-Action Manipulation [16.28432866472846]
我々は、状態レベルのメモリを通じて凍結したビジョン・ランゲージ・アクションポリシーをアップグレードする、トレーニング不要の時間的修正であるTempoFitを紹介する。
私たちの重要な洞察は、プレフィックスアテンションK/Vが、すでにモデルネイティブで、コンテンツ順応可能なランタイム状態を形成しています。
LIBERO-LONGでは、TempoFitは、ほぼリアルタイムのレイテンシを維持しながら、最大4.0%の成功率で、トレーニング済みの強いバックボーンを改善している。
論文 参考訳(メタデータ) (2026-03-08T14:17:25Z) - Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging [70.05077723711618]
本研究では, 1-32xChinchillaスケールで学習した言語モデルが時間とともに減衰し, 問題の発生源とキャパシティ条件によって減衰速度が決定されることを示した。
以上の結果から,重み付き平均化と地平線なしのステップサイズを組み合わせることで,大規模言語モデルの事前学習におけるコサイン学習率のスケジュールに代わる実用的で効果的な選択肢が得られることが示唆された。
論文 参考訳(メタデータ) (2026-02-03T16:24:05Z) - Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling [75.36692892951018]
トレーニング中のバッチサイズの増加は、大規模な言語モデルの事前トレーニングを加速するための有望な戦略である。
この研究はバッチサイズスケジューリングのための原則化されたフレームワークを開発する。
標準スケジューラが学習率を半減するたびに、Seesawは1/sqrt2$と倍増し、バッチサイズを倍増します。
論文 参考訳(メタデータ) (2025-10-16T14:17:38Z) - Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective [66.80315289020487]
Warmup-Stable-Decay (WSD) スケジュールは、一定の学習率を使用して、所定の計算予算なしで無限に継続できるイテレーションのメインブランチを生成する。
プレトレーニング損失は,河底に川がある深い谷に類似した河谷景観を呈することを示す。
この理論にインスパイアされたWSD-Sは、従来のチェックポイントの崩壊フェーズを再利用し、メインブランチを1つだけ保持するWSDの変種である。
論文 参考訳(メタデータ) (2024-10-07T16:49:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。