論文の概要: Optimizer Memory Schedules for Outscaling the Overtraining Axis
- arxiv url: http://arxiv.org/abs/2609.04577v1
- Date: Fri, 04 Sep 2026 00:15:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.866512
- Title: Optimizer Memory Schedules for Outscaling the Overtraining Axis
- Title(参考訳): オーバートレーニング軸のアウトスケーリングのための最適化メモリスケジューリング
- Authors: Katie Everett, Shikai Qiu,
- Abstract要約: 本稿では,AdamW に対する行列式法 (Muon と SOAP) と運動量スケジューリング法 (ADANA) のスケールについて検討する。
51M から 253M のパラメータと 1x から 256x のオーバートレーニング (OT) 因子を比較検討した。
これらの結果は,評価と設計に欠かせない軸として,トレーニングの地平線を定めている。
- 参考スコア(独自算出の注目度): 6.472871541511473
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We investigate how optimizers scale across the overtraining axis and show that relative optimizer performance and optimal hyperparameters change substantially with training horizon. In particular, we study how matrix-preconditioned methods (Muon and SOAP) and a momentum-scheduled method (ADANA) scale relative to AdamW. We compare these four optimizers across models from 51M to 253M parameters and overtraining (OT) factors from 1x to 256x, sweeping the base learning rate at every setting. The preferred learning rate schedule can reverse across the overtraining axis, the best weight decay coefficient scales approximately as sqrt(OT), and longer horizons generally favor longer fixed memory. ADANA's scaling advantage over AdamW persists after tuning AdamW's fixed memory separately at each horizon. Log-time weight decay and momentum cooldown provide substantial gains for ADANA that compound as training increases. With this treatment, ADANA outscales AdamW with an exponent advantage close to that predicted by DANA theory on power-law random features. Muon and SOAP instead provide roughly constant token-efficiency advantages over AdamW across most of the measured range, although SOAP may gain further at the highest overtraining factors. ADANA begins behind both matrix-preconditioned optimizers but closes the gaps as training increases, surpassing Muon and becoming competitive with SOAP at our highest OT factors. These results establish training horizon as an essential axis for optimizer evaluation and design.
- Abstract(参考訳): オーバートレーニング軸をまたぐオプティマイザのスケーリングについて検討し,トレーニング地平線とともに相対オプティマイザ性能と最適ハイパーパラメータが大きく変化することを示す。
特に,行列プレコンディショニング法 (Muon と SOAP) と運動量スケジューリング法 (ADANA) のAdamWとの比較について検討した。
これら4つのオプティマイザを51Mから253Mパラメータのモデルと1xから256xまでのオーバートレーニング(OT)要素で比較し,各設定におけるベース学習率を概観した。
好まれる学習速度スケジュールは、オーバートレーニング軸を横切ることができ、ベストウェイト崩壊係数は、ほぼsqrt(OT)としてスケールし、より長い水平線は一般的により長い固定メモリを好む。
アダナのAdamWに対するスケーリングの優位性は、各水平線でAdamWの固定メモリを個別に調整した後も持続する。
ログタイムの重量減少と運動量冷却は、トレーニングが増加するにつれて、ADANAにかなりの利益をもたらす。
この処理により、ADANAはAdamWをDANA理論が予測したパワー-ローランダムな特徴に近い指数的優位性でスケールする。
代わりに、MuonとSOAPは、測定範囲の大部分にわたってAdamWに対して、ほぼ一定のトークン効率の利点を提供します。
ADANAは、マトリックスプレコンディショニングされた両方のオプティマイザの後ろから始まりますが、トレーニングの増加に伴ってギャップを埋めます。
これらの結果は, 最適設計に不可欠な軸として, トレーニング地平線を定めている。
関連論文リスト
- SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales [48.03325171473355]
Muon や SOAP のような高次の LLM は、AdamW よりも高速な収束を提供するが、計算コストと数値安定性の課題は、大規模に採用されることが限られている。
我々は,大規模LLM事前訓練体制の実践的課題を克服するために,事前条件付き手法を適応し,強化する。
論文 参考訳(メタデータ) (2026-07-13T21:47:08Z) - Logarithmic-time Schedules for Scaling Language Models with Momentum [26.126146726481764]
言語データのゆるい構造を利用することで、大幅な性能向上をもたらす時間変化スケジュールを設計できることが示される。
我々は、AdamW風のスケジュールで、ログタイムスケジュールと、安定性とパフォーマンスのバランスをとるために明確な減衰とを結合するADANAを提示する。
さらに、AdEMAMixに対数時間スケジューリングを適用する際にも同様の利点が生じることを示し、対数時間ウェイトデカイだけでは大幅な改善が期待できることを示した。
論文 参考訳(メタデータ) (2026-02-05T04:42:27Z) - Hyperparameter Transfer Enables Consistent Gains of Matrix-Preconditioned Optimizers Across Scales [55.91454326946738]
学習速度と減量率の最適化は,幅広い言語に対して,モデルの幅と深さでどのようにスケールするかを検討する。
我々は、$Pによる学習率のスケーリングは転送を改善するが、それでもかなりの有限幅偏差に悩まされる可能性があることを見出した。
計算-最適スケーリングでは、独立したウェイト崩壊が1/mathrmwidth$で言語間でほぼ最適であることが分かる。
論文 参考訳(メタデータ) (2025-12-05T11:03:41Z) - Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling [75.36692892951018]
トレーニング中のバッチサイズの増加は、大規模な言語モデルの事前トレーニングを加速するための有望な戦略である。
この研究はバッチサイズスケジューリングのための原則化されたフレームワークを開発する。
標準スケジューラが学習率を半減するたびに、Seesawは1/sqrt2$と倍増し、バッチサイズを倍増します。
論文 参考訳(メタデータ) (2025-10-16T14:17:38Z) - APOLLO: SGD-like Memory, AdamW-level Performance [61.53444035835778]
大規模言語モデル(LLM)は、トレーニング中にメモリ集約的であることで知られている。
メモリ使用量を減らすために、様々なメモリ効率のScalが提案されている。
i)コストのかかるSVDオペレーション、(ii)AdamWと比較して大きなパフォーマンストレードオフ、(iii)競争性能を維持する上でのメモリオーバーヘッド、などです。
論文 参考訳(メタデータ) (2024-12-06T18:55:34Z) - AutoScale: Scale-Aware Data Mixing for Pre-Training LLMs [59.12061830645018]
より小さなスケールで良好に機能するデータ混合物は、大規模なスケールではその利点を保たない可能性があることを示す。
2段階のスケール対応データ合成フレームワークであるAutoScaleを提案する。
論文 参考訳(メタデータ) (2024-07-29T17:06:30Z) - Surge Phenomenon in Optimal Learning Rate and Batch Size Scaling [27.058009599819012]
本稿では,Adamスタイルにおける最適学習率とバッチサイズとの関係について検討する。
最適学習率が最初に上昇し、バッチサイズが大きくなるにつれて低下することを示す。
論文 参考訳(メタデータ) (2024-05-23T13:52:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。