論文の概要: M+Adam: Low-Precision Training via Additive-Multiplicative Optimization
- arxiv url: http://arxiv.org/abs/2607.10611v2
- Date: Tue, 14 Jul 2026 19:27:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 12:21:59.351172
- Title: M+Adam: Low-Precision Training via Additive-Multiplicative Optimization
- Title(参考訳): M+Adam: 付加多重最適化による低精度トレーニング
- Abstract要約: 量子化された重量のトレーニングはコストを削減できるが、しばしば精度が低下する。
本稿では,2つの更新タイプを組み合わせたM+Adamを提案する。
60M-1Bのモデルと1x-8xのチンチラ、BF16、FP8、FP4のマスターウェイトを使用したLLaMA型プレトレーニングでは、M+アダムは一貫して低精度トレーニングを改善している。
- 参考スコア(独自算出の注目度): 69.5989114185868
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training with quantized weights can reduce costs but often results in degraded accuracy, especially when optimization is carried out in low precision, without storing high-precision copies. We identify a key failure mode: under low precision, standard optimizers can get stuck and not make progress, especially at large weight magnitudes due to coarse mantissa resolution. To overcome this, multiplicative updates have been previously proposed, in place of additive updates in standard optimizers. While successful under extremely low precision, such as under the logarithmic number system, they suffer from failures near zero and across sign changes. The failure modes of additive and multiplicative updates are therefore complementary. To exploit this, we propose M+Adam, which combines both update types: additive steps handle sign changes and small magnitudes, while multiplicative steps ensure progress at large magnitudes when additive updates are zeroed out under rounding. We prove monotone descent for M+Adam under standard smoothness assumptions. Across LLaMA-style pretraining with 60M-1B models, 1x-8x Chinchilla budgets, and using only BF16, FP8, and FP4 master weights, M+Adam consistently improves low-precision training.
- Abstract(参考訳): 量子化された重量のトレーニングはコストを削減できるが、特に高い精度のコピーを格納することなく、低い精度で最適化を行う場合、しばしば精度が低下する。
低精度では、標準オプティマイザは立ち往生し、特に粗いマンティサ分解能によって大きな重量で進行しない。
これを解決するために、標準オプティマイザの付加的な更新の代わりに、乗法的更新がこれまで提案されていた。
対数数系のような極めて低い精度で成功するが、ゼロに近い故障や符号の変化に悩まされる。
したがって、加法的および乗法的更新の失敗モードは相補的である。
加算ステップは手形の変更や小ささを処理し、乗算ステップはラウンドアウト時に加算更新がゼロとなる場合、大規模に進行を保証します。
標準的な滑らか性仮定の下で, M+Adam のモノトン降下を証明した。
60M-1Bのモデルと1x-8xのチンチラ、BF16、FP8、FP4のマスターウェイトを使用したLLaMA型プレトレーニングでは、M+アダムは一貫して低精度トレーニングを改善している。
関連論文リスト
- ECO: Quantized Training without Full-Precision Master Weights [58.97082407934466]
Error-Compensating (ECO)は、量子化されたパラメータに直接更新を適用することで、マスターウェイトを除去する。
ECO は最適値の定数半径近傍に収束するが、素早いマスターウェイト除去は学習率に逆比例する誤差を生じさせる。
論文 参考訳(メタデータ) (2026-01-29T18:35:01Z) - Pushing the Limits of Low-Bit Optimizers: A Focus on EMA Dynamics [64.62231094774211]
ステートフル(例えばアダム)は、最適収束を達成するために、モデルサイズを2倍も補助情報を維持する。
SOLOにより、アダムスタイルは3ビットまたは2ビットの精度で量子化された状態を維持することができる。
したがって、SOLOはAdamスタイルにシームレスに適用でき、精度の低下を最小限に抑えることができる。
論文 参考訳(メタデータ) (2025-05-01T06:47:45Z) - QuZO: Quantized Zeroth-Order Fine-Tuning for Large Language Models [27.730213115659986]
言語モデル(LLM)はしばしば、推論におけるメモリコストとレイテンシを低減するために、精度を下げるために量子化される。
従来の微調整手法ではバックプロパゲーションが必要であり、低精度設定ではエラーが発生しやすい。
本稿では,低精度フォワードパスを用いた微調整LDMのための量子ゼロオーダー(Quantized Zeroth-Order)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-17T22:20:31Z) - HALO: Hadamard-Assisted Lower-Precision Optimization for LLMs [48.55966021231297]
本稿では,トランスフォーマーのための新しい量子化学習手法HALOを提案する。
提案手法により, 前方・後方パスにおける行列乗算の精度が低くなることが保証される。
LLAMAファミリーモデルに適用すると、HALOは様々なタスクの微調整中にほぼ完全精度に等しい結果が得られる。
論文 参考訳(メタデータ) (2025-01-05T18:41:54Z) - AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning [143.23123791557245]
下流タスクで訓練済みの大規模言語モデルを微調整することは、NLPにおいて重要なパラダイムとなっている。
重み行列のパラメータ予算をその重要度に応じて適応的に割り当てるAdaLoRAを提案する。
我々は,AdaLoRAの有効性を検証するために,自然言語処理,質問応答,自然言語生成に関する事前学習モデルを用いた広範囲な実験を行った。
論文 参考訳(メタデータ) (2023-03-18T22:36:25Z) - AdamP: Slowing Down the Slowdown for Momentum Optimizers on
Scale-invariant Weights [53.8489656709356]
正規化技術は現代の深層学習の恩恵である。
しかし、運動量を導入することで、スケール不変の重みに対する効果的なステップサイズが急速に小さくなることがしばしば見過ごされる。
本稿では,この2つの材料の組み合わせが,有効ステップサイズと準最適モデル性能の早期劣化につながることを検証した。
論文 参考訳(メタデータ) (2020-06-15T08:35:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。