論文の概要: Beyond Dense Adam States: Adaptive Log-Space Quantization for Memory-Efficient Optimizers
- arxiv url: http://arxiv.org/abs/2608.22322v2
- Date: Wed, 26 Aug 2026 09:11:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:14.986238
- Title: Beyond Dense Adam States: Adaptive Log-Space Quantization for Memory-Efficient Optimizers
- Title(参考訳): Beyond Dense Adam States: メモリ効率最適化のための適応的なログスペース量子化
- Abstract要約: 低精度状態法は、密度のアダムスタイルの第1および第2モーメントに対して設計・評価される。
我々は、言語モデルの事前学習から、この状態トレースを特徴付ける。
我々は,AdamW,Adafactor,CAME,APOLLOパスの密度,因子,信頼度,投射状態を評価した。
- 参考スコア(独自算出の注目度): 5.020887219109677
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Low-precision optimizer-state methods are commonly designed and evaluated for dense Adam-style first and second moments. Memory-efficient optimizers depart from this setting: Adafactor factorizes second moments, CAME adds factored confidence states, and APOLLO maintains statistics in a projected gradient space. Consequently, an equal amount of state reconstruction error can induce different update errors depending on state topology and update semantics. We first characterize this heterogeneity in optimizer-state traces from language model pre-training. We then introduce Adaptive Log-Space (AL) quantization, a block-wise representation for non-negative states that adapts its nonzero range per block and enforces the exact-zero invariant $q = 0 \Leftrightarrow x = 0$. AL8 and AL16 are combined with independent signed-momentum encodings and state-specific precision choices rather than a single policy for every state. Across 96 runs totaling 214.7 GPU-hours, we evaluate dense, factored, confidence, and projected states in AdamW, Adafactor, CAME, and APOLLO paths. On a 20K-step TinyLlama-1.1B pre-training benchmark, an AdamW configuration with AL8 second moments and uniform 8-bit momentum reaches 72.90 perplexity, compared with 72.48 for FP32 AdamW and 73.54 for an 8-bit dynamic-quantization baseline, while reducing measured optimizer-state storage from 8392.7 to 2119.2 MiB. CAME exposes a different precision regime: promoting its non-negative states to AL16 recovers 86.16 perplexity versus 86.68 for the full-precision reference, whereas all-AL8 reaches 90.19. A 100K-step GPT-2 experiment further shows that topology-aware parameter protection reduces the late-loss gap of quantized Adafactor from +0.1185 to +0.0159 in the evaluated setup. These results support a state- and topology-aware view of optimizer quantization.
- Abstract(参考訳): 低精度オプティマイザ状態法は、密集したアダムスタイルの第1モーメントと第2モーメントに対して一般的に設計・評価されている。
Adafactorは第2モーメントを分解し、CAMEは分解された信頼状態を追加し、APOLLOは投影された勾配空間で統計を維持する。
結果として、同じ量の状態再構成エラーが、状態トポロジや更新セマンティクスによって異なる更新エラーを引き起こす可能性がある。
まず,この不均一性を,言語モデルの事前学習から得られる最適化状態トレースに特徴付ける。
適応対数空間(AL)量子化(Adaptive Log-Space Quantization)は、非負の状態に対するブロックワイドな表現であり、ブロックごとの非ゼロ範囲を適応させ、正確なゼロ不変量である $q = 0 \Leftrightarrow x = 0$ を強制する。
AL8とAL16は、全ての州に対して単一のポリシーではなく、独立した署名されたモメンタムエンコーディングと州固有の精度選択と組み合わせられている。
96を越えると、合計214.7GPU時間で動作し、AdamW、Adafactor、CAME、APOLLOパスの密度、ファクター、信頼状態を評価します。
20KステップのTinyLlama-1.1B事前トレーニングベンチマークでは、AL8秒のモーメントと均一な8ビット運動量を持つAdamW構成が72.90パープレキシティに達するのに対し、FP32のAdamWは72.48で、8ビットの動的量子化ベースラインは73.54であり、測定されたオプティマイザ状態のストレージは8392.7から2119.2 MiBである。
非負の状態をAL16に昇格させると、全精度参照では86.16パープレキシティが86.68に回復し、オールAL8は90.19に回復する。
100K段階のGPT-2実験により、トポロジを意識したパラメータ保護は、評価設定において、量子化されたAdafactorの遅延ロスギャップを+0.1185から+0.0159に減少させることが示された。
これらの結果は、オプティマイザ量子化の状態とトポロジを意識したビューをサポートする。
関連論文リスト
- Binary Quantization For LLMs Through Dynamic Grouping [13.578307208515819]
大規模言語モデル(LLM)は、幅広い自然言語処理(NLP)タスクで顕著なパフォーマンスを示している。
16ビットのBrain Floatから-1,1の1ビットの表現にモデル重みを圧縮するバイナリ量子化は、ストレージと推論コストを大幅に削減する。
本稿では,2値量子化に適した新しい最適化目標と,これを効果的に実現するための3つのアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-09-03T06:36:21Z) - Pushing the Limits of Low-Bit Optimizers: A Focus on EMA Dynamics [64.62231094774211]
ステートフル(例えばアダム)は、最適収束を達成するために、モデルサイズを2倍も補助情報を維持する。
SOLOにより、アダムスタイルは3ビットまたは2ビットの精度で量子化された状態を維持することができる。
したがって、SOLOはAdamスタイルにシームレスに適用でき、精度の低下を最小限に抑えることができる。
論文 参考訳(メタデータ) (2025-05-01T06:47:45Z) - EfficientQAT: Efficient Quantization-Aware Training for Large Language Models [50.525259103219256]
量子化対応トレーニング(QAT)は、低ビット表現によるメモリ消費を最小限の精度で削減することで、ソリューションを提供する。
より有効なQATアルゴリズムであるEfficient QAT(Efficient Quantization-Aware Training)を提案する。
効率的なQATは、全てのパラメータのブロックワイドトレーニング(Block-AP)と量子化パラメータのエンドツーエンドトレーニング(E2E-QP)の2つのフェーズを含む。
論文 参考訳(メタデータ) (2024-07-10T17:53:30Z) - Genetic Quantization-Aware Approximation for Non-Linear Operations in Transformers [26.62171477561166]
非線型関数はトランスフォーマーとその軽量な変種で広く使われており、ハードウェアコストは大幅に過小評価されている。
従来の最先端の作業では、これらの操作を1次線形近似により最適化し、パラメータをルックアップテーブル(LUT)に格納する。
本稿では,量子化認識を用いたパラメータの自動決定が可能な遺伝的LUT近似アルゴリズムGQA-LUTを提案する。
論文 参考訳(メタデータ) (2024-03-28T17:13:47Z) - Quantized Neural Networks for Low-Precision Accumulation with Guaranteed
Overflow Avoidance [68.8204255655161]
本稿では,推定時のアキュムレータの精度を下げる際に,数値オーバーフローを回避する量子化学習アルゴリズムを提案する。
本手法は,浮動小数点点ベースラインに対するモデル精度を維持しつつ,アキュムレータの精度を低減できることを示す。
論文 参考訳(メタデータ) (2023-01-31T02:46:57Z) - LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale [80.86029795281922]
トランスにおけるフィードフォワードおよびアテンションプロジェクション層に対するInt8行列乗算法を開発した。
175Bパラメータ16/32ビットのチェックポイントをロードし、Int8に変換し、直ちに使用することができる。
論文 参考訳(メタデータ) (2022-08-15T17:08:50Z) - 8-bit Optimizers via Block-wise Quantization [57.25800395197516]
ステートフルズは、例えば過去の値の指数的滑らかな和(運動量付きSGD)や2乗和(アダム)など、時間の経過とともに統計を維持している。
この状態は、通常の勾配降下よりも最適化を加速するために使用することができるが、そうでなければモデルパラメータに割り当てられる可能性のあるメモリを使用する。
本稿では,32ビットの勾配状態を用いた場合の性能レベルを維持しながら,8ビット統計を用いた第1次勾配法を開発する。
論文 参考訳(メタデータ) (2021-10-06T15:43:20Z) - Non-Parametric Adaptive Network Pruning [125.4414216272874]
アルゴリズム設計を簡略化するノンパラメトリックモデリングを導入。
顔認識コミュニティに触発されて,メッセージパッシングアルゴリズムを用いて,適応的な例示数を求める。
EPrunerは「重要」フィルタを決定する際にトレーニングデータへの依存を壊します。
論文 参考訳(メタデータ) (2021-01-20T06:18:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。