論文の概要: Beyond Dense Adam States: Adaptive Log-Space Quantization for Memory-Efficient Optimizers
- arxiv url: http://arxiv.org/abs/2608.22322v3
- Date: Tue, 01 Sep 2026 09:55:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.420905
- Title: Beyond Dense Adam States: Adaptive Log-Space Quantization for Memory-Efficient Optimizers
- Title(参考訳): Beyond Dense Adam States: メモリ効率最適化のための適応的なログスペース量子化
- Authors: Yan Wang,
- Abstract要約: 我々は、状態量子化を表現、トポロジ、更新セマンティクスに関する共同問題として定式化する。
制御されたプローブは、適応範囲が更新エラーと時間的ドリフトを減らすことを示している。
エンドツーエンドの言語モデルトレーニングは、密度、因子、信頼性、予測された状態にわたる結果のポリシーを評価する。
- 参考スコア(独自算出の注目度): 5.020887219109677
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Optimizer-state quantization is commonly designed for Adam's dense, parameter-aligned first- and second-moment arrays. This abstraction breaks for memory-efficient optimizers, whose states may be factored, confidence-modulated, or maintained in a projected space, so similar reconstruction error can produce different update error. We formulate optimizer-state quantization as a joint problem over representation, topology, and update semantics. We then introduce Adaptive Log-Space (AL) quantization for non-negative states. AL fits each block's observed nonzero logarithmic interval and reserves a separate code for exact zero, enforcing $q = 0 \Leftrightarrow x = 0$; signed momentum and state precision remain independently selectable. Controlled probes show that adaptive ranges reduce update error and temporal drift, exact-zero reservation preserves dormant states, and state topology constrains useful block granularity. End-to-end language-model training evaluates the resulting policy across dense, factored, confidence, and projected optimizer states. On TinyLlama-1.1B, AL8 with uniform 8-bit momentum reaches 72.90 perplexity versus 73.54 for bitsandbytes 8-bit AdamW, with comparable optimizer-state storage and higher throughput. CAME matches reference-level final perplexity across three seeds when its non-negative states use AL16, while a semantic grouping-and-protection policy closes most of quantized Adafactor's 100K-step late-loss gap. These results make state topology and update semantics first-class design constraints for optimizer quantization.
- Abstract(参考訳): 最適化状態量子化(Optimizer-state Quantization)は、アダムの高密度なパラメータ整列の第1および第2モーメントアレイのために一般的に設計されている。
この抽象化はメモリ効率の良いオプティマイザを分解し、状態は予測された空間でファクタリング、信頼性変調、維持される可能性があるため、同様の再構成エラーは異なる更新エラーを発生させることができる。
我々は、表現、トポロジ、更新セマンティクスに関する共同問題として、最適化状態量子化を定式化する。
非負の状態に対して適応ログ空間(AL)量子化を導入する。
ALは各ブロックの観測された非ゼロ対数間隔に適合し、正確なゼロに対して別個の符号を保ち、$q = 0 \Leftrightarrow x = 0$; 符号付き運動量と状態精度は独立に選択可能である。
制御されたプローブは、適応範囲が更新エラーと時間的ドリフトを減少させ、正確なゼロ予約は休息状態を保存することを示し、状態トポロジーはブロックの粒度に有用な制約を与える。
エンドツーエンドの言語モデルトレーニングは、密集、ファクター、信頼、予測されたオプティマイザ状態にわたる結果のポリシーを評価する。
TinyLlama-1.1Bでは、均一な8ビットの運動量を持つAL8は72.90パープレキシティに達し、ビット/バイトの8ビットのAdamWは73.54となった。
CAMEは、非負の状態がAL16を使用するときの基準レベルの最終パープレキシティと一致し、セマンティックグルーピング・アンド・プロテクションポリシーは、量子化されたAdafactorの100K段階の遅延ロスギャップの大部分を閉じる。
これらの結果により、状態トポロジと更新セマンティクスが最適化量子化のための第一級設計制約となる。
関連論文リスト
- Binary Quantization For LLMs Through Dynamic Grouping [13.578307208515819]
大規模言語モデル(LLM)は、幅広い自然言語処理(NLP)タスクで顕著なパフォーマンスを示している。
16ビットのBrain Floatから-1,1の1ビットの表現にモデル重みを圧縮するバイナリ量子化は、ストレージと推論コストを大幅に削減する。
本稿では,2値量子化に適した新しい最適化目標と,これを効果的に実現するための3つのアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-09-03T06:36:21Z) - Pushing the Limits of Low-Bit Optimizers: A Focus on EMA Dynamics [64.62231094774211]
ステートフル(例えばアダム)は、最適収束を達成するために、モデルサイズを2倍も補助情報を維持する。
SOLOにより、アダムスタイルは3ビットまたは2ビットの精度で量子化された状態を維持することができる。
したがって、SOLOはAdamスタイルにシームレスに適用でき、精度の低下を最小限に抑えることができる。
論文 参考訳(メタデータ) (2025-05-01T06:47:45Z) - EfficientQAT: Efficient Quantization-Aware Training for Large Language Models [50.525259103219256]
量子化対応トレーニング(QAT)は、低ビット表現によるメモリ消費を最小限の精度で削減することで、ソリューションを提供する。
より有効なQATアルゴリズムであるEfficient QAT(Efficient Quantization-Aware Training)を提案する。
効率的なQATは、全てのパラメータのブロックワイドトレーニング(Block-AP)と量子化パラメータのエンドツーエンドトレーニング(E2E-QP)の2つのフェーズを含む。
論文 参考訳(メタデータ) (2024-07-10T17:53:30Z) - Genetic Quantization-Aware Approximation for Non-Linear Operations in Transformers [26.62171477561166]
非線型関数はトランスフォーマーとその軽量な変種で広く使われており、ハードウェアコストは大幅に過小評価されている。
従来の最先端の作業では、これらの操作を1次線形近似により最適化し、パラメータをルックアップテーブル(LUT)に格納する。
本稿では,量子化認識を用いたパラメータの自動決定が可能な遺伝的LUT近似アルゴリズムGQA-LUTを提案する。
論文 参考訳(メタデータ) (2024-03-28T17:13:47Z) - Quantized Neural Networks for Low-Precision Accumulation with Guaranteed
Overflow Avoidance [68.8204255655161]
本稿では,推定時のアキュムレータの精度を下げる際に,数値オーバーフローを回避する量子化学習アルゴリズムを提案する。
本手法は,浮動小数点点ベースラインに対するモデル精度を維持しつつ,アキュムレータの精度を低減できることを示す。
論文 参考訳(メタデータ) (2023-01-31T02:46:57Z) - LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale [80.86029795281922]
トランスにおけるフィードフォワードおよびアテンションプロジェクション層に対するInt8行列乗算法を開発した。
175Bパラメータ16/32ビットのチェックポイントをロードし、Int8に変換し、直ちに使用することができる。
論文 参考訳(メタデータ) (2022-08-15T17:08:50Z) - 8-bit Optimizers via Block-wise Quantization [57.25800395197516]
ステートフルズは、例えば過去の値の指数的滑らかな和(運動量付きSGD)や2乗和(アダム)など、時間の経過とともに統計を維持している。
この状態は、通常の勾配降下よりも最適化を加速するために使用することができるが、そうでなければモデルパラメータに割り当てられる可能性のあるメモリを使用する。
本稿では,32ビットの勾配状態を用いた場合の性能レベルを維持しながら,8ビット統計を用いた第1次勾配法を開発する。
論文 参考訳(メタデータ) (2021-10-06T15:43:20Z) - Non-Parametric Adaptive Network Pruning [125.4414216272874]
アルゴリズム設計を簡略化するノンパラメトリックモデリングを導入。
顔認識コミュニティに触発されて,メッセージパッシングアルゴリズムを用いて,適応的な例示数を求める。
EPrunerは「重要」フィルタを決定する際にトレーニングデータへの依存を壊します。
論文 参考訳(メタデータ) (2021-01-20T06:18:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。