論文の概要: AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization
- arxiv url: http://arxiv.org/abs/2605.08692v1
- Date: Sat, 09 May 2026 04:59:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.818146
- Title: AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization
- Title(参考訳): AAAC: 4ビットLLM重み量子化のためのアクティベーション対応コードブック
- Abstract要約: トレーニング後の4ビットへの重みのみの量子化は、大規模言語モデル推論のメモリと計算コストの削減に広く用いられている。
4ビットLLM重み量子化のための軽量なAAAC(Activation-Aware Adaptive Codebooks)を提案する。
AWQ, GPTQ, IF4, GPTVQ, OmniQuant, SqueezeLLM, QuIP#をモデルファミリー間で評価した。
- 参考スコア(独自算出の注目度): 2.9721401411878254
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training weight-only quantization to 4 bits is widely used to reduce the memory and compute costs of large language model inference. Existing PTQ methods, such as AWQ and GPTQ, improve how weights are mapped onto a fixed 4-bit grid through scaling, clipping, or error compensation. To further improve accuracy, methods such as OmniQuant and QuIP\# uses gradient-assisted algorithms at the cost of hours of quantization time. In this work, we propose AAAC (Activation-Aware Adaptive Codebooks), a lightweight method for 4-bit LLM weight quantization. AAAC replaces the fixed scalar codebook used in standard quantization with two small learned scalar codebooks (64 bytes) per layer. Each group of weights selects the codebook that minimizes activation-weighted reconstruction error, encoding the choice in the unused sign bit of the group's positive scale and adding zero storage overhead. AAAC completes in 3--30 minutes on a single GPU, and adds no memory beyond the model itself. We evaluate against AWQ, GPTQ, IF4, GPTVQ, OmniQuant, SqueezeLLM, and QuIP\# across model families. AAAC outperforms baselines at orders-of-magnitude less quantization time.
- Abstract(参考訳): トレーニング後の4ビットへの重みのみの量子化は、大規模言語モデル推論のメモリと計算コストの削減に広く用いられている。
AWQやGPTQといった既存のPTQ手法は、スケーリング、クリップング、エラー補償によって、固定された4ビットグリッドに重みがマッピングされる方法を改善する。
精度をさらに向上するために、OmniQuantやQuIP\#のようなメソッドは、量子化時間に何時間も費やして勾配支援アルゴリズムを使用する。
本研究では、4ビットLLM重み量子化のための軽量な方法であるAAAC(Activation-Aware Adaptive Codebooks)を提案する。
AAACは標準量子化で使用される固定スカラーコードブックを2つの小さな学習スカラーコードブック(64バイト)に置き換える。
各重みのグループは、アクティベーション重み付けされた再構成エラーを最小限に抑えるコードブックを選択し、その選択をグループの正のスケールの未使用の符号ビットにエンコードし、ストレージオーバーヘッドをゼロにする。
AAACは1つのGPU上で3~30分で完了する。
AWQ, GPTQ, IF4, GPTVQ, OmniQuant, SqueezeLLM, QuIP\#をモデルファミリー間で評価した。
AAACは、量子化の時間が少ないオーダー・オブ・マグニチュードでベースラインを上回ります。
関連論文リスト
- ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models [19.81248151945835]
後学習量子化(PTQ)は、大規模言語モデル(LLM)を圧縮するための主要なアプローチである。
本稿では,レイヤワイド量子化問題を考慮した新しい重み量子化アルゴリズムADMM-Qを提案する。
我々のアルゴリズムは、乗算器の交互方向法(ADMM)の変種に基づく。
論文 参考訳(メタデータ) (2026-05-11T20:33:41Z) - Learning Grouped Lattice Vector Quantizers for Low-Bit LLM Compression [57.54335545892155]
本稿では,各重みの群に独自の格子コードブックを割り当てるGLVQ(Grouped Lattice Vector Quantization)フレームワークを紹介する。
提案手法は,既存のトレーニング後の量子化ベースラインと比較して,モデルサイズと精度のトレードオフが良好である。
論文 参考訳(メタデータ) (2025-10-23T20:19:48Z) - CCQ: Convolutional Code for Extreme Low-bit Quantization in LLMs [25.32003624625106]
畳み込み符号量子化(英: Convolutional Code Quantization、CCQ)は、大言語モデルを2.0-2.75ビットに圧縮する推論最適化量子化手法である。
コードブックと重みの線形マッピングが可能なルックアップフリーな符号化空間を構築する。
CCQ は様々なベンチマークにおいて LLM 上で優れた性能を発揮することを示す実験である。
論文 参考訳(メタデータ) (2025-07-09T06:04:14Z) - Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design [34.04231165571518]
投機的復号化と量子化は、大きな言語モデルのメモリバウンド推論を効果的に加速する。
量子化は、重みとアクティベーションを低ビット幅に圧縮することでこれを達成し、低ビット行列乗算による計算を減らす。
実験により、4ビットの重み量子化によるメモリの利点は、投機的復号化による計算負荷によって減少することが示された。
論文 参考訳(メタデータ) (2025-05-28T09:55:08Z) - BCQ: Block Clustered Quantization for 4-bit (W4A4) LLM Inference [8.136601122570347]
後学習量子化(PTQ)は、より大きな言語モデル(LLM)のストレージと計算要求を、追加のトレーニングコストなしで削減するための有望なアプローチである。
最近のPTQ研究は、主に8ビット以上の活性化を維持しながら、重量のみを8ビット未満に定量化することに焦点を当てている。
論文 参考訳(メタデータ) (2025-02-07T23:06:03Z) - FlatQuant: Flatness Matters for LLM Quantization [58.28221892035609]
重みとアクティベーションの平坦性を高める新しいポストトレーニング量子化手法であるFlatQuantを提案する。
本手法では, 線形層毎の最適アフィン変換を, 軽量な目的により数時間で調整する。
LLaMA-3-70BモデルでのW4A4量子化の精度は1%以下で、SpinQuantを7.5%上回る。
論文 参考訳(メタデータ) (2024-10-12T08:10:28Z) - GPTQT: Quantize Large Language Models Twice to Push the Efficiency [1.3149617027696827]
本稿では,学習後量子化手法であるGPTQTを導入し,メモリ使用量の削減と処理速度の向上を図る。
重みの量子化誤差の最小化は非効率であり、過度に適合することを示した。
GPTQTは、最初は線形量子化を用いて重みを相対的に高いビットに量子化し、続いて得られた重みを低ビットバイナリ符号化に変換する。
論文 参考訳(メタデータ) (2024-07-03T08:08:01Z) - QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving [52.31791050376249]
量子化は大規模言語モデル(LLM)の推論を加速させる。
4ビット重み、8ビットアクティベーション、4ビットKVキャッシュを備えたW4A8KV4量子化アルゴリズムQoQを導入する。
QServeは、Llama-3-8BをA100で1.2倍、L40Sで1.4倍、Qwen-721.5BをA100で2.4倍、L40Sで3.5倍、達成可能な最大機能を改善する。
論文 参考訳(メタデータ) (2024-05-07T17:59:30Z) - QUIK: Towards End-to-End 4-Bit Inference on Generative Large Language
Models [57.04178959678024]
重み付けとアクティベーションの両方を4ビットにキャストすることで、大きな生成モデルに対する推論計算の大部分が実行可能であることを示す。
これをQUIKと呼ばれるハイブリッド量子化戦略により実現し、重みとアクティベーションの大部分を4ビットに圧縮する。
我々は、QUIKフォーマットを高効率なレイヤワイドランタイムに適合させるGPUカーネルを提供し、これにより、エンドツーエンドのスループットが3.4倍に向上する。
論文 参考訳(メタデータ) (2023-10-13T17:15:05Z) - OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models [57.27101446992148]
大規模言語モデル(LLM)は自然言語処理タスクに革命をもたらした。
近年のPTQ法はメモリフットプリントの削減とLLMの計算効率の向上に有効である。
多様な量子化設定において優れた性能を実現するLLMのOmnidirectly calibrated Quantization手法を提案する。
論文 参考訳(メタデータ) (2023-08-25T02:28:35Z) - SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight
Compression [76.73007709690306]
Sparse-Quantized Representation (SpQR) は,新しい圧縮フォーマットと量子化技術である。
SpQRは、高精度なLLaMAとFalcon LLMのパープレキシティにおいて、1%未満の相対的精度の損失を達成している。
これにより、1台の24GBのコンシューマGPU上で33BパラメータのLSMを実行でき、15%のスピードアップでパフォーマンスの劣化は発生しない。
論文 参考訳(メタデータ) (2023-06-05T17:53:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。