論文の概要: Theory-optimal Quantization Based on Flatness
- arxiv url: http://arxiv.org/abs/2605.18800v1
- Date: Mon, 11 May 2026 10:51:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-20 21:37:32.338769
- Title: Theory-optimal Quantization Based on Flatness
- Title(参考訳): 平坦性に基づく理論最適量子化
- Authors: Xiusheng Huang, Zhe Li, Xuanwu Yin, Lu Wang, Yequan Wang, Dong Li, Emad Barsoum, Kang Liu,
- Abstract要約: 学習後の量子化は、Large Language Models (LLMs) の推論を圧縮し加速する手法として広く採用されている。
LLM量子化における主な課題は、特に低ビット精度でモデル性能を著しく低下させる、外れ値に起因する。
本稿では,2方向対角量子化(BDQ)を提案する。
- 参考スコア(独自算出の注目度): 31.126049393687143
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training quantization has emerged as a widely adopted technique for compressing and accelerating the inference of Large Language Models (LLMs). The primary challenges in LLMs quantization stem from activation outliers, which significantly degrade model performance especially at lower bit precision. While recent approaches attempt to mitigate outliers through linear transformations across feature dimensions, our analysis reveals that the transformed weights and activations still exhibit persistent outlier patterns with concentrated magnitude distributions. In this paper, we first model the mathematical relationship between quantization error and outliers, and then introduce a new metric Flatness to quantify the distribution of outliers. Based on this, we derive the theoretical optimal solution with respect to Flatness. Building on these insights, we propose Bidirectional Diagonal Quantization (BDQ), a novel post-training quantization framework that effectively disperses outlier patterns through optimized matrix transformations. BDQ strategically distributes outlier magnitudes across matrix dimensions via learned diagonal operations. Extensive experiments demonstrate that BDQ establishes a new quantization benchmark. It achieves less than 1\% accuracy drop in W4A4 quantization on the LLaMA-3-8B model. In the more challenging W2A4KV16 experiment, compared to state-of-the-art approaches, BDQ reduces the performance gap by 39.1\% on the DeepSeek-R1-Distill-LLaMA-70B model.
- Abstract(参考訳): 学習後の量子化は、Large Language Models (LLMs) の推論を圧縮し、加速する手法として広く採用されている。
LLMの量子化における主な課題は、特に低ビット精度でモデル性能を著しく低下させるアクティベーション・アウトレイアに起因する。
近年の研究では, 特徴次元の線形変換による外乱の緩和が試みられているが, 解析の結果, 変形した重みとアクティベーションは, 等級分布が集中した持続的な外乱パターンを示すことが明らかとなった。
本稿では,まず量子化誤差と外れ値の関係をモデル化し,次に外れ値の分布を定量化するための新しい計量平坦性を導入する。
これに基づいて、平坦性に関する理論的最適解を導出する。
これらの知見に基づいて、最適化された行列変換によって外部パターンを効果的に分散する新しい学習後量子化フレームワークである双方向対角量子化(BDQ)を提案する。
BDQは、学習された対角線演算により、行列次元にアウトリー等級を戦略的に分配する。
大規模な実験では、BDQが新しい量子化ベンチマークを確立することが示されている。
LLaMA-3-8BモデルにおけるW4A4量子化の精度は1\%以下である。
さらに難しいW2A4KV16実験では、最先端のアプローチと比較して、BDQはDeepSeek-R1-Distill-LLaMA-70Bモデルでパフォーマンスギャップを39.1\%削減した。
関連論文リスト
- RUQuant: Towards Refining Uniform Quantization for Large Language Models [17.258420059228808]
ポストトレーニング量子化(PTQ)は、再トレーニングを必要とせずにモデルを圧縮することで、実用的なソリューションとして登場した。
既存の方法は、アクティベーション分布の非一様性により、かなりの精度の劣化に悩まされることが多い。
本研究では,ロイド-マックス最適条件に基づく理論的な観点から,活性化量子化問題を再考する。
論文 参考訳(メタデータ) (2026-04-05T08:04:39Z) - RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models [53.571195477043496]
本稿では,RoSTE (Rotated Straight-Through-Estimator) というアルゴリズムを提案する。
RoSTEは、量子化を意識した微調整(QA-SFT)と適応的な回転戦略を組み合わせることで、アクティベーションアウトリーを減少させる。
その結果, 予測誤差は収束重みの量子化誤差と直接比例し, 最適化された回転構成により効果的に管理できることが判明した。
論文 参考訳(メタデータ) (2025-02-13T06:44:33Z) - Pushing the Limits of Large Language Model Quantization via the Linearity Theorem [71.3332971315821]
本稿では,階層的$ell$再構成誤差と量子化によるモデルパープレキシティ増加との直接的な関係を確立する「線形定理」を提案する。
この知見は,(1)アダマール回転とHIGGSと呼ばれるMSE最適格子を用いた単純なデータフリーLCM量子化法,(2)非一様層ごとの量子化レベルを求める問題に対する最適解の2つの新しい応用を可能にする。
論文 参考訳(メタデータ) (2024-11-26T15:35:44Z) - FlatQuant: Flatness Matters for LLM Quantization [58.28221892035609]
重みとアクティベーションの平坦性を高める新しいポストトレーニング量子化手法であるFlatQuantを提案する。
本手法では, 線形層毎の最適アフィン変換を, 軽量な目的により数時間で調整する。
LLaMA-3-70BモデルでのW4A4量子化の精度は1%以下で、SpinQuantを7.5%上回る。
論文 参考訳(メタデータ) (2024-10-12T08:10:28Z) - BiSup: Bidirectional Quantization Error Suppression for Large Language Models [13.042992673384466]
本稿では,双方向量子化誤差抑圧法であるBiSupを紹介する。
BiSupは2つの最先端手法で性能を向上できることを示す。
論文 参考訳(メタデータ) (2024-05-24T08:39:27Z) - CBQ: Cross-Block Quantization for Large Language Models [66.82132832702895]
ポストトレーニング量子化(PTQ)は、超低コストで大規模言語モデル(LLM)を圧縮する上で重要な役割を果たしている。
LLMのためのクロスブロック再構成に基づくPTQ手法CBQを提案する。
CBQはリコンストラクションスキームを使用してクロスブロック依存関係を採用し、エラーの蓄積を最小限に抑えるために複数のブロックにまたがる長距離依存関係を確立する。
論文 参考訳(メタデータ) (2023-12-13T07:56:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。