論文の概要: A Method for Layer Bit-Width Allocation in LLM Quantization via Performance Maximization Under a Quality-Degradation Constraint
- arxiv url: http://arxiv.org/abs/2608.28003v1
- Date: Fri, 28 Aug 2026 07:13:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.236031
- Title: A Method for Layer Bit-Width Allocation in LLM Quantization via Performance Maximization Under a Quality-Degradation Constraint
- Title(参考訳): 品質劣化制約下での性能最大化によるLLM量子化におけるビット幅割当の一手法
- Authors: Artem Safronov,
- Abstract要約: 本稿ではGemma-3-1Bの層配置法を提案する。
時間と資源を消費する均一層量子化法とは異なる。
FFN と lm_head の場合、量子化/復号化の時間コストは整数演算によって補償される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper proposes a layer bit allocation method for Gemma-3-1B, formulating the problem as performance maximization (latency decrease) given a degradation budget constraint (allowable level of generation quality loss). This approach is different from time- and resource-consuming uniform layer quantization methods that are used in the literature (like GPTQ or AWQ) or allocation methods without proven performance-accelerating effect (like MixLLM or TorchAO). The layer sensitivity profile resulting from our prior work SA-PTQ is applied using the activation pass-through mode inside TensorRT-LLM. For each layer precision is determined individually in blocks, according to a grouping introduced in the prior step (5+5, 10+10, all26), differentiating the contribution of FFN, Attention, and lm_head to the overall speedup. The clock speed was measured for 13 W8A8 variants on an RTX 5090. We find that for FFN and lm_head the time cost of quantization/dequantization is compensated for by the use of integer arithmetic, while for short context lengths, the opposite holds true for Attention: an additional step of quantization slows execution down. We propose a manual implementation of SmoothQuant for TensorRT-LLM which was necessary due to export failures, unavailable for lm_head. The best solution found under joint consideration of all three criteria with minimal degradation was FFN 5+5 with lm_head, providing an 11.0% reduction in latency with negligible quality loss (98.90% Top-1 agreement, +0.85% perplexity degradation). With acceptable quality loss for FFN all26 + lm_head, a speedup up to 19.1% was found possible. We suggest further optimizations: fused attention kernels in INT8, KV-cache quantization, using FP8 instead of INT8 and partial Attention quantization analogous to FFN.
- Abstract(参考訳): 本稿では, ゲマ3-1Bの層配置法を提案し, 劣化予算制約(生成品質損失の許容レベル)を考慮し, 性能最大化(遅延低減)として問題を定式化する。
このアプローチは、(GPTQやAWQのような)文献や、(MixLLMやTorchAOのような)パフォーマンス加速効果を証明しない割当手法で使われる時間的およびリソース的に消費される均一層量子化手法とは異なる。
従来のSA-PTQによる層感度プロファイルをTensorRT-LLM内のアクティベーションパススルーモードを用いて適用した。
各層精度は、前ステップ(5+5、10+10、all26)で導入されたグループ化に従ってブロック毎に個別に決定され、全体的なスピードアップに対するFFN、注意、lm_headの寄与を微分する。
クロック速度は、RTX 5090で13のW8A8変種で測定された。
FFN と lm_head の場合、量子化/復号化の時間コストは整数演算によって補償されるのに対し、短い文脈長の場合、その逆は注意に当てはまる: 量子化のさらなるステップは実行を遅くする。
本稿では,輸出失敗のために必要であったTensorRT-LLM用のSmoothQuantを手動で実装する。
最小分解率の3つの基準を共同で検討した最良の解は、FFN 5+5とlm_headであり、無視できる品質損失の11.0%の遅延を減少させる(98.90%のTop-1合意、+0.85%のパープレキシティ劣化)。
FFN all26 + lm_headの許容品質低下により、19.1%のスピードアップが可能となった。
我々は、INT8の注意カーネルとKV-cache量子化を融合し、INT8の代わりにFP8を使用し、FFNに類似した部分的注意量子化を提案する。
関連論文リスト
- Robust Residual Finite Scalar Quantization for Neural Compression [46.574899938569125]
有限スカラー量子化(FSQ)は、簡易なトレーニングを提供するが、多段階設定での残留等級劣化に悩まされる。
本稿では,2つの新しい条件付け手法を用いて,この基本的な制限に対処するロバスト残留有限スカラー量子化(RFSQ)を提案する。
RFSQの有効性と一般化性を示す。
論文 参考訳(メタデータ) (2025-08-20T15:18:59Z) - FlexQ: Efficient Post-training INT6 Quantization for LLM Serving via Algorithm-System Co-Design [13.062940916273973]
大規模言語モデル(LLM)は例外的な性能を示すが、かなりのメモリと計算コストを必要とする。
既存のINT4/INT8量子化はこれらのコストを削減するが、しばしば精度を低下させるか、最適効率を欠く。
アルゴリズムの革新とシステムレベルの評価を組み合わせた新しいフレームワークFlexQを提案する。
論文 参考訳(メタデータ) (2025-08-06T12:47:05Z) - FireQ: Fast INT4-FP8 Kernel and RoPE-aware Quantization for LLM Inference Acceleration [1.6127639408026697]
FireQはPTQフレームワークとINT4-FP8行列乗算カーネルである。
FireQは、線形層重みとキー値をINT4に、アクティベーションとクエリをFP8に量子化する。
プリフィル相の3段配管は、プリフィル相における第1トーケンを減少させる。
論文 参考訳(メタデータ) (2025-05-27T07:58:35Z) - KurTail : Kurtosis-based LLM Quantization [51.24081396305435]
KurTailは、大規模言語モデルのアクティベートにおいて、アウトレーヤを緩和する、新しいトレーニング後の量子化スキームである。
MMLUの精度は13.3%向上し、Wikiの難易度はQuaRotに比べて15.5%低下している。
また、SpinQuantを2.6%のMMLUゲインで上回り、パープレキシティを2.9%削減し、トレーニングコストを削減した。
論文 参考訳(メタデータ) (2025-03-03T12:43:06Z) - KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization [67.74400574357472]
LLMは、大きなコンテキストウィンドウを必要とするアプリケーションでの利用が増えており、この大きなコンテキストウィンドウでは、KVキャッシュのアクティベーションが推論時のメモリ消費の主要な要因として表面化している。
量子化はKVキャッシュのアクティベーションを圧縮する上で有望な手法であるが、既存のソリューションは4ビット以下の精度でアクティベーションを正確に表現できない。
我々の研究であるKVQuantは、いくつかの新しい手法を取り入れることで、低精度のKVキャッシュ量子化を容易にする。
論文 参考訳(メタデータ) (2024-01-31T18:58:14Z) - HAWQV3: Dyadic Neural Network Quantization [73.11579145354801]
現在の低精度量子化アルゴリズムは、浮動小数点から量子化された整数値への変換の隠れコストを持つことが多い。
HAWQV3は、新しい混合精度整数のみの量子化フレームワークである。
論文 参考訳(メタデータ) (2020-11-20T23:51:43Z) - AQD: Towards Accurate Fully-Quantized Object Detection [94.06347866374927]
本稿では,浮動小数点演算を除去するために,AQDと呼ばれる高精度な量子化オブジェクト検出ソリューションを提案する。
我々のAQDは、非常に低ビットのスキームの下での完全精度と比較して、同等またはそれ以上の性能を実現しています。
論文 参考訳(メタデータ) (2020-07-14T09:07:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。