論文の概要: MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference
- arxiv url: http://arxiv.org/abs/2607.17733v1
- Date: Mon, 20 Jul 2026 09:23:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.573574
- Title: MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference
- Title(参考訳): MXSens:効率的なLCM推論のための感度・認識混合精度量子化
- Abstract要約: MXSensは,カラムとレイヤの感度に基づいて混合マンチサビット幅を割り当てる訓練不要な手法である。
MXSensは、それぞれLLaMA-2-70BとLLaMA-3-8Bの3.77と7.63の難易度を実現し、WikiText-2の既存のベースラインを大幅に改善した。
- 参考スコア(独自算出の注目度): 36.01709922688871
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: 4-bit quantization enables efficient LLM inference, but suffers from significant accuracy degradation due to outliers. Prior work addresses this problem via data rotation or mixed-precision integer quantization, but often relies on software-managed scaling and frequent dequantization, incurring substantial overhead. Microscaling formats, such as MXINT, eliminate these inefficiencies by encoding scales in hardware, yet remain incompatible with rotation-based methods. Our analysis reveals that outliers vary in severity, from rare extremes to frequent mild deviations, and that quantization sensitivity is unevenly distributed across layers and columns. These insights motivate a fine-grained, sensitivity-guided approach. We introduce MXSens, a training-free method that assigns mixed mantissa bitwidths (4/6/8) based on column- and layer-wise sensitivity, naturally leveraging the block-wise structure of MXINT. MXSens outperforms state-of-the-art quantization methods across a range of models and tasks. Under the W4A4KV4 setting, MXSens achieves perplexities of 3.77 and 7.63 on LLaMA-2-70B and LLaMA-3-8B, respectively, substantially improving over existing baselines on WikiText-2. Our work establishes a new balance between accuracy and resource efficiency for LLM quantization.
- Abstract(参考訳): 4ビット量子化は、効率的なLLM推論を可能にするが、外れ値による大幅な精度劣化に悩まされる。
以前の作業では、データの回転や混合精度の整数量子化によってこの問題に対処するが、ソフトウェア管理のスケーリングと頻繁な復号化に依存し、かなりのオーバーヘッドを発生させることが多い。
MXINTのようなマイクロスケーリングフォーマットは、ハードウェアのスケールを符号化することでこれらの非効率性を排除しているが、ローテーションベースの方法とは相容れない。
分析の結果,異常な極端値から頻繁な軽微な偏差,および量子化感度が不均一に層や柱に分散していることが判明した。
これらの洞察は、きめ細かい感度誘導アプローチを動機付けている。
MXINTのブロックワイド構造を自然に活用し,カラムワイド感度と層ワイド感度に基づいて混合マンチサビット幅(4/6/8)を割り当てる学習自由手法MXSensを紹介する。
MXSensは、様々なモデルやタスクで最先端の量子化手法より優れている。
W4A4KV4設定では、MXSensはLLaMA-2-70BとLLaMA-3-8Bの3.77と7.63の難易度を実現し、WikiText-2の既存のベースラインを大幅に改善した。
LLM量子化における精度と資源効率の新たなバランスを確立する。
関連論文リスト
- Multi-Scale Dequant: Eliminating Dequantization Bottleneck via Activation Decomposition for Efficient LLM Inference [12.249074183271743]
量子化は、効率的な大言語モデル(LLM)の推論に不可欠である。
行列乗算のための高精度な低ビット重みを復号化するためのステップ変換は、現代のAIアクセラレーターにとって重要なボトルネックとなっている。
本稿では,GEMM臨界経路から重み/KV重みを除去する量子化フレームワークであるMulti-Scale Dequant(MSD)を提案する。
論文 参考訳(メタデータ) (2026-05-13T09:49:56Z) - SDQ-LLM: Sigma-Delta Quantization for 1-bit LLMs of any size [5.229694155440675]
大規模言語モデル(LLM)は、計算とメモリの問題に直面する。
SDQ-LLM: Sigma-Delta Quantization for 1-bit LLMs of any size。
SDQ-LLMの特徴は、Over-Sampling Ratio (OSR) の連続層である。
論文 参考訳(メタデータ) (2025-09-27T14:49:58Z) - SmoothRot: Combining Channel-Wise Scaling and Rotation for Quantization-Friendly LLMs [0.0]
SmoothRotは、大規模言語モデル(LLM)における4ビット量子化の効率を高めるための、新しい学習後の量子化手法である。
本手法は,極端外れ値から量子化フレンドリなアクティベーションへと効果的に変換し,量子化精度を大幅に向上させる。
論文 参考訳(メタデータ) (2025-06-04T19:07:45Z) - QUAD: Quantization and Parameter-Efficient Tuning of LLM with Activation Decomposition [21.13478769431063]
QUID(Quantization with Activation Decomposition)は、Singular Value Decomposition(SVD)を利用して、有効4ビット量子化のためのアクティベーションアウトリアを抑制するフレームワークである。
W4A4の量子化では94パーセントの精度、W4A4/A8では98%の精度、Llama-3およびQwen-2.5モデルのパラメータ効率の微調整を実現している。
論文 参考訳(メタデータ) (2025-03-25T05:03:56Z) - Progressive Mixed-Precision Decoding for Efficient LLM Inference [49.05448842542558]
我々は,デコーディングのメモリバウンドネスに対処するために,プログレッシブ・ミックス・プレシジョン・デコーディング(PMPD)を導入する。
PMPDはfp16モデルの行列ベクトル乗算において1.4$-$12.2$times$ Speedupを達成する。
我々の手法は、fp16モデルよりも3.8$-$8.0$times$、均一量子化アプローチよりも1.54$times$のスループット向上をもたらす。
論文 参考訳(メタデータ) (2024-10-17T11:46:33Z) - Rotated Runtime Smooth: Training-Free Activation Smoother for accurate INT4 inference [54.2589824716527]
大規模言語モデルは、その大規模なため、相当な計算とメモリ移動コストを発生させる。
既存のアプローチでは、外れ値と通常の値を2つの行列に分けたり、アクティベーションからウェイトに移行したりしています。
Smooth と Rotation 操作からなる量子化のためのプラグ・アンド・プレイ・アクティベーション・スムーザである Rotated Smooth (RRS) を提案する。
提案手法は,LLaMAおよびQwenファミリーにおける最先端の手法より優れており,IF4推論におけるWikiText-2の難易度は57.33から6.66に向上している。
論文 参考訳(メタデータ) (2024-09-30T14:59:22Z) - I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models [20.070306492164427]
学習後の量子化は、大きな言語モデルの推論を加速する強力な技術として機能する。
既存の作業は、推論中にかなりの数の浮動小数点(FP)操作を必要とする。
この制限は、エッジとクラウドデバイス上の大きな言語モデルのデプロイを妨げる。
大規模言語モデルに適した整数のみの完全量子化PTQフレームワークであるI-LLMを提案する。
論文 参考訳(メタデータ) (2024-05-28T05:56:11Z) - SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models [63.118592279833656]
後学習量子化(PTQ)は,大規模言語モデル(LLM)の圧縮に有効な手法である
本稿では,SliM-LLMを提案する。SliM-LLMは,グループ単位でビット幅を割り当てるサリエンス駆動の混合精度量子化フレームワークである。
実験により、SliM-LLMは低ビット幅の様々なLLMにおいて優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2024-05-23T16:21:48Z) - DB-LLM: Accurate Dual-Binarization for Efficient LLMs [83.70686728471547]
大規模言語モデル(LLM)は自然言語処理の分野を著しく進歩させてきた。
既存の超低ビット量子化は、常に深刻な精度低下を引き起こす。
本稿では,LLM,すなわちDB-LLMのための新しいデュアルバイナライズ手法を提案する。
論文 参考訳(メタデータ) (2024-02-19T09:04:30Z) - Mixed Precision Low-bit Quantization of Neural Network Language Models
for Speech Recognition [67.95996816744251]
長期間のメモリリカレントニューラルネットワーク(LSTM-RNN)とトランスフォーマーで表される最先端言語モデル(LM)は、実用アプリケーションではますます複雑で高価なものになりつつある。
現在の量子化法は、均一な精度に基づいており、量子化誤差に対するLMの異なる部分での様々な性能感度を考慮できない。
本稿では,新しい混合精度ニューラルネットワークLM量子化法を提案する。
論文 参考訳(メタデータ) (2021-11-29T12:24:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。