論文の概要: MixQuant: Adaptive Mixed-Precision Quantization for Large Language Models
- arxiv url: http://arxiv.org/abs/2607.23047v1
- Date: Sat, 25 Jul 2026 05:10:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.981719
- Title: MixQuant: Adaptive Mixed-Precision Quantization for Large Language Models
- Title(参考訳): MixQuant: 大規模言語モデルのための適応型混合精度量子化
- Abstract要約: 混合精度量子化は、高いビット幅を機密層に割り当てることで、後トレーニング量子化の精度を向上させる。
現在のメソッドは、他のレイヤの量子化レベルへの依存性を考慮していない方法で、レイヤの感度をスコアします。
基本量子化器をラップする技術に依存しない適応フレームワークであるMixQuantを提案する。
- 参考スコア(独自算出の注目度): 1.2103718443991303
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Mixed-precision quantization improves the accuracy of post-training quantization by allocating higher bitwidths to sensitive layers, but existing methods solve the allocation for a single fixed memory budget. In practice the budget varies across deployments and is unknown at calibration time. Adaptive quantization addresses this with one offline calibration that serves any budget, yet current methods score layer sensitivity in a manner that does not consider its dependency on quantization levels of other layers. We show that a layer's sensitivity depends strongly on the bitwidths of its upstream layers and that this dependence shifts the resulting preferred bit allocation. We propose MixQuant, a technique-agnostic adaptive framework that wraps any base quantizer. MixQuant marginalizes each layer's distortion over random quantized upstream configurations to obtain budget-agnostic scores, calibrates the quantizer's parameters on plans the allocator itself produces, and penalizes allocations that leave layers at the lowest bitwidths. A single greedy pass then serves any budget at deployment. Across Llama-3.2-3B, Llama-2-7B, and Mistral-7B under AWQ and GPTQ, MixQuant outperforms adaptive and mixed-precision baselines in every setting, improving average accuracy by up to 8 points and reducing perplexity from 12.43 to 10.70 at the tightest budget, while matching an ILP solver at negligible deployment cost.
- Abstract(参考訳): 混合精度量子化は、高ビット幅を高感度層に割り当てることで、後トレーニング量子化の精度を向上させるが、既存の方法では1つの固定メモリ予算の割り当てを解決している。
実際には、予算は展開毎に異なり、キャリブレーション時に不明である。
アダプティブ・量子化(Adaptive Quantization)は、どの予算でも使える1つのオフラインキャリブレーションでこの問題に対処するが、現在の手法は、他のレイヤの量子化レベルへの依存性を考慮しない方法で層感度をスコアする。
以上の結果から,上流層のビット幅に層感度が強く依存することが明らかとなった。
基本量子化器をラップする技術に依存しない適応フレームワークであるMixQuantを提案する。
MixQuantは、ランダムな量子化された上流構成に対する各層の歪みを減らし、予算に依存しないスコアを取得し、アロケータ自体が生成する計画に基づいて量子化器のパラメータを校正し、層を最低ビット幅に残す割り当てを罰する。
単一の欲張りパスは、デプロイ時にどんな予算にも役立ちます。
AWQとGPTQによるLlama-3.2-3B、Llama-2-7B、Mistral-7Bでは、MixQuantは各設定において適応性と混合精度のベースラインを上回り、平均精度を最大8ポイント改善し、最も厳しい予算で12.43から10.70に低下させ、IPPソルバを無視可能な展開コストでマッチングする。
関連論文リスト
- APreQEL: Adaptive Mixed Precision Quantization For Edge LLMs [4.822345534269378]
本稿では,エッジ配置におけるメモリ,レイテンシ,精度のバランスをとる適応型混合精度量子化機構を提案する。
我々の研究は、均一な量子化が達成できない新しい構成設計を解き、資源制約されたデバイスにLLMを効率的にデプロイするために、ソリューション空間を拡張します。
論文 参考訳(メタデータ) (2026-03-24T13:27:13Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - Mix-QSAM: Mixed-Precision Quantization of the Segment Anything Model [0.0]
Mix-QSAMはSegment Anything Model(SAM)のためのPTQフレームワークである。
モデル出力に対する各レイヤの寄与を定量化するために,Kulback-Leibler (KL) 偏差を用いて導出したレイヤ単位の重要度スコアを導入する。
また、隣接層間の依存関係を捉えるために、因果的相互情報に基づく新しい計量である層間相乗法を導入する。
論文 参考訳(メタデータ) (2025-05-08T00:08:31Z) - HAFLQ: Heterogeneous Adaptive Federated LoRA Fine-tuned LLM with Quantization [55.972018549438964]
LLM(Federated Fine-tuning of Pre-trained Large Language Models)は、さまざまなデータセットにまたがるタスク固有の適応を可能にすると同時に、プライバシの保護を可能にする。
本研究では, HAFLQ (Heterogeneous Adaptive Federated Low-Rank Adaptation Fine-tuned LLM with Quantization) を提案する。
テキスト分類タスクの実験結果から,HAFLQはメモリ使用量を31%削減し,通信コストを49%削減し,精度を50%向上し,ベースライン法よりも高速な収束を実現している。
論文 参考訳(メタデータ) (2024-11-10T19:59:54Z) - Progressive Mixed-Precision Decoding for Efficient LLM Inference [49.05448842542558]
我々は,デコーディングのメモリバウンドネスに対処するために,プログレッシブ・ミックス・プレシジョン・デコーディング(PMPD)を導入する。
PMPDはfp16モデルの行列ベクトル乗算において1.4$-$12.2$times$ Speedupを達成する。
我々の手法は、fp16モデルよりも3.8$-$8.0$times$、均一量子化アプローチよりも1.54$times$のスループット向上をもたらす。
論文 参考訳(メタデータ) (2024-10-17T11:46:33Z) - SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models [63.118592279833656]
後学習量子化(PTQ)は,大規模言語モデル(LLM)の圧縮に有効な手法である
本稿では,SliM-LLMを提案する。SliM-LLMは,グループ単位でビット幅を割り当てるサリエンス駆動の混合精度量子化フレームワークである。
実験により、SliM-LLMは低ビット幅の様々なLLMにおいて優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2024-05-23T16:21:48Z) - Mixed-Precision Quantization for Deep Vision Models with Integer Quadratic Programming [7.0146264551420066]
量子化はニューラルネットワークを圧縮する技術として広く使われている。
MPQは、様々なビット幅をレイヤに割り当て、精度と効率のトレードオフを最適化することで、この問題に対処する。
我々は、量子化誤差の層間依存性をキャプチャする実用的な感度に基づくMPQアルゴリズムであるCLADOを紹介する。
論文 参考訳(メタデータ) (2023-07-11T15:56:00Z) - CSQ: Growing Mixed-Precision Quantization Scheme with Bi-level
Continuous Sparsification [51.81850995661478]
混合精度量子化はディープニューラルネットワーク(DNN)に広く応用されている
トレーニング中のビットレベル正規化とプルーニングに基づく動的精度調整の試みは、ノイズ勾配と不安定収束に悩まされている。
安定度を向上した混合精度量子化スキームを探索するビットレベル学習法である連続スカラー化量子化(CSQ)を提案する。
論文 参考訳(メタデータ) (2022-12-06T05:44:21Z) - RMSMP: A Novel Deep Neural Network Quantization Framework with Row-wise
Mixed Schemes and Multiple Precisions [43.27226390407956]
この研究は、Row-wise Mixed-Scheme and Multi-Precisionアプローチによる新しいディープニューラルネットワーク(DNN)量子化フレームワーク、すなわちRMSMPを提案する。
提案するRMSMPは、画像分類と自然言語処理(BERT)の分野でテストされている。
同等の精度で、最先端技術の中で最高の精度を実現する。
論文 参考訳(メタデータ) (2021-10-30T02:53:35Z) - Cluster-Promoting Quantization with Bit-Drop for Minimizing Network
Quantization Loss [61.26793005355441]
クラスタ・プロモーティング・量子化(CPQ)は、ニューラルネットワークに最適な量子化グリッドを見つける。
DropBitsは、ニューロンの代わりにランダムにビットをドロップする標準のドロップアウト正規化を改訂する新しいビットドロップ技術である。
本手法を様々なベンチマークデータセットとネットワークアーキテクチャ上で実験的に検証する。
論文 参考訳(メタデータ) (2021-09-05T15:15:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。