論文の概要: MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization
- arxiv url: http://arxiv.org/abs/2606.15652v1
- Date: Sun, 14 Jun 2026 07:43:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:33.779638
- Title: MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization
- Title(参考訳): MosaicQuant: Ilier-Outlier Disaggregation for Unified 4-bit LLM Quantization
- Abstract要約: 大規模言語モデル(LLM)のための統一的な4ビット量子化パラダイムを提案する。
MosaicQuantは、全重量行列を高密度な4ビット基底成分に量子化し、不純物は忠実に捕獲され、不純物は必然的に定量化される。
LLaMA3とQwen3の実験では、MosaicQuantはFP16に近い精度を維持し、W16A16ベースライン上で最大1.24タイムのスピードアップを実現している。
- 参考スコア(独自算出の注目度): 27.433770037419624
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: 4-bit quantization significantly reduces the memory footprint and accelerates the inference of large language models (LLMs). However, its limited bit-width representation struggles to faithfully capture both dense common values (\emph{inliers}) and rare large-magnitude values (\emph{outliers}), causing substantial accuracy degradation. Existing mixed-precision methods mitigate this by retaining outliers in high precision, but at the cost of breaking the uniformity of low-bit execution, introducing precision conversion and extra data movement that undermine practical speedup. We propose \textbf{MosaicQuant}, a unified 4-bit LLM quantization paradigm built on a novel principle of \emph{inlier--outlier disaggregation}. Rather than elevating outlier precision, MosaicQuant quantizes the full weight matrix into a dense 4-bit base component, where inliers are captured faithfully while outlier are inevitably quantized. A sparse 4-bit residual component is then introduced to compensate for these quantization errors, selectively targeting the most error-critical weight blocks where output distortion is shown to be concentrated. However, a unified representation alone is insufficient, as naïvely executing the sparse residual as a separate kernel still breaks the unified low-bit inference pipeline. To bridge this gap, we introduce \textbf{ZipperEngine}, which fuses sparse block computation into the dense 4-bit GEMM kernel via an overlapped pipeline, unifying not only the representation but also the execution into a single coherent low-bit inference pipeline. Extensive experiments on LLaMA3 and Qwen3 demonstrate that MosaicQuant preserves near-FP16 accuracy while achieving up to $1.24\times$ speedup over the W16A16 baseline.
- Abstract(参考訳): 4ビット量子化はメモリフットプリントを大幅に削減し、大きな言語モデル(LLM)の推論を高速化する。
しかし、その制限されたビット幅表現は、高密度な共通値 (\emph{inliers}) と希少な大振幅値 (\emph{outliers}) の両方を忠実に捉えるのに苦労し、かなりの精度の劣化を引き起こす。
既存の混合精度の手法は、アウトリーチを高精度に保持することでこれを緩和するが、低ビット実行の均一性を破り、精度変換とデータ移動を伴い、実用的なスピードアップを損なう。
本稿では,新しい原理である 'emph{inlier--outlier disaggregation} に基づいて構築された,統一4ビット LLM量子化パラダイムである \textbf{MosaicQuant} を提案する。
モザイク・クワントは、外周精度を上げるのではなく、全重量行列を密度の高い4ビット基底成分に量子化し、外周が必然的に定量化されている間に、不純物は忠実に捕獲される。
次に、これらの量子化誤差を補うためにスパース4ビット残差成分を導入し、出力歪みが集中していることを示す最もエラークリティカルな重みブロックを選択的にターゲットする。
しかし、分離されたカーネルとしてスパース残差を実行しても、統一された低ビット推論パイプラインを壊すため、統一された表現だけでは不十分である。
このギャップを埋めるために,我々は,疎結合なブロック計算を重なり合う4ビットGEMMカーネルに融合し,表現だけでなく,単一のコヒーレントな低ビット推論パイプラインへの実行を統一する \textbf{ZipperEngine} を導入する。
LLaMA3とQwen3の大規模な実験により、MosaicQuantはFP16に近い精度を維持し、W16A16ベースライン上で最大1.24\times$スピードアップを達成した。
関連論文リスト
- Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM [0.0]
ミニマ: NVFP4 W4A4は、GDNを含む496のリニア層である。
NVFP4の16要素ブロックのスケーリングが残ストリームの極端な外れ値の局所化の原因を説明する4つのメカニズムの研究がある。
ハイブリッド LLM の繰り返し半分が量子化し易い理由に関する力学的な説明。
論文 参考訳(メタデータ) (2026-09-03T17:04:26Z) - ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs [4.431548809730958]
ARCQuantは、Augmented Residual Channelsを通じてNVFP4パフォーマンスを向上させるフレームワークである。
ARCQuantは、複雑なタスクや下流タスクにおいて、完全精度のベースラインに匹敵する、最先端の精度を実現する。
論文 参考訳(メタデータ) (2026-01-12T12:27:22Z) - Post-Training Quantization via Residual Truncation and Zero Suppression for Diffusion Models [10.000323762676633]
拡散モデルは、高品質な画像生成を実現するが、高い計算要求のため、デプロイメントの課題に直面している。
拡散モデルのための4ビットPTQスキームであるResidual Truncation and Zero Suppression (QuaRTZ) による量子化を提案する。
提案手法は,外乱保存とLSB精度のバランスをとることにより,丸め誤差を低減し,量子化効率を向上させる。
論文 参考訳(メタデータ) (2025-09-30T15:55:42Z) - Improving Block-Wise LLM Quantization by 4-bit Block-Wise Optimal Float (BOF4): Analysis and Variations [22.127873567034825]
大規模言語モデル(LLM)は、微調整と推論の両方で広範なメモリ容量を必要とする。
既存の手法では、NF4やAF4といったブロックワイド量子化技術がネットワーク重みに適用されている。
これらの量子化手法が最適以下の量子化誤差を引き起こすことを示す。
論文 参考訳(メタデータ) (2025-05-10T14:00:15Z) - ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization [73.60493264901359]
本稿では,1ビット,1.58ビット,2ビット,3ビット,4ビットの量子化設定に対して厳密な比較を行う統一フレームワークを提案する。
3次、2ビット、3ビット量子化は、サイズと精度のトレードオフにおいて同等のパフォーマンスを維持していることを示す。
ハードウェアの制約を考慮すると、2ビット量子化はメモリの削減とスピードアップに有望な可能性を秘めている。
論文 参考訳(メタデータ) (2025-02-04T18:59:26Z) - ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals [10.860081994662645]
大規模言語モデル(LLM)の学習後の量子化は、推論時の計算コストを抑えるという約束を果たす。
本稿では,最先端技術をさらに推し進めるPTQ手法であるResQを提案する。
ResQは、様々なベンチマークにおいて、最近の一様および混合精度のPTQ法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-12-18T22:01:55Z) - AMXFP4: Taming Activation Outliers with Asymmetric Microscaling Floating-Point for 4-bit LLM Inference [6.699442219974261]
AMXFP4は4ビットの非対称なFPフォーマットで、どちらも非対称な共有スケールで処理する。
AMXFP4はVQAでMXFP4を3%上回り、CSQAで1.6%上回る。
論文 参考訳(メタデータ) (2024-11-15T03:11:19Z) - SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models [61.474101404805545]
拡散モデルは高品質なイメージを生成することができるが、スケールするにつれて、メモリ要求が増加し、より高いレイテンシがデプロイメント上の課題を引き起こす。
この制限を克服する新しい4ビット量子化パラダイムであるSVDQuantを提案する。
We reduce the memory usage for the 12B FLUX.1 models by 3.5$times$, achieved 3.0$times$ speedup over the 4-bit weight-only Quantization (W4A16) baseline。
論文 参考訳(メタデータ) (2024-11-07T18:59:58Z) - SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models [63.118592279833656]
後学習量子化(PTQ)は,大規模言語モデル(LLM)の圧縮に有効な手法である
本稿では,SliM-LLMを提案する。SliM-LLMは,グループ単位でビット幅を割り当てるサリエンス駆動の混合精度量子化フレームワークである。
実験により、SliM-LLMは低ビット幅の様々なLLMにおいて優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2024-05-23T16:21:48Z) - DB-LLM: Accurate Dual-Binarization for Efficient LLMs [83.70686728471547]
大規模言語モデル(LLM)は自然言語処理の分野を著しく進歩させてきた。
既存の超低ビット量子化は、常に深刻な精度低下を引き起こす。
本稿では,LLM,すなわちDB-LLMのための新しいデュアルバイナライズ手法を提案する。
論文 参考訳(メタデータ) (2024-02-19T09:04:30Z) - SqueezeLLM: Dense-and-Sparse Quantization [80.32162537942138]
LLMにおける生成推論の主なボトルネックは、単一のバッチ推論のための計算ではなく、メモリ帯域幅である。
学習後量子化フレームワークであるSqueezeLLMを導入し、最大3ビットの超低精度でのロスレス圧縮を実現する。
本フレームワークは,2次情報に基づく最適ビット精度割当を探索する感度ベース非一様量子化法と,2次情報に基づくDense-and-Sparse分解法と,2次情報量割当値と感度重み値を効率的にスパース形式で格納するDense-and-Sparse分解法である。
論文 参考訳(メタデータ) (2023-06-13T08:57:54Z) - HAWQV3: Dyadic Neural Network Quantization [73.11579145354801]
現在の低精度量子化アルゴリズムは、浮動小数点から量子化された整数値への変換の隠れコストを持つことが多い。
HAWQV3は、新しい混合精度整数のみの量子化フレームワークである。
論文 参考訳(メタデータ) (2020-11-20T23:51:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。