論文の概要: Activation Outliers Matter: Robust Recovery for Quantized Multimodal LLMs
- arxiv url: http://arxiv.org/abs/2608.26581v1
- Date: Thu, 27 Aug 2026 03:47:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.236074
- Title: Activation Outliers Matter: Robust Recovery for Quantized Multimodal LLMs
- Title(参考訳): 量子化多モードLCMのロバスト回復
- Authors: Tanzila Rahman, Mehran Taghian Jazi, Yunke Peng, Zhuang Ma, Anandharaju Durai Raju, Yao Wang, Xing Huang, Hei Yi Mak, Shadan Golestan, Hoang Le, Yonghan Dong, Wei Guo, Yaoyuan Wang,
- Abstract要約: 低ビット量子化は、マルチモーダル大言語モデルの計算およびメモリ要求を減らすための有望な道を提供する。
MXFP8やMXFP4やHiF4のような超低ビットフォーマットのような最近のハードウェアサポートは、効率的なMLLMトレーニングとデプロイメントの研究を加速している。
本稿では,映像生成タスクと推論タスクの両方にまたがる代表MLLMにおいて,これらの量子化方式を体系的に研究する。
- 参考スコア(独自算出の注目度): 14.385983354036142
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Low-bit quantization offers a promising avenue for reducing the computational and memory demands of Multimodal Large Language Models (MLLMs). Recent hardware support for low-precision formats, ranging from MXFP8 to ultra-low-bit formats such as MXFP4 and HiF4, has accelerated research into efficient MLLM training and deployment. In this work, we present a systematic study of these quantization schemes in representative MLLMs that span both video generation and reasoning tasks. Our analysis shows that MXFP8 achieves near-lossless performance, whereas aggressive 4-bit quantization leads to significant degradation. Through extensive ablations, we identify activation quantization as the primary source of this performance loss, contributing substantially more than weight quantization. Motivated by this observation, we propose Residual Fallback Quantization (RFQ), a lightweight activation reconstruction framework that supplements the primary ulta-low-bit activation representation with an auxiliary quantized residual pathway. By explicitly modeling and compensating for quantization errors, RFQ improves activation fidelity while preserving the efficiency advantages of ultra-low-bit computation. RFQ requires no architectural modifications and incurs negligible computational overhead. Extensive experiments on Wan2.2 and Qwen3-VL demonstrate that RFQ consistently recovers a substantial portion of the performance lost under the quantization of MXFP4 and HiF4, significantly narrowing the gap to BF16 baselines across both generation and 4 reasoning benchmarks. Our findings establish activation quantization as the dominant bottleneck in ultra-low-bit MLLMs and highlight residual-based activation reconstruction as an effective and practical strategy for robust 4-bit deployment.
- Abstract(参考訳): 低ビット量子化は、MLLM(Multimodal Large Language Models)の計算およびメモリ要求を減らすための有望な道を提供する。
MXFP8からMXFP4やHiF4のような超低ビットフォーマットまで、近年の低精度フォーマットに対するハードウェアサポートは、効率的なMLLMトレーニングとデプロイメントの研究を加速している。
本研究では,映像生成タスクと推論タスクの両方にまたがる代表MLLMにおいて,これらの量子化方式の体系的研究を行う。
解析の結果,MXFP8はロバストな性能を示す一方,アグレッシブな4ビット量子化は大きな劣化をもたらすことがわかった。
この性能損失の主な原因はアクティベーション量子化であり、重量量子化以上に大きく寄与する。
本研究は, 補助的量子化残差経路を用いて, 一次ulta-low-bit活性化表現を補足する軽量な活性化再構成フレームワークであるResidual Fallback Quantization (RFQ)を提案する。
量子化誤差を明示的にモデル化し補償することにより、RFQは超低ビット計算の効率性を保ちながら、活性化忠実度を向上させる。
RFQはアーキテクチャの変更を必要とせず、計算オーバーヘッドは無視できる。
Wan2.2 と Qwen3-VL の大規模な実験により、RFQ は MXFP4 と HiF4 の量子化で失われる性能のかなりの部分を一貫して回復し、世代別と4つの推論ベンチマークで BF16 ベースラインとのギャップを著しく狭めることを示した。
超低ビットMLLMにおけるアクティベーションの量子化が主要なボトルネックであり、ロバストな4ビット展開のための効果的かつ実用的な戦略として残余ベースのアクティベーション再構築が重要である。
関連論文リスト
- OffQ: Taming Structured Outliers in LLM Quantization by Offsetting [46.325071880831445]
OffQは、新しいオフセット機構を通じて、低ビット量子化におけるアクティベーションアウトリーを緩和する。
OffQは、低ビット効率を維持しながら、モデルの精度を一貫して改善する。
論文 参考訳(メタデータ) (2026-06-05T10:11:34Z) - Mix-Quant: Quantized Prefilling, Precise Decoding for Agentic LLMs [78.01752802974855]
高速エージェント推論のための簡易かつ効果的な位相認識量子化フレームワークであるMix-Quantを提案する。
我々は,Mix-Quantがタスク性能を保ち,高い効率向上を実現し,プリフィル時に最大3倍の高速化を実現していることを示す。
論文 参考訳(メタデータ) (2026-05-19T17:50:17Z) - SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization [19.022444007775896]
NVFP4は、最近、大規模言語モデルの効率的な4ビットマイクロスケーリングフォーマットとして登場した。
既存の方法は、しばしば、柔軟性のないスケールの選択と、量子化と量子化のスケールの併用による、最適以下の性能をもたらす。
NVFP4量子化の精度を向上する新しい学習後量子化フレームワークであるSOAR(Scale Optimization for Accurate Reconstruction)を提案する。
論文 参考訳(メタデータ) (2026-05-12T15:13:18Z) - HQ-DM: Single Hadamard Transformation-Based Quantization-Aware Training for Low-Bit Diffusion Models [5.320690460117234]
HQ-DMは、活性化行列に単一アダマール変換を適用する新しい量子化対応トレーニングフレームワークである。
このアプローチは、量子化下でのモデル性能を維持しながら、アクティベーションアウトリーを効果的に削減する。
LDM-4モデルを用いたImageNet 256x256データセットの条件生成のために、我々のW4A4およびW4A3量子化スキームは、それぞれインセプションスコアを12.8%改善し、467.73%改善した。
論文 参考訳(メタデータ) (2025-12-05T14:28:40Z) - Pioneering 4-Bit FP Quantization for Diffusion Models: Mixup-Sign Quantization and Timestep-Aware Fine-Tuning [14.145862114439831]
モデル量子化はウェイトとアクティベーションのビット幅を減らし、メモリ効率と推論速度を改善する。
既存の方法は、主に整数量子化と後学習量子化の微調整に基づいており、矛盾しない性能に悩まされている。
本稿では、まずモデル量子化に符号なしFP量子化を導入し、時間ステップ対応のLoRAとデノナイジング・ファクター損失アライメントを併用する混合符号浮動小数点量子化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-27T13:40:47Z) - Optimizing Large Language Model Training Using FP4 Quantization [73.55459961002371]
量子化トレーニングは、低ビット演算によるコスト削減を可能にすることで、有望なソリューションを提供する。
この研究は、大規模言語モデル(LLM)のための最初のFP4トレーニングフレームワークを紹介します。
論文 参考訳(メタデータ) (2025-01-28T18:04:50Z) - TCAQ-DM: Timestep-Channel Adaptive Quantization for Diffusion Models [49.65286242048452]
拡散モデル(TCAQ-DM)のためのタイムステップ・チャネル適応量子化法を提案する。
提案手法は,ほとんどの場合,最先端の手法よりも優れている。
論文 参考訳(メタデータ) (2024-12-21T16:57:54Z) - DB-LLM: Accurate Dual-Binarization for Efficient LLMs [83.70686728471547]
大規模言語モデル(LLM)は自然言語処理の分野を著しく進歩させてきた。
既存の超低ビット量子化は、常に深刻な精度低下を引き起こす。
本稿では,LLM,すなわちDB-LLMのための新しいデュアルバイナライズ手法を提案する。
論文 参考訳(メタデータ) (2024-02-19T09:04:30Z) - CBQ: Cross-Block Quantization for Large Language Models [66.82132832702895]
ポストトレーニング量子化(PTQ)は、超低コストで大規模言語モデル(LLM)を圧縮する上で重要な役割を果たしている。
LLMのためのクロスブロック再構成に基づくPTQ手法CBQを提案する。
CBQはリコンストラクションスキームを使用してクロスブロック依存関係を採用し、エラーの蓄積を最小限に抑えるために複数のブロックにまたがる長距離依存関係を確立する。
論文 参考訳(メタデータ) (2023-12-13T07:56:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。