論文の概要: C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs
- arxiv url: http://arxiv.org/abs/2607.21076v1
- Date: Thu, 23 Jul 2026 09:08:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.343494
- Title: C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs
- Title(参考訳): C-PTQ:MLLMのポストトレーニング量子化のための漁業用チャネルワイド感度
- Authors: Jiameng Li, Han Zhou, Matthew B. Blaschko,
- Abstract要約: マルチモーダル大言語モデル(MLLM)は、膨大なメモリと計算コストを必要とする。
ポストトレーニング量子化(PTQ)技術は、モデル圧縮と推論加速のための効率的なソリューションを提供する。
本稿では,タスク固有の損失摂動と量子化誤差を調和させる統一的なチャネルワイドPTQ法であるC-PTQを提案する。
- 参考スコア(独自算出の注目度): 23.275426637407033
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal large language models (MLLMs) require huge memory and computational costs, which limits their practical deployment. Post-training quantization (PTQ) techniques offer an efficient solution for model compression and inference acceleration. Yet, the quantized model faces performance degradation due to outlier channels, which are highly sensitive to quantization and substantially impair activation fidelity and task accuracy. To protect these salient channels during quantization, existing PTQ methods leverage modality- or token-level metrics to guide channel-wise scaling (CWS) of LLM decoders. However, these orthogonal measurements fail to capture channel-wise impacts on task-specific loss, and the misalignment between importance and scaling factors ultimately leads to suboptimal performance. To address this issue, we propose C-PTQ, a unified channel-wise PTQ method that harmonizes task-specific loss perturbation and quantization error. Motivated by second-order derivatives, we design a Fisher-weighted objective as a tractable Hessian approximation, seamlessly injecting task sensitivity into the scaling process. Notably, we achieve state-of-the-art performance without auxiliary modules like LoRA, thereby maintaining high efficiency. Experiments on Qwen2.5VL, InternVL2 and LLaVA-OV across 8 benchmarks demonstrate our effectiveness in both weight-only and weight-activation settings.
- Abstract(参考訳): MLLM(Multimodal large language model)は、大規模なメモリと計算コストを必要とするため、実際の展開が制限される。
ポストトレーニング量子化(PTQ)技術は、モデル圧縮と推論加速のための効率的なソリューションを提供する。
しかし、量子化モデルは、量子化に非常に敏感であり、アクティベーションの忠実度とタスク精度が著しく低下している、不整合チャネルによる性能劣化に直面している。
量子化中、これらの健全なチャネルを保護するため、既存のPTQ手法は、LLMデコーダのチャネルワイドスケーリング(CWS)を誘導するために、モダリティレベルまたはトークンレベルメトリクスを利用する。
しかし、これらの直交測定は、タスク固有の損失に対するチャネルワイズの影響を捉えることができず、重要度とスケーリング要因のミスアライメントは、究極的には準最適性能をもたらす。
この問題に対処するために,タスク固有の損失摂動と量子化誤差を調和させる統一的なチャネルワイズPTQ法であるC-PTQを提案する。
2階微分によって動機付けられ、我々はフィッシャー重み付けされた目的を、スケーリングプロセスにタスク感度をシームレスに注入する、引き込み可能なヘッセン近似として設計する。
特に,LoRAのような補助モジュールを使わずに最先端性能を実現し,高い効率性を維持する。
Qwen2.5VL, InternVL2, LLaVA-OVの8つのベンチマークによる実験により, 重量限定および重量活性化設定の有効性が示された。
関連論文リスト
- DA-PTQ: Drift-Aware Post-Training Quantization for Efficient Vision-Language-Action Models [61.26694413585136]
DA-PTQ (Drift-Aware Post-Training Quantization) は、逐次決定過程に対するドリフト-アウェア最適化問題として量子化を定式化する。
DA-PTQはキネマティックドリフトを著しく低減し、低ビット設定下での完全精度モデルに匹敵する性能を達成する。
論文 参考訳(メタデータ) (2026-04-13T14:51:43Z) - Spike-driven Large Language Model [49.52947423982696]
スパイキングニューラルネットワーク(SNN)はスパイク駆動特性を持つ。
現在のLarge Language Models (LLM) は主に大規模密度行列乗法に基づいている。
本研究では,スパース加算操作により高密度行列乗算を除去するスパイク駆動型大規模言語モデルであるSDLLMを提案する。
論文 参考訳(メタデータ) (2026-04-11T17:58:35Z) - LSGQuant: Layer-Sensitivity Guided Quantization for One-Step Diffusion Real-World Video Super-Resolution [52.627063566555194]
本稿では,一段階拡散に基づく実世界VSRのための層感度誘導量子化手法LSGQuantを紹介する。
本手法は,ビデオトークンのアクティベーションに適合する動的レンジ適応量子化器 (DRAQ) を備える。
提案手法は,完全精度のオリジンモデルに対してほぼ性能が良く,既存の量子化手法をはるかに上回っている。
論文 参考訳(メタデータ) (2026-02-03T06:53:19Z) - End-to-End On-Device Quantization-Aware Training for LLMs at Inference Cost [53.25965863436039]
量子化対応トレーニング(QAT)は、より原則化されたソリューションを提供するが、バックプロパゲーションに依存しているため、メモリコストは禁じられている。
重み付けとアクティベーション量子化の両方をサポートするゼロオーダー最適化ベースのQATフレームワークであるZeroQATを提案する。
実験の結果、ZeroQATはPTQとQATのベースラインを一貫して上回り、メモリは大幅に削減された。
論文 参考訳(メタデータ) (2025-08-21T01:18:27Z) - DMQ: Dissecting Outliers of Diffusion Models for Post-Training Quantization [29.066284789131494]
最近のトレーニング後の量子化法は、外乱を無視し、低ビット幅での劣化性能をもたらす。
本稿では,Learned Equivalent ScalingとチャネルワイドのPower-of-Two Scalingを組み合わせたDMQを提案する。
提案手法は,特に低ビット幅において,既存の処理性能を著しく向上させる。
論文 参考訳(メタデータ) (2025-07-17T09:15:29Z) - DopQ-ViT: Towards Distribution-Friendly and Outlier-Aware Post-Training Quantization for Vision Transformers [31.791935689364866]
視覚変換器(ViT)のためのDopQ-ViTを提案する。
第一に、DopQ-ViTはTan Quantizer (TanQ)を導入している。
第2に、DopQ-ViT は MAD-Guided Optimal Scaling Factor (MOSF) を提示する。
論文 参考訳(メタデータ) (2024-08-06T16:40:04Z) - QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models [44.515165695546614]
量子化アウェアトレーニング(QAT)はソリューションを提供するが、トレーニング後の量子化(PTQ)は大規模言語モデル(LLM)のより実践的なアプローチとなる。
LLM向けに設計された高精度かつ効率的な低ビット幅PTQ法QLLMを提案する。
論文 参考訳(メタデータ) (2023-10-12T05:25:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。