論文の概要: W4A4 Quantization for Inference on Wan2.2-I2V-A14B
- arxiv url: http://arxiv.org/abs/2606.29337v1
- Date: Sun, 28 Jun 2026 11:12:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.881925
- Title: W4A4 Quantization for Inference on Wan2.2-I2V-A14B
- Title(参考訳): W4A4 Wan2.2-I2V-A14Bにおける推論の量子化
- Authors: Yidong Chen, Chengyu Shi, Jiahao Liu,
- Abstract要約: サブチャンジは、HiF4またはMXFP4の数値形式の下で、Wan-AI/Wan2.2-I2V-A14B上の4ビットの重量と4ビットの活性化を目標としている。
LLM量子化の2つの相補的アイデア、スパースアクティベーションアウトリアに対するMixQスタイルの混合精度、およびSmoothQuantスタイルのチャネルごとの平滑化に適応する。
公式のVBench I2V測定値では、私たちのパイプラインはFP16の2-3.5パーセント以内で、ほとんどの品質の軸に留まり、動きの滑らかさを改善しています。
- 参考スコア(独自算出の注目度): 23.122181646076882
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We summarize our submission to Sub-Challenge 1: W4A4 Quantization for Inference (HiF4 / MXFP4) of the ICME 2026 Low-Bit-width Large-Model Quantization Challenge. The sub-challenge targets 4-bit weight and 4-bit activation inference on Wan-AI/Wan2.2-I2V-A14B under HiF4 or MXFP4 numerical formats. We adapt two complementary ideas from LLM quantization, MixQ-style mixed precision for sparse activation outliers and SmoothQuant-style per-channel smoothing, together with block-wise HiF4 packing for Wan2.2 feed-forward linear layers. Calibration on representative OpenS2V-5M batches identifies heavy-tailed activation channels; smoothing rebalances dynamic range before W4A4 rounding; and a dual-branch GEMM preserves outlier columns in higher precision while the bulk of channels use strict W4A4. On official VBench I2V metrics, our pipeline stays within 2-3.5 percent of FP16 on most quality axes and improves motion smoothness, outperforming a native HiFloat4 baseline that degrades roughly 5 percent relative to FP16 across all reported scores.
- Abstract(参考訳): ICME 2026 Low-Bit-width Large-Model Quantization Challenge の W4A4 Quantization for Inference (HiF4 / MXFP4) への提出を要約する。
サブチャレンジは、HiF4またはMXFP4の数値形式の下で、Wan-AI/Wan2.2-I2V-A14B上の4ビットの重量と4ビットの活性化を目標としている。
We adapt two complementary ideas from LLM Quantization, MixQ-style mixed precision for sparse activation outliers and SmoothQuant-style per-channel smoothing, with block-wise HiF4 packing for Wan2.2 feed-forward linear layer。
代表的なOpenS2V-5Mバッチの校正では、ヘビーテールのアクティベーションチャネルを特定し、W4A4ラウンド前にダイナミックレンジをスムーズにリバランスし、デュアルブランチのGEMMは、多くのチャネルが厳格なW4A4を使用している間に、より高い精度で外部カラムを保存する。
公式のVBench I2V測定値では、私たちのパイプラインは、ほとんどの品質軸でFP16の2-3.5パーセント以内にとどまり、動きのスムーズさを改善しています。
関連論文リスト
- SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference [4.219937026460372]
SharQは、オンラインスパース-デンス分解による活性化空間とFP4量子化を橋渡しする。
スパースFP4 GEMMはバックボーンを処理し、密度の高いFP4 GEMMはマスク誘起活性化損失とスパースパス量子化誤差の両方を補償する。
論文 参考訳(メタデータ) (2026-06-25T04:19:04Z) - MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models [57.87791117741788]
本稿では,モダリティを考慮したPTQフレームワークを提案する。
Distribution-Aware Bias Compensation (DABC) は、長い尾の外れ値からチャネルのバイアスを選択的に吸収する。
また,量子化格子をバイアスマスクと共最適化するために,MDQFO (Morphology-Directed Quantization Function Optimization) を提案する。
論文 参考訳(メタデータ) (2026-06-03T02:05:10Z) - Qift: Shift-Friendly No-Zero W2 Post-Training Quantization for Rotated W2A4/KV4 LLM Inference [3.308743964406687]
2ビットの重み量子化はメモリ効率のLLM推論には魅力的である。
標準のW2レベルセット-2,-1,0,+1は攻撃的なW2A4/KV4設定でしばしば崩壊する。
回転W2A4/KV4推論のための固定ノゼロのW2レベルセットであるQiftを提案する。
論文 参考訳(メタデータ) (2026-06-01T19:40:32Z) - Timestep-Aware SVDQuant-GPTQ for W4A4 Quantization of Wan2.2-I2V [23.570323694430538]
大規模なビデオ拡散変換器の量子化W4A4は、メモリの大幅な節約を提供するが、2つの大きな課題によって妨げられる。
これらの難しさは、Wan2.2-I2V の2つの試験的混合型 DiT 設計によって複雑化されている。
本稿では,SVDQuantをベースとした低ランク外乱補償,GPTQをベースとした再構成型残量量子化,および各専門家が独立に行う時間ステップ2分単位のアクティベーションクリッピング比探索を組み合わせた後学習量子化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-26T13:24:01Z) - Tail-Aware HiFloat4: W4A4 Post-Training Quantization for Wan2.2 [45.26076445356586]
本稿では,低ビットテキスト・ビデオ生成量子化問題に対する提案であるTail-Aware HiFloat4について述べる。
We Quantize the main linear layer in both Wan2.2 transformer module with W4A4 HiFloat4 fake Quantization。
この設計は、ランタイムのHiFloat4演算とサンプリングパイプラインを変更せずに、稀な外れ値のキャリブレーションの影響を低減する。
論文 参考訳(メタデータ) (2026-05-26T07:04:22Z) - DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers [3.0583214514538084]
Diffusion Transformer (DiTs) は最先端の画像生成品質を実現するが、推論時にかなりのメモリと計算コストを発生させる。
平滑化法、混合精度法、回転法、低ランク残差法などの既存の手法は、この問題を部分的に緩和するが、それでもFP16/BF16の性能に顕著なギャップを残している。
本稿では、回転認識型アクティベーション量子化による劣化を緩和するW4A4 PTQフレームワークであるDiRotQを紹介する。
論文 参考訳(メタデータ) (2026-05-16T00:52:00Z) - Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization [77.67818998672516]
本研究は,MXFP4とNVFP4の学習後量子化に関する総合的研究である。
本稿では,従来のGPTQ量子化アルゴリズムの変種であるMicro-Rotated-GPTQ(MR-GPTQ)を紹介する。
MR-GPTQは最先端の精度で一致または性能が向上することを示す。
論文 参考訳(メタデータ) (2025-09-27T09:22:21Z) - SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models [61.474101404805545]
拡散モデルは高品質なイメージを生成することができるが、スケールするにつれて、メモリ要求が増加し、より高いレイテンシがデプロイメント上の課題を引き起こす。
この制限を克服する新しい4ビット量子化パラダイムであるSVDQuantを提案する。
We reduce the memory usage for the 12B FLUX.1 models by 3.5$times$, achieved 3.0$times$ speedup over the 4-bit weight-only Quantization (W4A16) baseline。
論文 参考訳(メタデータ) (2024-11-07T18:59:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。