論文の概要: SoloQ: Calibration-Free Quantization for Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2610.07121v1
- Date: Mon, 05 Oct 2026 17:30:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.567983
- Title: SoloQ: Calibration-Free Quantization for Diffusion Language Models
- Title(参考訳): SoloQ: 拡散言語モデルの校正自由量子化
- Abstract要約: SoloQは、ウェイトとアクティベーションを正規化された回転基底にマッピングするキャリブレーションのない量子化フレームワークである。
NVFP4では、SoloQはピークメモリを最大2.61倍に削減し、エンドツーエンドの推論を最大2.24倍に高速化する。
- 参考スコア(独自算出の注目度): 14.828626704900861
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion large language models dLLMs) have emerged as a promising alternative to autoregressive language models through bidirectional diffusion-based token generation. However, their growing model sizes and high inference costs make efficient deployment challenging: full-sequence denoising repeatedly invokes compute-intensive forward passes, while block-diffusion models additionally introduce a memory-intensive KV-cache. Low-bit weight-activation quantization is therefore attractive, yet existing dLLM post-training quantization methods rely on calibration data despite activation distributions shifting across masking states and denoising steps. We present SoloQ, a calibration-free quantization framework that maps weights and activations into a normalized rotated basis with a predictable marginal distribution, enabling data-independent quantization. SoloQ combines a structured K-RPBH rotation with a lightweight rescaling correction for calibration-free quantization. Its predictable post-rotation distribution supports both distribution-matched codebooks and hardware-native NVFP4. For block-diffusion models, SoloQ further applies commit-time KV-cache quantization to compress persistent states without perturbing the actively denoised block. Across full-sequence dLLMs (LLaDA and Dream) and block-diffusion dLLMs(Fast-dLLM v2 and Nemotron-Labs-Diffusion), SoloQ retains accuracy under 4-bit quantization and outperforms calibration-based baselines on knowledge- and reasoning-intensive benchmarks. With NVFP4, SoloQ reduces peak memory by up to 2.61X and accelerates end-to-end inference by up to 2.24X.
- Abstract(参考訳): 拡散型大規模言語モデル(dLLM)は、双方向拡散型トークン生成による自己回帰型言語モデルに代わる有望な代替品として登場した。
しかし、モデルサイズの増加と高い推論コストにより、効率的なデプロイメントが困難になる。フルシーケンスのデノベーションは、計算集約的なフォワードパスを繰り返し呼び出す一方で、ブロック拡散モデルは、メモリ集約的なKV-cacheも導入する。
そのため、低ビット重量活性化量子化は魅力的であるが、既存のdLLMポストトレーニング量子化法は、マスキング状態とデノイングステップをまたぐ活性化分布にもかかわらず、キャリブレーションデータに依存している。
本稿では,重みとアクティベーションを正規化された回転ベースにマッピングするキャリブレーションフリーな量子化フレームワークであるSoloQについて,予測可能な限界分布で表現し,データ非依存の量子化を可能にする。
SoloQは、構造化K-RPBH回転と、キャリブレーションのない量子化のための軽量な再スケーリング補正を組み合わせる。
その予測可能なポストローテーションディストリビューションは、分散マッチングされたコードブックと、ハードウェアネイティブなNVFP4の両方をサポートしている。
ブロック拡散モデルでは、SoloQはさらにコミット時KVキャッシュ量子化を適用して、アクティブな復号化ブロックを摂動することなく永続状態を圧縮する。
フルシーケンスのdLLM(LLaDAとDream)とブロック拡散dLLM(Fast-dLLM v2とNemotron-Labs-Diffusion)にわたって、SoloQは4ビット量子化の下で精度を維持し、知識および推論集約ベンチマークのキャリブレーションベースのベースラインより優れている。
NVFP4では、SoloQはピークメモリを最大2.61倍に削減し、エンドツーエンドの推論を最大2.24倍に高速化する。
関連論文リスト
- SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization [19.022444007775896]
NVFP4は、最近、大規模言語モデルの効率的な4ビットマイクロスケーリングフォーマットとして登場した。
既存の方法は、しばしば、柔軟性のないスケールの選択と、量子化と量子化のスケールの併用による、最適以下の性能をもたらす。
NVFP4量子化の精度を向上する新しい学習後量子化フレームワークであるSOAR(Scale Optimization for Accurate Reconstruction)を提案する。
論文 参考訳(メタデータ) (2026-05-12T15:13:18Z) - Q-Drift: Quantization-Aware Drift Correction for Diffusion Model Sampling [45.88028371034407]
ポストトレーニング量子化(PTQ)は、大規模な拡散モデルを展開するための実践的な方法である。
本稿では,量子化誤差を暗黙の摂動として扱うQ-Driftを提案する。
Q-Driftは、キャリブレーションから時間的変動統計を推定し、実際には5つの完全精度/量子化キャリブレーションを必要とする。
論文 参考訳(メタデータ) (2026-03-18T10:19:36Z) - MPQ-DMv2: Flexible Residual Mixed Precision Quantization for Low-Bit Diffusion Models with Temporal Distillation [74.34220141721231]
我々は,textbfMixed textbfPrecision textbfQuantizationフレームワークを改良したMPQ-DMv2を提案する。
論文 参考訳(メタデータ) (2025-07-06T08:16:50Z) - Pioneering 4-Bit FP Quantization for Diffusion Models: Mixup-Sign Quantization and Timestep-Aware Fine-Tuning [14.145862114439831]
モデル量子化はウェイトとアクティベーションのビット幅を減らし、メモリ効率と推論速度を改善する。
既存の方法は、主に整数量子化と後学習量子化の微調整に基づいており、矛盾しない性能に悩まされている。
本稿では、まずモデル量子化に符号なしFP量子化を導入し、時間ステップ対応のLoRAとデノナイジング・ファクター損失アライメントを併用する混合符号浮動小数点量子化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-27T13:40:47Z) - MergeQuant: Accurate 4-bit Static Quantization of Large Language Models by Channel-wise Calibration [23.752021919501207]
本稿では,チャネルごとの静的量子化フレームワークであるMergeQuantを提案する。
MergeQuantは、量子化ステップマイグレーション(QSM)メソッドを通じて、チャネルごとの量子化ステップと対応するスケーリングと線形マッピングを統合する。
Llama-2-7Bモデルでは、MergeQuantはFP16ベースラインと比較してデコードで最大1.77倍、エンドツーエンドで最大2.06倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2025-03-07T04:52:28Z) - MPQ-DM: Mixed Precision Quantization for Extremely Low Bit Diffusion Models [37.061975191553]
本稿では,拡散モデルのための混合精度量子化法MPQ-DMを提案する。
重み付き外周波による量子化誤差を軽減するために,外周波混合量子化手法を提案する。
時間ステップを横断する表現を頑健に学習するために,時間-平滑な関係蒸留方式を構築した。
論文 参考訳(メタデータ) (2024-12-16T08:31:55Z) - 2DQuant: Low-bit Post-Training Quantization for Image Super-Resolution [83.09117439860607]
低ビット量子化は、エッジ展開のための画像超解像(SR)モデルを圧縮するために広く普及している。
低ビット量子化は、フル精度(FP)と比較してSRモデルの精度を低下させることが知られている。
本稿では2DQuantという画像超解像のための2段階の低ビット後量子化(PTQ)法を提案する。
論文 参考訳(メタデータ) (2024-06-10T06:06:11Z) - SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models [63.118592279833656]
後学習量子化(PTQ)は,大規模言語モデル(LLM)の圧縮に有効な手法である
本稿では,SliM-LLMを提案する。SliM-LLMは,グループ単位でビット幅を割り当てるサリエンス駆動の混合精度量子化フレームワークである。
実験により、SliM-LLMは低ビット幅の様々なLLMにおいて優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2024-05-23T16:21:48Z) - DB-LLM: Accurate Dual-Binarization for Efficient LLMs [83.70686728471547]
大規模言語モデル(LLM)は自然言語処理の分野を著しく進歩させてきた。
既存の超低ビット量子化は、常に深刻な精度低下を引き起こす。
本稿では,LLM,すなわちDB-LLMのための新しいデュアルバイナライズ手法を提案する。
論文 参考訳(メタデータ) (2024-02-19T09:04:30Z) - CBQ: Cross-Block Quantization for Large Language Models [66.82132832702895]
ポストトレーニング量子化(PTQ)は、超低コストで大規模言語モデル(LLM)を圧縮する上で重要な役割を果たしている。
LLMのためのクロスブロック再構成に基づくPTQ手法CBQを提案する。
CBQはリコンストラクションスキームを使用してクロスブロック依存関係を採用し、エラーの蓄積を最小限に抑えるために複数のブロックにまたがる長距離依存関係を確立する。
論文 参考訳(メタデータ) (2023-12-13T07:56:27Z) - Q-Diffusion: Quantizing Diffusion Models [52.978047249670276]
ポストトレーニング量子化(PTQ)は、他のタスクに対するゴーツー圧縮法であると考えられている。
本稿では,一意なマルチステップパイプラインとモデルアーキテクチャに適した新しいPTQ手法を提案する。
提案手法は,完全精度の非条件拡散モデルを同等の性能を維持しつつ4ビットに定量化できることを示す。
論文 参考訳(メタデータ) (2023-02-08T19:38:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。