論文の概要: CentriQ: Calibration-Free Quantization of Diffusion Transformers via Exact Mean Centering
- arxiv url: http://arxiv.org/abs/2610.06260v1
- Date: Mon, 05 Oct 2026 12:54:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 17:22:16.479202
- Title: CentriQ: Calibration-Free Quantization of Diffusion Transformers via Exact Mean Centering
- Title(参考訳): CentriQ: 厳密な平均中心化による拡散変圧器の校正自由量子化
- Abstract要約: 拡散変換器(DiT)は最先端の画像生成を実現するが、サンプリングコストは配置を制限する。
我々は、回転前に各トークンを集中し、平均を正確に復元するキャリブレーションフリーの量子化器であるCentriQを紹介する。
2ビットのアクティベーションで使用可能な画質を維持する最初のキャリブレーションフリー方式である。
- 参考スコア(独自算出の注目度): 45.88028371034407
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion transformers (DiTs) achieve state-of-the-art image generation, but their sampling cost limits deployment. Quantizing both weights and activations to 4 bits reduces this cost, yet existing methods fall short in one of two ways. Calibration-based methods are tied to a specific checkpoint and prompt distribution, whereas data-free Hadamard rotation, effective for LLMs, loses quality on DiTs. We show that this loss has a structural cause. Adaptive layer-norm conditioning adds a per-token mean to the activations, and at the widths of the evaluated DiTs, the Hadamard rotations used by data-free methods cannot spread this mean uniformly across coordinates. A single dominant direction therefore survives the rotation and sets the quantization range. We introduce CentriQ, a calibration-free quantizer that centers each token before rotation and restores the mean exactly through a rank-1 full-precision branch, so that per-token scales follow in closed form without data. Weights are fitted under a robust $\ell_p$ objective that tracks the dense mode of each group and discounts heavy tails. Across three DiTs, CentriQ matches the quality of calibrated SVDQuant at 4 bits, whereas calibration-free weight quantizers with plain per-token activation quantization collapse or degrade substantially. CentriQ outperforms the strongest calibration-free method reported to date at 2-bit weights. It is also the first calibration-free method to retain usable image quality at 2-bit activations.
- Abstract(参考訳): 拡散変換器(DiT)は最先端の画像生成を実現するが、サンプリングコストは配置を制限する。
重みとアクティベーションの両方を4ビットに量子化することで、このコストを削減できるが、既存の方法は2つの方法の1つで不足する。
キャリブレーションに基づく手法は特定のチェックポイントと即時分布に結びついているが、データフリーなアダマール回転はLLMに有効であり、DiTの品質を損なう。
この損失には構造的な原因がある。
適応層ノルム条件付けは、アクティベーションにトーケン平均を付加し、評価されたDiTの幅では、データフリーメソッドで使用されるアダマール回転はこの平均を座標に均一に分散することはできない。
したがって、1つの支配的な方向が回転を生き残り、量子化範囲を設定する。
CentriQは、回転前に各トークンを集中し、ランク1の完全精度分岐を通して正確に平均を復元するキャリブレーションのない量子化器である。
重量は頑丈な$\ell_p$の目標の下で、各グループの密集モードを追跡し、重いテールを割引する。
3つの DiT 全体で、CentriQ はキャリブレーションされた SVDQuant の質を 4 ビットで一致させるが、キャリブレーションフリーな量量量化器は単発のアクティベーション量子化が崩壊するか、大幅に低下する。
CentriQは、これまで報告された最強のキャリブレーションフリーの手法を2ビットの重量で上回っている。
また、2ビットのアクティベーションで使用可能な画質を維持する最初のキャリブレーションフリーの手法でもある。
関連論文リスト
- Scale Sensitivity in Low-Bit Post-Training Quantization: Curvature of the Quantization Error Landscape [15.425095447368962]
GPTQファミリーにおけるポストトレーニング量子化(PTQ)法は、スケールを選択しなければならない一様格子上の層次再構成誤差を最小限に抑える。
この目的がスケールに対してどれほど敏感か研究する。
ガウス重みと十分に大きな有効ランクのキャリブレーションアクティベートを持つ層に対して、幅が大きくなるにつれて正規化された円-熱損失は高い確率で収束することを示す。
論文 参考訳(メタデータ) (2026-09-29T12:46:41Z) - KroQuant: Kronecker-Structured Block Transforms for Efficient Post-Training Quantization of Diffusion Transformers [42.11461757540461]
拡散変圧器(DiT)からW4A4への後処理量子化は出力品質を著しく低下させる。
KroQuantは、学習されたKronecker構造を持つ可逆変換をアクティベーションの各32要素ブロックに適用するPTQ手法である。
論文 参考訳(メタデータ) (2026-07-23T15:52:20Z) - OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers [11.521397862111824]
ポストトレーニング量子化(PTQ)は自然な治療であるが、DiTアクティベーションはタイムステップ、プロンプト、ガイダンスブランチにまたがる。
正規化・回転ベースで定量化することで範囲推定を回避し,データに依存しない重みアクティベーション量子化器OrbitQuantを提案する。
我々は、同じ量化器をオフラインに拡張し、重みに回転を吸収し、各線形層の内部でキャンセルし、アクティベーションにおける前方回転のみが実行時に残るようにした。
論文 参考訳(メタデータ) (2026-07-02T17:27:34Z) - TWLA: Achieving Ternary Weights and Low-Bit Activations for LLMs via Post-Training Quantization [15.401450705732232]
ターナライゼーションは有望な圧縮技術として登場した。
既存の方法は重み付き活性化分布に苦しむ。
我々は1.58ビットの重み圧縮と4ビットのアクティベーション量子化を実現するフレームワークであるTWLAを提案する。
論文 参考訳(メタデータ) (2026-06-11T08:37:20Z) - HARP: Hadamard-Preconditioned Adaptive Rotation Processor for Extreme LLM Quantization [48.87937677659571]
本稿では, HARP (Hadamard-preconditioned Adaptive Rotation Processor) を導入する。
1Bから70Bまでのモデルの2-4ビット設定では、HARPは固定RHTよりもパープレキシティとゼロショット精度を改善している。
HarPはデプロイ効率を保ち、FP16では128トン/秒、61トン/秒に達する。
論文 参考訳(メタデータ) (2026-05-28T12:24:15Z) - ConQuR: Corner Aligned Activation Quantization via Optimized Rotations for LLMs [14.352305549429289]
大きな言語モデル(LLM)は、大きなメモリフットプリントと高い推論コストのために、デプロイにコストがかかる。
ウェイトアクティベーション量子化はこれらのコストを削減することができるが、アクティベーションアウトレイアが大きな量子化誤差を引き起こすため、低ビットアクティベーション量子化は依然として困難である。
LLMアクティベーション量子化のための軽量な後回転校正法を提案する。
論文 参考訳(メタデータ) (2026-05-11T16:23:10Z) - Quantized Visual Geometry Grounded Transformer [67.15451442018258]
本稿では,VGGTの最初の量子化フレームワーク,すなわちQuantVGGTを提案する。
球状前アダマール回転と局所流路平滑化を統合したDual-Smoothed Fine-Grained Quantizationを導入する。
また、重層統計量を用いて外周をフィルタするノイズフィルタディバースサンプリングを設計する。
論文 参考訳(メタデータ) (2025-09-25T15:17:11Z) - FlatQuant: Flatness Matters for LLM Quantization [58.28221892035609]
重みとアクティベーションの平坦性を高める新しいポストトレーニング量子化手法であるFlatQuantを提案する。
本手法では, 線形層毎の最適アフィン変換を, 軽量な目的により数時間で調整する。
LLaMA-3-70BモデルでのW4A4量子化の精度は1%以下で、SpinQuantを7.5%上回る。
論文 参考訳(メタデータ) (2024-10-12T08:10:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。