論文の概要: OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers
- arxiv url: http://arxiv.org/abs/2607.02461v1
- Date: Thu, 02 Jul 2026 17:27:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.942857
- Title: OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers
- Title(参考訳): OrbitQuant: 画像およびビデオ拡散変換器のデータ非依存量子化
- Authors: Donghyun Lee, Jitesh Chavan, Duy Nguyen, Sam Huang, Liming Jiang, Priyadarshini Panda, Timo Mertens, Saurabh Shukla,
- Abstract要約: ポストトレーニング量子化(PTQ)は自然な治療であるが、DiTアクティベーションはタイムステップ、プロンプト、ガイダンスブランチにまたがる。
正規化・回転ベースで定量化することで範囲推定を回避し,データに依存しない重みアクティベーション量子化器OrbitQuantを提案する。
我々は、同じ量化器をオフラインに拡張し、重みに回転を吸収し、各線形層の内部でキャンセルし、アクティベーションにおける前方回転のみが実行時に残るようにした。
- 参考スコア(独自算出の注目度): 11.521397862111824
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion transformers (DiTs) achieve state-of-the-art image and video generation, but their multi-step sampling and growing parameter count make inference expensive. Post-training quantization (PTQ) is the natural remedy, yet DiT activations shift across timesteps, prompts, and guidance branches, forcing prior methods to re-fit calibration data for every new checkpoint or modality. We present OrbitQuant, a data-agnostic weight-activation quantizer that bypasses range estimation by quantizing in a normalized, rotated basis. In this basis, a randomized permuted block-Hadamard (RPBH) rotation concentrates each coordinate around one fixed, known marginal regardless of the input, so a single Lloyd-Max codebook serves all timesteps, prompts, and layers of a given input dimension. We extend the same quantizer to weight rows offline, absorbing the rotation into the weights so that it cancels inside each linear layer and only a forward rotation on the activations remains at runtime. The same recipe transfers from image to video with no per-modality tuning. Across FLUX.1, Z-Image-Turbo, Wan 2.1, and CogVideoX, it sets the state of the art for PTQ at several low-bit settings. It also pushes PTQ of image diffusion transformers to W2A4 with usable generation quality.
- Abstract(参考訳): 拡散変換器(DiT)は最先端の画像と映像を生成するが、その多段階サンプリングとパラメータの増大は推論コストを高くする。
ポストトレーニング量子化(PTQ)は自然な治療法であるが、DiTのアクティベーションはタイムステップ、プロンプト、ガイダンスブランチにまたがってシフトし、新しいチェックポイントやモダリティごとにキャリブレーションデータを再適合させる。
正規化・回転ベースで定量化することで範囲推定を回避し,データに依存しない重みアクティベーション量子化器OrbitQuantを提案する。
このベースでは、ランダム化された置換ブロック-アダマール回転(RPBH)は入力に関係なく、各座標を1つの固定された、既知の辺りの辺りに集中させるため、単一のロイド・マックス符号ブックは与えられた入力次元のすべてのタイムステップ、プロンプト、および層を提供する。
我々は、同じ量化器をオフラインに拡張し、重みに回転を吸収し、各線形層の内部でキャンセルし、アクティベーションにおける前方回転のみが実行時に残るようにした。
同じレシピは、モダリティごとのチューニングなしで、イメージからビデオに転送される。
FLUX.1、Z-Image-Turbo、Wan 2.1、CagVideoXの他、PTQの最先端をいくつかの低ビット設定で設定する。
また、画像拡散変換器のPTQを、使用可能な生成品質でW2A4にプッシュする。
関連論文リスト
- AdaTSQ: Pushing the Pareto Frontier of Diffusion Transformers via Temporal-Sensitivity Quantization [22.45250803905198]
拡散変換器(DiT)は、高忠実度画像とビデオ生成のための最先端のバックボーンとして登場した。
後学習量子化(PTQ)は、大規模言語モデル(LLM)に有効であることが証明された。
本稿では,DiTの時間感度を利用して効率と品質のフロンティアを推し進める新しいPTQフレームワークであるAdaTSQを提案する。
論文 参考訳(メタデータ) (2026-02-10T15:23:18Z) - Quantized Visual Geometry Grounded Transformer [67.15451442018258]
本稿では,VGGTの最初の量子化フレームワーク,すなわちQuantVGGTを提案する。
球状前アダマール回転と局所流路平滑化を統合したDual-Smoothed Fine-Grained Quantizationを導入する。
また、重層統計量を用いて外周をフィルタするノイズフィルタディバースサンプリングを設計する。
論文 参考訳(メタデータ) (2025-09-25T15:17:11Z) - LRQ-DiT: Log-Rotation Post-Training Quantization of Diffusion Transformers for Image and Video Generation [41.66473889057111]
Diffusion Transformer (DiTs) は、テキスト・ツー・イメージとテキスト・ツー・ビデオ生成において、優れたパフォーマンスを実現している。
DiTsの高計算コストと大きなパラメータサイズは、リソース制約のあるシナリオでの利用に重大な課題をもたらす。
本稿では,映像・映像生成のための学習後量子化フレームワークLRQ-DiTを提案する。
論文 参考訳(メタデータ) (2025-08-05T14:16:11Z) - FlatQuant: Flatness Matters for LLM Quantization [58.28221892035609]
重みとアクティベーションの平坦性を高める新しいポストトレーニング量子化手法であるFlatQuantを提案する。
本手法では, 線形層毎の最適アフィン変換を, 軽量な目的により数時間で調整する。
LLaMA-3-70BモデルでのW4A4量子化の精度は1%以下で、SpinQuantを7.5%上回る。
論文 参考訳(メタデータ) (2024-10-12T08:10:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。