論文の概要: DSAQuant: Denoising-Stage-Aligned Quantization-Aware Training for Video Generation
- arxiv url: http://arxiv.org/abs/2609.04031v1
- Date: Thu, 03 Sep 2026 16:09:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.151139
- Title: DSAQuant: Denoising-Stage-Aligned Quantization-Aware Training for Video Generation
- Title(参考訳): DSAQuant:ビデオ生成のためのデノジング段階の量子化アウェアトレーニング
- Abstract要約: ビデオ拡散モデル(VDM)は、テキスト・ビデオ生成において顕著な進歩を遂げているが、その高メモリと計算コストは、実用的な展開を妨げる。
本稿では,VDMのためのDSAQuantを提案する。
- 参考スコア(独自算出の注目度): 64.0912100506603
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video diffusion models (VDMs) have achieved impressive progress in text-to-video generation, but their high memory and computational costs hinder practical deployment. Quantization-aware training (QAT) is an effective solution for compressing and accelerating advanced generative models without runtime overhead at inference. However, existing QAT methods suffer from a distinctive challenge in VDMs: while they often preserve prompt semantics, global layout, and coarse motion, the quantized model severely degrades visual details, texture fidelity, and sharpness. In this paper, we trace this degradation to the timestep-agnostic design of conventional quantization pipelines, which overlooks the stage-wise functionality of video denoising. In VDMs, early denoising steps mainly establish global structure and motion, whereas middle and late steps refine local appearance and high-frequency details. Based on this insight, we propose DSAQuant, a Denoising-Stage-Aligned Quantization-aware training framework for VDMs. During training, Denoising-Stage Oriented Supervision preserves teacher distillation in early steps for stable structure planning, while shifting later steps toward target-driven optimization to enhance detail reconstruction. During inference, Denoising-Stage Gated Guidance disables CFG in the final denoising steps to prevent it from amplifying quantization-induced errors into high-frequency artifacts. Extensive experiments on the Wan and CogVideoX families under W4A4 and W3A3 settings show that DSAQuant consistently outperforms the SOTA QAT baseline, improving the VBench average score by up to 6.60 under aggressive W3A3 quantization while preserving strong text-video alignment. These results demonstrate that effective VDM quantization requires not only reducing quantization error, but also aligning quantization training and inference with the stage-wise nature of video diffusion.
- Abstract(参考訳): ビデオ拡散モデル(VDM)は、テキスト・ビデオ生成において顕著な進歩を遂げているが、その高メモリと計算コストは、実用的な展開を妨げる。
量子化対応トレーニング(QAT)は、推論時に実行時のオーバーヘッドを伴わずに、高度な生成モデルを圧縮し、加速するための有効なソリューションである。
しかし、既存のQAT法はVDMにおいて顕著な課題に悩まされている: 即時意味論、グローバルなレイアウト、粗い動きをしばしば保存するが、量子化モデルは視覚的詳細、テクスチャの忠実さ、鋭さを著しく劣化させる。
本稿では,この劣化を従来の量子化パイプラインの時間ステップに依存しない設計に追従する。
VDMでは、初期認知段階は主にグローバルな構造と動きを確立し、中段と後期段は局所的な外観と高周波の詳細を洗練させる。
この知見に基づいて,VDMのためのDSAQuant(Denoising-Stage-Aligned Quantization-aware training framework)を提案する。
訓練中、Denoising-Stage Oriented Supervisionは教師の蒸留を早期に保存し、構造計画の安定を図った。
推論中、Denoising-Stage Gated Guidanceは最後のdenoisingステップでCFGを無効にし、量子化によるエラーを高周波アーティファクトに増幅するのを防ぐ。
Wan と CogVideoX ファミリーの W4A4 と W3A3 設定による大規模な実験により、DSAQuant は SOTA QAT ベースラインを一貫して上回り、強いテキスト・ビデオアライメントを維持しながら、攻撃的な W3A3 量子化の下で VBench 平均スコアを6.60 まで改善した。
これらの結果から,有効なVDM量子化は量子化誤差を低減させるだけでなく,映像拡散の段階的な性質と量子化トレーニングと推論を一致させる必要があることが示された。
関連論文リスト
- RhymeFlow: Training-Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling [51.279397568734424]
Diffusion Transformers (DiTs) に基づく映像生成モデルは,映像合成において顕著な性能を発揮している。
DiTは3次元の注意の二次的な複雑さのために、高い推論遅延と計算コストに悩まされる。
我々はbftextRhymeFlowを紹介した。bftextRhymeFlowはトレーニング不要のフレームワークで、異なるフレームの認知軌道を分離する。
論文 参考訳(メタデータ) (2026-06-04T15:49:37Z) - Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep [37.62908191585867]
HetCacheは、ビデオ・ツー・ビデオ(MV2V)の生成と編集のためのトレーニング不要な拡散加速フレームワークである。
編集の一貫性と忠実さを維持しながら、冗長な注意操作を低減する。
実験によると、HetCacheは2.67$times$レイテンシのスピードアップやFLOPの削減など、目立った加速を実現している。
論文 参考訳(メタデータ) (2026-03-25T12:53:31Z) - USV: Unified Sparsification for Accelerating Video Diffusion Models [11.011602744993942]
ビデオ拡散モデルのための統一スパシフィケーションは、エンドツーエンドのトレーニング可能なフレームワークである。
モデルの内部計算とサンプリングプロセスの両方でスパーシフィケーションをオーケストレーションする。
最大83.3%のスピードアップと22.7%のエンドツーエンドの加速を実現し、高い視力を維持している。
論文 参考訳(メタデータ) (2025-12-05T14:40:06Z) - Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models [11.913945404405865]
ほとんどのビデオ拡散モデル(VDM)は自己回帰的な方法でビデオを生成し、それに続く繰り返しフレームを生成する。
本稿では,自動回帰VDMのためのAdaptive Begin-of-Video Tokens(ada-BOV)を提案する。
論文 参考訳(メタデータ) (2025-11-15T08:29:14Z) - FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion [22.207275433870937]
拡散言語モデルは並列トークン生成と本質的に双方向性を提供する。
最先端拡散モデル(ドリーム7B、LLaDA 8Bなど)は推論が遅い。
我々は,トークンアンマキングを監督するために,軽量な事前学習型自己回帰モデルを用いた学習自由度法であるガイドド拡散を導入する。
論文 参考訳(メタデータ) (2025-05-27T17:39:39Z) - PMQ-VE: Progressive Multi-Frame Quantization for Video Enhancement [83.89668902758243]
多フレームビデオ強調タスクは、ビデオシーケンスの空間的および時間的解像度と品質を改善することを目的としている。
映像強調のためのプログレッシブマルチフレーム量子化(PMQ-VE)を提案する。
このフレームワークは、バックトラックベースマルチフレーム量子化(BMFQ)とプログレッシブマルチ教師蒸留(PMTD)という、粗大な2段階のプロセスを備えている。
論文 参考訳(メタデータ) (2025-05-18T07:10:40Z) - Training-free Diffusion Acceleration with Bottleneck Sampling [37.9135035506567]
Bottleneck Samplingは、低解像度の事前処理を活用して、出力の忠実さを維持しながら計算オーバーヘッドを低減する、トレーニング不要のフレームワークである。
画像生成に最大3$times$、ビデオ生成に2.5$times$、標準のフル解像度サンプリングプロセスに匹敵する出力品質を維持しながら、推論を加速する。
論文 参考訳(メタデータ) (2025-03-24T17:59:02Z) - One-Step Diffusion Model for Image Motion-Deblurring [85.76149042561507]
本稿では,脱臭過程を1段階に短縮する新しいフレームワークである脱臭拡散モデル(OSDD)を提案する。
拡散モデルにおける忠実度損失に対処するために,構造復元を改善する改良された変分オートエンコーダ(eVAE)を導入する。
提案手法は,実測値と非参照値の両方で高い性能を達成する。
論文 参考訳(メタデータ) (2025-03-09T09:39:57Z) - Rethinking Video Tokenization: A Conditioned Diffusion-based Approach [58.164354605550194]
新しいトークン化ツールであるDiffusion Conditioned-based Gene Tokenizerは、GANベースのデコーダを条件付き拡散モデルで置き換える。
再建に基本的MSE拡散損失とKL項,LPIPSを併用した訓練を行った。
CDTのスケールダウン版(3$times inference speedup)でさえ、トップベースラインと互換性がある。
論文 参考訳(メタデータ) (2025-03-05T17:59:19Z) - GAQAT: gradient-adaptive quantization-aware training for domain generalization [54.31450550793485]
そこで本研究では,DGのためのGAQAT(Gradient-Adaptive Quantization-Aware Training)フレームワークを提案する。
我々のアプローチは、低精度量子化におけるスケール・グラディエント・コンフリクト問題を特定することから始まる。
GAQATフレームワークの有効性を実験により検証した。
論文 参考訳(メタデータ) (2024-12-07T06:07:21Z) - QVD: Post-training Quantization for Video Diffusion Models [33.13078954859106]
ポストトレーニング量子化(PTQ)は、メモリフットプリントの削減と計算効率の向上に有効な手法である。
本稿では,QVDと呼ばれるビデオ拡散モデルに適した最初のPTQ戦略を紹介する。
我々は、W8A8のほぼロスレス性能劣化を達成し、FVDの205.12倍の性能向上を実現した。
論文 参考訳(メタデータ) (2024-07-16T10:47:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。