論文の概要: DraftAttention2: Fast Video Diffusion with Low-Resolution-Guided Mixed-Precision Attention
- arxiv url: http://arxiv.org/abs/2609.32628v1
- Date: Sat, 26 Sep 2026 13:47:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:53:09.83008
- Title: DraftAttention2: Fast Video Diffusion with Low-Resolution-Guided Mixed-Precision Attention
- Title(参考訳): DraftAttention2: 低分解能混合精度注意による高速ビデオ拡散
- Abstract要約: ビデオトランスフォーマーは、生成されたビデオの質が向上するが、ビデオの解像度と持続時間が増えるにつれて、トークンに対する注意がますます高くなる。
本稿では,低解像度のドラフトアテンションマップを用いて,アテンションブロックを共同選択し,それらの数値精度を割り当てる学習自由フレームワークであるDraft2を提案する。
実験により,本手法は既存の効率的なビデオ生成方法よりも優れた品質・効率トレードオフを実現することが示された。
- 参考スコア(独自算出の注目度): 41.687316333346
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Video generation has broad applications in content creation and entertainment. Diffusion transformers have advanced the quality of generated videos, but attention over spatiotemporal tokens becomes increasingly expensive as video resolution and duration increase. We present DraftAttention2, a training-free framework that uses the low-resolution draft attention map to jointly select attention blocks and assign their numerical precision. Specifically, spatial 2D average- and max-pooled queries and keys capture complementary regional statistics to estimate block importance, and a shared ranking assigns higher precision to important blocks, lower precision to less important retained blocks, and skips the rest under configurable budgets. Our analysis separates sparsification error from attention-weighted quantization error, establishing when recovering skipped interactions with low-bit computation tightens the output-error bound. This analysis motivates retaining more interactions at low precision while reserving higher precision for blocks with larger attention mass. To translate these fine-grained assignments into practical speedups, we further develop fused operand preparation and a single attention kernel with precision-specific phases, sharing data movement, softmax statistics, and output accumulation across precisions. Experiments demonstrate that our method achieves a superior quality-efficiency trade-off over existing efficient video generation methods. Notably, its advantage is particularly pronounced for few-step video diffusion, where jointly combining sparsity with 4- and 8-bit mixed-precision computation substantially improves generation quality while retaining significant acceleration. Code is available at https://github.com/anemoi-project/anemoi
- Abstract(参考訳): ビデオ生成はコンテンツ制作やエンターテイメントに広く応用されている。
拡散変換器は生成ビデオの品質を向上してきたが、ビデオ解像度と持続時間の増加に伴い、時空間トークンに対する注意がますます高くなる。
本稿では,低解像度のドラフトアテンションマップを用いてアテンションブロックを共同選択し,それらの数値精度を割り当てる学習自由フレームワークであるDraftAttention2を提案する。
具体的には、空間的な2D平均値と最大値のクエリとキーは、ブロックの重要度を推定するために補完的な地域統計をキャプチャし、共有ランキングは、重要なブロックに高い精度を割り当て、より重要でない保持ブロックに低い精度を割り当て、構成可能な予算で残りをスキップする。
我々の分析では、スペーシフィケーションエラーとアテンション重み付き量子化誤差を分離し、低ビット演算によるスキップ相互作用の回復が出力エラー境界を締め付ける。
この分析は、注目質量が大きいブロックに対して高い精度を維持しながら、低い精度でより多くの相互作用を保持する動機となる。
これらの微粒な割り当てを実用的なスピードアップに変換するため、我々はさらに、高精度な位相、データ移動の共有、ソフトマックス統計、精度を越えた出力蓄積を含む、融合オペランド準備と単一注意カーネルを開発する。
実験により,本手法は既存の効率的なビデオ生成方法よりも優れた品質・効率トレードオフを実現することが示された。
特に、4ビットと8ビットの混合精度計算を併用することで、大幅な加速を維持しながら、生成品質を大幅に向上させることができる。
コードはhttps://github.com/anemoi-project/anemoiで入手できる。
関連論文リスト
- QuantWM: Temporally Consistent 2-Bit KV Cache Quantization for Video World Models [58.40720767342501]
ビデオワールドモデルは、生成中にKVキャッシュを格納することで、長距離時間一貫性を実現する。
既存の2ビットKVキャッシュ量子化法は、ビデオワールドモデルに適用した場合、時間的フレッカリングと視覚的劣化を引き起こす。
我々は,ビデオワールドモデルのためのトレーニング不要な2ビットKVキャッシュ量子化フレームワークQuantWMを提案する。
論文 参考訳(メタデータ) (2026-09-22T13:50:54Z) - Towards Error-Free Long Video Generation [56.86952045212838]
本稿では,高品質でダイナミックでアイデンティティに一貫性のある単一ショット長ビデオを生成する,無限長のビデオ生成フレームワークを提案する。
まず,大規模なショートビデオデータに基づいて拡散モデルをビデオ拡張モデルとして微調整し,時間的コヒーレントなクリップを自動的に生成する。
我々のフレームワークは、リアルでコヒーレントな微小レベルのビデオ合成のための新しいベンチマークを確立する。
論文 参考訳(メタデータ) (2026-06-21T07:39:37Z) - BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers [13.600791786470841]
注意のバイナライゼーションは,本質的な類似性関係を保ち,バイナリアテンションを提案する。
学習可能なバイアスを組み込むことで1ビット量子化の下での固有情報損失を軽減し、エンドツーエンドの加速を可能にする。
我々の研究は、低ビットビジョンと拡散トランスフォーマーのフロンティアを推し進め、完全精度の注意に対する高効率で効果的な代替手段を提供する。
論文 参考訳(メタデータ) (2026-03-10T12:31:54Z) - DraftAttention: Fast Video Diffusion via Low-Resolution Attention Guidance [43.423240627266644]
拡散変換器を用いたビデオ生成モデル(DiTs)は近年,その優れた生成品質に注目が集まっている。
しかしながら、その計算コストは、ボトルネック注意だけで、全体の80%以上の遅延の原因となっている。
本稿では,GPUに動的に注意を向けたビデオ拡散変換器の高速化のためのトレーニングフリーフレームワークであるDraftAttentionを提案する。
論文 参考訳(メタデータ) (2025-05-17T04:34:34Z) - SparseTem: Boosting the Efficiency of CNN-Based Video Encoders by Exploiting Temporal Continuity [19.900719882624028]
本稿では,メモリオーバーヘッドを削減するためのメモリ効率スケジューリング手法と,精度の劣化を最小限に抑えるためのオンライン調整機構を提案する。
SparseTemは効率の良いDetでは1.79x、CRNNでは4.72xの高速化を実現している。
論文 参考訳(メタデータ) (2024-10-28T07:13:25Z) - Accurate Block Quantization in LLMs with Outliers [0.6138671548064355]
極大規模LLMの推理需要はここ数カ月で大きく伸びている。
この問題は処理中のシーケンスの長さが爆発的に増加することで増大する。
重みとアクティベーションの両方の正確な量子化を可能にする様々な量子化技術が提案されている。
論文 参考訳(メタデータ) (2024-03-29T12:15:06Z) - Object-Centric Diffusion for Efficient Video Editing [64.71639719352636]
拡散ベースのビデオ編集は素晴らしい品質に達している。
このようなソリューションは通常、時間的に整合性のあるフレームを生成するために重いメモリと計算コストを発生させる。
品質を維持しつつ、大幅なスピードアップを可能にする修正を提案する。
論文 参考訳(メタデータ) (2024-01-11T08:36:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。