論文の概要: SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference
- arxiv url: http://arxiv.org/abs/2608.03335v1
- Date: Tue, 04 Aug 2026 08:47:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.103277
- Title: SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference
- Title(参考訳): SPADE: 高速ビデオ拡散モデル推論のための入力適応スパースアテンションエンジン
- Abstract要約: ビデオ拡散変換器(vDiTs)は高品質だが、二次的な自己注意コストを支払う。
3つのパートからなるトレーニング不要なスパースアテンションエンジンであるSPADEについて述べる。
Hunyuan-Video と Wan 2.1/2.2 はテキスト・ツー・ビデオおよび画像・ビデオ生成用で、SPADE は品質を保ちながら空間性と速度を向上する。
- 参考スコア(独自算出の注目度): 7.309663528163573
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video diffusion transformers (vDiTs) generate high quality but pay quadratic self-attention cost, making inference prohibitive at video-token scales. The challenge is input-adaptive sparsity: selecting critical Q/K/V tokens with negligible overhead and executing them for end-to-end gains. We present SPADE, a training-free sparse-attention engine of three parts: (i) vDiT-SSR, a specification defining 3D blocking candidates and formalizing dynamic masks via Summarizer/Estimator expressions; (ii) runtime scheme generation using SICS and a head-wise policy; and (iii) an executor with low-overhead index search, flash block-sparse attention, and kernel grouping. Across Hunyuan-Video and Wan 2.1/2.2 for text-to-video and image-to-video generation, SPADE raises sparsity and speed while preserving quality, accelerating attention by 2.26x-3.40x and end-to-end inference by 1.49x-1.80x. Our code is open-sourced at https://github.com/6somehow/DAC-SPADE.
- Abstract(参考訳): ビデオ拡散変換器(vDiTs)は高品質であるが、二次的な自己注意コストがかかるため、ビデオトーケンスケールでは推論が禁止される。
重要なQ/K/Vトークンを無視可能なオーバーヘッドで選択し、エンドツーエンドのゲインのために実行する。
トレーニング不要なスパースアテンションエンジンであるSPADEについて述べる。
(i)vDiT-SSRは、3Dブロッキング候補を定義し、Summarizer/Estimator式を介して動的マスクを定式化する仕様である。
(II)SICSとヘッドワイドポリシーを用いた実行時スキーム生成
(iii)低オーバーヘッドインデックス検索、フラッシュブロックスパースアテンション、カーネルグループ化を備えた実行子。
Hunyuan-Video と Wan 2.1/2.2 はテキスト・ツー・ビデオ・ジェネレーションと画像・ビデオ生成で、SPADE は品質を保ちながら空間性と速度を高め、2.26x-3.40x の注目を加速し、エンド・ツー・エンドの推論は 1.49x-1.80x になる。
私たちのコードはhttps://github.com/6somehow/DAC-SPADE.comで公開されている。
関連論文リスト
- HASTE: Training-Free Video Diffusion Acceleration via Head-Wise Adaptive Sparse Attention [68.95533683996236]
トレーニング不要のスパースアテンションは、トレーニングなしで事前トレーニングされたモデルを加速するため、魅力的である。
既存のオンラインのトップ$p$のスパース・アテンションは、マスクの予測に何の費用もかからない。
これら2つの見過ごされた要因は、ビデオDiTにおけるトレーニング不要のスパースアテンションの実践的スピード品質トレードオフを制限していることを示す。
論文 参考訳(メタデータ) (2026-05-14T07:57:55Z) - Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer [13.545000689565732]
トランスフォーマーベースのビデオ拡散モデル(VDM)は、最先端のビデオ生成の品質を提供するが、自己注意の二次コストに制約される。
我々は,訓練前のVDMの注意をスクラッチからトレーニングすることなくリニアライズあるいはハイブリダイズするための効果的なフレームワークである注意外科を紹介した。
論文 参考訳(メタデータ) (2025-09-29T15:09:51Z) - DSV: Exploiting Dynamic Sparsity to Accelerate Large-Scale Video DiT Training [85.04885553561164]
Diffusion Transformer (DiTs) は高品質なビデオの生成において顕著な性能を示した。
DiTは処理時間の95%を消費し、特別なコンテキスト並列性を要求する。
本稿では,経験的に観察したダイナミックアテンション空間を利用して,DSVによるビデオDiTトレーニングを高速化する手法を提案する。
論文 参考訳(メタデータ) (2025-02-11T14:39:59Z) - Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity [59.80405282381126]
拡散変換器(DiT)はビデオ生成を支配しているが、その高い計算コストは現実の応用性を著しく制限する。
Sparse VideoGen (SVG) と呼ばれる3次元フルアテンションに固有の空間を利用して推論効率を向上する学習自由フレームワークを提案する。
SVGはCagVideoX-v1.5とHunyuanVideoで最大2.28倍と2.33倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2025-02-03T19:29:16Z) - V^3: Viewing Volumetric Videos on Mobiles via Streamable 2D Dynamic Gaussians [53.614560799043545]
V3 (Viewing Volumetric Videos) は,ダイナミックガウスのストリーミングによる高品質なモバイルレンダリングを実現する,新たなアプローチである。
私たちの重要なイノベーションは、ダイナミックな3DGSを2Dビデオと見なすことで、ハードウェアビデオコーデックの使用を促進することです。
モバイル端末でダイナミックなガウシアンをストリームする最初の手段として、私たちのコンパニオンプレーヤーは、前例のないボリュームビデオ体験をユーザに提供します。
論文 参考訳(メタデータ) (2024-09-20T16:54:27Z) - Scalable Neural Video Representations with Learnable Positional Features [73.51591757726493]
我々は,学習可能な位置特徴(NVP)を用いて,映像を潜時符号として効果的に再生するニューラル表現の訓練方法を示す。
一般的なUVGベンチマークにおけるNVPの優位性を実証し,先行技術と比較して,NVPは2倍の速度(5分以内)で走行するだけでなく,符号化品質も34.07rightarrow$34.57(PSNR測定値で測定)に上回っている。
論文 参考訳(メタデータ) (2022-10-13T08:15:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。