論文の概要: HyperVAttention: Efficient Sparse Attention with Spatio-Temporal Clustering for Video Diffusion
- arxiv url: http://arxiv.org/abs/2607.03012v1
- Date: Fri, 03 Jul 2026 06:46:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.496281
- Title: HyperVAttention: Efficient Sparse Attention with Spatio-Temporal Clustering for Video Diffusion
- Title(参考訳): HyperVAttention:ビデオ拡散のための時空間クラスタリングによる効率的なスパースアテンション
- Abstract要約: ビデオ拡散変換器(VDiT)は高忠実度ビデオ生成において重要な機能を示す。
長期保存ビデオを作成する能力は、自己保持機構の二次的な複雑さによって制約される。
最近のクラスタリングに基づくスパースアテンション手法は意味論的に類似したトークンをグループ化することで品質と速度のトレードオフを改善するが、その実用効率は2つのボトルネックによって制限されている。
両ボトルネックに共同で対処する,トレーニング不要のスパースアテンションフレームワークであるHyperVAを提案する。
- 参考スコア(独自算出の注目度): 37.76188499190129
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Video Diffusion Transformers (VDiTs) have demonstrated significant capabilities in high-fidelity video generation. However, their ability to produce long-duration videos is fundamentally constrained by the quadratic complexity of the self-attention mechanism. Recent clustering-based sparse attention methods improve the quality-speed trade-off by grouping semantically similar tokens, but their practical efficiency remains limited by two bottlenecks: substantial clustering overhead and low CTA utilization caused by irregular cluster-induced blocks. We propose HyperVAttention (HVA), a training-free sparse attention framework that addresses both bottlenecks jointly. To reduce clustering overhead, we introduce 3D local-window clustering, which exploits the spatio-temporal locality of video tokens to restrict centroid search to fixed local neighborhoods, and implement it with a custom Triton kernel for efficient execution. We further propose a hybrid clustering strategy that performs full clustering only at anchor steps and updates only subset tokens at intermediate steps, leveraging the temporal stability of cluster assignments across denoising steps. To improve CTA utilization, we present hardware-aware cluster merging that minimizes CTA-aligned execution cost through parallel agglomerative merging, improving block density and approximation fidelity by utilizing idle tile capacity. Together, these components reduce clustering overhead, avoid redundant updates, and better align sparse attention with the fixed tile structure of modern GPU kernels. Experiments on Text-to-Video generation show that HVA establishes a new Pareto frontier for training-free sparse attention in video diffusion, reducing end-to-end latency by up to $2.13\times$ while improving fidelity over existing training-free sparse attention baselines.
- Abstract(参考訳): ビデオ拡散変換器(VDiT)は高忠実度ビデオ生成において重要な機能を示す。
しかし、長周期ビデオを作成する能力は、自己注意機構の二次的な複雑さによって根本的に制限されている。
最近のクラスタリングに基づくスパースアテンション手法は,意味論的に類似したトークンをグループ化することによって,品質と速度のトレードオフを改善するが,その実用的効率は,クラスタリングのオーバヘッドと不規則なクラスタリングブロックによる低CTA利用という2つのボトルネックによって制限されている。
両ボトルネックに共同で対処する,トレーニング不要のスパースアテンションフレームワークであるHyperVAを提案する。
クラスタリングのオーバーヘッドを低減するために,ビデオトークンの時空間的局所性を利用した3Dローカルウィンドウクラスタリングを導入する。
さらに、アンカーステップのみでフルクラスタリングを行い、中間ステップでサブセットトークンのみを更新するハイブリッドクラスタリング戦略を提案する。
CTA利用を改善するため,並列アグリメティブマージによるCTA対応の実行コストを最小化し,アイドルタイル容量を利用してブロック密度と近似忠実度を向上させるハードウェア・アウェア・クラスタ・マージを提案する。
これらのコンポーネントは、クラスタリングのオーバーヘッドを減らし、冗長な更新を回避し、最新のGPUカーネルの固定タイル構造とスパースアテンションをよりよく調整する。
テキスト・ツー・ビデオ生成の実験によると、HVAはビデオ拡散におけるトレーニングフリーなスパースアテンションのための新しいパレートフロンティアを確立し、既存のトレーニングフリーなスパースアテンションベースラインよりも忠実さを向上しつつ、エンドツーエンドのレイテンシを最大2.13\times$に削減している。
関連論文リスト
- RhymeFlow: Training-Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling [51.279397568734424]
Diffusion Transformers (DiTs) に基づく映像生成モデルは,映像合成において顕著な性能を発揮している。
DiTは3次元の注意の二次的な複雑さのために、高い推論遅延と計算コストに悩まされる。
我々はbftextRhymeFlowを紹介した。bftextRhymeFlowはトレーニング不要のフレームワークで、異なるフレームの認知軌道を分離する。
論文 参考訳(メタデータ) (2026-06-04T15:49:37Z) - AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation [9.162823040512645]
ビデオ拡散変換器(DiT)は、二次的注意の複雑さにより、推論の禁止遅延に悩まされる。
トレーニング不要なアダプティブクラスタリングフレームワークであるAdaClusterを提案する。
1つのA40 GPU上でのCagVideoX-2B、HunyuanVideo、Wan-2.1の実験では、1.67-4.31xのスピードアップが無視できる品質劣化を示す。
論文 参考訳(メタデータ) (2026-04-20T14:43:36Z) - Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining [86.49790441700195]
ClusterSTMは、効率的なビデオ言語事前学習のためのクラスタワイズ時空間マスキング戦略である。
従来の視覚的再構成以上の高レベルなマルチモーダル・セマンティクスを整列するビデオテキスト関連性再構築手法を提案する。
論文 参考訳(メタデータ) (2026-03-24T08:48:15Z) - DiEC: Diffusion Embedded Clustering [0.76629754443761]
ディープクラスタリングは、明確なクラスタ構造を公開する表現に依存します。
従来のほとんどのメソッドは、オートエンコーダや自己教師付きエンコーダによる単一の埋め込みを学び、クラスタリングの第一の表現として扱う。
本研究では,事前学習した拡散U-Netの中間活性化を直接利用して,この軌道を利用する教師なしクラスタリングフレームワークであるEmbed Diffusion Clustering (DiEC)を提案する。
論文 参考訳(メタデータ) (2025-12-24T03:10:00Z) - You Can Trust Your Clustering Model: A Parameter-free Self-Boosting Plug-in for Deep Clustering [73.48306836608124]
DCBoostはパラメータフリーのプラグインで、現在のディープクラスタリングモデルのグローバルな特徴構造を強化するように設計されている。
本手法は, クラスタリング性能を効果的に向上することを目的としている。
論文 参考訳(メタデータ) (2025-11-26T09:16:36Z) - Compact Attention: Exploiting Structured Spatio-Temporal Sparsity for Fast Video Generation [21.87891961960399]
Compact Attentionは,3つのイノベーションを特徴とする,ハードウェア対応のアクセラレーションフレームワークだ。
単体GPUのセットアップに注意を向け,1.62.5倍の高速化を実現した。
この研究は、構造化された空間的利用を通じて効率的な長ビデオ生成を解放するための原則化されたアプローチを提供する。
論文 参考訳(メタデータ) (2025-08-18T14:45:42Z) - Temporal Cluster Assignment for Efficient Real-Time Video Segmentation [9.248291541710781]
ビジョントランスフォーマーは、画像ドメインとビデオドメインの両方にわたるセグメンテーションモデルの性能を大幅に向上させた。
Swinのウィンドウベースのアテンションメカニズムは、ウィンドウ毎に一定数のトークンを必要とするため、従来のプルーニング技術の適用性が制限される。
時間的コヒーレンスを活用してトークンクラスタリングを強化する軽量かつ効果的で微調整のない戦略である時間的クラスタ割り当て(TCA)を導入する。
論文 参考訳(メタデータ) (2025-08-07T20:52:49Z) - Revisiting Self-Supervised Heterogeneous Graph Learning from Spectral Clustering Perspective [52.662463893268225]
自己教師付きヘテロジニアスグラフ学習(SHGL)は様々なシナリオにおいて有望な可能性を示している。
既存のSHGLメソッドには2つの大きな制限がある。
ランクと二重整合性制約によって強化された新しいフレームワークを導入する。
論文 参考訳(メタデータ) (2024-12-01T09:33:20Z) - Improving Weakly-supervised Video Instance Segmentation by Leveraging Spatio-temporal Consistency [9.115508086522887]
我々はEigen VISと呼ばれる弱い教師付き手法を導入し、他のVIS手法と比較して競争精度を向上する。
この方法は、時間固有値損失(TEL)とクリップレベルの品質コ効率(QCC)の2つの重要なイノベーションに基づいている。
コードはhttps://github.com/farnooshar/EigenVIS.comで公開されている。
論文 参考訳(メタデータ) (2024-08-29T16:05:05Z) - CenterCLIP: Token Clustering for Efficient Text-Video Retrieval [67.21528544724546]
CLIPでは、ビデオ内の連続するフレームの冗長性のために、離散的な視覚トークンシーケンスを生成する重要な視覚トークン化プロセスが、多くの均一なトークンを生成する。
これにより、計算コストが大幅に増加し、Webアプリケーションにおけるビデオ検索モデルの展開が妨げられる。
本稿では,最も代表的なトークンを抽出し,非意味トークンをドロップするマルチセグメントトークンクラスタリングアルゴリズムを設計する。
論文 参考訳(メタデータ) (2022-05-02T12:02:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。