論文の概要: ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers
- arxiv url: http://arxiv.org/abs/2606.23019v1
- Date: Mon, 22 Jun 2026 08:32:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 02:50:36.727623
- Title: ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers
- Title(参考訳): スケールアテンション:ビデオ拡散変換器の固有スパースアテンショントポロジーを発見する
- Authors: Ruiliang Zhou, Xuecheng Wu, Kang He, Guangyun Han, Bin Liu, Qinqin Chen, Wende Xu, Qingjie Zhao, Chengru Song,
- Abstract要約: Diffusion Transformers (DiTs) は高忠実度ビデオ生成に革命をもたらしたが、3Dフルアテンションに依存しているため、二次的な計算ボトルネックが生じる。
動的プルーニングは禁止されたランタイムのオーバーヘッドとメモリの断片化に悩まされ、静的はきめ細かい依存関係をキャプチャできない。
本研究では,重要な帰納バイアスに基づくトレーニングフリーフレームワークであるScalingAttentionを提案する。
Wan2.1の実験では、1.90倍のエンドツーエンドのスピードアップが達成され、最先端のベースラインに対する新たなフロンティアが確立された。
- 参考スコア(独自算出の注目度): 7.879917783645986
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Diffusion Transformers (DiTs) have revolutionized high-fidelity video generation, their reliance on 3D full attention creates a quadratic computational bottleneck. Existing sparse methods face a dilemma: dynamic pruning suffers from prohibitive runtime overhead and memory fragmentation, while static heuristics fail to capture fine-grained dependencies. In this work, we propose ScalingAttention, a training-free framework grounded in a key inductive bias: while individual activations are input-dependent, the high-mass attention regions for each head rapidly converge to a stable, prompt-agnostic Intrinsic Sparse Topology. This topology is weight-encoded, scale-invariant, and efficient to extract. ScalingAttention decouples topology discovery from sparsity control via: (1) WEST (Weight-Encoded Sparse Topology), which extracts a robust block-sparse prior mask offline to eliminate runtime search; (2) FAST (Fidelity-Aware Sensitivity Tuning), which adaptively tunes head-wise sparsity based on diffusion fidelity requirements. To ensure practical acceleration, we co-design a hardware-aligned bit-wise block-sparse kernel. Experiments on Wan2.1 show up to 1.90X end-to-end speedup with superior fidelity, establishing a new Pareto frontier over state-of-the-art baselines.
- Abstract(参考訳): Diffusion Transformers (DiTs) は高忠実度ビデオ生成に革命をもたらしたが、3Dフルアテンションへの依存は2次計算ボトルネックを生み出した。
動的プルーニングは禁止されたランタイムのオーバーヘッドとメモリの断片化に悩まされ、静的ヒューリスティックはきめ細かい依存関係をキャプチャできない。
本研究では, 個別のアクティベーションが入力依存である一方, 各頭部の高質量注意領域は, 安定かつ急激な固有スパーストポロジーに急速に収束する, 重要な帰納バイアスを基礎とした学習自由フレームワークであるScalingAttentionを提案する。
このトポロジーは重量エンコードされ、スケール不変であり、抽出するのに効率的である。
ScalingAttention は,(1)WEST (Weight-Encoded Sparse Topology)、(2)FAST (Fidelity-Aware Sensitivity Tuning)、(2)FAST (Fdelity-Aware Sensitivity Tuning)、および(1)WEST (Weight-Encoded Sparse Topology)。
実用的な高速化を実現するため,ハードウェア対応のビットワイドブロックスパースカーネルを共同設計する。
Wan2.1の実験では、1.90倍のエンドツーエンドのスピードアップが達成され、最先端のベースラインに対する新たなパレートフロンティアが確立された。
関連論文リスト
- Temporal Backtracking Search for Test-time Generative Video Reasoning [51.4821857044108]
生成的ビデオ推論は、シングルショットのパラダイムによってボトルネックになっている。
本稿では,検索空間を時間軸にシフトさせるTBS(Temporal Backtracking Search)を提案する。
厳格なアウト・オブ・ディストリビューション設定では、TBSは22.7%を達成し、解決された各エピソードは再起動されたブランチから始まる。
論文 参考訳(メタデータ) (2026-06-11T19:41:18Z) - Test-time Sparsity for Extreme Fast Action Diffusion [15.679362579177267]
アクション拡散は、高忠実なアクション生成において優れるが、反復的なデノイングの性質のため、計算コストが重い。
この課題に対処するために,テスト時間間隔を提案する。これは,各モデルに対する動的に予測可能な残差計算をテスト時に前方に進めることで,動作拡散を加速することを目的としている。
論文 参考訳(メタデータ) (2026-05-13T10:28:50Z) - Ride the Wave: Precision-Allocated Sparse Attention for Smooth Video Generation [9.132288507881592]
ビデオ拡散変換器は高忠実度ビデオ生成に革命をもたらしたが、自己注意の膨大な計算負担に悩まされている。
PASA(Precision-Allocated Sparse Attention)は,高効率かつ時間的にスムーズなビデオ生成を目的としたトレーニングフリーフレームワークである。
論文 参考訳(メタデータ) (2026-04-14T02:51:52Z) - Fast-SAM3D: 3Dfy Anything in Images but Faster [65.17322167628367]
SAM3Dは複雑なシーンからスケーラブルでオープンな3D再構築を可能にする。
textbfFast-SAM3Dは、計算を瞬時生成の複雑さと整合させる、トレーニング不要のフレームワークである。
論文 参考訳(メタデータ) (2026-02-05T04:27:59Z) - Compact Attention: Exploiting Structured Spatio-Temporal Sparsity for Fast Video Generation [21.87891961960399]
Compact Attentionは,3つのイノベーションを特徴とする,ハードウェア対応のアクセラレーションフレームワークだ。
単体GPUのセットアップに注意を向け,1.62.5倍の高速化を実現した。
この研究は、構造化された空間的利用を通じて効率的な長ビデオ生成を解放するための原則化されたアプローチを提供する。
論文 参考訳(メタデータ) (2025-08-18T14:45:42Z) - Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers [24.105473321347894]
本稿では,ビデオ拡散変換器(vDiT)の空間加速度フレームワークであるSparse-vDiTを提案する。
Sparse-vDiT が 2.09$times$, 2.38$times$, 1.67$times$理論 FLOP 還元, 1.76$times$, 1.85$times$, 1.58$times$ をそれぞれ達成していることを示す。
我々の研究は、vDiTsの潜伏構造空間を長期ビデオ合成に体系的に活用できることを実証した。
論文 参考訳(メタデータ) (2025-06-03T16:42:37Z) - FUSE: Label-Free Image-Event Joint Monocular Depth Estimation via Frequency-Decoupled Alignment and Degradation-Robust Fusion [92.4205087439928]
画像強調共同深度推定法は、頑健な知覚に相補的なモダリティを利用するが、一般化可能性の課題に直面している。
自己監督型転送(PST)と周波数デカップリング型フュージョンモジュール(FreDF)を提案する。
PSTは、画像基盤モデルとの遅延空間アライメントによるクロスモーダルな知識伝達を確立し、データ不足を効果的に軽減する。
FreDFは、低周波構造成分から高周波エッジ特性を明示的に分離し、モード比周波数ミスマッチを解消する。
この組み合わせのアプローチにより、FUSEはターゲットデータセットに対する軽量デコーダ適応のみを必要とするユニバーサルなイメージイベントを構築することができる。
論文 参考訳(メタデータ) (2025-03-25T15:04:53Z) - Training-free and Adaptive Sparse Attention for Efficient Long Video Generation [31.615453637053793]
Diffusion Transformers (DiTs) による高忠実度長ビデオの生成は、しばしば大きな遅延によって妨げられる。
本稿では,最初の動的パターンとオンライン精密検索スパースアテンション手法であるAdaSpaを提案する。
AdaSpaは適応的なプラグアンドプレイソリューションとして実装されており、既存のDiTとシームレスに統合することができる。
論文 参考訳(メタデータ) (2025-02-28T14:11:20Z) - Towards Stabilized and Efficient Diffusion Transformers through Long-Skip-Connections with Spectral Constraints [51.83081671798784]
Diffusion Transformers (DiT) は、画像およびビデオ生成のための強力なアーキテクチャとして登場し、優れた品質とスケーラビリティを提供している。
DiTの実用アプリケーションは本質的に動的特徴不安定性に悩まされており、キャッシュされた推論中にエラーを増幅する。
我々は,Long-Skip-Connections (LSCs) で拡張された画像およびビデオ生成型DiTであるSkip-DiTを提案する。
論文 参考訳(メタデータ) (2024-11-26T17:28:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。