論文の概要: Token Radius Attention for Efficient Video Generation
- arxiv url: http://arxiv.org/abs/2608.02504v1
- Date: Mon, 03 Aug 2026 17:05:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.723093
- Title: Token Radius Attention for Efficient Video Generation
- Title(参考訳): 効率的な映像生成のためのToken Radius Attention
- Abstract要約: 本稿では,問合せエントロピーを分析トークン予算にマッピングし,時間的に減衰した半径に変換する学習自由フレームワークを提案する。
7基のWan2.1、Wan2.2、HunyuanVideo T2V/I2V構成で、TRAは注意相互作用の9-19%しか保持せず、競争力のある生成品質で1.56x-2.05xのスピードアップを実現している。
- 参考スコア(独自算出の注目度): 14.657468653848627
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video Diffusion Transformers (VDiTs) enable high-fidelity generation but incur quadratic cost from dense 3D self-attention. Existing head- and block-level sparse methods share computation budgets across queries, overlooking token-specific attention demand. We observe that retained density varies across queries yet correlates log-linearly with attention entropy, while dominant interactions form query-centered neighborhoods with token-dependent radii. Based on these findings, we propose Token Radius Attention (TRA), a training-free framework that maps query entropy to an analytic token budget and converts it into a temporally decayed radius without explicit key ranking. Fused entropy extraction, warm-up reuse, and block-sparse mask construction further reduce overhead. Across seven Wan2.1, Wan2.2, and HunyuanVideo T2V/I2V configurations, TRA retains only 9-19% of attention interactions and achieves 1.56x-2.05x speedup with competitive generation quality. Code is available at https://github.com/IF-LAB-PKU/Token-Radius-Attention.
- Abstract(参考訳): ビデオ拡散変換器(VDiT)は高忠実度生成を可能にするが、高密度な3次元自己アテンションから2次コストを発生させる。
既存のヘッドレベルとブロックレベルのスパースメソッドは、トークン固有の注意要求を見越して、クエリ間で計算予算を共有する。
保持密度はクエリによって異なるが,注目エントロピーと対数直線的に相関するのに対し,支配的な相互作用はトークン依存ラジイとクエリ中心の近傍を形成する。
これらの知見に基づいて、クエリエントロピーを分析トークン予算にマッピングし、明示的なキーランキングなしで時間的に減衰した半径に変換する、トレーニング不要なフレームワークであるToken Radius Attention (TRA)を提案する。
融解エントロピー抽出、ウォームアップ再利用、ブロックスパースマスク構築によりオーバーヘッドはさらに低減される。
7基のWan2.1、Wan2.2、HunyuanVideo T2V/I2V構成で、TRAは注意相互作用の9-19%しか保持せず、競争力のある生成品質で1.56x-2.05xのスピードアップを実現している。
コードはhttps://github.com/IF-LAB-PKU/Token-Radius-Attentionで入手できる。
関連論文リスト
- Dense Video Understanding with Gated Residual Tokenization [49.17263029080152]
高時間分解能は、ビデオ理解における微細な細部を捉えるのに不可欠である。
現在のベンチマークは主に低フレームレートサンプリングに依存している。
Dense Video Understanding (DVU)は、トークン化時間とトークンオーバーヘッドの両方を削減することで、高FPSビデオの理解を可能にする。
論文 参考訳(メタデータ) (2025-09-17T17:34:40Z) - Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers [24.105473321347894]
本稿では,ビデオ拡散変換器(vDiT)の空間加速度フレームワークであるSparse-vDiTを提案する。
Sparse-vDiT が 2.09$times$, 2.38$times$, 1.67$times$理論 FLOP 還元, 1.76$times$, 1.85$times$, 1.58$times$ をそれぞれ達成していることを示す。
我々の研究は、vDiTsの潜伏構造空間を長期ビデオ合成に体系的に活用できることを実証した。
論文 参考訳(メタデータ) (2025-06-03T16:42:37Z) - Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation [84.00166854547241]
拡散変換器(DiT)はビデオ生成に必須であるが,注意の2次複雑さにより遅延が著しく低下する。
SVG2は,識別精度を最大化し,無駄を最小化する学習自由フレームワークである。
論文 参考訳(メタデータ) (2025-05-24T21:30:29Z) - VSA: Faster Video Diffusion with Trainable Sparse Attention [38.37291040904089]
ビデオ拡散トランス (DiTs) のスケーリングは、注意質量の大部分が少数の位置に集中しているにもかかわらず、2次元の注意によって制限される。
私たちはこの観察を、トレーニング可能なハードウェア効率の良いスパースアテンションであるVSAに変換し、Emphbothのトレーニングと推論の完全なアテンションを置き換える。
論文 参考訳(メタデータ) (2025-05-19T17:30:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。