論文の概要: Token Radius Attention for Efficient Video Generation
- arxiv url: http://arxiv.org/abs/2608.02504v1
- Date: Mon, 03 Aug 2026 17:05:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.723093
- Title: Token Radius Attention for Efficient Video Generation
- Title(参考訳): 効率的な映像生成のためのToken Radius Attention
- Abstract要約: 本稿では,問合せエントロピーを分析トークン予算にマッピングし,時間的に減衰した半径に変換する学習自由フレームワークを提案する。
7基のWan2.1、Wan2.2、HunyuanVideo T2V/I2V構成で、TRAは注意相互作用の9-19%しか保持せず、競争力のある生成品質で1.56x-2.05xのスピードアップを実現している。
- 参考スコア(独自算出の注目度): 14.657468653848627
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video Diffusion Transformers (VDiTs) enable high-fidelity generation but incur quadratic cost from dense 3D self-attention. Existing head- and block-level sparse methods share computation budgets across queries, overlooking token-specific attention demand. We observe that retained density varies across queries yet correlates log-linearly with attention entropy, while dominant interactions form query-centered neighborhoods with token-dependent radii. Based on these findings, we propose Token Radius Attention (TRA), a training-free framework that maps query entropy to an analytic token budget and converts it into a temporally decayed radius without explicit key ranking. Fused entropy extraction, warm-up reuse, and block-sparse mask construction further reduce overhead. Across seven Wan2.1, Wan2.2, and HunyuanVideo T2V/I2V configurations, TRA retains only 9-19% of attention interactions and achieves 1.56x-2.05x speedup with competitive generation quality. Code is available at https://github.com/IF-LAB-PKU/Token-Radius-Attention.
- Abstract(参考訳): ビデオ拡散変換器(VDiT)は高忠実度生成を可能にするが、高密度な3次元自己アテンションから2次コストを発生させる。
既存のヘッドレベルとブロックレベルのスパースメソッドは、トークン固有の注意要求を見越して、クエリ間で計算予算を共有する。
保持密度はクエリによって異なるが,注目エントロピーと対数直線的に相関するのに対し,支配的な相互作用はトークン依存ラジイとクエリ中心の近傍を形成する。
これらの知見に基づいて、クエリエントロピーを分析トークン予算にマッピングし、明示的なキーランキングなしで時間的に減衰した半径に変換する、トレーニング不要なフレームワークであるToken Radius Attention (TRA)を提案する。
融解エントロピー抽出、ウォームアップ再利用、ブロックスパースマスク構築によりオーバーヘッドはさらに低減される。
7基のWan2.1、Wan2.2、HunyuanVideo T2V/I2V構成で、TRAは注意相互作用の9-19%しか保持せず、競争力のある生成品質で1.56x-2.05xのスピードアップを実現している。
コードはhttps://github.com/IF-LAB-PKU/Token-Radius-Attentionで入手できる。
関連論文リスト
- SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference [7.309663528163573]
ビデオ拡散変換器(vDiTs)は高品質だが、二次的な自己注意コストを支払う。
3つのパートからなるトレーニング不要なスパースアテンションエンジンであるSPADEについて述べる。
Hunyuan-Video と Wan 2.1/2.2 はテキスト・ツー・ビデオおよび画像・ビデオ生成用で、SPADE は品質を保ちながら空間性と速度を向上する。
論文 参考訳(メタデータ) (2026-08-04T08:47:57Z) - Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers [54.01042826416009]
ビジュアル生成には高解像度の画像、長いビデオ、マルチモーダルコンテキストが必要である。
原理的なスケーリングレシピを備えたハイブリッドビジュアル拡散バックボーンであるChimeraを紹介した。
密度の高いバックボーンは、一致したフルアテンションWan2.1 2Bベースラインの1.7倍の計算効率を示す。
論文 参考訳(メタデータ) (2026-07-30T17:58:02Z) - Surprise Forcing: What to Remember, When to Skip in Long Video Generation [65.0022589149937]
自己回帰拡散をストリーミングすることで、ミニスケールのビデオ合成が実用的になるが、そのコンテキスト境界と固定化スケジュールはリソースを均一に割り当てる。
我々は、両方の制限をオンラインリソース割り当て問題として扱う、トレーニング不要のフレームワークであるSurprise Forcingを紹介した。
VBench、VBench-Long、VBench-2.0の実験では、提案されたアロケーション戦略は、リアルタイムストリーミングスループットを維持しながら、長時間の一貫性と視覚的品質を改善する。
論文 参考訳(メタデータ) (2026-07-20T18:37:58Z) - V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models [48.80617385008755]
ビデオ言語モデル(VideoLLMs)は理解に強い能力を示すが、長いコンテキスト推論はプリフィル段階では巨大な冗長な視覚トークンに支配されている。
長文ビデオ推論のための訓練不要なプラグアンドプレイプルーニングポリシーであるV-CASTを提案する。
論文 参考訳(メタデータ) (2026-03-29T11:53:32Z) - Going Down Memory Lane: Scaling Tokens for Video Stream Understanding with Dynamic KV-Cache Memory [50.30283773196725]
既存のアプローチは、時間とともにフレームレベルの詳細を蓄積するためにキーバリューキャッシングに依存していますが、フレーム毎に限られた数のトークンを使用します。
より詳細な時間的理解と推論を可能にするためにトークン予算のスケーリングを提案する。
論文 参考訳(メタデータ) (2026-02-20T18:59:50Z) - Light Forcing: Accelerating Autoregressive Video Diffusion via Sparse Attention [28.598033369607723]
textscLight Forcingは、ARビデオ生成モデルに適した、テキストファーストのスパースアテンションソリューションである。
textitChunk-Aware Growthメカニズムを組み込んで,各チャンクのコントリビューションを定量的に見積もる。
また,情報的歴史的・局所的文脈を粗い方法で捉えるために,テキストスパース注意を導入する。
論文 参考訳(メタデータ) (2026-02-04T17:41:53Z) - PISA: Piecewise Sparse Attention Is Wiser for Efficient Diffusion Transformers [37.401543107035046]
拡散変換器はビデオおよび画像生成に基本となるが、その効率は注意の二次的複雑さによってボトルネックとなる。
PISA(Piecewise Sparse Attention)を提案する。
論文 参考訳(メタデータ) (2026-02-01T07:47:06Z) - Dense Video Understanding with Gated Residual Tokenization [49.17263029080152]
高時間分解能は、ビデオ理解における微細な細部を捉えるのに不可欠である。
現在のベンチマークは主に低フレームレートサンプリングに依存している。
Dense Video Understanding (DVU)は、トークン化時間とトークンオーバーヘッドの両方を削減することで、高FPSビデオの理解を可能にする。
論文 参考訳(メタデータ) (2025-09-17T17:34:40Z) - Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers [24.105473321347894]
本稿では,ビデオ拡散変換器(vDiT)の空間加速度フレームワークであるSparse-vDiTを提案する。
Sparse-vDiT が 2.09$times$, 2.38$times$, 1.67$times$理論 FLOP 還元, 1.76$times$, 1.85$times$, 1.58$times$ をそれぞれ達成していることを示す。
我々の研究は、vDiTsの潜伏構造空間を長期ビデオ合成に体系的に活用できることを実証した。
論文 参考訳(メタデータ) (2025-06-03T16:42:37Z) - Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation [84.00166854547241]
拡散変換器(DiT)はビデオ生成に必須であるが,注意の2次複雑さにより遅延が著しく低下する。
SVG2は,識別精度を最大化し,無駄を最小化する学習自由フレームワークである。
論文 参考訳(メタデータ) (2025-05-24T21:30:29Z) - VSA: Faster Video Diffusion with Trainable Sparse Attention [38.37291040904089]
ビデオ拡散トランス (DiTs) のスケーリングは、注意質量の大部分が少数の位置に集中しているにもかかわらず、2次元の注意によって制限される。
私たちはこの観察を、トレーニング可能なハードウェア効率の良いスパースアテンションであるVSAに変換し、Emphbothのトレーニングと推論の完全なアテンションを置き換える。
論文 参考訳(メタデータ) (2025-05-19T17:30:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。