論文の概要: Improving Video Sparse Attention with Fine-grained Router and Sparse Rebasing
- arxiv url: http://arxiv.org/abs/2609.32882v1
- Date: Sat, 26 Sep 2026 19:05:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 19:27:17.148976
- Title: Improving Video Sparse Attention with Fine-grained Router and Sparse Rebasing
- Title(参考訳): きめ細かなルータとスパースリベースによるビデオスパースアテンションの改善
- Abstract要約: VSA2は、ビデオDiTのための、フロンティアトレーニング可能なスパースアテンションである。
フルアテンションのDiTと同等か、あるいは同等のクオリティのDiTを生産する。
プログレッシブ・ロー・ツー・ハイ・レゾリューション・プレトレーニングの途中で、完全な注意を置き換えることができる。
- 参考スコア(独自算出の注目度): 21.64233359553617
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present VSA2, a frontier trainable sparse attention for video DiTs. VSA2 includes a variety of new architectural features and training procedures that we apply across all stages of the DiT development cycle, including pretraining, RL, and inference, to produce a DiT with comparable or better quality than a full attention counterpart. Architecturally, VSA2 introduces a fine-grained router that improves the precision of identifying critical tokens and supports dynamic computation by allowing each query to attend to a variable number of key-value pairs. In training, we identify a Hard-to-Easy Curriculum, where models trained under high sparsity and later evaluated with lower sparsity during inference not only generalize effectively, but also outperform models trained with full attention in motion quality. VSA2 is also flexible: it can replace full attention during the middle of progressive low-to-high resolution pretraining, rebasing early-stage full-attention checkpoints. Experiments show that VSA2 reduces attention computation by half over VSA with lower loss. On 720p videos, it accelerates attention by 8.9x and end-to-end generation by 4.62x compared to the FlashAttention-3 baseline, while achieving comparable or better video quality.
- Abstract(参考訳): ビデオDiTに対して,フロンティアトレーニング可能なスパースアテンションであるVSA2を提示する。
VSA2には、プレトレーニング、RL、推論を含む、DiT開発サイクルの全段階にわたって適用する、さまざまなアーキテクチャ機能とトレーニング手順が含まれています。
アーキテクチャ上、VSA2は、重要なトークンを識別する精度を改善し、各クエリが可変数のキーと値のペアに参加することを可能にすることで動的計算をサポートする、きめ細かいルータを導入している。
トレーニングでは、高間隔でトレーニングされたモデルと、推論中に低間隔で評価されたモデルが効果的に一般化されるだけでなく、運動品質に十分な注意を払ってトレーニングされたモデルよりも優れる、ハード・トゥ・イージーなカリキュラムを同定する。
VSA2はフレキシブルで、プログレッシブな低解像度から高解像度の事前トレーニング中、早期のフルアテンションチェックポイントをリベースして、フルアテンションを置き換えることができる。
実験の結果、VSA2は低い損失でVSAの半分以上の注意計算を減らしている。
720pの動画では、FlashAttention-3のベースラインに比べて8.9倍、エンド・ツー・エンドの世代が4.62倍の注目を惹きつける。
関連論文リスト
- Bidirectional Sparse Attention for Faster Video Diffusion Training [14.523882232476092]
ビデオ拡散トランスフォーマー(DiT)モデルは、生成品質は優れているが、高解像度の長期ビデオを生成する際に大きな計算ボトルネックにぶつかる。
本稿では,2方向スパースアテンション(BSA)フレームワークを提案する。このフレームワークは,クエリとキー-バリューのペアを動的に3Dフルアテンション内に分散させる。
BSAは長いシーケンスにわたるDiTトレーニングを著しく加速し、FLOPを最大20倍に減らし、17.79倍のアテンショントレーニングを達成した。
論文 参考訳(メタデータ) (2025-09-01T03:16:52Z) - VSA: Faster Video Diffusion with Trainable Sparse Attention [38.37291040904089]
ビデオ拡散トランス (DiTs) のスケーリングは、注意質量の大部分が少数の位置に集中しているにもかかわらず、2次元の注意によって制限される。
私たちはこの観察を、トレーニング可能なハードウェア効率の良いスパースアテンションであるVSAに変換し、Emphbothのトレーニングと推論の完全なアテンションを置き換える。
論文 参考訳(メタデータ) (2025-05-19T17:30:13Z) - Towards Generalized Video Quality Assessment: A Weak-to-Strong Learning Paradigm [76.63001244080313]
映像品質評価(VQA)は、人間の視覚的知覚に合わせて映像の知覚的品質を予測することを目的としている。
支配的なVQAパラダイムは、人間のラベル付きデータセットによる教師付きトレーニングに依存している。
我々は、大規模な人ラベルデータセットに頼らずにVQAを進めるための新しいパラダイムとして、弱い対強学習(W2S)を探求する。
論文 参考訳(メタデータ) (2025-05-06T15:29:32Z) - DSV: Exploiting Dynamic Sparsity to Accelerate Large-Scale Video DiT Training [85.04885553561164]
Diffusion Transformer (DiTs) は高品質なビデオの生成において顕著な性能を示した。
DiTは処理時間の95%を消費し、特別なコンテキスト並列性を要求する。
本稿では,経験的に観察したダイナミックアテンション空間を利用して,DSVによるビデオDiTトレーニングを高速化する手法を提案する。
論文 参考訳(メタデータ) (2025-02-11T14:39:59Z) - T2V-Turbo-v2: Enhancing Video Generation Model Post-Training through Data, Reward, and Conditional Guidance Design [84.03286690283747]
提案手法であるT2V-Turbo-v2は、様々な監視信号を統合することにより、大幅な進歩をもたらす。
特定の学習目標に対するデータセットの調整の重要性を強調した。
トレーニングデータセットから動作ガイダンスを抽出し,ODEソルバに組み込むことにより,このアプローチの可能性を示す。
論文 参考訳(メタデータ) (2024-10-08T04:30:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。