論文の概要: MC-Sparse: Deconstructing and Closing the Dense-Sparse Attention Gap in Diffusion Transformers
- arxiv url: http://arxiv.org/abs/2610.06801v1
- Date: Mon, 05 Oct 2026 17:51:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 22:37:59.953624
- Title: MC-Sparse: Deconstructing and Closing the Dense-Sparse Attention Gap in Diffusion Transformers
- Title(参考訳): MC-Sparse:拡散変圧器におけるDense-Sparse Attention Gapの分解と閉鎖
- Abstract要約: スパースアテンション(Sparse attention)は、長周期生成タスクにおける拡散変圧器の遅延を低減するための主要なアプローチである。
同様のクエリをタイル型グループに整理しながら,個々のキー値(KV)トークンを選択するトレーニングフリーフレームワークであるMeta-Cached Sparse Attention (MC-Sparse)を提案する。
目に見える品質劣化を伴わずに、高密度アテンション出力に対する忠実度を達成し、既存のスパースアテンションベースラインよりも大きなデノナイジングスピードアップを実現する。
- 参考スコア(独自算出の注目度): 51.6540025252929
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse attention is a primary approach to reducing the latency of diffusion transformers in long-sequence generation tasks, such as video and high-resolution 3D asset generation. However, existing methods can degrade generation quality and fidelity at high sparsity levels. Through controlled oracle comparisons, we trace this degradation to three sources: constraints imposed by token grouping, inaccurate interaction selection, and the attention contributions lost when tokens are discarded. Guided by this analysis, we propose Meta-Cached Sparse Attention (MC-Sparse), a training-free framework that selects individual key-value (KV) tokens while organizing similar queries into tile-aligned groups for efficient GPU execution. MC-Sparse caches metadata comprising query groups, KV indices selected using exact attention probabilities, and residuals between dense and sparse attention outputs, and reuses them across subsequent denoising steps. Across video and 3D generation models, MC-Sparse achieves higher fidelity to dense-attention outputs and larger denoising speedups than existing sparse-attention baselines, without visible quality degradation. Relative to dense attention, it delivers a $1.80\times$ denoising speedup on Minimax-H3-Base and a $2.32\times$ speedup on 3D asset generation, both with negligible quality loss.
- Abstract(参考訳): スパースアテンション(Sparse attention)は、ビデオや高解像度の3Dアセット生成など、長いシーケンス生成タスクにおける拡散変圧器の遅延を低減するための主要なアプローチである。
しかし、既存の手法は、高い疎度で生成品質と忠実度を低下させることができる。
制御されたオラクルの比較を通して、この劣化を、トークングループ化による制約、不正確な相互作用の選択、トークンが破棄されたときに失われた注意貢献の3つの源まで追跡する。
この分析で導かれたMeta-Cached Sparse Attention (MC-Sparse) は,個々のキー値(KV)トークンを選択しつつ,類似クエリをタイル整列グループに整理し,GPUを効率的に実行するためのトレーニングフリーフレームワークである。
MC-Sparseは、クエリグループと、正確な注意確率から選択されたKVインデックスと、密集した注意出力と疎通した注意出力の間の残差からなるメタデータをキャッシュし、その後の認知ステップで再利用する。
ビデオおよび3D生成モデル全体で、MC-Sparseは、目に見える品質劣化を伴わずに、高密度アテンション出力に対する忠実度と、既存のスパースアテンションベースラインよりも大きなデノージングスピードアップを達成する。
注目度は高いが、Minimax-H3-Baseでは1.80\times$のデノイング・スピードアップ、3Dアセット・ジェネレーションでは2.32\times$のスピードアップを提供する。
関連論文リスト
- Parameterized Stripe Attention for Efficient Video Generation [7.1448760533211635]
Diffusion Diffusion (DiTs) は高品質なビデオ生成を可能にするが、相当な推論遅延に悩まされる。
スパースアテンション手法は潜在的な解決策を提供するが、既存のアプローチは固有の柔軟性-効率ジレンマに直面している。
既存の手法の限界としてDiTアテンションの統一的な構造的特徴が欠如していることを認識し,ビデオDiTアテンションが時間的・次元的に規則性を示すことを示す。
論文 参考訳(メタデータ) (2026-09-29T08:29:33Z) - QuantWM: Temporally Consistent 2-Bit KV Cache Quantization for Video World Models [58.40720767342501]
ビデオワールドモデルは、生成中にKVキャッシュを格納することで、長距離時間一貫性を実現する。
既存の2ビットKVキャッシュ量子化法は、ビデオワールドモデルに適用した場合、時間的フレッカリングと視覚的劣化を引き起こす。
我々は,ビデオワールドモデルのためのトレーニング不要な2ビットKVキャッシュ量子化フレームワークQuantWMを提案する。
論文 参考訳(メタデータ) (2026-09-22T13:50:54Z) - HyperVAttention: Efficient Sparse Attention with Spatio-Temporal Clustering for Video Diffusion [37.76188499190129]
ビデオ拡散変換器(VDiT)は高忠実度ビデオ生成において重要な機能を示す。
長期保存ビデオを作成する能力は、自己保持機構の二次的な複雑さによって制約される。
最近のクラスタリングに基づくスパースアテンション手法は意味論的に類似したトークンをグループ化することで品質と速度のトレードオフを改善するが、その実用効率は2つのボトルネックによって制限されている。
両ボトルネックに共同で対処する,トレーニング不要のスパースアテンションフレームワークであるHyperVAを提案する。
論文 参考訳(メタデータ) (2026-07-03T06:46:35Z) - Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs [21.02858354959528]
視覚言語モデルと視覚言語アクションモデルにより、ロボットには前例のない能力がある。
ビデオや高解像度画像の入力は膨大な数の視覚トークンをもたらし、非常に高い推論遅延をもたらし、ロボットのリアルタイム制御を著しく妨げる。
本稿では,視覚的エンコーディングフェーズにおいて,冗長トークンを直接効率的に融合するプラグイン・アンド・プレイフレームワークST-Mergeを提案する。
論文 参考訳(メタデータ) (2026-06-28T11:42:55Z) - StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression [39.0869112189715]
StreamCacheVGTは、キャッシュ管理を再定義するトレーニング不要のフレームワークである。
一定のコストの制約に厳格に固執しつつ、より優れた復元精度と長期安定を提供する。
論文 参考訳(メタデータ) (2026-04-16T17:12:10Z) - Hierarchical Adaptive Eviction for KV Cache Management in Multimodal Language Models [8.944739362562494]
既存のKVキャッシュ消去戦略は、視覚トークンとテキストトークンの間の不均一な注意分布に対処できない。
MLLMにおけるテキスト-視覚トークンの相互作用を最適化するKVキャッシュ消去フレームワークである階層適応消去(HAE)を提案する。
HAEは層間のKVキャッシュ使用を最小化し、インデックスブロードキャストによる計算オーバーヘッドを低減し、理論的には優れた情報完全性と低いエラー境界を保証する。
論文 参考訳(メタデータ) (2026-02-02T15:01:44Z) - Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation [84.00166854547241]
拡散変換器(DiT)はビデオ生成に必須であるが,注意の2次複雑さにより遅延が著しく低下する。
SVG2は,識別精度を最大化し,無駄を最小化する学習自由フレームワークである。
論文 参考訳(メタデータ) (2025-05-24T21:30:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。