論文の概要: SparkDiffusion: Mitigating the High-Sparsity Trap --- A Unified Framework for up to $265\times$ Single-GPU Acceleration of Visual Generation
- arxiv url: http://arxiv.org/abs/2609.23153v1
- Date: Sat, 19 Sep 2026 17:45:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.689384
- Title: SparkDiffusion: Mitigating the High-Sparsity Trap --- A Unified Framework for up to $265\times$ Single-GPU Acceleration of Visual Generation
- Title(参考訳): SparkDiffusion: 高分離トラップの緩和 -- ビジュアル生成のシングルGPUアクセラレーションに対して最大265\timesの統一フレームワーク
- Abstract要約: 短時間の温暖化, 数ステップのトラジェクトリ混合蒸留, FP8量子化を融合した, ビジュアル生成のための統合加速フレームワークを開発した。
Wan2.1/バックボーンとT2V/I2Vタスクにわたる長時間の720P生成に強い視覚的品質を持ち、Wan2.1-T2V-1.3B-480Pでは90%$スパシティを持つ。
- 参考スコア(独自算出の注目度): 31.384360433864206
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video diffusion transformers are expensive because attention dominates long spatiotemporal token sequences. We identify the \emph{high-sparsity trap}: at extreme attention sparsity, step-local training losses keep decreasing while terminal generation quality stagnates or degrades. The trap is one of supervision: the dominant terminal errors originate in the high-noise structure-generation stage, and terminal-aligned training corrects terminal errors that substantially extended step-local training cannot. This yields a simple staging principle: \emph{first adapt the sparse architecture into a coarse prior, then correct the terminal distribution}. We instantiate the principle as \method, a unified acceleration framework for visual generation that combines a short sparse warm-up, few-step trajectory-mixed distillation, and FP8 quantization with fused kernels. \method sustains $97\%$ attention sparsity with strong visual quality on long-sequence 720P generation across Wan2.1/Wan2.2 backbones and T2V/I2V tasks, and $90\%$ sparsity on Wan2.1-T2V-1.3B-480P. With 3-step CFG-free inference, \method achieves a $265\times$ end-to-end speedup over the 50-step CFG dense baseline for Wan2.1-T2V-14B-720P on a single RTX~5090 ($220\times$ on H100), and denoises a Wan2.1-T2V-1.3B-480P video in $1.3$s.
- Abstract(参考訳): ビデオ拡散変換器は、長時間の時空間トークンシーケンスに注意が支配的であるため、高価である。
極端に注意を向けると、端末生成品質が停滞したり劣化したりしながら、ステップローカルトレーニングの損失は減少し続けます。
このトラップは監督の1つであり、支配的な終端誤差は高ノイズ構造生成段階に起因し、終端整列トレーニングは、ステップローカルトレーニングが実質的に拡張できない終端誤差を補正する。
これは単純なステージング原理をもたらす: \emph{first} スパースアーキテクチャを粗い事前に適応し、次に終端分布を補正する。
我々は, 短時間の温暖化, 数ステップのトラジェクトリ混合蒸留, FP8量子化を融合した, ビジュアル生成のための統合加速フレームワークである‘method’として, 原理をインスタンス化する。
Wan2.1/Wan2.2のバックボーンとT2V/I2Vタスクの長いシーケンスの720P生成に強い視覚的品質を持ち、Wan2.1-T2V-1.3B-480Pでは90.%のアテンションスパシティを持つ。
3段階のCFG推論では、Wan2.1-T2V-14B-720PのWan2.1-T2V-1.3B-480Pの50ステップのCFG高密度ベースラインに対して、Wan2.1-T2V-1.3B-480Pの動画を1.3ドルでデノーズする。
関連論文リスト
- TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation [105.14745366152725]
TurboT2VAは、ジョイントテキスト・ツー・ビデオ・オーディオ生成のための蒸留および推論フレームワークである。
LTX-2では、4段階の蒸留により512$times$768の標準評価解像度でジェネレータのレイテンシを50.52sから2.51sに短縮する。
完全なスタックは、ジェネレータのレイテンシを318.74sから1つのNVIDIA H20で5.83sに短縮し、54.67$times$ジェネレータのみのスピードアップを達成した。
論文 参考訳(メタデータ) (2026-08-25T15:09:02Z) - FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation [19.638077533543754]
トレーニング不要なスパースアテンションは、マルチGPUシーケンス下での適応スパースアテンションの分散実行効率を向上させる。
平均負荷不均衡を 1.34 から 1.08 に減らし、FlashAttention よりも 4.41 倍の注目速度を提供する。
Wan2.2 I2V では、平均負荷不均衡を 1.34 から 1.08 に減らし、FlashAttention よりも 4.41 倍の注意速度を提供する。
論文 参考訳(メタデータ) (2026-07-17T17:59:32Z) - Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs [21.02858354959528]
視覚言語モデルと視覚言語アクションモデルにより、ロボットには前例のない能力がある。
ビデオや高解像度画像の入力は膨大な数の視覚トークンをもたらし、非常に高い推論遅延をもたらし、ロボットのリアルタイム制御を著しく妨げる。
本稿では,視覚的エンコーディングフェーズにおいて,冗長トークンを直接効率的に融合するプラグイン・アンド・プレイフレームワークST-Mergeを提案する。
論文 参考訳(メタデータ) (2026-06-28T11:42:55Z) - Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - HASTE: Training-Free Video Diffusion Acceleration via Head-Wise Adaptive Sparse Attention [68.95533683996236]
トレーニング不要のスパースアテンションは、トレーニングなしで事前トレーニングされたモデルを加速するため、魅力的である。
既存のオンラインのトップ$p$のスパース・アテンションは、マスクの予測に何の費用もかからない。
これら2つの見過ごされた要因は、ビデオDiTにおけるトレーニング不要のスパースアテンションの実践的スピード品質トレードオフを制限していることを示す。
論文 参考訳(メタデータ) (2026-05-14T07:57:55Z) - DualTCN: A Physics-Constrained Temporal Convolutional Network for 2 Time-Domain Marine CSEM Inversion [1.2031796234206138]
DualTCNは、時間領域の海洋電磁制御源(MCSEM)過渡データを反転させるための最初のディープラーニングフレームワークである。
このフレームワークは、4つのアースモデルパラメータを回帰し、微分可能なソフトステップデコーダを用いてプロファイルを再構成する。
このフレームワークは、カリキュラムベースの振幅増大によるノイズに対する高い堅牢性を示し、平均$barR2$ 0.858 at $pm2%$ランダム振幅誤差を維持している。
論文 参考訳(メタデータ) (2026-05-06T14:58:17Z) - SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing [77.91660464664615]
Diffusion Transformers (DiTs) はビデオ生成において主要なバックボーンとなっているが、その二次的注意コストは依然として大きなボトルネックとなっている。
本稿では,不足しているコントリビューションをトレーニングなしで回収できることを示す。
パラメータフリーな線形補償分岐であるSVG-EARを導入する。
論文 参考訳(メタデータ) (2026-03-09T22:15:31Z) - PUSA V1.0: Surpassing Wan-I2V with $500 Training Cost by Vectorized Timestep Adaptation [18.2095668161519]
Pusaは、一貫したビデオ拡散フレームワーク内で微細な時間的制御を可能にする、画期的なパラダイムである。
We set a new standard for image-to-video (I2V) generation, to achieve a VBench-I2V total score 87.32%。
この研究は、次世代のビデオ合成のためのスケーラブルで効率的で多用途なパラダイムを確立する。
論文 参考訳(メタデータ) (2025-07-22T00:09:37Z) - HELENA: High-Efficiency Learning-based channel Estimation using dual Neural Attention [0.0]
HELENAは、軽量な畳み込みバックボーンと2つの効率的な注意機構を組み合わせた、コンパクトなディープラーニングモデルである。
HELENAは推論時間を45.0%削減する(0.175,ms対0.318,ms)
論文 参考訳(メタデータ) (2025-06-16T12:21:27Z) - VSA: Faster Video Diffusion with Trainable Sparse Attention [38.37291040904089]
ビデオ拡散トランス (DiTs) のスケーリングは、注意質量の大部分が少数の位置に集中しているにもかかわらず、2次元の注意によって制限される。
私たちはこの観察を、トレーニング可能なハードウェア効率の良いスパースアテンションであるVSAに変換し、Emphbothのトレーニングと推論の完全なアテンションを置き換える。
論文 参考訳(メタデータ) (2025-05-19T17:30:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。