論文の概要: Efficient Video Diffusion Models: Advancements and Challenges
- arxiv url: http://arxiv.org/abs/2604.15911v1
- Date: Fri, 17 Apr 2026 10:11:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-20 22:00:19.872984
- Title: Efficient Video Diffusion Models: Advancements and Challenges
- Title(参考訳): 効率的なビデオ拡散モデル:進歩と課題
- Authors: Shitong Shao, Lichen Bai, Pengfei Wan, James Kwok, Zeke Xie,
- Abstract要約: ビデオ合成化合物は、空間的時間的トークン成長と反復的 denoising の計算を行う。
この調査は、効率的なビデオ拡散モデルの体系的およびデプロイメント指向のレビューを提供する。
- 参考スコア(独自算出の注目度): 24.838386291735024
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Video diffusion models have rapidly become the dominant paradigm for high-fidelity generative video synthesis, but their practical deployment remains constrained by severe inference costs. Compared with image generation, video synthesis compounds computation across spatial-temporal token growth and iterative denoising, making attention and memory traffic major bottlenecks in real-world settings. This survey provides a systematic and deployment-oriented review of efficient video diffusion models. We propose a unified categorization that organizes existing methods into four classes of main paradigms, including step distillation, efficient attention, model compression, and cache/trajectory optimization. Building on this categorization, we respectively analyze algorithmic trends of these four paradigms and examine how different design choices target two core objectives: reducing the number of function evaluations and minimizing per-step overhead. Finally, we discuss open challenges and future directions, including quality preservation under composite acceleration, hardware-software co-design, robust real-time long-horizon generation, and open infrastructure for standardized evaluation. To the best of our knowledge, our work is the first comprehensive survey on efficient video diffusion models, offering researchers and engineers a structured overview of the field and its emerging research directions.
- Abstract(参考訳): ビデオ拡散モデルは、高忠実度生成ビデオ合成において、急速に支配的なパラダイムとなっているが、その実践的展開は、厳しい推論コストに制約されているままである。
画像生成と比較して、ビデオ合成化合物は空間的時間的トークン成長と反復的復調の計算を行い、実際の環境において注意とメモリトラフィックがボトルネックとなる。
この調査は、効率的なビデオ拡散モデルの体系的およびデプロイメント指向のレビューを提供する。
本稿では,既存の手法を,ステップ蒸留,効率的な注意,モデル圧縮,キャッシュ/トラジェクトリ最適化といった4つのパラダイムのクラスにまとめる統一分類を提案する。
この分類に基づいて、これらの4つのパラダイムのアルゴリズム的傾向を分析し、異なる設計選択が2つの中核目標をどのように狙うかを検討する。
最後に, 複合加速度下での品質維持, ハードウェア・ソフトウェア共同設計, 堅牢なリアルタイムロングホライゾン生成, 標準化された評価のためのオープンインフラストラクチャなど, オープンな課題と今後の方向性について論じる。
我々の知る限り、我々の研究は、効率的なビデオ拡散モデルに関する最初の総合的な調査であり、研究者やエンジニアに、この分野とその新たな研究方向性に関する構造化された概要を提供する。
関連論文リスト
- Demystifing Video Reasoning [71.53763299316041]
ビデオモデルにおける推論は、主に拡散認知のステップに沿って現れることを示す。
モデル性能に重要ないくつかの創発的推論行動を特定する。
これらの知見に触発され、私たちは概念実証としてトレーニングフリー戦略を提示した。
論文 参考訳(メタデータ) (2026-03-17T17:59:55Z) - SimpleGVR: A Simple Baseline for Latent-Cascaded Video Super-Resolution [46.311223206965934]
後続の超解像モデルの設計原理について検討し,その設計原理について検討する。
まず、ベースモデルの出力特性をよりよく模倣し、VSRモデルと上流ジェネレータとの整合性を確保するための2つのトレーニングペアを生成する方法を提案する。
第2に,(1)時間ステップサンプリング戦略,(2)低分解能(LR)入力に対する雑音増強効果の系統的解析を通じて,VSRモデル行動に対する批判的洞察を提供する。
論文 参考訳(メタデータ) (2025-06-24T17:57:26Z) - RAGME: Retrieval Augmented Video Generation for Enhanced Motion Realism [73.38167494118746]
生成ビデオにおける動きのリアリズムを改善するための枠組みを提案する。
生成フェーズにおける検索機構の導入を提唱する。
私たちのパイプラインは、どんなテキスト間拡散モデルにも適用できるように設計されています。
論文 参考訳(メタデータ) (2025-04-09T08:14:05Z) - AccVideo: Accelerating Video Diffusion Model with Synthetic Dataset [55.82208863521353]
合成データセットを用いたビデオ拡散モデルの高速化のための推論ステップを削減するために,AccVideoを提案する。
本モデルでは,教師モデルに比べて生成速度が8.5倍向上した。
従来の高速化手法と比較して,より高品質で解像度の高いビデオを生成することができる。
論文 参考訳(メタデータ) (2025-03-25T08:52:07Z) - Raccoon: Multi-stage Diffusion Training with Coarse-to-Fine Curating Videos [15.781862060265519]
CFC-VIDS-1Mは、体系的な粗いキュレーションパイプラインによって構築された高品質のビデオデータセットである。
我々は、空間的時間的注意機構を分離したトランスフォーマーベースのアーキテクチャであるRACCOONを開発した。
論文 参考訳(メタデータ) (2025-02-28T18:56:35Z) - An Efficient Recurrent Adversarial Framework for Unsupervised Real-Time
Video Enhancement [132.60976158877608]
対比ビデオの例から直接学習する効率的な対比ビデオ強化フレームワークを提案する。
特に,空間的情報と時間的情報の暗黙的統合のための局所的モジュールとグローバルモジュールからなる新しい再帰的セルを導入する。
提案する設計では,フレーム間の情報伝達を効率的に行うことができ,複雑なネットワークの必要性を低減できる。
論文 参考訳(メタデータ) (2020-12-24T00:03:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。