論文の概要: Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions
- arxiv url: http://arxiv.org/abs/2606.09150v1
- Date: Mon, 08 Jun 2026 07:45:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:06.810389
- Title: Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions
- Title(参考訳): Ultra Flash: リアルタイムストリーミングビデオ生成を高解像度にスケールアップ
- Abstract要約: Ultra Flashは、リアルタイムの高解像度ビデオ生成が可能なカスケードストリーミングフレームワークである。
この結果から,Ultra Flashは最先端の視覚的品質と優れた効率を維持しつつ,高解像度のストリーミング映像を確実に生成できることが示唆された。
- 参考スコア(独自算出の注目度): 69.0190486024094
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While recent autoregressive video diffusion models achieve remarkable streaming quality, they remain confined to low resolutions (e.g., 480P), leaving efficient, scalable, real-time high-resolution video generation a fundamental open challenge. To bridge this gap, we present Ultra Flash, a cascaded streaming framework capable of real-time high-resolution video generation. Ultra Flash achieves ~30 FPS at 1K resolution and ~18 FPS at 2K resolution on a single GPU through three key contributions: (1) an architecture-preserving T2V-to-TV2V super-resolution training paradigm coupled with an AIGC-oriented data degradation pipeline that effectively preserves the generative capability of the base model, enabling enhanced high-resolution detail when cascaded after mainstream low-resolution generative models; (2) a causal streaming latent upsampler paired with a high-resolution decoder, which enhances spatiotemporal coherence while enabling efficient latent spatial scaling and precise high-resolution decoding with negligible computational overhead; and (3) a cascade high-resolution streaming video generation optimization scheme that first performs hybrid-reward-enhanced sparse causalization and single-step distillation of the super-resolution model, then introduces cascaded streaming self-forcing preference optimization with dynamic cache management, jointly enhancing overall coherence, improving quality, and enabling real-time high-resolution streaming video generation. Extensive experiments demonstrate that Ultra Flash reliably produces ultra-high-resolution streaming video while maintaining state-of-the-art visual quality and superior efficiency.
- Abstract(参考訳): 最近の自己回帰的ビデオ拡散モデルはストリーミングの品質を著しく向上させるが、低解像度(例:480P)に留まり、効率的でスケーラブルでリアルタイムな高解像度ビデオ生成は根本的なオープンな課題である。
このギャップを埋めるために、リアルタイムの高解像度ビデオ生成が可能なカスケードストリーミングフレームワークであるUltra Flashを紹介します。
アーキテクチャ保存型T2V-to-TV2V超分解能トレーニングパラダイムとAIGC指向のデータ分解パイプラインを組み合わせることで、ベースモデルの生成能力を効果的に維持し、主流の低分解能生成モデルの後にカスケードされた場合の高分解能ディテールを向上する。
広汎な実験により、Ultra Flashは最先端の視覚的品質と優れた効率を維持しつつ、高解像度のストリーミングビデオを確実に生成することを示した。
関連論文リスト
- ViBe: Ultra-High-Resolution Video Synthesis Born from Pure Images [30.646542711556787]
トランスフォーマーに基づくビデオ拡散モデルは、空間的および時間的トークンに対する3次元の注意に依存している。
我々は,高解像度映像を合成するために,ネイティブスケールで事前学習したビデオ拡散変換器をアップグレードする純粋な画像適応フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-24T15:27:22Z) - Morphe: High-Fidelity Generative Video Streaming with Vision Foundation Model [47.71265147565265]
ビジョンファウンデーションモデル(VFM)は、強力なビデオ理解と処理能力を活用するために用いられる。
VFMに基づくエンドツーエンド生成ストリーミングを実現するための,最初の革新的パラダイムを提案する。
Morpheは、H.265と比較して62.5%の帯域幅を節約し、挑戦的なネットワーク環境ではリアルタイムで損失耐性のあるビデオ配信を実現している。
論文 参考訳(メタデータ) (2026-02-03T13:47:18Z) - HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming [58.55148690302855]
HiStreamは、3つの軸にわたる冗長性を体系的に低減する効率的な自動回帰フレームワークである。
1080pのベンチマークでは、主要なHiStreamモデル(i+ii)は最先端のビジュアル品質を実現し、Wan2.1ベースラインと比較して76.2倍高速なデノイングを実現した。
より高速なHiStream+は3つの最適化を全て適用し、ベースライン上で107.5倍の高速化を実現しています。
論文 参考訳(メタデータ) (2025-12-24T18:59:58Z) - StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation [65.90400162290057]
生成モデルは、コンテンツの作り方、スタイル、配信方法を再定義することで、ライブストリーミング業界を変革している。
ビデオ拡散の最近の進歩は、オフライン生成のための時間的一貫性とサンプリング効率を著しく改善した。
ライブオンラインストリーミングは厳しいサービスレベル(SLO)の下で動作します。 タイム・ツー・ファーストフレームは最小限でなければなりません。
論文 参考訳(メタデータ) (2025-11-10T18:51:28Z) - UltraGen: High-Resolution Video Generation with Hierarchical Attention [62.99161115650818]
UltraGenは、(i)効率的で(i)ネイティブな高解像度ビデオ合成を可能にする、新しいビデオ生成フレームワークである。
我々は,UltraGenが事前学習した低解像度ビデオモデルを1080P,さらに4K解像度に効果的に拡張できることを実証した。
論文 参考訳(メタデータ) (2025-10-21T16:23:21Z) - VividFace: High-Quality and Efficient One-Step Diffusion For Video Face Enhancement [51.83206132052461]
ビデオ顔強調(VFE)は、劣化したビデオシーケンスから高品質な顔領域を再構築することを目指している。
ビデオの超解像と生成フレームワークに依存する現在の手法は、3つの根本的な課題に直面している。
ビデオ・フェイス・エンハンスメントのための新規かつ効率的なワンステップ拡散フレームワークであるVividFaceを提案する。
論文 参考訳(メタデータ) (2025-09-28T02:39:48Z) - FlashVideo: Flowing Fidelity to Detail for Efficient High-Resolution Video Generation [61.61415607972597]
DiT拡散モデルは、モデルキャパシティとデータスケールのスケーラビリティを活用して、テキスト・ビデオ生成において大きな成功を収めた。
しかし、テキストプロンプトに一致した高い内容と動きの忠実度は、しばしば大きなモデルパラメータとかなりの数の関数評価(NFE)を必要とする。
本稿では,モデルキャパシティとNFEを戦略的に割り当て,生成精度と品質のバランスをとる新しい2つのステージフレームワークであるFlashVideoを提案する。
論文 参考訳(メタデータ) (2025-02-07T18:59:59Z) - CascadeV: An Implementation of Wurstchen Architecture for Video Generation [4.086317089863318]
本稿では,最先端の2K解像度ビデオを生成することができるLDM(Latent diffusion model)を提案する。
実験により, 高い圧縮比を達成でき, 高品質ビデオ生成に伴う計算課題を大幅に削減できることが示された。
我々のモデルは既存のT2Vモデルとカスケードすることができ、理論的には、微調整なしで4$times$の解像度やフレームを毎秒増加させることができる。
論文 参考訳(メタデータ) (2025-01-28T01:14:24Z) - DiffVSR: Revealing an Effective Recipe for Taming Robust Video Super-Resolution Against Complex Degradations [25.756755602342942]
本稿では,この学習負担を段階的学習を通じて体系的に分解するプログレッシブ・ラーニング・ストラテジー(PLS)を特徴とするDiffVSRを提案する。
我々のフレームワークには、追加のトレーニングオーバーヘッドを伴わずに競合時間一貫性を維持するILT(Interweaved Latent Transition)技術も組み込まれています。
論文 参考訳(メタデータ) (2025-01-17T10:53:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。