論文の概要: Ms. Forcing: Efficient Streaming Video Generation with Multi-Scale Patchification and Attention
- arxiv url: http://arxiv.org/abs/2607.20940v1
- Date: Thu, 23 Jul 2026 05:35:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.297339
- Title: Ms. Forcing: Efficient Streaming Video Generation with Multi-Scale Patchification and Attention
- Title(参考訳): Ms.Forcing:マルチスケールのバッチ化とアテンションによる効率的なストリーミングビデオ生成
- Authors: Zekun Li, Xiaoyan Cong, Hongyu Li, Zhiyang Dou, Chuan Guo, Abhay Mittal, Sizhe An, Srinath Sridhar,
- Abstract要約: Ms.Forcingは、各状態のノイズレベルに空間的粒度を適応させる効率的なストリーミングビデオ生成パラダイムである。
Ms.Forcingは1つのH200 GPU上で22.84 FPSに達し、Rolling Forcingよりも39.6%高速である。
- 参考スコア(独自算出の注目度): 20.731300934175042
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Streaming video diffusion models have made substantial progress toward interactive and dynamic world simulation, but the nested autoregressive and denoising loops of conventional next-frame generation hinder real-time deployment. Recent rolling-window methods pipeline denoising across multiple consecutive frames at different noise levels, improving throughput and long-horizon stability. However, they tokenize every state at the same fine spatial granularity, leaving substantial noise-dependent redundancy in the joint denoising window. We propose Ms.Forcing, an efficient streaming video generation paradigm that adapts spatial granularity to each state's noise level. Its Multi-Scale Patchification (MSP) assigns coarser patches to noisier states, reducing the active-window token count by 45%, while Multi-Scale Self-Attention (MSSA) matches the density of visible non-sink keys and values to each query scale to further reduce attention cost. Because both schedules are fixed by window position, Ms.Forcing retains a static, hardware-friendly computation graph. We further introduce Homogeneous-Noise-Level DMD (H-DMD), which assembles each fake video from clean predictions sharing the same source noise level, thereby reducing the mismatch between DMD training sequences and inference-time rollouts. The multi-scale design helps offset the additional training cost of backpropagating through overlapping windows. We include both quantitative and qualitative experiments to show that Ms.Forcing reaches 22.84 FPS on a single H200 GPU, 39.6% faster than Rolling Forcing, while significantly improving VBench scores in both short video and long video generation setting.
- Abstract(参考訳): ストリーミングビデオ拡散モデルは、インタラクティブでダイナミックな世界シミュレーションに向けて大きな進歩を遂げてきたが、ネストされた自己回帰ループとデノイングループは、従来の次世代生成のリアルタイム展開を妨げている。
最近のローリングウインドウ・パイプラインは、複数の連続するフレームを異なるノイズレベルでdenoisingし、スループットと長期安定性を改善している。
しかし、同じ微細な空間的粒度で全ての状態をトークン化し、大きなノイズ依存性の冗長性を残している。
我々は、各状態の雑音レベルに空間的粒度を適応させる効率的なストリーミングビデオ生成パラダイムであるMs.Forcingを提案する。
そのMulti-Scale Patchification (MSP) は、粗いパッチをノイズの多い状態に割り当て、アクティブウィンドウトークン数を45%削減する一方、Multi-Scale Self-Attention (MSSA) は、目に見えるノンシンクキーの密度と各クエリスケールの値とを一致させて、注意コストをさらに削減する。
どちらのスケジュールもウィンドウ位置で固定されているため、Ms.Forcingは静的なハードウェアフレンドリーな計算グラフを保持する。
さらに、同じ音源のノイズレベルを共有するクリーンな予測から、各フェイクビデオを組み立て、MDDトレーニングシーケンスと推論時ロールアウトのミスマッチを低減する。
マルチスケールの設計は、重なり合うウィンドウをバックプロパゲートするための追加のトレーニングコストを相殺するのに役立ちます。
我々は、Ms.Forcingが1つのH200 GPU上で22.84 FPSに達し、RollingForcingよりも39.6%速く、VBenchスコアを短いビデオと長いビデオの両方で大幅に改善したことを示す定量的および定性的な実験を含む。
関連論文リスト
- Surprise Forcing: What to Remember, When to Skip in Long Video Generation [65.0022589149937]
自己回帰拡散をストリーミングすることで、ミニスケールのビデオ合成が実用的になるが、そのコンテキスト境界と固定化スケジュールはリソースを均一に割り当てる。
我々は、両方の制限をオンラインリソース割り当て問題として扱う、トレーニング不要のフレームワークであるSurprise Forcingを紹介した。
VBench、VBench-Long、VBench-2.0の実験では、提案されたアロケーション戦略は、リアルタイムストリーミングスループットを維持しながら、長時間の一貫性と視覚的品質を改善する。
論文 参考訳(メタデータ) (2026-07-20T18:37:58Z) - RhymeFlow: Training-Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling [51.279397568734424]
Diffusion Transformers (DiTs) に基づく映像生成モデルは,映像合成において顕著な性能を発揮している。
DiTは3次元の注意の二次的な複雑さのために、高い推論遅延と計算コストに悩まされる。
我々はbftextRhymeFlowを紹介した。bftextRhymeFlowはトレーニング不要のフレームワークで、異なるフレームの認知軌道を分離する。
論文 参考訳(メタデータ) (2026-06-04T15:49:37Z) - Not All Frames Deserve Full Computation: Accelerating Autoregressive Video Generation via Selective Computation and Predictive Extrapolation [8.70067126225172]
オートレグレッシブ(AR)ビデオ拡散モデルは、長めのビデオ生成を可能にするが、複数ステップの復調を繰り返して高価である。
我々は,効率的なARビデオ拡散のためのトレーニングフリーフレームワークSCOPEを提案する。
MAGI-1とSkyReels-V2では、SCOPEは元の出力に匹敵する品質を維持しながら最大4.73倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2026-04-03T11:34:47Z) - Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation [69.57572900337176]
本稿では,効率的なストリーミングビデオ生成のための新しいフレームワークであるReward Forcingを紹介する。
EMA-Sinkトークンは、長期コンテキストと最近のダイナミクスの両方をキャプチャし、初期フレームコピーを防ぐ。
Re-DMDは、視覚言語モデルにより評価されたより大きなダイナミックスを持つサンプルを優先順位付けすることで、モデル出力分布を高逆領域にバイアスする。
論文 参考訳(メタデータ) (2025-12-04T11:12:13Z) - Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models [11.913945404405865]
ほとんどのビデオ拡散モデル(VDM)は自己回帰的な方法でビデオを生成し、それに続く繰り返しフレームを生成する。
本稿では,自動回帰VDMのためのAdaptive Begin-of-Video Tokens(ada-BOV)を提案する。
論文 参考訳(メタデータ) (2025-11-15T08:29:14Z) - Rolling Forcing: Autoregressive Long Video Diffusion in Real Time [86.40480237741609]
Rolling Forcingは、エラーの最小限の蓄積で長いビデオをストリーミングできる、新しいビデオ生成技術である。
転がり強制力には3つの新しい設計が伴う。第一に、エラー伝播を加速する個別のフレームを反復的にサンプリングする代わりに、共同演示方式を設計する。
第2に,アテンションシンク機構を長軸ストリームビデオ生成タスクに導入し,初期フレームのキー値状態をグローバルなコンテキストアンカーとして保持する。
第3に,大半が拡張された遮音窓上での無段蒸留を可能にする効率的な訓練アルゴリズムを設計する。
論文 参考訳(メタデータ) (2025-09-29T17:57:14Z) - Real-time Streaming Video Denoising with Bidirectional Buffers [48.57108807146537]
リアルタイムDenoisingアルゴリズムは、通常、ビデオストリームの撮影と送信にかかわるノイズを取り除くために、ユーザーデバイスに採用されている。
最近のマルチアウトプット推論は、双方向の時間的特徴を並列または繰り返しのフレームワークで伝達する。
本研究では,過去と未来の両方の時間的受容場を持つストリーミングビデオに対して,高忠実度リアルタイムデノナイズを実現するための双方向ストリーミングビデオデノナイズフレームワークを提案する。
論文 参考訳(メタデータ) (2022-07-14T14:01:03Z) - MANet: Improving Video Denoising with a Multi-Alignment Network [72.93429911044903]
本稿では,複数フローの提案とアテンションに基づく平均化を行うマルチアライメントネットワークを提案する。
大規模ビデオデータセットを用いた実験により,本手法は調音ベースラインモデルを0.2dBで改善することを示した。
論文 参考訳(メタデータ) (2022-02-20T00:52:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。