論文の概要: Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model
- arxiv url: http://arxiv.org/abs/2607.03509v1
- Date: Fri, 03 Jul 2026 17:34:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.635109
- Title: Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model
- Title(参考訳): Flex-Forcing: 統合された自己回帰的双方向ビデオ拡散モデルを目指して
- Abstract要約: Flex-Forcingは、ビデオ拡散モデルが双方向および自動回帰生成方式の両方でシームレスに動作できるようにする統合トレーニングおよび推論フレームワークである。
複数のビデオ生成ベンチマークの実験により、Flex-Forcingは、厳格な推論スケジュールを持つ強いベースラインよりも、ビデオ品質、長ビデオの安定性が一貫して向上していることが示された。
- 参考スコア(独自算出の注目度): 88.42070387375679
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent progress in large-scale generative models has substantially advanced video generation, yet existing methods remain constrained by a rigid inference paradigm. Bidirectional diffusion models excel at global coherence and visual fidelity but suffer from slow inference, while autoregressive models offer efficient and streaming generation at the cost of long-range consistency and exposure bias. We introduce Flex-Forcing, a unified training and inference framework that enables a video diffusion model to seamlessly operate under both bidirectional and autoregressive generation regimes. The core idea is a flexible chunking mechanism jointly defined over the temporal axis and denoising steps. This design allows the model to (1) perform flexible chunking according to different device budgets, (2) perform bidirectional inference across chunks for global structure planning, while generating frames autoregressively within each chunk for efficient and fine-grained synthesis, and (3) perform any-order, any-timestep autoregressive generation without the strict causal constraint. Extensive experiments on multiple video generation benchmarks demonstrate that Flex-Forcing achieves consistently better video quality, long-video stability than strong baselines with a rigid inference schedule, while offering faster inference.
- Abstract(参考訳): 大規模生成モデルの最近の進歩はビデオ生成が大幅に進歩しているが、既存の手法は厳密な推論パラダイムによって制約されている。
双方向拡散モデルは、大域的コヒーレンスと視覚的忠実度で優れるが、推論が遅いのに対して、自己回帰モデルは、長距離一貫性と露光バイアスを犠牲にして効率的なストリーミング生成を提供する。
Flex-Forcingは、ビデオ拡散モデルが双方向および自動回帰生成方式の両方でシームレスに動作できるようにする統合トレーニングおよび推論フレームワークである。
中心となるアイデアは、時間軸上で共同で定義されたフレキシブルなチャンキング機構と、ステップの認知である。
この設計により、(1)異なるデバイス予算に応じて柔軟なチャンキングを行い、(2)グローバルな構造計画のためのチャンク間で双方向の推論を行い、(2)効率的かつきめ細かな合成のために各チャンク内でフレームを自己回帰的に生成し、(3)厳密な因果制約を伴わずに、任意の順序で非時間的自己回帰生成を行うことができる。
複数のビデオ生成ベンチマークでの大規模な実験により、Flex-Forcingは、より高速な推論を提供しながら、強いベースラインよりも安定したビデオ品質、長いビデオ安定性を実現していることが示された。
関連論文リスト
- FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching [68.01498128172214]
本稿では,アーキテクチャに依存しない,追加のトレーニングを必要としない長大なビデオ生成のための,斬新でシンプルな推論時間アプローチを提案する。
提案手法では,隣接するウィンドウからのクリーンサンプルをemphTweedieマッチングでブレンドし,テキストbfmanifoldの制約と重複領域間の時間的一貫性を強制する。
本手法は, 時間的一貫性と視覚的品質において, トレーニング不要, 自己回帰ベースラインを両立させながら, ネイティブウィンドウ長よりも数倍長大のビデオを生成する。
論文 参考訳(メタデータ) (2026-05-20T08:55:37Z) - From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation [54.68405211129937]
Exo-Seqto-Egoビデオ生成は、同期された3人称と対応するカメラポーズから1人称ビューを合成することを目的としている。
同期されたExo-egoデータは本質的に時間的不連続を導入し、標準ビデオ生成ベンチマークのスムーズな動作仮定に違反する。
我々は、ソースとターゲットビデオの間に補間して単一の連続信号を形成するシーケンシャルシーケンスモデルであるSyn2Ex-Forcingを提案する。
論文 参考訳(メタデータ) (2026-04-15T12:32:25Z) - DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation [10.575655795360937]
DCARLは、分割・変換方式の構造安定性と高忠実度VDMの生成を結合した、新規な分割・変換型自己回帰フレームワークである。
提案手法は,最先端の自己回帰的・分割型ベースラインと比較して,視覚的品質とカメラの密着性の両方において優れた性能を実現する。
論文 参考訳(メタデータ) (2026-03-25T22:07:09Z) - LongScape: Advancing Long-Horizon Embodied World Models with Context-Aware MoE [16.561410415129778]
LongScapeは、チャンク内拡散とチャンク間自己回帰因果生成を組み合わせたハイブリッドフレームワークである。
私たちの中心となるイノベーションは、ロボットアクションのセマンティックコンテキストに基づいてビデオを分割するアクションガイド付き可変長チャンキングメカニズムです。
論文 参考訳(メタデータ) (2025-09-26T02:47:05Z) - Seedance 1.0: Exploring the Boundaries of Video Generation Models [71.26796999246068]
Seedance 1.0は高性能で推論効率の良いビデオ基盤生成モデルである。
精度と意味のあるビデオキャプションを付加したマルチソースキュレーションデータを統合する。
Seedance 1.0は1080p解像度で5秒のビデオを生成することができる。
論文 参考訳(メタデータ) (2025-06-10T17:56:11Z) - Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion [67.94300151774085]
本稿では,自己回帰ビデオ拡散モデルのための新しい訓練パラダイムであるSelf Forcingを紹介する。
露光バイアスの長年の問題に対処し、地道的な文脈で訓練されたモデルは、自身の不完全な出力で条件付けられたシーケンスを生成する必要がある。
論文 参考訳(メタデータ) (2025-06-09T17:59:55Z) - AR-Diffusion: Asynchronous Video Generation with Auto-Regressive Diffusion [19.98565541640125]
自動回帰拡散(AR-Diffusion, Auto-Regressive Diffusion)は, フレキシブルビデオ生成のための自己回帰拡散モデルと拡散モデルの強みを組み合わせた新しいモデルである。
自己回帰生成に触発されて、個々のフレームの腐敗タイムステップに非減少制約を組み込む。
このセットアップは、時間的因果的注意とともに、時間的コヒーレンスを保ちながら、長さの異なる柔軟なビデオの生成を可能にする。
論文 参考訳(メタデータ) (2025-03-10T15:05:59Z) - Upscale-A-Video: Temporal-Consistent Diffusion Model for Real-World
Video Super-Resolution [65.91317390645163]
Upscale-A-Videoは、ビデオアップスケーリングのためのテキストガイド付き遅延拡散フレームワークである。
ローカルでは、一時的なレイヤをU-NetとVAE-Decoderに統合し、短いシーケンス内で一貫性を維持する。
また、テキストプロンプトによってテクスチャ生成と調整可能なノイズレベルをガイドし、復元と生成のバランスを取ることで、柔軟性も向上する。
論文 参考訳(メタデータ) (2023-12-11T18:54:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。