論文の概要: MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing
- arxiv url: http://arxiv.org/abs/2607.05376v1
- Date: Mon, 06 Jul 2026 17:54:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.271284
- Title: MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing
- Title(参考訳): MV-Forcing: 4D-Grounded Spatio-Temporal Self-Forcingによるロングマルチビュービデオ生成
- Abstract要約: 本稿では,1つの拡散モデル内で時間的および視点的自己回帰を構成するフレームワークであるMV-Forcingを提案する。
MV-Forcingは任意の長さで動的シーンの幾何学的に一貫したマルチビュービデオを生成する。
- 参考スコア(独自算出の注目度): 25.612425628475705
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in video diffusion models have enabled either long single-view generation through temporal autoregression, or short multi-view synthesis through bidirectional attention. However, generating long, multi-view consistent videos of dynamic scenes remains unsolved. In this work, we present MV-Forcing, a framework that composes temporal and view-wise autoregression within a single diffusion model by introducing a 4D geometric bridge between sequentially generated views. Our key insight is that an autoregressive 3D reconstruction model naturally interfaces between autoregressively generated views. Given a completed source view, we reconstruct its 3D structure and render a geometric prior of the next target viewpoint, which the diffusion model refines into a high-quality video. To extend generation beyond the teacher's fixed temporal window, we introduce a joint denoising regime where both view slots are initialized from noise during training, enabling temporally unbounded generation. We distill the model via Distribution Matching Distillation with Spatio-Temporal Self-Forcing, closing the train-inference exposure bias gap for both temporal and view-sequential autoregression. Extensive experiments on both synthetic and real-world data demonstrate that MV-Forcing produces geometrically consistent multi-view videos of dynamic scenes at arbitrary lengths and viewpoint counts using a single few-step student model.
- Abstract(参考訳): 近年の映像拡散モデルの進歩により、時間的自己回帰による長い一視点生成が可能になったり、双方向の注意による短い多視点合成が可能になった。
しかし、ダイナミックシーンの長い多視点一貫したビデオを生成することは未解決のままである。
本研究では,逐次的に生成されたビューの間に4次元幾何学的ブリッジを導入することで,単一拡散モデル内で時間的および視点的自己回帰を構成するフレームワークであるMV-Forcingを提案する。
我々の重要な洞察は、自己回帰的な3D再構成モデルが自然に自己回帰的に生成されたビュー間で相互作用することである。
ソースビューが完了すると、その3D構造を再構築し、次のターゲット視点に幾何学的事前を描画し、拡散モデルにより高品質な映像に洗練する。
教師の定時窓を超えて世代を拡大するために,両視点スロットが訓練中にノイズから初期化され,時間的制約のない生成が可能となる共同認知システムを導入する。
本研究では, 時間的, 視線的自己回帰の両面において, 時間的, 視線的自己回帰の両面において, 時間的, 時間的, 時間的, 時間的, 時間的, 時間的差分差の差を埋めることによって, モデルを蒸留する。
MV-Forcingは、任意の長さと視点のダイナミックシーンの幾何的一貫したマルチビュー映像を、数ステップの学生モデルを用いて生成することを示した。
関連論文リスト
- Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model [33.214927542512555]
Diff-VFは、短いビデオ拡散バックボーンをベースモデルを変更または微調整することなく、長ビデオジェネレータに変換するフレームワークである。
VBench-Long の評価結果から,Diff-VF は基本モデルよりも時間的コヒーレンスと動きの多様性のバランスが良好であることが示唆された。
論文 参考訳(メタデータ) (2026-08-06T12:53:46Z) - FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching [68.01498128172214]
本稿では,アーキテクチャに依存しない,追加のトレーニングを必要としない長大なビデオ生成のための,斬新でシンプルな推論時間アプローチを提案する。
提案手法では,隣接するウィンドウからのクリーンサンプルをemphTweedieマッチングでブレンドし,テキストbfmanifoldの制約と重複領域間の時間的一貫性を強制する。
本手法は, 時間的一貫性と視覚的品質において, トレーニング不要, 自己回帰ベースラインを両立させながら, ネイティブウィンドウ長よりも数倍長大のビデオを生成する。
論文 参考訳(メタデータ) (2026-05-20T08:55:37Z) - Human Video Generation from a Single Image with 3D Pose and View Control [62.676151243249556]
HVG(Human Video Generation in 4D)は、1つの画像から高画質のマルチビュー、時間的コヒーレントな人間の映像を生成できる潜時ビデオ拡散モデルである。
1)新しい2次元骨地図を通して3次元関節の解剖学的関係を捉え、3次元情報を導入して自己閉塞を解消するArticulated Pose Modulation、(ii)参照画像とフレーム間安定性のためのポーズシーケンス間の多視点一貫性と整合性を保証するView and Temporal Alignment、(iii)
論文 参考訳(メタデータ) (2026-02-24T18:42:20Z) - RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space [51.441415833480505]
RAYNOVAは、二重因果自己回帰フレームワークを使用するシナリオを駆動するための多視点世界モデルである。
相対的なシャーカー線位置符号化に基づいて、ビュー、フレーム、スケールにまたがる等方的時間的表現を構築する。
論文 参考訳(メタデータ) (2026-02-24T08:41:40Z) - MV-Performer: Taming Video Diffusion Model for Faithful and Synchronized Multi-view Performer Synthesis [34.793258395288895]
モノクロフルボディキャプチャーから新しいビュービデオを作成するための革新的なフレームワークであるMV-Performerを提案する。
360度合成を実現するために、MVHumanNetデータセットを広範囲に活用し、情報伝達条件信号を取り込む。
生成したビデオの同期を維持するために,多視点の人間中心ビデオ拡散モデルを提案する。
論文 参考訳(メタデータ) (2025-10-08T16:24:22Z) - Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models [83.76517697509156]
本稿では、疎視映像を入力として高忠実度視点合成の課題に対処する。
本研究では, 4次元拡散モデルの視時整合性を高めるために, 反復的スライディング・デノナイジング法を提案する。
提案手法は,高品質で一貫したノベルビュー映像を合成し,既存の手法を大幅に上回っている。
論文 参考訳(メタデータ) (2025-07-17T17:59:17Z) - Vivid-ZOO: Multi-View Video Generation with Diffusion Model [76.96449336578286]
新しい課題は、大量のキャプション付きマルチビュービデオの欠如と、そのような多次元分布をモデル化する複雑さにある。
本稿では,テキストから動的3Dオブジェクトを中心に,高品質なマルチビュービデオを生成する拡散型パイプラインを提案する。
論文 参考訳(メタデータ) (2024-06-12T21:44:04Z) - RAVEN: Rethinking Adversarial Video Generation with Efficient Tri-plane Networks [93.18404922542702]
本稿では,長期的空間的および時間的依存関係に対処する新しいビデオ生成モデルを提案する。
提案手法は,3次元認識型生成フレームワークにインスパイアされた,明示的で単純化された3次元平面のハイブリッド表現を取り入れたものである。
我々のモデルは高精細度ビデオクリップを解像度256時間256$ピクセルで合成し、フレームレート30fpsで5ドル以上まで持続する。
論文 参考訳(メタデータ) (2024-01-11T16:48:44Z) - Spatio-Temporal Self-Attention Network for Video Saliency Prediction [13.873682190242365]
3D畳み込みニューラルネットワークは、コンピュータビジョンにおけるビデオタスクに対して有望な結果を得た。
本稿では,ビデオ・サリエンシ予測のための時空間自己注意3ネットワーク(STSANet)を提案する。
論文 参考訳(メタデータ) (2021-08-24T12:52:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。