論文の概要: ChronoWorld: Camera-Controlled Consistent 4D World Generation via Spatiotemporal Cues and Geometric Reflections
- arxiv url: http://arxiv.org/abs/2610.06687v2
- Date: Tue, 06 Oct 2026 09:12:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.441524
- Title: ChronoWorld: Camera-Controlled Consistent 4D World Generation via Spatiotemporal Cues and Geometric Reflections
- Title(参考訳): ChronoWorld: 時空間キューと幾何学的反射によるカメラ制御された連続4Dワールドジェネレーション
- Abstract要約: ChronoWorldは"状態観察"フレームワークで、因果的、時間的、再構築の事前を利用して、一貫したフリービュー4Dシーンを生成する。
動的自己極性反射と生成した出力の補正を可能にする4次元検索戦略を用いた再構成駆動幾何反射法を開発した。
- 参考スコア(独自算出の注目度): 46.54937682514625
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While existing camera-controllable video generation models can produce visually compelling sequences, preserving intrinsic 4D spatiotemporal coherence remains challenging. To address this limitation, we propose ChronoWorld, an "Observation--State--Reflection" framework that leverages spatiotemporal causal cues and reconstruction priors to generate globally consistent, free-view 4D scenes. Given a context video, we introduce a Spatiotemporal Epipolar Causal Attention mechanism that enforces multi-view epipolar constraints and temporal causality throughout the generation process. In addition, we develop a reconstruction-driven geometric reflection pipeline with a 4D retrieval strategy to enable dynamic self-assessment and correction of generated outputs, improving consistency and accuracy. Extensive experiments show that ChronoWorld achieves state-of-the-art performance in spatiotemporally consistent, cinematic-quality 4D scene generation, with strong generalization and high-fidelity geometry across diverse scenarios.
- Abstract(参考訳): 既存のカメラ制御可能なビデオ生成モデルは視覚的に魅力的なシーケンスを生成することができるが、固有の4D空間の空間的コヒーレンスを保存することは依然として困難である。
この制限に対処するため,一貫した自由視点4Dシーンを生成するために,時空間の因果的手がかりと再構成を生かした「観測-状態-反射」フレームワークであるChronoWorldを提案する。
コンテクストビデオでは、生成過程を通じて多視点のエピポーラ制約と時間的因果関係を強制する時空間因果性注意機構を導入する。
さらに, 動的自己評価と出力の補正が可能で, 整合性と精度が向上する4次元検索戦略を備えた再構成駆動型幾何反射パイプラインを開発した。
大規模な実験により、クロノワールドは時空間的に一貫した撮影品質の4Dシーン生成において、多種多様なシナリオにまたがる強力な一般化と高忠実度幾何学により、最先端のパフォーマンスを達成することが示された。
関連論文リスト
- RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space [51.441415833480505]
RAYNOVAは、二重因果自己回帰フレームワークを使用するシナリオを駆動するための多視点世界モデルである。
相対的なシャーカー線位置符号化に基づいて、ビュー、フレーム、スケールにまたがる等方的時間的表現を構築する。
論文 参考訳(メタデータ) (2026-02-24T08:41:40Z) - WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling [63.37476802589492]
We present WorldReel, a 4D video that are native-temporally consistent。
WorldReelは、ポイントマップ、カメラ軌道、高密度フローを含む4Dシーン表現と共にフレームを生成する。
We believe that WorldReel bring video generation to 4D-consistent world modeling。
論文 参考訳(メタデータ) (2025-12-08T18:54:12Z) - ChronosObserver: Taming 4D World with Hyperspace Diffusion Sampling [15.409157645520219]
本研究では,4次元世界シーンの時間的制約を表現するために,World State Hyperspaceを含むトレーニング不要な手法を提案する。
本研究では,拡散モデルの訓練や微調整を行うことなく,高忠実度かつ3次元連続時間同期ビデオを実現する方法を示す。
論文 参考訳(メタデータ) (2025-12-01T10:00:26Z) - ShapeGen4D: Towards High Quality 4D Shape Generation from Videos [85.45517487721257]
ビデオからエンドツーエンドに1つの動的3次元表現を合成する,ネイティブなビデオから4次元の形状生成フレームワークを提案する。
本手法は,フレームごとの最適化を行なわずに,非剛性運動,体積変化,および位相遷移を正確にキャプチャする。
論文 参考訳(メタデータ) (2025-10-07T17:58:11Z) - 4D Driving Scene Generation With Stereo Forcing [62.47705572424127]
現在の生成モデルは、時間外挿と空間的新規ビュー合成(NVS)をシーンごとの最適化なしで同時にサポートする動的4D駆動シーンの合成に苦慮している。
PhiGenesisは、幾何学的・時間的整合性を持った映像生成技術を拡張する4次元シーン生成のための統合フレームワークである。
論文 参考訳(メタデータ) (2025-09-24T15:37:17Z) - Dream4D: Lifting Camera-Controlled I2V towards Spatiotemporally Consistent 4D Generation [3.1852855132066673]
現在のアプローチは、複雑なシーンダイナミクスを処理しながら、ビューの一貫性を維持するのに苦労することが多い。
このフレームワークは、リッチな時間的先行ビデオ拡散モデルと、再構成モデルの幾何学的認識の両方を活用する最初のものである。
これは4D生成を著しく促進し、既存の方法よりも高い品質(mPSNR、mSSIMなど)を示す。
論文 参考訳(メタデータ) (2025-08-11T08:55:47Z) - Free4D: Tuning-free 4D Scene Generation with Spatial-Temporal Consistency [49.875459658889355]
Free4Dは、単一の画像から4Dシーンを生成するためのチューニング不要のフレームワークである。
我々の重要な洞察は、一貫した4次元シーン表現のために、事前訓練された基礎モデルを蒸留することである。
結果の4D表現はリアルタイムで制御可能なレンダリングを可能にする。
論文 参考訳(メタデータ) (2025-03-26T17:59:44Z) - Real-time Photorealistic Dynamic Scene Representation and Rendering with
4D Gaussian Splatting [8.078460597825142]
2次元画像から動的3Dシーンを再構成し、時間とともに多様なビューを生成することは、シーンの複雑さと時間的ダイナミクスのために困難である。
本研究では、4次元プリミティブの集合を明示的な幾何学と外観モデルを用いて最適化することにより、動的シーンの基本的な時間的レンダリング量を近似することを提案する。
我々のモデルは概念的に単純であり、異方性楕円によってパラメータ化され、空間と時間で任意に回転する4次元ガウスのパラメータと、4次元球面調和係数で表されるビュー依存および時間進化の外観から構成される。
論文 参考訳(メタデータ) (2023-10-16T17:57:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。