論文の概要: Kepler4D: Controllable Future Video Generation via 4D Scene State Evolution
- arxiv url: http://arxiv.org/abs/2610.04152v1
- Date: Fri, 02 Oct 2026 23:53:00 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:56:10.36556
- Title: Kepler4D: Controllable Future Video Generation via 4D Scene State Evolution
- Title(参考訳): Kepler4D:4D Scene State Evolutionによる制御可能な未来のビデオ生成
- Abstract要約: Kepler4Dは、4Dシーン状態の明示的な進化を通じて、将来の映像生成のためのフレームワークである。
モノクロビデオが与えられた後、Kepler4Dは背景形状、物体の動き履歴、粗い空間サポート、意味的コンテキストの共有3D表現を構築する。
実世界のビデオの実験では、ケプラー4Dは制御可能な物体の動きと将来のロールアウトを可能にしている。
- 参考スコア(独自算出の注目度): 28.15084496855441
- License:
- Abstract: Video world models aim to preserve scene structure and predict how dynamic objects evolve beyond visual observations. We present Kepler4D, a framework for future video generation through explicit 4D scene state evolution. Given a monocular video, Kepler4D constructs a shared 3D representation of background geometry, object motion histories, coarse spatial supports, and semantic context. Chain-of-Motion summarizes observed motion and uses a vision-language model to select structured speed and heading decisions and decide whether to bound object-center height from below. A deterministic rollout converts these decisions into future object trajectories for inspection and editing before synthesis. We render the evolving proxies into geometric controls for a pretrained video generator, separating coarse object motion from the synthesis of appearance and articulation. Experiments on real-world videos demonstrate that Kepler4D enables controllable object motion and plausible future rollout while preserving scene consistency.
- Abstract(参考訳): ビデオワールドモデルは、シーン構造を保存し、動的オブジェクトが視覚的な観察を超えてどのように進化するかを予測することを目的としている。
Kepler4Dは、4Dシーン状態の明示的な進化を通じて、将来の映像生成のためのフレームワークである。
モノクロビデオが与えられた後、Kepler4Dは背景形状、物体の動き履歴、粗い空間サポート、意味的コンテキストの共有3D表現を構築する。
Chain-of-Motionは観察された動きを要約し、視覚言語モデルを用いて構造化された速度と方向決定を選択し、対象中心の高さを下から束縛するかを決定する。
決定論的ロールアウトは、これらの決定を将来のオブジェクト軌跡に変換して、合成前の検査と編集を行う。
我々は、進化するプロキシを事前訓練されたビデオジェネレータの幾何学的制御に応用し、粗い物体の動きを外観と調音の合成から分離する。
実世界のビデオの実験では、Kepler4Dはシーンの一貫性を保ちながら、制御可能な物体の動きと将来のロールアウトを可能にしている。
関連論文リスト
- 4DGS-WAM: Bridging Past and Future with an Object-Centric World Action Model based on 4D Gaussian Splatting [72.02343855552051]
現在の世界アクションモデル(WAM)は2次元の視覚データを扱うのが一般的である。
動的オブジェクトとシーンの静的背景を別々にモデル化した,明示的な4Dガウススティング(4DGS)表現を利用する。
4DGS-WAMは2次元観察を永続的な4次元表現に上げ、将来の予測で観測済みの静的コンテンツを再利用できるようにする。
論文 参考訳(メタデータ) (2026-08-26T16:16:57Z) - Motion 3-to-4: 3D Motion Reconstruction for 4D Synthesis [53.48281548500864]
Motion 3-to-4は、単一のモノクロビデオから高品質な4Dダイナミックオブジェクトを合成するためのフィードフォワードフレームワークである。
我々のモデルは、コンパクトな動き潜在表現を学習し、フレーム単位の軌道を予測して、時間的コヒーレントな幾何である完全なロバスト性を取り戻す。
論文 参考訳(メタデータ) (2026-01-20T18:59:48Z) - ObjectForesight: Predicting Future 3D Object Trajectories from Human Videos [48.24897274501108]
本研究では,3次元オブジェクト中心のダイナミックスモデルを導入し,短い自我中心の映像シーケンスから剛体物体の将来の6-DoFのポーズと軌跡を予測する。
ピクセルまたは潜在空間で動作する従来の世界やダイナミクスモデルとは異なり、ObjectForesightはオブジェクトレベルで3Dで明示的に世界を表現する。
我々は、ObjectForesightが、未確認のオブジェクトやシーンへの精度、幾何整合性、一般化において、大幅に向上することを示す。
論文 参考訳(メタデータ) (2026-01-08T18:58:08Z) - Geometry-aware 4D Video Generation for Robot Manipulation [28.709339959536106]
そこで本研究では,映像の多視点3次元整合性を実現する4次元映像生成モデルを提案する。
この幾何学的監督により、モデルはシーンの共有3次元表現を学習することができ、新しい視点から将来の映像シーケンスを予測することができる。
既存のベースラインと比較して,本手法は複数のシミュレーションおよび実世界のロボットデータセットに対して,より視覚的に安定かつ空間的に整合した予測を生成する。
論文 参考訳(メタデータ) (2025-07-01T18:01:41Z) - TC4D: Trajectory-Conditioned Text-to-4D Generation [94.90700997568158]
提案するTC4D: trajectory-conditioned text-to-4D 生成は,グローバルおよびローカルなコンポーネントへの移動を要因とする。
我々は,テキスト・ビデオ・モデルから,グローバルな軌跡に適合する局所的な変形を観察する。
提案手法は,任意の軌跡に沿ってアニメーションされたシーンの合成,構成シーンの生成,および生成した動きのリアリズムと量に対する大幅な改善を可能にする。
論文 参考訳(メタデータ) (2024-03-26T17:55:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。