論文の概要: OmniX: Any-view and Any-time 4D Reconstruction via Feed-forward Trajectory Fields
- arxiv url: http://arxiv.org/abs/2607.10840v1
- Date: Sun, 12 Jul 2026 17:05:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.551441
- Title: OmniX: Any-view and Any-time 4D Reconstruction via Feed-forward Trajectory Fields
- Title(参考訳): OmniX:フィードフォワード軌道場による任意のビューと任意の4D再構成
- Authors: Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo,
- Abstract要約: OmniXというフィードフォワードの4D再構成フレームワークを提案し、大きなカメラモーションを持つビデオから各ピクセルの高密度な3D点軌跡を推定する。
3次元運動のスパース構造とローランク構造を利用して、これらのトークンはグローバルな相互作用を効率的に保ちながら、全画像にわたる全画素の軌跡場を生成する。
- 参考スコア(独自算出の注目度): 69.80996430631079
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Previous feed-forward 4D reconstruction methods either predict per-frame static point clouds, ignoring foreground motion, or estimate point cloud trajectories while being limited to small camera motions. This restricts their ability to aggregate observations over time and reconstruct complete dynamic scenes under large viewpoint changes. To address this limitation, we propose OmniX, a feed-forward 4D reconstruction framework that predicts dense 3D point trajectories for every pixel from videos with large camera motion. OmniX decouples dynamic motion modeling from static geometry prediction and represents motion using a compact set of dynamic tokens. By leveraging the sparse and low-rank structure of 3D motion, these tokens generate trajectory fields for all pixels across all images while efficiently preserving global interactions. To facilitate training, we further build an automatic UE5-based 4D data engine and introduce a large-scale dataset containing 80K scenes and 1.28M multi-view videos with full geometric annotations. OmniX achieves state-of-the-art performance on dense 3D point trajectory prediction and 3D point tracking, while also demonstrating competitive results on video depth estimation and camera pose estimation.
- Abstract(参考訳): 以前のフィードフォワード4D再構成手法では、フレームごとの静的な点群を予測したり、前景の動きを無視したり、小さなカメラの動きに制限された状態で点群を推定したりしていた。
これにより、時間とともに観察を集約し、大きな視点の変化の下で完全なダイナミックなシーンを再構築する能力を制限することができる。
この制限に対処するため,大規模なカメラモーション映像から各画素の高密度3次元点軌跡を推定するフィードフォワード4D再構成フレームワークであるOmniXを提案する。
OmniXは静的幾何予測から動的運動モデリングを分離し、コンパクトな動的トークンセットを用いて動きを表現する。
3次元運動のスパース構造とローランク構造を利用して、これらのトークンはグローバルな相互作用を効率的に保ちながら、全画像にわたる全画素の軌跡場を生成する。
トレーニングを容易にするために、自動UE5ベースの4Dデータエンジンを構築し、80Kシーンと1.28Mマルチビュービデオを含む大規模なデータセットを全幾何学アノテーションで導入する。
OmniXは、高密度な3D点軌跡予測と3D点追跡の最先端性能を実現し、ビデオ深度推定とカメラポーズ推定の競合結果を実証する。
関連論文リスト
- Syn4D: A Multiview Synthetic 4D Dataset [92.50132053229817]
モノクロビデオからの動的シーンの3D再構成と追跡は、コンピュータビジョンにおいて重要な課題である。
この制限に対処するために、マルチビュー合成動的シーンであるSyn4Dを紹介する。
Syn4Dの主な特徴は、任意のピクセルを3Dに切り離すことである。
論文 参考訳(メタデータ) (2026-05-06T17:59:55Z) - Track4World: Feedforward World-centric Dense 3D Tracking of All Pixels [67.36972154532761]
モノクロビデオから各ピクセルの3D軌跡を推定することは重要であり、ビデオの3Dダイナミックスを包括的に理解する上で有望である。
最近のモノラルな3D追跡作業は印象的な性能を示しているが、第1フレーム上のスパースポイントのトラッキングや、高密度トラッキングのための遅い最適化ベースのフレームワークに限られている。
そこで我々は,Track4Worldと呼ばれるフィードフォワードモデルを提案し,世界中心座標系における全画素の効率的な3D追跡を可能にする。
論文 参考訳(メタデータ) (2026-03-03T03:45:43Z) - C4D: 4D Made from 3D through Dual Correspondences [77.04731692213663]
時間的対応を利用して既存の3次元再構成を4Dに拡張するフレームワークであるC4Dを紹介する。
C4Dは、短期光学フローと長期点追跡の2種類の対応をキャプチャする。
我々は、追加の移動情報を提供する動的認識ポイントトラッカーを訓練する。
論文 参考訳(メタデータ) (2025-10-16T17:59:06Z) - Trace Anything: Representing Any Video in 4D via Trajectory Fields [98.85848134960172]
軌道場 (Trajectory Field) は、各フレーム内の各ピクセルに時間の連続した3次元軌跡関数を割り当てる密集写像である。
我々は,1つのフィードフォワードパスで軌道場全体を予測するニューラルネットワークであるTrace Anythingを紹介する。
私たちは、新しいプラットフォームからのデータを含む大規模な4Dデータに基づいて、Trace Anythingモデルをトレーニングしました。
論文 参考訳(メタデータ) (2025-10-15T17:59:04Z) - Geometry-aware 4D Video Generation for Robot Manipulation [28.709339959536106]
そこで本研究では,映像の多視点3次元整合性を実現する4次元映像生成モデルを提案する。
この幾何学的監督により、モデルはシーンの共有3次元表現を学習することができ、新しい視点から将来の映像シーケンスを予測することができる。
既存のベースラインと比較して,本手法は複数のシミュレーションおよび実世界のロボットデータセットに対して,より視覚的に安定かつ空間的に整合した予測を生成する。
論文 参考訳(メタデータ) (2025-07-01T18:01:41Z) - Easi3R: Estimating Disentangled Motion from DUSt3R Without Training [69.51086319339662]
Easi3Rは,4次元再構成のための簡易かつ効率的なトレーニングフリー手法である。
提案手法は,事前学習やネットワークファインチューニングの必要性を排除し,推論中の注意適応を適用した。
実世界のダイナミックビデオの実験では、従来の最先端手法よりも軽量な注意適応が著しく優れていたことが示されている。
論文 参考訳(メタデータ) (2025-03-31T17:59:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。