論文の概要: Syn4D: A Multiview Synthetic 4D Dataset
- arxiv url: http://arxiv.org/abs/2605.05207v1
- Date: Wed, 06 May 2026 17:59:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.986829
- Title: Syn4D: A Multiview Synthetic 4D Dataset
- Title(参考訳): Syn4D: 多視点合成4Dデータセット
- Abstract要約: モノクロビデオからの動的シーンの3D再構成と追跡は、コンピュータビジョンにおいて重要な課題である。
この制限に対処するために、マルチビュー合成動的シーンであるSyn4Dを紹介する。
Syn4Dの主な特徴は、任意のピクセルを3Dに切り離すことである。
- 参考スコア(独自算出の注目度): 92.50132053229817
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dense 3D reconstruction and tracking of dynamic scenes from monocular video remains an important open challenge in computer vision. Progress in this area has been constrained by the scarcity of high-quality datasets with dense, complete, and accurate geometric annotations. To address this limitation, we introduce Syn4D, a multiview synthetic dataset of dynamic scenes that includes ground-truth camera motion, depth maps, dense tracking, and parametric human pose annotations. A key feature of Syn4D is the ability to unproject any pixel into 3D to any time and to any camera. We conduct extensive evaluations across multiple downstream tasks to demonstrate the utility and effectiveness of the proposed dataset, including 4D scene reconstruction, 3D point tracking, geometry-aware camera retargeting, and human pose estimation. The experimental results highlight Syn4D's potential to facilitate research in dynamic scene understanding and spatiotemporal modeling.
- Abstract(参考訳): モノクロ映像からのダイナミックシーンの3D再構成と追跡は、コンピュータビジョンにおいて重要な課題である。
この領域の進歩は、密度が高く、完全で正確な幾何学的アノテーションを持つ高品質なデータセットの不足によって制約されている。
この制限に対処するため、Syn4Dという動的シーンのマルチビュー合成データセットを導入し、地平線カメラの動き、深度マップ、密集度追跡、パラメトリックな人間のポーズアノテーションを含む。
Syn4Dの重要な特徴は、任意のピクセルをいつでも3Dに切り離すことができることだ。
本研究では,4次元シーン再構成,3次元点追跡,幾何認識カメラのリターゲティング,人間のポーズ推定など,複数の下流タスクに対して広範囲に評価を行い,提案したデータセットの有用性と有効性を示す。
実験結果は、動的シーン理解と時空間モデリングの研究を促進するSyn4Dの可能性を強調した。
関連論文リスト
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration [38.16996826492207]
HAT-4Dは、単一のビデオから複数の物体の3次元幾何学、時間力学、物理的相互作用を再構成する。
スケーラブルなデータエンジンとして、HAT-4Dはモノクロ4Dインタラクション再構築のためのオープンワールドベンチマークであるMVOIK-4Dの作成を容易にする。
論文 参考訳(メタデータ) (2026-06-26T16:05:58Z) - SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations [88.8747004592363]
SceneScribe-1Mは新しい大規模多時間ビデオデータセットである。
そこには100万本のビデオが含まれており、それぞれに詳細なテキスト記述、正確なパラメータ、深度マップ、一貫性のある3Dポイントトラックなどが含まれている。
SceneScribe-1Mの汎用性と価値は、単眼深度推定、シーン再構成動的点追跡、テキスト・ビデオ合成などの生成タスク、カメラ制御の有無にかかわらず、幅広い下流タスクのベンチマークを確立することで示される。
論文 参考訳(メタデータ) (2026-04-09T08:59:33Z) - Motion 3-to-4: 3D Motion Reconstruction for 4D Synthesis [53.48281548500864]
Motion 3-to-4は、単一のモノクロビデオから高品質な4Dダイナミックオブジェクトを合成するためのフィードフォワードフレームワークである。
我々のモデルは、コンパクトな動き潜在表現を学習し、フレーム単位の軌道を予測して、時間的コヒーレントな幾何である完全なロバスト性を取り戻す。
論文 参考訳(メタデータ) (2026-01-20T18:59:48Z) - Joint 3D Geometry Reconstruction and Motion Generation for 4D Synthesis from a Single Image [88.71287865590273]
そこでTrajScene-60Kについて紹介する。
拡散型4次元シーン軌道生成装置(4D-STraG)を提案する。
次に、4Dポイントトラック表現から任意のカメラトラジェクトリでビデオをレンダリングする4Dビュー合成モジュール(4D-Vi)を提案する。
論文 参考訳(メタデータ) (2025-12-04T17:59:10Z) - C4D: 4D Made from 3D through Dual Correspondences [77.04731692213663]
時間的対応を利用して既存の3次元再構成を4Dに拡張するフレームワークであるC4Dを紹介する。
C4Dは、短期光学フローと長期点追跡の2種類の対応をキャプチャする。
我々は、追加の移動情報を提供する動的認識ポイントトラッカーを訓練する。
論文 参考訳(メタデータ) (2025-10-16T17:59:06Z) - Geometry-aware 4D Video Generation for Robot Manipulation [28.709339959536106]
そこで本研究では,映像の多視点3次元整合性を実現する4次元映像生成モデルを提案する。
この幾何学的監督により、モデルはシーンの共有3次元表現を学習することができ、新しい視点から将来の映像シーケンスを予測することができる。
既存のベースラインと比較して,本手法は複数のシミュレーションおよび実世界のロボットデータセットに対して,より視覚的に安定かつ空間的に整合した予測を生成する。
論文 参考訳(メタデータ) (2025-07-01T18:01:41Z) - 4D Gaussian Splatting: Modeling Dynamic Scenes with Native 4D Primitives [115.67081491747943]
動的3Dシーン表現と新しいビュー合成はAR/VRおよびメタバースアプリケーションの実現に不可欠である。
我々は,その基礎となる4次元体積を近似として,時間変化の異なる3次元シーンの再構成を再構成する。
ストレージのボトルネックに対処するため、メモリフットプリントを効果的に削減するいくつかのコンパクトなバリエーションを導出する。
論文 参考訳(メタデータ) (2024-12-30T05:30:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。