論文の概要: TAPVid-MV: A Benchmark for Tracking Any Point in 3D Across Multiple Views
- arxiv url: http://arxiv.org/abs/2609.01899v1
- Date: Tue, 01 Sep 2026 21:58:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.990162
- Title: TAPVid-MV: A Benchmark for Tracking Any Point in 3D Across Multiple Views
- Title(参考訳): TAPVid-MV: 複数の視点で3次元の任意の点を追跡するベンチマーク
- Abstract要約: この設定の最初のベンチマークであるTAPVid-MV(Tracking Any Point in Video across Multiple Views)を紹介します。
キュレートされた284のシーケンス、1,142のキャリブレーションされたカメラストリーム、109,769のトラックが、屋内と屋外のドメインにまたがる7つのサブセットにまたがっている。
本研究では,センサ深度,LiDAR,SLAM,SfM点,ヒューマンメッシュ,ポーズされたオブジェクトメッシュ,シミュレーションといった,データセット固有の補助的モダリティを用いてこれらのトラジェクトリを解析し,各シーケンスとトラジェクトリを人間のアノテーションによって視覚的に検証する。
- 参考スコア(独自算出の注目度): 50.26507994908593
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multi-camera systems are increasingly practical for robotics, AR/VR, and autonomous driving because complementary views reduce depth ambiguity and preserve visibility under occlusion. Existing point-tracking benchmarks, however, focus on a single video or static multi-camera rigs. None test long-term 3D point tracking across several synchronized views under camera motion. We introduce TAPVid-MV (Tracking Any Point in Video across Multiple Views), the first benchmark for this setting. It contains a curated set of 284 sequences, 1,142 calibrated camera streams, and 109,769 point tracks across seven subsets spanning indoor and outdoor domains, from robotics and human activity to driving and synthetic procedural scenes. We obtain these trajectories using dataset-specific auxiliary modalities: sensor depth, LiDAR, SLAM and SfM points, human meshes, posed object meshes, and simulation. Every sequence and trajectory is visually verified by human annotators. Across more than 30 baselines, no method comes close to solving the task. Surprisingly, existing multi-view point trackers do not consistently outperform monocular point trackers. By evaluating reconstruction and point tracking on the same datasets, TAPVid-MV helps distinguish errors in recovered geometry from errors in point correspondence. Through this joint analysis, we identify geometry recovery as a major bottleneck for accurate 3D point tracking. Beyond multi-view 3D point tracking, our released annotations support monocular 2D and 3D point tracking, future-trajectory prediction, and 4D reconstruction.
- Abstract(参考訳): マルチカメラシステムは、ロボット工学、AR/VR、自律運転においてますます実用的になっている。
しかし、既存のポイントトラッキングベンチマークでは、単一のビデオまたは静的なマルチカメラリグに焦点を当てている。
カメラモーション下で複数の同期ビューを横断する長期3Dポイントトラッキングは行わない。
この設定の最初のベンチマークであるTAPVid-MV(Tracking Any Point in Video across Multiple Views)を紹介します。
キュレートされた284のシーケンス、1,142のキャリブレーションされたカメラストリーム、109,769のトラックが室内と屋外の7つのサブセットにまたがっている。
我々は,センサ深度,LiDAR,SLAM,SfM点,人的メッシュ,ポーズ対象メッシュ,シミュレーションといった,データセット固有の補助モーダリティを用いてこれらのトラジェクトリを得る。
すべてのシーケンスと軌道は、人間のアノテーションによって視覚的に検証される。
30以上のベースラインにまたがって、タスクの解決に近づく方法はない。
驚いたことに、既存のマルチビューポイントトラッカーは単色ポイントトラッカーより一貫して優れているわけではない。
TAPVid-MVは、同じデータセット上での再構成と点追跡を評価することにより、復元された幾何の誤差と点対応の誤差を区別するのに役立つ。
この共同解析により,正確な3次元点追跡のボトルネックとして幾何復元が重要である。
マルチビュー3Dポイントトラッキング以外にも,モノクロ2Dおよび3Dポイントトラッキング,将来の軌道予測,4D再構成をサポートするアノテーションがリリースされた。
関連論文リスト
- Point2Pose: Occlusion-Recovering 6D Pose Tracking and 3D Reconstruction for Multiple Unknown Objects Via 2D Point Trackers [17.68066197994233]
Point2Poseは、モノクロRGB-Dビデオからの剛体物体の因果6Dポーズトラッキングのためのモデルレス手法である。
アプローチでは、オブジェクトCADモデルやカテゴリ先行を必要とせずに、複数の未確認オブジェクトを追跡できる。
実験により、Point2Poseは、厳密な閉塞ベンチマークで最先端の手法に匹敵する性能を達成することが示された。
論文 参考訳(メタデータ) (2026-04-12T02:17:49Z) - TAPVid-360: Tracking Any Point in 360 from Narrow Field of View Video [7.009814571727852]
TAPVid-360は,ビデオシーケンスを横断するシーンポイントに対する3次元方向の予測を必要とする新しいタスクである。
我々は360度動画を監督の源として利用し、真実の方向を計算しながら視野を狭くする。
我々のベースラインはCoTracker v3に適応し、方向更新のためのポイント毎の回転を予測し、既存のTAPおよびTAPVid 3D法より優れている。
論文 参考訳(メタデータ) (2025-11-26T22:13:26Z) - Multi-View 3D Point Tracking [67.21282192436031]
本稿では,複数のカメラビューを用いた動的シーンにおける任意の点の追跡を目的とした,データ駆動型マルチビュー3Dポイントトラッカーについて紹介する。
本モデルでは,現実的な数のカメラを用いて直接3次元対応を推定する。
我々は5K合成多視点Kubricシーケンスをトレーニングし、2つの実世界のベンチマークで評価する。
論文 参考訳(メタデータ) (2025-08-28T17:58:20Z) - SpatialTrackerV2: 3D Point Tracking Made Easy [73.0350898700048]
SpaceTrackerV2はモノクロビデオのフィードフォワード3Dポイントトラッキング手法である。
これは、世界空間の3Dモーションをシーン幾何学、カメラエゴモーション、ピクセルワイドオブジェクトモーションに分解する。
このような異種データから幾何学と運動を共同で学習することで、SpatialTrackerV2は既存の3Dトラッキング方法よりも30%優れています。
論文 参考訳(メタデータ) (2025-07-16T17:59:03Z) - Dynamic Point Maps: A Versatile Representation for Dynamic 3D Reconstruction [56.32589034046427]
本研究では,ダイナミックポイントマップ(DPM)を導入し,モーションセグメンテーション,シーンフロー推定,3次元物体追跡,2次元対応などの4次元タスクをサポートする標準点マップを拡張した。
我々は,合成データと実データを組み合わせたDPM予測器を訓練し,映像深度予測,ダイナミックポイントクラウド再構成,3次元シーンフロー,オブジェクトポーズ追跡,最先端性能の達成など,様々なベンチマークで評価する。
論文 参考訳(メタデータ) (2025-03-20T16:41:50Z) - TAPVid-3D: A Benchmark for Tracking Any Point in 3D [63.060421798990845]
我々は,3Dにおける任意の点の追跡作業を評価するための新しいベンチマークTAPVid-3Dを導入する。
このベンチマークは、モノクロビデオから正確な3Dの動きと表面の変形を理解する能力を改善するためのガイドポストとして機能する。
論文 参考訳(メタデータ) (2024-07-08T13:28:47Z) - Monocular Quasi-Dense 3D Object Tracking [99.51683944057191]
周囲の物体の将来の位置を予測し、自律運転などの多くのアプリケーションで観測者の行動を計画するためには、信頼性と正確な3D追跡フレームワークが不可欠である。
移動プラットフォーム上で撮影された2次元画像のシーケンスから,移動物体を時間とともに効果的に関連付け,その全3次元バウンディングボックス情報を推定するフレームワークを提案する。
論文 参考訳(メタデータ) (2021-03-12T15:30:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。