論文の概要: EgoTrack3D: A Modular Framework for Egocentric 3D Object Tracking
- arxiv url: http://arxiv.org/abs/2608.08016v1
- Date: Sat, 08 Aug 2026 08:53:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.604943
- Title: EgoTrack3D: A Modular Framework for Egocentric 3D Object Tracking
- Title(参考訳): EgoTrack3D:エゴセントリックな3Dオブジェクト追跡のためのモジュールフレームワーク
- Abstract要約: 我々はEgoTrack3Dを紹介した。EgoTrack3Dは、エゴセントリックなRGBビデオから直接動的3Dシーンを再構成し、維持するモジュラーフレームワークである。
EgoTrack3Dは時間とともに正確な表現を維持し、正しい位置の割合で11%改善している。
密集深度マップをスパース3次元境界ボックス推定に置き換え、相互作用誘導動的アソシエーションを統合する。
- 参考スコア(独自算出の注目度): 48.532819029347785
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding 3D scenes from egocentric video is fundamental for robotics and autonomous navigation, yet rapid viewpoint changes and partial occlusions make building structured representations challenging. Existing 3D tracking and scene graph construction methods primarily address explicit interactions or assume static scenes, limiting their ability to capture complex dynamics. We introduce EgoTrack3D, a modular framework that reconstructs and maintains a dynamic 3D scene representation directly from egocentric RGB video. The framework lifts 2D segmentation masks into a global 3D coordinate frame, using a point-based motion scoring mechanism alongside a voxel-based merging heuristic to associate object tracks. EgoTrack3D maintains accurate representations over time, achieving an 11% improvement in percentage of correct locations (PCL) relative to the strongest baseline on the Aria Digital Twin (ADT) dataset, while addressing the more general setting of persistent 3D tracking for both static and dynamic objects. Furthermore, to demonstrate the system's robustness under degraded conditions that simulate real-world deployment constraints, we replace dense depth maps with sparse 3D bounding box estimation and integrate interaction-guided dynamic association, enabling EgoTrack3D to maintain accurate spatial representations despite noisy observations.
- Abstract(参考訳): エゴセントリックなビデオから3Dシーンを理解することは、ロボティクスや自律ナビゲーションに不可欠だが、迅速な視点の変化と部分的な閉塞は、構造化された表現の構築を困難にしている。
既存の3Dトラッキングとシーングラフ構築手法は主に明示的な相互作用に対処するか、静的なシーンを仮定し、複雑なダイナミクスをキャプチャする能力を制限する。
我々はEgoTrack3Dを紹介した。EgoTrack3Dは、エゴセントリックなRGBビデオから直接動的3Dシーンを再構成し、維持するモジュラーフレームワークである。
このフレームワークは、2Dセグメンテーションマスクをグローバルな3D座標フレームに持ち上げる。
EgoTrack3Dは正確な表現を維持し、Aria Digital Twin(ADT)データセット上の最強ベースラインに対する正しい位置(PCL)の割合を11%改善し、静的オブジェクトと動的オブジェクトの両方に対して永続的な3Dトラッキングのより一般的な設定に対処する。
さらに, 実世界の展開制約をシミュレートする劣化条件下でのシステムの堅牢性を示すため, 密集深度マップをスパース3D境界ボックス推定に置き換え, 相互作用誘導動的アソシエーションを統合し, ノイズの多い観測にもかかわらず正確な空間表現をEgoTrack3Dが維持できるようにする。
関連論文リスト
- Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding [34.1504914582344]
3D Visual Groundingは、自然言語記述を通じてオブジェクトを3Dシーンにローカライズすることを目的としている。
生のRGB-Dストリーム上で直接動作する2次元から3次元の再生パラダイムである"Think, Act, Build (TAB)"を提案する。
厳密なVLMセマンティックトラッキングによる多視点カバレッジ障害を克服するために,セマンティックアンコレッド幾何拡張を導入する。
論文 参考訳(メタデータ) (2026-04-01T06:12:16Z) - Sparse3DTrack: Monocular 3D Object Tracking Using Sparse Supervision [16.586885757497203]
モノクロ3Dオブジェクトトラッキングは、ビデオフレーム全体で時間的に一貫した3Dオブジェクトのポーズを推定することを目的としている。
既存の最先端のアプローチは、完全に監視されており、長いビデオシーケンスよりも密集した3Dアノテーションに依存している。
モノクロ3次元物体追跡のための最初の教師付きフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-18T21:36:41Z) - Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints [87.13154261503168]
モーションコントロール可能なビデオ生成は、仮想現実と組み込みAIにおけるエゴセントリックなアプリケーションに不可欠である。
既存の手法は、しばしば3D一貫性のきめ細かい手話を実現するのに苦労する。
単一の参照フレームからエゴセントリックなビデオを生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-12T10:02:23Z) - SpatialTrackerV2: 3D Point Tracking Made Easy [73.0350898700048]
SpaceTrackerV2はモノクロビデオのフィードフォワード3Dポイントトラッキング手法である。
これは、世界空間の3Dモーションをシーン幾何学、カメラエゴモーション、ピクセルワイドオブジェクトモーションに分解する。
このような異種データから幾何学と運動を共同で学習することで、SpatialTrackerV2は既存の3Dトラッキング方法よりも30%優れています。
論文 参考訳(メタデータ) (2025-07-16T17:59:03Z) - POMATO: Marrying Pointmap Matching with Temporal Motion for Dynamic 3D Reconstruction [53.19968902152528]
POMATOは時間運動と一致する点マップを結合して動的3次元再構成を実現するための統合フレームワークである。
具体的には,RGB画素を動的および静的の両方の領域から3次元ポイントマップにマッピングすることで,明示的なマッチング関係を学習する。
本稿では,複数の下流タスクにまたがる顕著な性能を示すことによって,提案したポイントマップマッチングと時間融合のパラダイムの有効性を示す。
論文 参考訳(メタデータ) (2025-04-08T05:33:13Z) - 3D-Aware Instance Segmentation and Tracking in Egocentric Videos [107.10661490652822]
エゴセントリックなビデオは、3Dシーンの理解にユニークな課題を提示する。
本稿では,一対一のビデオにおけるインスタンスのセグメンテーションとトラッキングに対する新しいアプローチを提案する。
空間的および時間的手がかりを取り入れることで、最先端の2D手法と比較して優れた性能が得られる。
論文 参考訳(メタデータ) (2024-08-19T10:08:25Z) - Monocular Quasi-Dense 3D Object Tracking [99.51683944057191]
周囲の物体の将来の位置を予測し、自律運転などの多くのアプリケーションで観測者の行動を計画するためには、信頼性と正確な3D追跡フレームワークが不可欠である。
移動プラットフォーム上で撮影された2次元画像のシーケンスから,移動物体を時間とともに効果的に関連付け,その全3次元バウンディングボックス情報を推定するフレームワークを提案する。
論文 参考訳(メタデータ) (2021-03-12T15:30:02Z) - Tracking Emerges by Looking Around Static Scenes, with Neural 3D Mapping [23.456046776979903]
本稿では,任意の場面(静的あるいは動的)における静止点のマルチビューデータを利用して,ニューラル3Dマッピングモジュールを学習することを提案する。
ニューラル3Dマッパーは、RGB-Dデータを入力として消費し、深い特徴の3Dボクセルグリッドを出力として生成する。
教師なし3Dオブジェクトトラッカーは、教師なし2Dと2.5Dのトラッカーよりも優れており、教師なし3Dオブジェクトトラッカーの精度に近づいていることを示す。
論文 参考訳(メタデータ) (2020-08-04T02:59:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。