論文の概要: Beyond the Image Plane: World-Grounded Queries for Multi-Object Tracking
- arxiv url: http://arxiv.org/abs/2609.00924v1
- Date: Tue, 01 Sep 2026 08:48:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.486625
- Title: Beyond the Image Plane: World-Grounded Queries for Multi-Object Tracking
- Title(参考訳): イメージプレーンを超えて:マルチオブジェクトトラッキングのためのワールドグラウンドクエリ
- Authors: Orcun Cetintas, Guillem Brasó, Tim Meinhardt, Laura Leal-Taixé,
- Abstract要約: マルチオブジェクトトラッカーは、主に画像平面でのみ観察される外観と幾何学を用いて、オブジェクトをローカライズし、関連付ける。
画像平面を超えて移動するために設計された、エンドツーエンドのマルチオブジェクトトラッカーPLANETを紹介する。
我々は,再構成された3次元シーン形状をクエリ生成時に使用する特徴や位置エンコーディングに埋め込むことで,ワールドグラウンドクエリを形成する。
補完的な二重分解能時間記憶は、この証拠をより長い時間的ギャップにわたって保存する。
- 参考スコア(独自算出の注目度): 33.75220308607584
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Monocular videos record 3D scenes as sequences of 2D image-plane projections, obscuring depth and spatial relationships. Multi-object trackers localize and associate objects primarily using appearance and geometry observed only in the image plane, inheriting these ambiguities. To address this limitation, we introduce PLANET, an end-to-end multi-object tracker designed to move beyond the image plane. As an enabling step, we lift existing 2D tracking datasets into 3D. We then form world-grounded queries by embedding reconstructed 3D scene geometry into the features and positional encodings used during query formation. An auxiliary 3D location prediction task further encourages the queries to encode object positions during training. A complementary dual-resolution temporal memory preserves this evidence across longer temporal gaps. As a result, PLANET achieves state-of-the-art performance across three diverse benchmarks.
- Abstract(参考訳): モノクロビデオは、3Dシーンを2次元画像平面投影、奥行きと空間的関係のシーケンスとして記録する。
マルチオブジェクトトラッカーは、主に画像平面でのみ観察される外観と幾何学を用いてオブジェクトをローカライズし、関連付け、それらの曖昧さを継承する。
この制限に対処するために,画像平面の向こう側へ移動するように設計された,エンドツーエンドのマルチオブジェクトトラッカーPLANETを導入する。
可能なステップとして、既存の2Dトラッキングデータセットを3Dに上げます。
次に,再構成された3次元シーン形状をクエリ生成時に使用する特徴や位置エンコーディングに埋め込むことで,世界的検索を行う。
補助的な3D位置予測タスクにより、クエリはさらに、トレーニング中にオブジェクト位置をエンコードするように促す。
補完的な二重分解能時間記憶は、この証拠をより長い時間的ギャップにわたって保存する。
その結果、PLANETは3つの異なるベンチマークで最先端のパフォーマンスを達成した。
関連論文リスト
- Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding [34.1504914582344]
3D Visual Groundingは、自然言語記述を通じてオブジェクトを3Dシーンにローカライズすることを目的としている。
生のRGB-Dストリーム上で直接動作する2次元から3次元の再生パラダイムである"Think, Act, Build (TAB)"を提案する。
厳密なVLMセマンティックトラッキングによる多視点カバレッジ障害を克服するために,セマンティックアンコレッド幾何拡張を導入する。
論文 参考訳(メタデータ) (2026-04-01T06:12:16Z) - Sparse3DTrack: Monocular 3D Object Tracking Using Sparse Supervision [16.586885757497203]
モノクロ3Dオブジェクトトラッキングは、ビデオフレーム全体で時間的に一貫した3Dオブジェクトのポーズを推定することを目的としている。
既存の最先端のアプローチは、完全に監視されており、長いビデオシーケンスよりも密集した3Dアノテーションに依存している。
モノクロ3次元物体追跡のための最初の教師付きフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-18T21:36:41Z) - Drag4D: Align Your Motion with Text-Driven 3D Scene Generation [77.79131321983677]
Drag4Dはインタラクティブなフレームワークで、テキスト駆動の3Dシーン生成にオブジェクトの動き制御を統合する。
このフレームワークにより、ユーザーは単一の画像から生成された3Dオブジェクトに対して3Dトラジェクトリを定義し、それらを高品質な3D背景にシームレスに統合することができる。
論文 参考訳(メタデータ) (2025-09-26T05:23:45Z) - Dynamic Point Maps: A Versatile Representation for Dynamic 3D Reconstruction [56.32589034046427]
本研究では,ダイナミックポイントマップ(DPM)を導入し,モーションセグメンテーション,シーンフロー推定,3次元物体追跡,2次元対応などの4次元タスクをサポートする標準点マップを拡張した。
我々は,合成データと実データを組み合わせたDPM予測器を訓練し,映像深度予測,ダイナミックポイントクラウド再構成,3次元シーンフロー,オブジェクトポーズ追跡,最先端性能の達成など,様々なベンチマークで評価する。
論文 参考訳(メタデータ) (2025-03-20T16:41:50Z) - Generating Visual Spatial Description via Holistic 3D Scene
Understanding [88.99773815159345]
視覚空間記述(VSD)は、画像内の対象物の空間的関係を記述するテキストを生成することを目的としている。
外部の3Dシーン抽出器を用いて,入力画像の3Dオブジェクトとシーン特徴を抽出する。
対象物の中心となる3次元空間シーングラフ(Go3D-S2G)を構築し,対象物の空間意味を総合的な3次元シーン内にモデル化する。
論文 参考訳(メタデータ) (2023-05-19T15:53:56Z) - Graph-DETR3D: Rethinking Overlapping Regions for Multi-View 3D Object
Detection [17.526914782562528]
グラフ構造学習(GSL)による多視点画像情報を自動的に集約するグラフDETR3Dを提案する。
我々の最良のモデルは、nuScenesテストリーダーボード上で49.5 NDSを達成し、様々な画像ビュー3Dオブジェクト検出器と比較して新しい最先端技術を実現している。
論文 参考訳(メタデータ) (2022-04-25T12:10:34Z) - Multi-Plane Program Induction with 3D Box Priors [110.6726150681556]
1つの画像からプログラムライクなシーン表現を推論するBox Program Injection (BPI)を提案する。
BPIは同時に、複数の2次元平面上の繰り返し構造、平面の3次元位置と向き、およびカメラパラメータをモデル化する。
ニューラルネットワークを使って、点の消滅やワイヤーフレーム線などの視覚的手がかりを推論し、検索ベースのアルゴリズムを誘導し、最もよく画像を説明するプログラムを見つける。
論文 参考訳(メタデータ) (2020-11-19T18:07:46Z) - 3D Crowd Counting via Geometric Attention-guided Multi-View Fusion [50.520192402702015]
本稿では,3次元シーンレベルの密度マップと3次元特徴融合により,多視点群カウントタスクを解くことを提案する。
2D融合と比較すると、3D融合はz次元(高さ)に沿った人々のより多くの情報を抽出し、複数のビューにわたるスケールの変動に対処するのに役立つ。
3D密度マップは、和がカウントである2D密度マップの特性を保ちながら、群衆密度に関する3D情報も提供する。
論文 参考訳(メタデータ) (2020-03-18T11:35:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。