論文の概要: Beyond 2D Matching: A Unified Single-Stage Framework for Geometry-Aware Cross-View Object Geo-Localization
- arxiv url: http://arxiv.org/abs/2606.30576v1
- Date: Mon, 29 Jun 2026 17:19:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.359394
- Title: Beyond 2D Matching: A Unified Single-Stage Framework for Geometry-Aware Cross-View Object Geo-Localization
- Title(参考訳): 2Dマッチングを超えて: 幾何学を意識したクロスビューオブジェクトジオローカライゼーションのための統一された単一ステージフレームワーク
- Authors: Liyao Wang, Ruipu Wu, Haojun Xu, Lei Shi, Linjiang Huang, Si Liu,
- Abstract要約: クロスビューオブジェクトジオローカライゼーション(CVOGL)は、ジオタグ付き参照画像(衛星など)内のクエリビューからターゲットオブジェクトを見つけることを目的としている。
既存のアプローチは2次元の外観マッチングに大きく依存しており、幾何学的メタデータを欠いた限られたデータセットによって制約されている。
まず、22万以上の地上衛星とドローンと衛星のペアからなる大規模で高忠実なビルディングデータセットであるデータセットを紹介します。
変分同変量3D基礎モデル$をベースとした新しい一段階幾何対応ジオローカライゼーションフレームワーク(GAGeo)を提案する。
- 参考スコア(独自算出の注目度): 21.013795754583697
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cross-view object geo-localization (CVOGL) aims to locate a target object from a query view (e.g., ground or drone) within a geo-tagged reference image (e.g., satellite). Existing approaches heavily rely on 2D appearance matching and are constrained by limited datasets lacking geometric metadata, diverse prompts, and standard field-of-view imagery. To address these intertwined challenges, we first introduce \dataset, a large-scale, high-fidelity building dataset comprising over 220,000 ground-satellite and drone-satellite pairs. It provides multi-modal prompts (points, boxes, masks) and camera poses to enable flexible target referring and explicit spatial modeling. Furthermore, we propose a novel single-stage Geometry-Aware Geo-localization framework (GAGeo), built upon the permutation-equivariant 3D foundation model $π^3$. By seamlessly integrating visual features, referring prompts, and learnable task tokens, our model adapts the inherited 3D prior to jointly predict bounding boxes, segmentation masks, and camera poses in a single forward pass. Additionally, we introduce a contrastive loss that utilizes the satellite view as a universal anchor, implicitly aligning ground and drone representations to enable zero-shot ground-to-drone localization without requiring triplet training data. Extensive experiments demonstrate that our approach significantly outperforms state-of-the-art methods, exhibiting exceptional generalization ability in unseen scenes and novel cross-view setups.
- Abstract(参考訳): クロスビューオブジェクトジオローカライゼーション(CVOGL)は、ジオタグ付き参照画像(例えば、衛星)内のクエリビュー(例えば、地上またはドローン)からターゲットオブジェクトを見つけることを目的としている。
既存のアプローチは2次元の外観マッチングに大きく依存しており、幾何学的メタデータ、多様なプロンプト、標準視野画像を持たない限られたデータセットによって制約されている。
これらの課題に対処するために、まず最初に、22万以上の地上衛星とドローンと衛星のペアからなる大規模で高忠実なビルディングデータセットである \datasetを紹介します。
マルチモーダルプロンプト(ポイント、ボックス、マスク)とカメラのポーズを提供し、フレキシブルなターゲット参照と明示的な空間モデリングを可能にする。
さらに,変分等価な3D基礎モデルである$π^3$を基盤として構築された新しい一段幾何対応ジオローカライゼーションフレームワーク(GAGeo)を提案する。
視覚的特徴のシームレスな統合、プロンプトの参照、学習可能なタスクトークンにより、我々のモデルは、境界ボックス、セグメンテーションマスク、カメラポーズを1つの前方パスで共同予測する前に、継承した3Dに適応する。
さらに、衛星ビューを普遍的なアンカーとして利用し、暗黙的に地上とドローンの表現を整列させ、トリプルトトレーニングデータを必要としないゼロショット地対ドローンのローカライゼーションを可能にするコントラスト的な損失を導入する。
広汎な実験により,本手法は最先端の手法よりも優れており,見知らぬシーンにおける例外的な一般化能力と新しいクロスビュー・セットアップが示される。
関連論文リスト
- Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence [63.11502936651325]
本稿では,空間知能のための二経路幾何対応MLLMであるGAMSIを提案する。
RGB画像のみを入力とし、両方の幾何学的形態を統一された自己回帰バックボーン内に内包する。
GAMSIは、7つの空間インテリジェンスベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-25T01:33:19Z) - 3dSAGER: Geospatial Entity Resolution over 3D Objects (Technical Report) [7.378893412842889]
3dSAGERは3Dオブジェクト上の空間的エンティティ解決のためのエンドツーエンドパイプラインである。
本稿では,マッチングペアの複雑な幾何学的特徴をキャプチャする,空間参照非依存のデファクトチュール化機構を提案する。
また、訓練されたモデルを活用して、ハイリコール候補セットを効率的に生成する、軽量で解釈可能な新しいブロッキング手法であるBKAFIを提案する。
論文 参考訳(メタデータ) (2025-11-09T09:35:45Z) - IGGT: Instance-Grounded Geometry Transformer for Semantic 3D Reconstruction [82.53307702809606]
人間は自然に3次元世界の幾何学的構造と意味的内容を中間次元として知覚する。
本稿では,空間再構成とインスタンスレベルの文脈理解の両面での知識を統合するために,IGGT (InstanceGrounded Geometry Transformer) を提案する。
論文 参考訳(メタデータ) (2025-10-26T14:57:44Z) - Seeing the Unseen: Mask-Driven Positional Encoding and Strip-Convolution Context Modeling for Cross-View Object Geo-Localization [8.559240391514063]
クロスビューオブジェクトジオローカライゼーションは、クロスビューマッチングによる高精度オブジェクトローカライゼーションを可能にする。
既存の手法はキーポイントに基づく位置符号化に依存しており、オブジェクトの形状情報を無視しながら2次元座標のみをキャプチャする。
空間座標と物体シルエットの両方を捕捉するために分割マスクを利用するマスクベースの位置符号化方式を提案する。
EDGeoは、堅牢なクロスビューオブジェクトジオローカライズのためのエンドツーエンドフレームワークである。
論文 参考訳(メタデータ) (2025-10-23T06:07:07Z) - Zero-shot Inexact CAD Model Alignment from a Single Image [53.37898107159792]
1つの画像から3Dシーン構造を推測する実践的なアプローチは、データベースから密に一致する3Dモデルを検索し、画像内のオブジェクトと整列させることである。
既存のメソッドは、イメージによる教師付きトレーニングとアノテーションのポーズに依存しており、オブジェクトカテゴリの狭いセットに制限されている。
ポーズアノテーションを必要とせず、未知のカテゴリに一般化する不正確な3次元モデルの弱い教師付き9-DoFアライメント法を提案する。
論文 参考訳(メタデータ) (2025-07-04T04:46:59Z) - GREAT: Geometry-Intention Collaborative Inference for Open-Vocabulary 3D Object Affordance Grounding [53.42728468191711]
Open-Vocabulary 3D object affordance groundingは、任意の命令で3Dオブジェクト上のアクション可能性の領域を予測することを目的としている。
GREAT (GeometRy-intEntion collAboraTive Inference) を提案する。
論文 参考訳(メタデータ) (2024-11-29T11:23:15Z) - Multiview Scene Graph [7.460438046915524]
適切なシーン表現は、空間知性の追求の中心である。
未提示画像からマルチビューシーングラフ(MSG)を構築することを提案する。
MSGは、場所とオブジェクトノードを相互接続したシーンをトポロジ的に表現する。
論文 参考訳(メタデータ) (2024-10-15T02:04:05Z) - GeoWizard: Unleashing the Diffusion Priors for 3D Geometry Estimation from a Single Image [94.56927147492738]
単一画像から幾何学的属性を推定するための新しい生成基盤モデルであるGeoWizardを紹介する。
拡散前処理の活用は,資源利用における一般化,詳細な保存,効率性を著しく向上させることが示唆された。
本稿では,様々なシーンの複雑なデータ分布を,個別のサブディストリビューションに分離する,シンプルかつ効果的な戦略を提案する。
論文 参考訳(メタデータ) (2024-03-18T17:50:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。