論文の概要: RIM: A Retrieval-In-Matching Framework for Cross-Domain Global Visual Localization of UAVs
- arxiv url: http://arxiv.org/abs/2607.20116v1
- Date: Wed, 22 Jul 2026 13:20:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.088583
- Title: RIM: A Retrieval-In-Matching Framework for Cross-Domain Global Visual Localization of UAVs
- Title(参考訳): RIM:UAVのクロスドメイングローバルな視覚的ローカライゼーションのための検索内マッチングフレームワーク
- Abstract要約: リモートセンシング参照マップを用いた無人航空機(UAV)のグローバルな視覚的位置推定が注目されている。
Google 3D TilesのUAVビューポイント参照ビューを、位置、高度、方向にわたってサンプリングすることで、これらのシフトに対処する。
2段階のクロスドメインファインチューニングレシピは、SALADをポーズ・ニア・ポジティブと地理的に離れたハード・ネガティブを使って適用し、局所的な幾何学的整合性はトップK候補を再ランク付けする。
適応したDINOv2-Bレトリバーを凍結し、トークンフィールドを再利用するローカルディスクリプタデコーダを除去するRetrieval-In-Matching (RIM)を提案する。
- 参考スコア(独自算出の注目度): 8.321575653158094
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Global visual localization of unmanned aerial vehicles (UAVs) using remote-sensing reference maps has attracted increasing attention. However, acquisition-time and imaging-platform differences between UAV and reference imagery induce substantial cross-domain appearance and viewpoint shifts, challenging robust six-degree-of-freedom (6-DoF) pose estimation. We address these shifts by sampling UAV-viewpoint reference views from Google 3D Tiles across locations, altitudes, and orientations. A two-stage cross-domain fine-tuning recipe adapts SALAD using pose-near positives and geographically distant hard negatives, while local geometric consistency re-ranks the Top-K candidates. We further propose Retrieval-In-Matching (RIM), which freezes the adapted DINOv2-B retriever and distils a local-descriptor decoder that reuses its token field alongside a shallow VGG19 detail stream. One query-side DINOv2-B forward thus serves both SALAD retrieval and local description, eliminating a second foundation-model backbone while preserving retrieval descriptors by construction. We evaluate RIM zero-shot on the reconstructed EPFL Urbanscape and self-collected Chang'an Park datasets, both geographically disjoint from the training data. RIM outperforms ten recent retrieval baseline families. At 25/50 m under the full 3D distance metric, it improves Recall@1 over SALAD by 8.55/13.77 percentage points on EPFL and 4.45/8.94 points on Park. At Top-K=5, the complete measured localization query, including retrieval, candidate matching, and robust geometric verification, takes 67.9 ms end-to-end: 1.8 times faster than the strongest separate sparse-matching baseline and over 40 times faster than RoMa, while achieving comparable re-ranking accuracy. These results establish an efficient and deployable pipeline for UAV global visual localization in GNSS-challenged environments.
- Abstract(参考訳): リモートセンシング参照マップを用いた無人航空機(UAV)のグローバルな視覚的位置推定が注目されている。
しかし、UAVと参照画像の取得時間と画像プラットフォームの違いは、領域間の出現と視点シフトを著しく引き起こし、頑健な6自由度(6-DoF)に挑戦すると推定される。
Google 3D TilesのUAVビューポイント参照ビューを、位置、高度、方向にわたってサンプリングすることで、これらのシフトに対処する。
2段階のクロスドメインファインチューニングレシピは、SALADをポーズ・ニア・ポジティブと地理的に離れたハード・ネガティブを使って適用し、局所的な幾何学的整合性はトップK候補を再ランク付けする。
さらに、適応したDINOv2-Bレトリバーを凍結し、浅いVGG19ディテールストリームと共にトークンフィールドを再利用するローカルディスクリプタデコーダを除去するRetrieval-In-Matching (RIM)を提案する。
1つのクエリサイドのDINOv2-Bフォワードは、SALAD検索とローカル記述の両方を提供し、構築による検索記述子を保持しながら、第2の基盤モデルバックボーンを除去する。
再建されたEPFLアーバンスケープと自己収集したChang'an ParkのデータセットからRIMゼロショットを評価する。
RIMは最近の10の検索ベースラインファミリを上回っている。
3D距離で25/50m、EPFLでは8.55/13.77、Parkでは4.45/8.94でリコール@1が改善されている。
Top-K=5では、検索、候補マッチング、ロバストな幾何学的検証を含む完全な測定されたローカライゼーションクエリは67.9msのエンドツーエンドで処理される。
これらの結果は, GNSS環境下でのUAVグローバルな視覚的ローカライゼーションのための, 効率的かつデプロイ可能なパイプラインを構築した。
関連論文リスト
- Cross-View Sequential Visual Localization with Spatio-Temporal Context Modeling for Autonomous Driving [6.234507553234407]
地上画像と衛星地図とを視認する。
既存のクロスビュー視覚的ローカライゼーション手法は、各フレームを独立して処理する。
本研究では,クロスビュー・シーケンス・ビジュアル・ローカライゼーションのための時間コンテキスト拡張フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-11T08:44:42Z) - SeqLoc: Beyond the Single Frame for Cross-View Geo-Localization in Feature-Sparse Scenes [49.30971835891526]
OpenStreetMap (OSM) を用いたクロスビュージオローカライゼーションは、構造豊かな都市環境では良好に機能するが、農村道路のような特徴の少ないシーンでは崩壊する。
CV-FSSは5つの農村地域の連続パノラマとOSMマップの整列をペアリングするベンチマークである。
次に,3つのキーコンポーネントを持つログ信頼性ボリュームを維持するオンラインテスト時間シーケンスアグリゲーション機構であるSeqLocを提案する。
論文 参考訳(メタデータ) (2026-08-08T00:42:23Z) - LoRetta: A Foundation Model and Extensive Dataset for Global-Scale Remote Sensing Dense Image Matching [39.25581475845445]
一致可能性を考慮したアフィンの局所化と高密度登録を導出する基礎モデルであるLoRettaを提案する。
また、LEVIR-GMは、データセット固有のマッチング性ラベルを持つグローバルスケールの多時間光マッチングベンチマークである。
LEVIR-GMでは、ローレッタは曲線(AUC)の83.3%の領域を達成し、最強のベースラインであるRoMa v2を1.6ポイント上回っている。
論文 参考訳(メタデータ) (2026-08-04T18:02:19Z) - FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry [52.232826445242644]
FoundationGeoは空間キャリブレーションと原則データ設計による相対的および計量的予測を橋渡しする。
ステージ1は DINOv3 で初期化することで高忠実なアフィン不変幾何モデルを学ぶ。
ステージ2は、メートル法推定のためのピクセルワイドキャリブレーションフィールドを導入することで、グローバルなスケーリングを越えている。
論文 参考訳(メタデータ) (2026-07-13T14:10:01Z) - CIPER: A Unified Framework for Cross-view Image-retrieval and Pose-estimation [14.612259909790454]
クロスビュージオローカライゼーションは、地上画像の位置を航空画像データベースとマッチングすることによって推定する。
既存の手法では、大規模な検索と正確なポーズ推定のいずれかによってこれに取り組むが、両方ではない。
両タスクを共同で実行する単一アーキテクチャであるCIPER(Cross-view Image-Retrieval and Pose-estimation TransformER)を提案する。
論文 参考訳(メタデータ) (2026-06-03T15:31:06Z) - Unifying UAV Cross-View Geo-Localization via 3D Geometric Perception [51.687842983240564]
無人航空機(UAV)のクロスビューな地上局地化は、斜めのUAV画像と衛星地図との厳密な幾何学的相違により、いまだに困難である。
本稿では,3次元シーン形状を明示的にモデル化し,粗い位置認識ときめ細かなポーズ推定を統一する,幾何認識型UAV測位フレームワークを提案する。
提案手法は, 最先端のベースラインを著しく上回り, ロバストメータレベルのローカライゼーション精度を実現し, 複雑な都市環境における一般化を向上する。
論文 参考訳(メタデータ) (2026-04-02T08:08:41Z) - Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation [51.286599397552756]
本稿では,UAVの絶対位置と近距離からの進路を共同で予測する視覚駆動型クロスビューナビゲーション手法であるBering-UAVを提案する。
我々はまた、クロスビューのローカライゼーションとナビゲーションを評価するベンチマークである Bearing-UAV-90k も提示する。
論文 参考訳(メタデータ) (2026-03-23T16:17:39Z) - VLM2GeoVec: Toward Universal Multimodal Embeddings for Remote Sensing [59.73939718087177]
シングルエンコーダの視覚言語モデルは、統合ベクトル空間にインターリーブされた入力を埋め込むために対照的に訓練された。
VLM2GeoVecは、領域レベルの空間推論とスケーラブルな検索を統合し、リモートセンシングにおける凝集性多モード解析を可能にする。
論文 参考訳(メタデータ) (2025-12-12T11:39:35Z) - MobileGeo: Exploring Hierarchical Knowledge Distillation for Resource-Efficient Cross-view Drone Geo-Localization [47.16612614191333]
クロスビューなジオローカライゼーションにより、航空画像とジオタグ付き衛星データベースとのマッチングによるドローンのローカライゼーションが可能になる。
MobileGeoは、デバイス上の効率的なCVGL用に設計されたモバイルフレンドリーなフレームワークである。
MobileGeoはNVIDIA AGX Orinエッジデバイス上で251.5FPSで動作する。
論文 参考訳(メタデータ) (2025-10-26T08:47:20Z) - LiDAR-based Registration against Georeferenced Models for Globally Consistent Allocentric Maps [16.335109366948473]
現代の無人航空機(UAV)は、状況の概要を把握したり、人員を危険にさらすことなくクローズアップを提供するため、捜索救難(SAR)ミッションでは不可能である。
しかし、UAVはオープンスペースでうまく機能するグローバルナビゲーション衛星システム(GNSS)に大きく依存しているが、その精度は建物周辺で劇的に低下している。
対照的に、CityGMLモデルは正確なジオレファレンスポーズを持つ近似的な建物形状を提供する。
論文 参考訳(メタデータ) (2024-12-03T16:25:08Z) - V-DETR: DETR with Vertex Relative Position Encoding for 3D Object
Detection [73.37781484123536]
DETRフレームワークを用いた点雲のための高性能な3次元物体検出器を提案する。
限界に対処するため,新しい3次元相対位置(3DV-RPE)法を提案する。
挑戦的なScanNetV2ベンチマークで例外的な結果を示す。
論文 参考訳(メタデータ) (2023-08-08T17:14:14Z) - Visual Cross-View Metric Localization with Dense Uncertainty Estimates [11.76638109321532]
本研究は、屋外ロボティクスにおける視覚的クロスビューメトリックローカライゼーションに対処する。
地上レベルのカラー画像と局地的な環境を含む衛星パッチが与えられた場合、衛星パッチ内の地上カメラの位置を特定することが課題である。
我々は、より高密度な衛星記述子、ボトルネックにおける類似性マッチング、およびマルチモーダルなローカライゼーションの曖昧さを捉えるための出力としての密度空間分布を備えた新しいネットワークアーキテクチャを考案した。
論文 参考訳(メタデータ) (2022-08-17T20:12:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。