論文の概要: Accuracy potential of visual localization exploiting high-end street-level imagery
- arxiv url: http://arxiv.org/abs/2607.24409v1
- Date: Mon, 27 Jul 2026 13:25:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.42809
- Title: Accuracy potential of visual localization exploiting high-end street-level imagery
- Title(参考訳): ハイエンドストリートレベルの画像を用いた視覚的位置推定の精度
- Abstract要約: そこで我々は,ジオレファレンスで高解像度の映像をその場から直接表現できる,スケーラブルなビジュアルローカライゼーションパイプラインを提案する。
実験では、翻訳で1-5cm、回転で0.05-0.1の範囲で中央値の精度が示され、調査段階の条件下では最低1cmに達する。
- 参考スコア(独自算出の注目度): 2.9538906120661186
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Accurate and reliable pose information with respect to a reference frame is increasingly demanded across applications such as autonomous navigation, surveying, robotics, and augmented and mixed reality. Visual localization can serve as a complementary positioning modality to GNSS, whose applicability and accuracy are often limited. Yet, the accuracy potential of visual localization has not been systematically investigated against survey-grade demands. This is mainly due to the lack of publicly available, large-scale outdoor datasets with ground-truth poses in the sub-centimeter range. In this work, we address both gaps. We introduce a scalable visual localization pipeline that employs precisely georeferenced, high-resolution street-level imagery directly as the scene representation. It combines prior-guided reference candidate selection with on-the-fly local Structure-from-Motion reconstruction and PnP-based pose estimation. We further present the FHNW Muttenz dataset, a real-world dataset covering a contiguous 10 km street network mapped in two mobile mapping campaigns approximately 1.5 years apart. It consists of high-resolution reference imagery and query sequences acquired by four different cameras across five representative scenes. All images are precisely co-registered, yielding 6-DoF ground-truth poses in the sub-centimeter range. Using this dataset, we evaluate the accuracy potential of visual localization. Our experiments demonstrate median pose accuracies in the range of 1-5 cm for translation and 0.05-0.1° for rotation, reaching as low as 1 cm and 0.03° under favorable conditions. These results show that visual localization can complement survey-grade GNSS positioning, paving the way for 3D geospatial data acquisition using consumer devices and fully automated georeferencing approaches. The dataset is publicly available at: https://fhnw-muttenz-vl-dataset.github.io/.
- Abstract(参考訳): 参照フレームに関する正確で信頼性の高いポーズ情報は、自律的なナビゲーション、サーベイ、ロボット工学、拡張現実と混成現実などのアプリケーションでますます求められている。
視覚的ローカライゼーションは、適用性や精度が制限されるGNSSと相補的な位置決めモダリティとして機能する。
しかし,視覚的位置推定の精度は,調査段階の要求に対して体系的に調査されていない。
これは主に、地下からセンチメートル以下の範囲で地軸のポーズを持つ大規模な屋外データセットが公開されていないためである。
この作業では、両方のギャップに対処します。
そこで我々は,現場表現として,正確なジオレファレンス,高解像度のストリートレベルの画像を利用する,スケーラブルなビジュアルローカライゼーションパイプラインを提案する。
事前誘導された参照候補選択と、オンザフライのローカルな構造-移動再構成とPnPベースのポーズ推定を組み合わせる。
さらにFHNW Muttenzデータセット(約1.5年後の2つのモバイルマッピングキャンペーンでマッピングされた連続した10kmのストリートネットワークをカバーする実世界のデータセット)を提示する。
高解像度の参照画像と5つの代表シーンにわたる4つの異なるカメラによって取得されるクエリシーケンスで構成されている。
すべての画像は正確に共登録され、6-DoFの地平線をサブセンチメートルの範囲で撮影する。
このデータセットを用いて,視覚的位置推定の精度を評価する。
実験では, 翻訳では1~5cm, 回転では0.05~0.1°であり, 良好な条件下では1cm, 0.03°と低い値を示した。
これらの結果から, 3次元地理空間データ取得と全自動ジオレファレンス手法の併用により, 調査グレードのGNSS測位を補完できる可能性が示唆された。
データセットは、https://fhnw-muttenz-vl-dataset.github.io/で公開されている。
関連論文リスト
- OpenCVL: An Open, Diverse, and Large-Scale Dataset for Fine-Grained Cross-View Localization [73.84434300039767]
ヨーロッパ4か国41都市にまたがる617,388の地上画像からなる大規模で多様でオープンなデータセットOpenCVLを紹介した。
OpenCVLには、一般化と堅牢性を評価する専用のクロスエリアと雪テストセットが含まれている。
OpenCVL上での最先端CVLモデルによる実験により、ノイズの多い内部データを組み込むことで、クリーンなテストセットの性能が一貫して向上することが示された。
論文 参考訳(メタデータ) (2026-08-26T01:20:46Z) - FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry [52.232826445242644]
FoundationGeoは空間キャリブレーションと原則データ設計による相対的および計量的予測を橋渡しする。
ステージ1は DINOv3 で初期化することで高忠実なアフィン不変幾何モデルを学ぶ。
ステージ2は、メートル法推定のためのピクセルワイドキャリブレーションフィールドを導入することで、グローバルなスケーリングを越えている。
論文 参考訳(メタデータ) (2026-07-13T14:10:01Z) - Framework and Multi-modal Dataset for Roadwork Zone Detection and Geo-localization [4.788126276837108]
Roadwork Zone Detection and Geo-localization (RZDG)データセットには、シミュレーションデータと実世界のデータの両方が含まれている。
RZDGデータセットは、イメージセマンティックセグメンテーション、3Dオブジェクト検出、オブジェクトのジオローカライゼーションなど、複数の知覚タスクをサポートする。
AB3DMOTの拡張であるRZDGパイプラインも導入した。
論文 参考訳(メタデータ) (2026-07-05T14:24:42Z) - CIPER: A Unified Framework for Cross-view Image-retrieval and Pose-estimation [14.612259909790454]
クロスビュージオローカライゼーションは、地上画像の位置を航空画像データベースとマッチングすることによって推定する。
既存の手法では、大規模な検索と正確なポーズ推定のいずれかによってこれに取り組むが、両方ではない。
両タスクを共同で実行する単一アーキテクチャであるCIPER(Cross-view Image-Retrieval and Pose-estimation TransformER)を提案する。
論文 参考訳(メタデータ) (2026-06-03T15:31:06Z) - Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales [61.03549470159347]
視覚言語モデル (VLM) は急速に進歩しているが, オープンワールド環境における画像位置決め能力は, 網羅的に評価されていない。
我々は、視覚認識、ステップバイステップ推論、エビデンス利用を評価するVLM画像位置情報の総合ベンチマークであるEarthWhereを提示する。
論文 参考訳(メタデータ) (2025-10-13T01:12:21Z) - Loc$^2$: Interpretable Cross-View Localization via Depth-Lifted Local Feature Matching [80.57282092735991]
本稿では,高精度かつ解釈可能なクロスビューローカライズ手法を提案する。
地上画像の3自由度(DoF)のポーズを、その局所的な特徴と基準空中画像とをマッチングすることによって推定する。
実験では、クロスエリアテストや未知の向きといった挑戦的なシナリオにおいて、最先端の精度を示す。
論文 参考訳(メタデータ) (2025-09-11T18:52:16Z) - Enhancing Worldwide Image Geolocation by Ensembling Satellite-Based Ground-Level Attribute Predictors [4.415977307120618]
本稿では,GPSなどの位置情報が存在しない場合の地上画像の位置を推定することの課題について検討する。
本稿では,推定位置分布の精度を計測する新しい指標であるリコール対エリア(Recall vs Area)を紹介する。
次に,複数の情報源からの情報を組み込んだグローバルな画像位置決め手法について検討する。
論文 参考訳(メタデータ) (2024-07-18T19:15:52Z) - GeoCLIP: Clip-Inspired Alignment between Locations and Images for
Effective Worldwide Geo-localization [61.10806364001535]
世界規模のジオローカライゼーションは、地球上のどこでも撮影された画像の正確な位置を特定することを目的としている。
既存のアプローチは、地球を離散的な地理的細胞に分割し、問題を分類タスクに変換する。
画像と対応するGPS位置のアライメントを強制する新しいCLIPにインスパイアされた画像-GPS検索手法であるGeoCLIPを提案する。
論文 参考訳(メタデータ) (2023-09-27T20:54:56Z) - Cross-View Visual Geo-Localization for Outdoor Augmented Reality [11.214903134756888]
地上画像のクロスビューマッチングによる測地位置推定の課題をジオレファレンス衛星画像データベースに解決する。
本稿では,新しいトランスフォーマーニューラルネットワークモデルを提案する。
いくつかのベンチマーク・クロスビュー・ジオローカライズ・データセットの実験により、我々のモデルが最先端の性能を達成することを示す。
論文 参考訳(メタデータ) (2023-03-28T01:58:03Z) - Visual Cross-View Metric Localization with Dense Uncertainty Estimates [11.76638109321532]
本研究は、屋外ロボティクスにおける視覚的クロスビューメトリックローカライゼーションに対処する。
地上レベルのカラー画像と局地的な環境を含む衛星パッチが与えられた場合、衛星パッチ内の地上カメラの位置を特定することが課題である。
我々は、より高密度な衛星記述子、ボトルネックにおける類似性マッチング、およびマルチモーダルなローカライゼーションの曖昧さを捉えるための出力としての密度空間分布を備えた新しいネットワークアーキテクチャを考案した。
論文 参考訳(メタデータ) (2022-08-17T20:12:23Z) - Beyond Cross-view Image Retrieval: Highly Accurate Vehicle Localization
Using Satellite Image [91.29546868637911]
本稿では,地上画像と架空衛星地図とをマッチングすることにより,車載カメラのローカライゼーションの問題に対処する。
鍵となる考え方は、タスクをポーズ推定として定式化し、ニューラルネットベースの最適化によってそれを解くことである。
標準自動運転車のローカライゼーションデータセットの実験により,提案手法の優位性が確認された。
論文 参考訳(メタデータ) (2022-04-10T19:16:58Z) - Continuous Self-Localization on Aerial Images Using Visual and Lidar
Sensors [25.87104194833264]
本研究では,車両のセンサ情報を未確認対象領域の航空画像に登録することにより,屋外環境におけるジオトラッキング手法を提案する。
我々は、地上および空中画像から視覚的特徴を抽出するために、計量学習環境でモデルを訓練する。
本手法は,視認不可能な正光の自己局在化のために,エンド・ツー・エンドの微分可能なモデルでオンボードカメラを利用する最初の方法である。
論文 参考訳(メタデータ) (2022-03-07T12:25:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。