論文の概要: One Query, Many Scales: Sparse Mixture-of-Experts for Efficient Hierarchical Cross-View Geo-Localization
- arxiv url: http://arxiv.org/abs/2608.01060v1
- Date: Sun, 02 Aug 2026 07:53:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.075227
- Title: One Query, Many Scales: Sparse Mixture-of-Experts for Efficient Hierarchical Cross-View Geo-Localization
- Title(参考訳): 一つの質問, 多数の尺度: 効率的な階層的クロスビュージオローカライゼーションのためのスパース・ミックス・オブ・エクスプロイト
- Abstract要約: クロスビュージオローカライゼーションは、地上ビュークエリのためにジオタグ付き衛星画像を取得する。
局所階層探索からグローバルなマルチスケール表現学習を分離する,スパース・オブ・サーキットのデュアルエンコーダであるGeoMoEを紹介する。
- 参考スコア(独自算出の注目度): 18.593712283784708
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Cross-view geo-localization (CVGL) retrieves geo-tagged satellite imagery for a ground-view query. Most systems exhaustively search a flat, fixed-resolution gallery, incurring high cost over large areas and adapting poorly to satellite resolution changes. Autoregressive coarse-to-fine alternatives reduce comparisons but bind later predictions to earlier decisions and a predefined hierarchy. We introduce GeoMoE, a sparse mixture-of-experts dual encoder that decouples global multi-scale representation learning from local hierarchical search. Global multi-scale supervision and content-adaptive routing map ground and satellite images across resolutions into a globally comparable embedding space. At inference, each image is encoded once, and probabilistic beam search follows parent--child links to score a small candidate subset. Later levels reuse these descriptors rather than features generated by preceding levels, limiting feature-level error propagation and hierarchy coupling. We further introduce VIGOR-M, a four-city benchmark with an explicit parent--child satellite hierarchy and held-out half-step galleries for single-resolution, cross-resolution, and hierarchical evaluation. GeoMoE achieves 95.78% R@40m on Just Zoom In, 2.77 percentage points above the previous best, and 62.39% R@1 on VIGOR-M. The latter requires 0.885 MMAC/query for descriptor matching, 5.27% of an exhaustive L3 scan, while exceeding the strongest exhaustive baseline by 3.12 percentage points in R@1. One model trained on L1, L2, and L3 also outperforms a matched dense control across all six galleries and transfers to three withheld resolutions. By decoupling globally trained embeddings from local hierarchical search, GeoMoE jointly improves localization accuracy, search efficiency, and cross-resolution transfer.
- Abstract(参考訳): クロスビュージオローカライゼーション(CVGL)は、地上ビュークエリのためにジオタグ付き衛星画像を取得する。
ほとんどのシステムは、平坦で固定された解像度のギャラリーを徹底的に探索し、大きな領域で高いコストを発生させ、衛星解像度の変化に不適応させる。
自己回帰的粗大な代替手段は比較を減らすが、後続の予測は以前の決定と事前定義された階層に結び付ける。
局所階層探索からグローバルなマルチスケール表現学習を分離する,スパース・オブ・サーキットのデュアルエンコーダであるGeoMoEを紹介する。
グローバルなマルチスケールの監視とコンテント適応型のルーティングマップと衛星画像が、解像度を越え、グローバルに匹敵する埋め込み空間へと変換される。
推測では、各画像は一度符号化され、確率的ビームサーチは親子リンクに従って小さな候補部分集合をスコアする。
その後のレベルは、前のレベルによって生成された機能ではなく、これらの記述子を再利用し、特徴レベルのエラー伝搬と階層結合を制限する。
さらに、VIGOR-Mは、明示的な親子衛星階層と、一分解能、クロスレゾリューション、階層的評価のための半段階のギャラリーを持つ4都市ベンチマークである。
GeoMoE は Just Zoom In で95.78% R@40m、前回最高の2.77ポイント、VIGOR-Mで62.39% R@1を達成した。
後者はディスクリプタマッチングに0.885 MMAC/クエリが必要であり、L3スキャンの5.27%、R@1の3.12ポイントを超える。
L1、L2、L3で訓練された1つのモデルは、6つのギャラリー全てで一致した密集制御を上回り、3つの非保持解像度に転送する。
グローバルにトレーニングされた埋め込みを局所階層検索から切り離すことで、GeoMoEはローカライズ精度、探索効率、クロスレゾリューション転送を共同で改善する。
関連論文リスト
- SeqLoc: Beyond the Single Frame for Cross-View Geo-Localization in Feature-Sparse Scenes [49.30971835891526]
OpenStreetMap (OSM) を用いたクロスビュージオローカライゼーションは、構造豊かな都市環境では良好に機能するが、農村道路のような特徴の少ないシーンでは崩壊する。
CV-FSSは5つの農村地域の連続パノラマとOSMマップの整列をペアリングするベンチマークである。
次に,3つのキーコンポーネントを持つログ信頼性ボリュームを維持するオンラインテスト時間シーケンスアグリゲーション機構であるSeqLocを提案する。
論文 参考訳(メタデータ) (2026-08-08T00:42:23Z) - CIPER: A Unified Framework for Cross-view Image-retrieval and Pose-estimation [14.612259909790454]
クロスビュージオローカライゼーションは、地上画像の位置を航空画像データベースとマッチングすることによって推定する。
既存の手法では、大規模な検索と正確なポーズ推定のいずれかによってこれに取り組むが、両方ではない。
両タスクを共同で実行する単一アーキテクチャであるCIPER(Cross-view Image-Retrieval and Pose-estimation TransformER)を提案する。
論文 参考訳(メタデータ) (2026-06-03T15:31:06Z) - GeoRouter: Dynamic Paradigm Routing for Worldwide Image Geolocalization [27.99381782234921]
ジオローカライゼーションは、地球上のどこでも撮影された画像の正確なGPS座標を予測することを目的としている。
最近の手法は主に、参照データベースとクエリを一致させる検索ベースアプローチと、座標を直接予測する生成ベースアプローチの2つのパラダイムに従う。
最適パラダイムに各クエリを適応的に割り当てる動的ルーティングフレームワークであるGeoを提案する。
論文 参考訳(メタデータ) (2026-03-25T14:56:57Z) - GeoFocus: Blending Efficient Global-to-Local Perception for Multimodal Geometry Problem-Solving [55.14836667214487]
GeoFocusは、2つのコアモジュールからなる新しいフレームワークである。
GeoFocusは、主要な特殊モデルよりも4.7%の精度向上を実現している。
多様な視覚条件下でのMATHVERSEの強靭性を示す。
論文 参考訳(メタデータ) (2026-02-09T11:15:01Z) - VLM2GeoVec: Toward Universal Multimodal Embeddings for Remote Sensing [59.73939718087177]
シングルエンコーダの視覚言語モデルは、統合ベクトル空間にインターリーブされた入力を埋め込むために対照的に訓練された。
VLM2GeoVecは、領域レベルの空間推論とスケーラブルな検索を統合し、リモートセンシングにおける凝集性多モード解析を可能にする。
論文 参考訳(メタデータ) (2025-12-12T11:39:35Z) - Dynamic Contrastive Learning for Hierarchical Retrieval: A Case Study of Distance-Aware Cross-View Geo-Localization [20.868592923432843]
既存のディープラーニングを用いたクロスビュージオローカライズ手法は主に、クロスドメイン画像マッチングの精度向上に重点を置いている。
特徴表現を階層的空間的マージンに応じて段階的に整列させる新しいフレームワークである動的コントラスト学習(DyCL)を提案する。
論文 参考訳(メタデータ) (2025-06-29T03:57:01Z) - A Unified Hierarchical Framework for Fine-grained Cross-view Geo-localization over Large-scale Scenarios [43.8734658237949]
クロスビューなジオローカライゼーションは大規模ローカライゼーション問題に対する有望な解決策である。
本稿では,新しい階層的ジオローカライゼーションフレームワークUnifyGeoを提案する。
タスク分離設定とタスク関連設定の両方において、UnifyGeoは最先端の処理性能を大きく上回ることを示す。
論文 参考訳(メタデータ) (2025-05-12T14:44:31Z) - EarthMapper: Visual Autoregressive Models for Controllable Bidirectional Satellite-Map Translation [50.433911327489554]
制御可能な衛星マップ翻訳のための新しいフレームワークであるEarthMapperを紹介する。
また,中国38都市を対象とした302,132組の衛星マップからなる大規模データセットであるCNSatMapをコントリビュートした。
CNSatMapとNew Yorkデータセットの実験は、EarthMapperの優れたパフォーマンスを実証している。
論文 参考訳(メタデータ) (2025-04-28T02:41:12Z) - Hierarchical Matching and Reasoning for Multi-Query Image Retrieval [113.44470784756308]
マルチクエリ画像検索のための階層マッチング・推論ネットワーク(HMRN)を提案する。
MQIRを3つの階層的なセマンティック表現に分解し、きめ細かい局所的な詳細、文脈的グローバルスコープ、高レベルの固有の相関をキャプチャする責任を負う。
我々のHMRNは最先端の手法を大幅に上回っている。
論文 参考訳(メタデータ) (2023-06-26T07:03:56Z) - Beyond Cross-view Image Retrieval: Highly Accurate Vehicle Localization
Using Satellite Image [91.29546868637911]
本稿では,地上画像と架空衛星地図とをマッチングすることにより,車載カメラのローカライゼーションの問題に対処する。
鍵となる考え方は、タスクをポーズ推定として定式化し、ニューラルネットベースの最適化によってそれを解くことである。
標準自動運転車のローカライゼーションデータセットの実験により,提案手法の優位性が確認された。
論文 参考訳(メタデータ) (2022-04-10T19:16:58Z) - An Optimal Transport Perspective on Unpaired Image Super-Resolution [97.24140709634203]
実世界の画像超解像(SR)タスクは、しばしばペア化されたデータセットを持たず、教師付き技術の適用を制限する。
このようなモデルで生じる最適化問題を調査し、2つの驚くべき観測結果を得る。
学習した写像が偏りがあること、すなわち、低解像度画像の分布を高解像度画像に変換するものではないことを実証し、実証的に示す。
論文 参考訳(メタデータ) (2022-02-02T16:21:20Z) - Leveraging EfficientNet and Contrastive Learning for Accurate
Global-scale Location Estimation [15.633461635276337]
地球規模の画像ジオロケーションのための混合分類検索方式を提案する。
このアプローチは、4つの公開データセットで非常に競争力のあるパフォーマンスを示す。
論文 参考訳(メタデータ) (2021-05-17T07:18:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。