論文の概要: Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition
- arxiv url: http://arxiv.org/abs/2607.00090v1
- Date: Tue, 30 Jun 2026 19:33:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.608589
- Title: Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition
- Title(参考訳): 足の喪失:都市の視覚的位置認識における地理的不均衡に対処する
- Abstract要約: 都市規模のビジュアルプレース認識は、ジオタグ付きデータベースとマッチングすることで、クエリ画像の地理的位置を特定することを目的としている。
近年の手法は優れた性能を発揮するが、都市規模データセットに隠された深刻な長尾問題を見落としている。
本研究では,モデルに依存しないプラグインフレームワークであるDis Distribution-Aware Place Recognition (DAPR)を提案する。
- 参考スコア(独自算出の注目度): 9.31929142038003
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Urban-scale Visual Place Recognition (VPR) aims to identify the geographic location of a query image by matching it against a geo-tagged database. While recent methods achieve impressive performance, they overlook a serious long-tailed problem hidden in urban-scale datasets, which biases the model towards locations with abundant images and ignores less-visited areas, causing models to systematically favor frequently photographed locations while failing in sparsely covered areas. In this paper, we systematically characterize this imbalance challenge and propose Distribution-Aware Place Recognition (DAPR), a model-agnostic plug-in framework that rebalances gradient contributions across head and tail classes. Additionally, within classification-retrieval pipelines, DAPR applies a multi-scale distance search mechanism to compute per-class distributional compactness, providing complementary gains at the retrieval stage. On the large-scale SF-XL benchmark, our framework outperforms the previous classification-retrieval baseline by 18.3% on test set v1, and 6.7% on test set v2. As a plug-in module, it achieves consistent improvements across representative VPR methods on SF-XL, MSLS, and Pitts30k, demonstrating broad generalizability across different methods and benchmarks.
- Abstract(参考訳): VPR(Urban-scale Visual Place Recognition)は、ジオタグ付きデータベースと照合することで、クエリ画像の地理的位置を特定することを目的としている。
都市規模のデータセットに隠された深刻な長い尾の問題は、画像が豊富にある場所をモデルに偏り、視界の低い地域を無視し、わずかにカバーされた領域で失敗しながら、頻繁に撮影される場所を体系的に好む結果となった。
本稿では,この不均衡な課題を体系的に評価し,頭と尾のクラス間で勾配の寄与を再均衡させるモデルに依存しないプラグインフレームワークである分散意識位置認識(DAPR)を提案する。
さらに、分類-検索パイプラインでは、DAPRはクラスごとの分布のコンパクト性を計算するためにマルチスケール距離探索機構を適用し、検索段階で補完的なゲインを提供する。
大規模SF-XLベンチマークでは,テストセットv1では18.3%,テストセットv2では6.7%,従来の分類検索ベースラインでは18.3%を上回った。
プラグインモジュールとして、SF-XL、MSLS、Pitts30k上の代表的VPRメソッド間で一貫した改善を実現し、異なるメソッドやベンチマークで広範な一般化性を示す。
関連論文リスト
- CIPER: A Unified Framework for Cross-view Image-retrieval and Pose-estimation [14.612259909790454]
クロスビュージオローカライゼーションは、地上画像の位置を航空画像データベースとマッチングすることによって推定する。
既存の手法では、大規模な検索と正確なポーズ推定のいずれかによってこれに取り組むが、両方ではない。
両タスクを共同で実行する単一アーキテクチャであるCIPER(Cross-view Image-Retrieval and Pose-estimation TransformER)を提案する。
論文 参考訳(メタデータ) (2026-06-03T15:31:06Z) - Region Matters: Efficient and Reliable Region-Aware Visual Place Recognition [46.97190804063947]
本稿では,ロバストな識別領域モデリングと適応的再ランク付けを組み合わせたFoL++を提案する。
FoL++は、軽量なメモリフットプリントで最先端のパフォーマンスを実現し、FoLよりも推論速度を40%向上させる。
論文 参考訳(メタデータ) (2026-04-24T09:28:35Z) - Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales [61.03549470159347]
視覚言語モデル (VLM) は急速に進歩しているが, オープンワールド環境における画像位置決め能力は, 網羅的に評価されていない。
我々は、視覚認識、ステップバイステップ推論、エビデンス利用を評価するVLM画像位置情報の総合ベンチマークであるEarthWhereを提示する。
論文 参考訳(メタデータ) (2025-10-13T01:12:21Z) - Saccadic Vision for Fine-Grained Visual Classification [10.681604440788854]
きめ細かい視覚分類(FGVC)は、微妙で局所的な特徴によって視覚的に類似したカテゴリーを区別する必要がある。
既存のパートベースの手法は、ピクセルからサンプル空間へのマッピングを学習する複雑なローカライゼーションネットワークに依存している。
本稿では,まず周辺特徴を抽出し,サンプルマップを生成する2段階プロセスを提案する。
我々は、周辺と焦点の表現を融合する前に、各固定パッチの影響を定量的に評価するために、文脈選択的注意を用いる。
論文 参考訳(メタデータ) (2025-09-19T07:03:37Z) - Deep Homography Estimation for Visual Place Recognition [49.235432979736395]
本稿では,変換器を用いたディープホモグラフィー推定(DHE)ネットワークを提案する。
バックボーンネットワークによって抽出された濃密な特徴写像を入力とし、高速で学習可能な幾何的検証のためにホモグラフィーに適合する。
ベンチマークデータセットを用いた実験により,本手法はいくつかの最先端手法より優れていることが示された。
論文 参考訳(メタデータ) (2024-02-25T13:22:17Z) - Towards Seamless Adaptation of Pre-trained Models for Visual Place Recognition [72.35438297011176]
視覚的位置認識のための事前学習モデル(VPR)のシームレスな適応を実現する新しい手法を提案する。
具体的には、地域を識別するための有意義なランドマークに焦点を当てたグローバルな特徴とローカルな特徴の両方を得るために、ハイブリッド適応法を設計する。
実験結果から,本手法はトレーニングデータやトレーニング時間が少なく,最先端の手法よりも優れていることがわかった。
論文 参考訳(メタデータ) (2024-02-22T12:55:01Z) - Fine-grained Recognition with Learnable Semantic Data Augmentation [68.48892326854494]
きめ細かい画像認識は、長年続くコンピュータビジョンの課題である。
本稿では,識別領域損失問題を軽減するため,特徴レベルのトレーニングデータを多様化することを提案する。
本手法は,いくつかの人気分類ネットワーク上での一般化性能を著しく向上させる。
論文 参考訳(メタデータ) (2023-09-01T11:15:50Z) - PSE-Match: A Viewpoint-free Place Recognition Method with Parallel
Semantic Embedding [9.265785042748158]
PSE-Matchは3次元ポイントクラウドモデルから分離されたセマンティック属性の並列意味解析に基づく視点自由場所認識手法である。
PSE-Matchは、分岐場所学習ネットワークを組み込んで、球面調和領域を通じて異なる意味的属性を並列にキャプチャする。
論文 参考訳(メタデータ) (2021-08-01T22:16:40Z) - LABNet: Local Graph Aggregation Network with Class Balanced Loss for
Vehicle Re-Identification [0.0]
車両再識別は、特定の車両を特定することを目的としている重要なコンピュータビジョンタスクである。
深層学習に基づく最近の手法は,背骨特徴抽出器のグローバル平均プール層を利用する。
バックボーン特徴マップ上で局所グラフの集約を行い,局所情報の関連性を学習する。
論文 参考訳(メタデータ) (2020-11-29T18:43:30Z) - Generalized Focal Loss: Learning Qualified and Distributed Bounding
Boxes for Dense Object Detection [85.53263670166304]
一段検出器は基本的に、物体検出を密度の高い分類と位置化として定式化する。
1段検出器の最近の傾向は、局所化の質を推定するために個別の予測分岐を導入することである。
本稿では, 上記の3つの基本要素, 品質推定, 分類, ローカライゼーションについて述べる。
論文 参考訳(メタデータ) (2020-06-08T07:24:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。