論文の概要: Breaking Déjà Vu: Independent Auditing of Visual Place Recognition through Vision-Language Reasoning
- arxiv url: http://arxiv.org/abs/2607.12818v1
- Date: Tue, 14 Jul 2026 14:30:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.17082
- Title: Breaking Déjà Vu: Independent Auditing of Visual Place Recognition through Vision-Language Reasoning
- Title(参考訳): breaking Déjà Vu: Vision-Language Reasoningによる視覚的位置認識の独立監査
- Authors: Sania Waheed, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan,
- Abstract要約: 視覚的位置認識(VPR)は、ロボット工学アプリケーションにおいて、正確な位置決めと長期の自律ナビゲーションを可能にする重要な手段である。
VLMベースの監査は、最先端の手法に比べて平均13.6%改善している。
- 参考スコア(独自算出の注目度): 16.054905457693824
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual place recognition (VPR) is a key enabler of accurate localization and long-term autonomous navigation in robotics applications, such as loop closure detection for simultaneous localisation and mapping (SLAM). However, real-world VPR deployment relies on selecting an image matching threshold that balances precision and recall. These thresholds are typically tuned using labeled validation data and fixed during deployment, making them unreliable under environmental changes where ground truth is unavailable. This is particularly problematic in safety-critical robotics, where accepting a false loop closure can corrupt the estimated trajectory and map. In this work, we introduce Visual Place Recognition Auditing, an independent post-retrieval verification framework that leverages Vision-Language Models (VLMs) to assess retrieved matches by reasoning jointly over query and candidate images. Unlike conventional verification methods, our approach performs instance-level verification without requiring architecture-specific confidence measures, dataset-dependent thresholds, or prior knowledge of the deployment environment. We evaluate our method on six benchmark datasets using five state-of-the-art VPR methods and four VLMs. Results show that VLM-based auditing improves recall@1 by 13.6% on average as compared to state-of-the-art methods while reducing false acceptance rates to 12%, maintaining precision above 95% and coverage above 75%.
- Abstract(参考訳): 視覚的位置認識(VPR)は、ロボットアプリケーションにおける正確な位置決めと長期自律ナビゲーションの鍵となる機能であり、例えば、同時位置決めとマッピング(SLAM)のためのループ閉鎖検出である。
しかし、現実のVPRデプロイメントは、精度とリコールのバランスをとる画像マッチングしきい値を選択することに依存している。
これらのしきい値は通常ラベル付き検証データを使用して調整され、デプロイ中に固定される。
これは安全クリティカルなロボット工学において特に問題であり、偽ループの閉鎖を受け入れると推定された軌道と地図が破損する可能性がある。
本研究では,視覚言語モデル(VLM)を活用して検索されたマッチングを,検索画像と候補画像とを併用して評価する,独立検索後検証フレームワークであるVisual Place Recognition Auditingを紹介する。
従来の検証手法とは異なり,本手法では,アーキテクチャ固有の信頼度,データセット依存しきい値,デプロイメント環境の事前知識を必要とせずに,インスタンスレベルの検証を行う。
本手法は,5つの最先端VPR法と4つのVLMを用いて,6つのベンチマークデータセット上で評価する。
その結果、VLMベースの監査は、最先端の手法と比較して平均13.6%改善し、偽の受け入れ率を12%削減し、95%以上の精度と75%以上のカバレッジを維持した。
関連論文リスト
- KappaPlace: Learning Hyperspherical Uncertainty for Visual Place Recognition via Prototype-Anchored Supervision [3.7599363231894176]
視覚的位置認識(VPR)は自律ナビゲーションに不可欠である。
標準パイプラインは、クエリがあいまいであったり、マッチが正しくない可能性がある場合に、確実に信号を送ることができない。
我々は不確実性を認識したVPR表現を学習するための原則的フレームワークであるKappaPlaceを提案する。
論文 参考訳(メタデータ) (2026-05-19T06:45:27Z) - Discovery of Hidden Miscalibration Regimes [52.452902154360565]
モデルは何らかの入力を体系的に過信し、他人を過信することがある。
対応する誤校正分野を定義し,それを推定するための診断フレームワークを提案する。
提案手法は,入力空間のキャリブレーションを意識した表現を学習し,学習幾何学におけるカーネルの平滑化による符号付き局所的誤校正を推定する。
論文 参考訳(メタデータ) (2026-05-13T13:07:50Z) - Open-Set Vein Biometric Recognition with Deep Metric Learning [0.0]
我々は厳密なオープンセット制約の下でDeep Metric Learning(DML)の計算境界を厳格に評価する。
提案手法は,非ネイティブなL2正規化埋め込みを学習し,類似性しきい値を用いたプロトタイプベースマッチングを採用する。
大規模MMCBNU 6000ベンチマークでは、我々の最良のモデル(ResNet50-CBAM)がOSCR 0.9945、AUROC 0.9974、EER 1.57%を達成し、高い識別精度 (99.6% Rank-1) を維持しながら、未知の被験者を頑健に拒否する。
論文 参考訳(メタデータ) (2026-04-16T11:03:11Z) - Automatic Map Density Selection for Locally-Performant Visual Place Recognition [16.893170921147608]
本稿では,対象環境からの参照トラバースのペアを用いて,適切な地図密度を自動的に選択する動的VPRマッピング手法を提案する。
提案システムは,少なくともユーザによって特定された環境の割合に対して,特定ローカルリコールレベルを一貫して達成または超過することを示す。
論文 参考訳(メタデータ) (2026-02-25T01:03:34Z) - Quantile Transfer for Reliable Operating Point Selection in Visual Place Recognition [15.33833908429706]
閾値は通常、特定の環境のために手動でオフラインで調整され、デプロイメント中に固定される。
本稿では,ユーザ定義の精度要件に基づき,VPRシステムの動作点を自動的に選択してリコールを最大化する手法を提案する。
複数の最先端のVPR技術とデータセットによる実験では、提案手法が一貫して最先端のVPRよりも優れていることが示されている。
論文 参考訳(メタデータ) (2026-02-04T10:31:29Z) - VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension [51.76841625486355]
Referring Expression (REC) は、自然言語クエリに対応する画像領域をローカライズすることを目的としている。
最近のニューロシンボリックRECアプローチは、大規模言語モデル(LLM)と視覚言語モデル(VLM)を利用して構成推論を行う。
推論ステップ内に軽量な演算子レベルの検証器を組み込む,ニューロシンボリックなフレームワークであるVIROを紹介する。
論文 参考訳(メタデータ) (2026-01-19T07:21:19Z) - Through the Lens of Doubt: Robust and Efficient Uncertainty Estimation for Visual Place Recognition [11.33609434801822]
視覚的場所認識は、既知の場所のデータベースに対する現在の観測と一致させることで、これまで訪れた場所を特定できる。
同時ローカライゼーションとマッピングパイプラインにおけるループクロージャ検出などの障害クリティカルなVPRアプリケーションは、位置マッチングの不確実性を堅牢に評価する必要がある。
本稿では,既存のVPR法を用いて,類似度スコアの固有統計パターンを解析し,予測信頼度を推定する3つのトレーニング不要不確実性指標を提案する。
論文 参考訳(メタデータ) (2025-10-15T12:12:55Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Learning for Transductive Threshold Calibration in Open-World Recognition [83.35320675679122]
グラフニューラルネットワークを用いた高剛性と適応性を有するトランスダクティブしきい値キャリブレーション法であるOpenGCNを導入する。
オープンワールドの視覚認識ベンチマークにおける実験は、オープンワールドのしきい値校正のための既存のポストホック校正方法よりもOpenGCNの方が優れていることを検証する。
論文 参考訳(メタデータ) (2023-05-19T23:52:48Z) - Cluster-level pseudo-labelling for source-free cross-domain facial
expression recognition [94.56304526014875]
表情認識のためのSFUDA法を提案する。
本手法は,自己教師付き事前学習を利用して,対象データから優れた特徴表現を学習する。
提案手法の有効性を4つの適応方式で検証し,FERに適用した場合,既存のSFUDA法より一貫して優れていることを示す。
論文 参考訳(メタデータ) (2022-10-11T08:24:50Z) - Unsupervised Metric Relocalization Using Transform Consistency Loss [66.19479868638925]
メートル法再ローカライズを行うためのトレーニングネットワークは、従来、正確な画像対応が必要である。
地図内のクエリ画像のローカライズは、登録に使用される参照画像に関係なく、同じ絶対的なポーズを与えるべきである。
提案手法は, 限られた地下構造情報が得られる場合に, 他の教師あり手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2020-11-01T19:24:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。