論文の概要: Warp-free Cross-view Geo-localization via Feature-space Consensus Mining
- arxiv url: http://arxiv.org/abs/2608.09321v1
- Date: Mon, 10 Aug 2026 09:02:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.174222
- Title: Warp-free Cross-view Geo-localization via Feature-space Consensus Mining
- Title(参考訳): 空間的コンセンサスマイニングによるワープフリークロスビュージオローカライゼーション
- Abstract要約: ストリートレベルの画像と衛星画像の間に大きな違いがあるため、クロスビューのジオローカライゼーションは困難である。
本稿では,明示的な幾何学的ワープを完全に回避する,新しい統合ビュー・コンセンサス誘導学習フレームワークを提案する。
- 参考スコア(独自算出の注目度): 49.843311525678565
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Cross-view geo-localization is challenging due to drastic viewpoint changes and large appearance discrepancies between street-level and satellite imagery. Although existing methods often use geometric warping to expose co-visible cues, such transformations rely on restrictive spatial assumptions and inevitably introduce severe visual distortions under view-dependent visibility, yielding noisy supervision and fragile correspondences. To overcome this, we propose a novel joint-view consensus-guided learning framework that entirely bypasses explicit geometric warping. Instead of forcing rigid spatial alignment, we dynamically mine and adaptively strengthen a semantic consensus directly within the feature space. Specifically, an auxiliary joint-view pathway during training enables direct cross-view interaction, allowing each view to selectively aggregate corroborative evidence into a unified consensus representation. To resolve feature heterogeneity among the single- and joint-view streams, we introduce global pattern probes acting as a semantic dictionary to project divergent modalities into a strictly aligned metric space. Guided by a consensus-mediated contrastive objective, single-view embeddings are explicitly pulled toward the joint-view anchor during training, distilling this consensus-mining capability into the single-view encoders for robust retrieval at inference. Extensive experiments demonstrate that our method achieves state-of-the-art performance across four standard benchmarks, underscoring the importance of discovering cross-view semantic consensus for reliable geo-localization.
- Abstract(参考訳): ストリートレベルの画像と衛星画像の間に大きな違いがあるため、クロスビューのジオローカライゼーションは困難である。
既存の手法はしばしば幾何学的ワープを用いてコヴィジュアブルな手がかりを露呈するが、そのような変換は制限的な空間的仮定に依存し、視野に依存した可視性の下で必然的に激しい視覚的歪みを生じさせ、ノイズの多い監視と脆弱な対応をもたらす。
これを解決するために,明示的な幾何学的ワープを完全に回避する,新しい統合ビュー・コンセンサス誘導学習フレームワークを提案する。
厳密な空間アライメントを強制するのではなく、特徴空間内でのセマンティックコンセンサスを直接動的にマイニングし、適応的に強化する。
具体的には、トレーニング中の補助的なジョイントビューパスは、直接のクロスビュー相互作用を可能にし、各ビューは、相関的証拠を選択的に統合されたコンセンサス表現に集約することができる。
単一および共同ビューストリーム間の特徴の不均一性を解決するため,大域的パターンプローブが意味辞書として機能し,発散度を厳密に整合した距離空間に投影する手法を提案する。
コンセンサスを媒介とする対照的な目的によって導かれるシングルビュー埋め込みは、トレーニング中にジョイントビューアンカーに向かって明示的にプルされ、このコンセンサスマイニング能力をシングルビューエンコーダに蒸留し、推論時に堅牢な検索を行う。
大規模な実験により,提案手法は4つの標準ベンチマークにおける最先端性能を達成し,信頼性の高い地理局所化のためのクロスビューセマンティック・コンセンサスを発見することの重要性を浮き彫りにした。
関連論文リスト
- SASGeo: Stability-Aware Semantic Map Localization for GNSS-Denied UAVs -- A Framework and Synthetic Proof of Concept [0.0]
sasは、永続的な構造を通して環境を表現するセマンティックマップローカライゼーションフレームワークである。
sasは意味的アライメント、グラフのエビデンス、特徴安定性と地理的特異性、明示的な肯定的/矛盾的/未知の観察、曖昧な修正の完全性を無視する。
予備実験は実飛行航法を検証せず、むしろ、構造的意味幾何学が制御された横方向の摂動の下で位置を識別できることを実証している。
論文 参考訳(メタデータ) (2026-07-07T16:57:43Z) - Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - Seeking Consensus: Geometric-Semantic On-the-Fly Recalibration for Open-Vocabulary Remote Sensing Semantic Segmentation [27.476148859056114]
SeeCoは、リモートセンシング画像におけるトレーニング不要のOVSSモデルのパフォーマンスを向上させるための、プラグアンドプレイフレームワークである。
デュアルコンセンサスを求めることにより、任意のOVSSモデルをオンザフライで再分類する。
8つのリモートセンシングOVSSベンチマークの実験は、一貫した利得を示している。
論文 参考訳(メタデータ) (2026-04-29T01:57:21Z) - Towards Domain-Generalized Open-Vocabulary Object Detection: A Progressive Domain-invariant Cross-modal Alignment Method [59.30562121800656]
Open-Vocabulary Object Detectionは、新しいカテゴリへの一般化において大きな成功を収めた。
我々は、OVODパラダイムの原則的な見直しを行い、根本的な脆弱性を明らかにする。
PICA(Progressive Domain-invariant Cross-Modal Alignment)を提案する。
論文 参考訳(メタデータ) (2026-03-29T07:39:31Z) - Reference-Free Omnidirectional Stereo Matching via Multi-View Consistency Maximization [22.711843818785454]
フリーオムニMVSはペアの相関関係を頑健でオールニの認識とグローバルなコンセンサスに集約することができる。
可視性を考慮したコンセンサスを実現するために,相関ベクトルを適応的に融合する軽量アテンション機構を提案する。
多様なベンチマークデータセットに対する実験は、グローバルに一貫性があり、可視性があり、スケールアウェアな深さ推定のための手法の優位性を実証している。
論文 参考訳(メタデータ) (2026-03-16T09:23:23Z) - Unified and Semantically Grounded Domain Adaptation for Medical Image Segmentation [26.940252595979892]
医用画像セグメンテーションのための以前の教師なし領域適応アプローチは、ソースアクセス可能な設定に合わせて狭義に調整されている。
我々は、ソースアクセシビリティとソースフリーアダプションの両方をサポートする統一的でセマンティックな基盤となるフレームワークを導入する。
当社のフレームワークは、ソースフリー性能がソースアクセシビリティに近づきながら、両方の設定で最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-08-12T05:56:16Z) - Imputation-free and Alignment-free: Incomplete Multi-view Clustering Driven by Consensus Semantic Learning [65.75756724642932]
不完全なマルチビュークラスタリングでは、欠落したデータがビュー内のプロトタイプシフトとビュー間のセマンティック不整合を誘導する。
コンセンサスセマンティクス学習(FreeCSL)のためのIMVCフレームワークを提案する。
FreeCSLは、最先端の競合他社と比較して、IMVCタスクの信頼性と堅牢な割り当てを実現している。
論文 参考訳(メタデータ) (2025-05-16T12:37:10Z) - View Consistent Purification for Accurate Cross-View Localization [59.48131378244399]
本稿では,屋外ロボットのための微細な自己局在化手法を提案する。
提案手法は,既存のクロスビューローカライゼーション手法の限界に対処する。
これは、動的環境における知覚を増強する初めての疎視のみの手法である。
論文 参考訳(メタデータ) (2023-08-16T02:51:52Z) - Modeling Multiple Views via Implicitly Preserving Global Consistency and
Local Complementarity [61.05259660910437]
複数の視点から表現を学習するために,グローバルな一貫性と相補性ネットワーク(CoCoNet)を提案する。
グローバルな段階では、重要な知識はビュー間で暗黙的に共有され、そのような知識を捕捉するためのエンコーダの強化は、学習された表現の識別性を向上させることができる。
最後に、局所的な段階において、横断的な識別的知識を結合する相補的要素を提案し、また、エンコーダが視点的識別性だけでなく、横断的な相補的情報も学習するように誘導する。
論文 参考訳(メタデータ) (2022-09-16T09:24:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。