論文の概要: Spatially-Weighted CLIP for Street-View Geo-localization
- arxiv url: http://arxiv.org/abs/2604.04357v1
- Date: Mon, 06 Apr 2026 02:10:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:19.063171
- Title: Spatially-Weighted CLIP for Street-View Geo-localization
- Title(参考訳): ストリートビュー地形定位のための空間重み付きCLIP
- Authors: Ting Han, Fengjiao Li, Chunsong Chen, Haoling Huang, Yiping Chen, Meiliu Wu,
- Abstract要約: 本稿では,空間的自己相関を視覚言語によるコントラスト学習に明示的に組み込む,ストリートビューのジオローカライゼーションのための新しいフレームワークを提案する。
多都市データセットの実験により、SW-CLIPは地理的ローカライゼーションの精度を著しく向上し、長いテール誤差を低減し、標準のCLIPに比べて空間コヒーレンスを向上させることが示された。
- 参考スコア(独自算出の注目度): 5.8048364242505945
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper proposes Spatially-Weighted CLIP (SW-CLIP), a novel framework for street-view geo-localization that explicitly incorporates spatial autocorrelation into vision-language contrastive learning. Unlike conventional CLIP-based methods that treat all non-matching samples as equally negative, SW-CLIP leverages Tobler's First Law of Geography to model geographic relationships through distance-aware soft supervision. Specifically, we introduce a location-as-text representation to encode geographic positions and replace one-hot InfoNCE targets with spatially weighted soft labels derived from geodesic distance. Additionally, a neighborhood-consistency regularization is employed to preserve local spatial structure in the embedding space. Experiments on a multi-city dataset demonstrate that SW-CLIP significantly improves geo-localization accuracy, reduces long-tail errors, and enhances spatial coherence compared to standard CLIP. The results highlight the importance of shifting from semantic alignment to geographic alignment for robust geo-localization and provide a general paradigm for integrating spatial principles into multimodal representation learning.
- Abstract(参考訳): 本稿では,空間的自己相関を視覚言語によるコントラスト学習に明示的に組み込んだ,ストリートビューのジオローカライゼーションのための新しいフレームワークであるSpatially-Weighted CLIP (SW-CLIP)を提案する。
全ての非マッチングサンプルを同等に否定的に扱う従来のCLIPベースの手法とは異なり、SW-CLIPはトブラーの第1法則を利用して距離対応ソフト・インスペクションを通じて地理的関係をモデル化する。
具体的には、地理的位置を符号化し、1ホットのInfoNCEターゲットを測地距離から得られる空間重み付きソフトラベルに置き換える。
さらに、埋め込み空間における局所的な空間構造を保存するために、近傍整合正則化を用いる。
多都市データセットの実験により、SW-CLIPは地理的ローカライゼーションの精度を著しく向上し、長いテール誤差を低減し、標準のCLIPに比べて空間コヒーレンスを向上させることが示された。
その結果,意味的アライメントから地理的アライメントへのシフトの重要性が強調され,空間原理をマルチモーダル表現学習に統合するための一般的なパラダイムが提供される。
関連論文リスト
- Global Cross-Modal Geo-Localization: A Million-Scale Dataset and a Physical Consistency Learning Framework [13.268717213871147]
クロスモーダルジオローカライゼーション(CMGL)は、地上レベルのテキスト記述とジオタグ付き空中画像とを一致させる。
グローバルCMGL専用の最初の100万規模のデータセットであるCOREを紹介する。
モーダルな地理的ローカライゼーションのための物理ロッド・アウェア・ネットワーク(PLANET)を提案する。
論文 参考訳(メタデータ) (2026-03-09T15:27:19Z) - Reasoning Over Space: Enabling Geographic Reasoning for LLM-Based Generative Next POI Recommendation [8.829656404389178]
Reasoning Over Space (ROS) は、地理を推論プロセスにおける重要な決定変数として利用するフレームワークである。
ROSは、粗い局所性とPOIセマンティクスを合成トークンに識別する階層的空間意味ID(SID)を導入している。
空間誘導強化学習(Reinforcement Learning, RL)により, 実世界の地理とモデルをさらに整合させる。
論文 参考訳(メタデータ) (2026-01-08T03:46:03Z) - Vision-Language Reasoning for Geolocalization: A Reinforcement Learning Approach [41.001581773172695]
提案するGeo-Rは,既存の接地トラス座標から構造的推論経路を明らかにする,検索不要なフレームワークである。
本稿では,ルールに基づく階層的推論パラダイムである領域の連鎖を提案する。
提案手法は,空間的直接監視による地理的推論を構造化し,位置推定精度の向上,一般化の強化,透過的な推論を行う。
論文 参考訳(メタデータ) (2026-01-01T16:51:41Z) - CLNet: Cross-View Correspondence Makes a Stronger Geo-Localizationer [48.52152634356309]
本稿では,異なるビュー間の意味的および幾何学的ギャップを明示的に橋渡しする,CLNetと呼ばれる通信対応機能改善フレームワークを提案する。
CLNetはビューアライメントプロセスを3つの学習可能な補完モジュールに分解する。
提案するCLNetは、より優れた解釈性と一般化性を提供しながら、最先端の性能を実現する。
論文 参考訳(メタデータ) (2025-12-16T16:31:41Z) - HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models [63.87966115136411]
HarmoCLIPはContrastive Language-Image Pre-training内のグローバルおよびリージョン表現を調和させるように設計された新しいフレームワークである。
本研究では,地域レベルでの表現能力を高めるために,地域調整管理戦略を導入する。
論文 参考訳(メタデータ) (2025-11-27T16:24:53Z) - LLM-Aligned Geographic Item Tokenization for Local-Life Recommendation [21.430438767288106]
LGSID は LLM-Hierarchical Geographic Item Tokenization Framework for Local-life Recommendation である。
本稿では,学習前報酬モデルを用いて空間知識の一般化と協調的な信号をLLMに注入する新しいG-DPOアルゴリズムを提案する。
実世界のKuaishou産業データセットの実験によると、LGSIDは最先端の差別的で生成的なレコメンデーションモデルよりも一貫して優れている。
論文 参考訳(メタデータ) (2025-11-18T07:54:32Z) - Can LLMs Learn to Map the World from Local Descriptions? [50.490593949836146]
本研究では,Large Language Models (LLMs) がコヒーレントなグローバル空間認識を構築できるかどうかを検討する。
都市環境を模擬した実験により, LLMは実空間分布に一致した潜在表現を示すことを示した。
論文 参考訳(メタデータ) (2025-05-27T08:22:58Z) - GeoCLIP: Clip-Inspired Alignment between Locations and Images for
Effective Worldwide Geo-localization [61.10806364001535]
世界規模のジオローカライゼーションは、地球上のどこでも撮影された画像の正確な位置を特定することを目的としている。
既存のアプローチは、地球を離散的な地理的細胞に分割し、問題を分類タスクに変換する。
画像と対応するGPS位置のアライメントを強制する新しいCLIPにインスパイアされた画像-GPS検索手法であるGeoCLIPを提案する。
論文 参考訳(メタデータ) (2023-09-27T20:54:56Z) - Each Part Matters: Local Patterns Facilitate Cross-view Geo-localization [54.00111565818903]
クロスビューなジオローカライゼーションは、異なるプラットフォームから同じ地理的ターゲットの画像を見つけることである。
既存の手法は通常、画像センター内の地理的ターゲットの微細な特徴をマイニングすることに集中している。
我々は、文脈情報を活用するために、ローカルパターンネットワーク(LPN)と呼ばれるシンプルで効果的なディープニューラルネットワークを導入する。
論文 参考訳(メタデータ) (2020-08-26T16:06:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。