論文の概要: Zero-Shot Satellite Image Retrieval through Joint Embeddings: Application to Crisis Response
- arxiv url: http://arxiv.org/abs/2605.05405v1
- Date: Wed, 06 May 2026 19:43:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.398738
- Title: Zero-Shot Satellite Image Retrieval through Joint Embeddings: Application to Crisis Response
- Title(参考訳): 共同埋め込みによるゼロショット衛星画像検索:危機応答への応用
- Abstract要約: CLAYのようなビジュアル基盤モデルは、衛星画像のリッチな埋め込みを生成するが、直感的なクエリに必要な自然言語の基盤は欠如している。
提案するGeoQueryはゼロショット検索システムである。
イギリスの洪水、アメリカの山火事、合衆国の干ばつを含む76の災害対応クエリについて、GeoQueryは50km以内で31.6%の精度を達成している。
- 参考スコア(独自算出の注目度): 0.6614755043607777
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Semantic search of Earth observation archives remains challenging. Visual foundation models such as CLAY produce rich embeddings of satellite imagery but lack the natural-language grounding needed for intuitive query, and full contrastive training of a remote-sensing CLIP-style model requires paired data and compute that are unavailable at global scale. We present GeoQuery, a zero-shot retrieval system that sidesteps this constraint through prompt-aligned text proxies. Rather than training a joint encoder, we generate language descriptions for a 100k proxy subset of global Sentinel-2 tiles and optimise the description-generation prompt so that distances in the resulting text-embedding space correlate with distances in the frozen CLAY visual-embedding space. Queries are resolved in two stages, with a text-similarity search over the proxy subset followed by a visual nearest-neighbour search over worldwide CLAY embeddings. On 76 disaster-location queries covering UK floods, US wildfires, and US droughts, GeoQuery achieves 31.6% accuracy within 50 km, with the strongest performance on floods (50% within 50 km) where terrain features are well captured by RGB embeddings. Deployed within ECHO, a crisis response system using Agentic Action Graphs, GeoQuery identified vulnerable areas during Brisbane's 2025 Cyclone Alfred, with downstream flood simulations reproducing historical patterns. Prompt-aligned proxies offer a practical bridge between EO foundation models and operational retrieval when full contrastive training is out of reach.
- Abstract(参考訳): 地球観測アーカイブのセマンティック検索はいまだに困難である。
CLAYのようなビジュアルファンデーションモデルは、衛星画像のリッチな埋め込みを生成するが、直感的なクエリに必要な自然言語基盤が欠如しており、リモートセンシングのCLIPスタイルモデルの完全なコントラストトレーニングには、グローバルスケールでは利用できないペアデータと計算が必要である。
提案するGeoQueryはゼロショット検索システムである。
共同エンコーダを訓練する代わりに、グローバルなSentinel-2タイルの100kプロキシサブセットの言語記述を生成し、その記述生成プロンプトを最適化することにより、結果のテキスト埋め込み空間の距離と凍結したCLAYビジュアル埋め込み空間の距離とを相関させる。
クエリは2つの段階で解決され、プロキシサブセット上でのテキスト類似性検索と、グローバルなCLAY埋め込み上での視覚的近接性検索が続く。
イギリスの洪水、合衆国の山火事、合衆国の干ばつなど76の災害対応クエリでは、GeoQueryは50km以内で31.6%の精度を達成し、RGBの埋め込みによって地形の特徴がよく捉えられる洪水(50km以内)で最も高いパフォーマンスである。
エージェントアクショングラフを使用した危機対応システムであるECHO内に展開されたGeoQueryは、ブリスベンの2025年のサイクロン・アルフレッドにおける脆弱な地域を特定し、下流の洪水シミュレーションが歴史的なパターンを再現した。
プロンプト整列プロキシは、EOファンデーションモデルと、完全なコントラストトレーニングが到達できない場合の運用検索の間に実践的な橋渡しを提供する。
関連論文リスト
- Global Cross-Modal Geo-Localization: A Million-Scale Dataset and a Physical Consistency Learning Framework [13.268717213871147]
クロスモーダルジオローカライゼーション(CMGL)は、地上レベルのテキスト記述とジオタグ付き空中画像とを一致させる。
グローバルCMGL専用の最初の100万規模のデータセットであるCOREを紹介する。
モーダルな地理的ローカライゼーションのための物理ロッド・アウェア・ネットワーク(PLANET)を提案する。
論文 参考訳(メタデータ) (2026-03-09T15:27:19Z) - AIFloodSense: A Global Aerial Imagery Dataset for Semantic Segmentation and Understanding of Flooded Environments [1.381010753883328]
AIFloodSenseは、64か国と6大陸にわたる230の異なる洪水イベントの470の高解像度画像からなる、包括的で公開可能な航空画像データセットである。
以前のベンチマークとは異なり、AIFloodSenseはグローバルな多様性と時間的関連性(2022-2024)を確保し、3つの補完的なタスクをサポートする。
最新のアーキテクチャを使って、すべてのタスクのベースラインベンチマークを確立し、データセットの複雑さとその価値を実証します。
論文 参考訳(メタデータ) (2025-12-19T10:34:45Z) - VLM2GeoVec: Toward Universal Multimodal Embeddings for Remote Sensing [59.73939718087177]
シングルエンコーダの視覚言語モデルは、統合ベクトル空間にインターリーブされた入力を埋め込むために対照的に訓練された。
VLM2GeoVecは、領域レベルの空間推論とスケーラブルな検索を統合し、リモートセンシングにおける凝集性多モード解析を可能にする。
論文 参考訳(メタデータ) (2025-12-12T11:39:35Z) - Scaling Image Geo-Localization to Continent Level [48.7766435870634]
本稿では,大陸規模を拡大する大規模地形をまたいだ微粒な地理的局在化を実現するためのハイブリッドアプローチを提案する。
我々は、訓練中にプロキシ分類タスクを利用して、正確な位置情報を暗黙的にエンコードするリッチな特徴表現を学習する。
我々の評価は,ヨーロッパの大部分をカバーするデータセットのクエリの68%以上を200m以内でローカライズできることを示す。
論文 参考訳(メタデータ) (2025-10-30T17:59:35Z) - Empowering LLM Agents with Geospatial Awareness: Toward Grounded Reasoning for Wildfire Response [9.801192259936888]
既存の統計的アプローチは意味的な文脈を欠くことが多く、イベント全体にわたって一般化し、限定的な解釈性を提供する。
地空間認識層(Geospatial Awareness Layer, GAL)を導入し, LLMエージェントを地球構造データに固定する。
GALは、外部ジオデータベースからインフラストラクチャ、人口統計、地形、気象情報を自動的に取得し、統合する。
このリッチなコンテキストにより、エージェントはエビデンスベースのリソース割り当てレコメンデーションを作成することができる。
論文 参考訳(メタデータ) (2025-10-14T01:59:02Z) - CLOSP: A Unified Semantic Space for SAR, MSI, and Text in Remote Sensing [20.32829825711161]
我々は647,000以上のSentinel-1 SARとSentinel-2マルチスペクトル画像からなる新しい大規模コーパスCrisisLandMarkを紹介する。
次に、テキストをブリッジとして使用する新しいフレームワークであるCLOSPを紹介し、未対光画像とSAR画像を統合埋め込み空間に整列させる。
実験の結果, CLOSPは新たな最先端を実現し, nDGC@1000を既存モデルよりも54%向上した。
論文 参考訳(メタデータ) (2025-07-14T15:46:56Z) - Spatial-RAG: Spatial Retrieval Augmented Generation for Real-World Geospatial Reasoning Questions [5.053463027769152]
空間RAG(Spatial-RAG)は、地理空間質問応答用に設計された検索型生成フレームワークである。
構造化空間データベースと大きな言語モデル(LLM)をハイブリッド空間レトリバーを介して統合する。
応答過程を空間的および意味的関連性に対する多目的最適化として定式化する。
論文 参考訳(メタデータ) (2025-02-04T01:30:06Z) - Swarm Intelligence in Geo-Localization: A Multi-Agent Large Vision-Language Model Collaborative Framework [51.26566634946208]
smileGeoは、新しい視覚的ジオローカライゼーションフレームワークである。
エージェント間のコミュニケーションによって、SmithGeoはこれらのエージェントの固有の知識と、検索された情報を統合する。
その結果,本手法は現在の最先端手法よりも優れていた。
論文 参考訳(メタデータ) (2024-08-21T03:31:30Z) - Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching [60.645802236700035]
自然言語コマンドを通じてドローンをナビゲートすることは、アクセス可能なマルチモーダルデータセットが不足しているため、依然として難しい。
我々は新しい自然言語誘導ジオローカライゼーションベンチマークGeoText-1652を紹介する。
このデータセットは、インタラクティブなヒューマンコンピュータプロセスを通じて体系的に構築される。
論文 参考訳(メタデータ) (2023-11-21T17:52:30Z) - GeoLLM: Extracting Geospatial Knowledge from Large Language Models [49.20315582673223]
大規模言語モデルから地理空間的知識を効果的に抽出する新しい手法であるGeoLLMを提案する。
我々は、人口密度や経済生活の計測など、国際社会への関心の中心となる複数の課題にまたがるアプローチの有用性を実証する。
実験の結果, LLMは試料効率が高く, 地理空間情報に富み, 世界中のロバストであることがわかった。
論文 参考訳(メタデータ) (2023-10-10T00:03:23Z) - SIRI: Spatial Relation Induced Network For Spatial Description
Resolution [64.38872296406211]
言語誘導型ローカライゼーションのための新しい関係誘導型ネットワーク(SIRI)を提案する。
提案手法は,80ピクセルの半径で測定した精度で,最先端手法よりも約24%優れていた。
提案手法は,Touchdownと同じ設定で収集した拡張データセットをうまく一般化する。
論文 参考訳(メタデータ) (2020-10-27T14:04:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。