論文の概要: GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision
- arxiv url: http://arxiv.org/abs/2607.01050v1
- Date: Wed, 01 Jul 2026 15:12:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.957233
- Title: GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision
- Title(参考訳): GeoSearcher: プロセススーパービジョンによるリモートセンシングビジュアルグラウンドのためのアンカーガイド付きプログレッシブ推論
- Abstract要約: 高解像度のリモートセンシング画像は、通常大規模なシーンをカバーし、ターゲットは極端に小さく、多くの視覚的に類似した邪魔者に囲まれている。
既存のMLLMベースの手法は通常、RSVGを1ステップの座標生成として定式化し、小さなオブジェクトのローカライゼーションや複雑なクエリの不安定な予測につながる可能性がある。
提案するGeoSearcherは, RSVGをアンカー誘導プログレッシブ推論プロセスとして再構成し, 2つの組み合わせの段階を通して実現する。
ACR-SFTでは、アンカー中心の推論データを使用して、重要な視覚的手がかりをアンカーとして表現し、位置、リレーショナル、属性を段階的に統合する。
- 参考スコア(独自算出の注目度): 16.353894490538227
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent multimodal large language models (MLLMs) have shown strong cross-modal understanding and coordinate generation abilities in visual grounding. However, transferring these abilities to remote sensing visual grounding (RSVG) remains challenging. High-resolution remote sensing images usually cover large-scale scenes, where targets are often extremely small and surrounded by numerous visually similar distractors. Meanwhile, queries often contain multiple clues, such as reference objects, spatial relations, and target attributes. Existing MLLM-based methods usually formulate RSVG as one-step coordinate generation, which may lead to unstable predictions for small-object localization and complex queries. To address these challenges, we propose GeoSearcher, which reformulates RSVG as an anchor-guided progressive reasoning process and realizes it through two coupled stages: Anchor-Centric Reasoning Supervised Fine-Tuning (ACR-SFT) and Process-Faithful Group Relative Policy Optimization (PF-GRPO). In ACR-SFT, anchor-centric reasoning data are used to teach the model to represent key visual clues as anchors and progressively integrate location, relational, and attribute clues around them. In PF-GRPO, Process-Aware Reward (PAR) and Reasoning-Informative Sample Selector (RISS) further optimize this reasoning behavior by jointly evaluating key reasoning steps and target localization, while focusing training on samples that are more beneficial for improving progressive reasoning. Through this design, GeoSearcher transforms large-scale visual search into a more constrained local reasoning process. Extensive experiments on DIOR-RSVG, OPT-RSVG, and VRS-Bench show that GeoSearcher outperforms existing state-of-the-art methods. The project will be released at https://github.com/wangdianyu954-xixi/GeoSearcher.
- Abstract(参考訳): 近年のマルチモーダル大言語モデル(MLLM)は,視覚的接地において強い相互理解とコーディネート生成能力を示している。
しかし、これらの能力をリモートセンシング視覚接地(RSVG)に転送することは依然として困難である。
高解像度のリモートセンシング画像は、通常大規模なシーンをカバーし、ターゲットは極端に小さく、多くの視覚的に類似した邪魔者に囲まれている。
一方、クエリには、参照オブジェクト、空間関係、ターゲット属性など、複数のヒントが含まれていることが多い。
既存のMLLMベースの手法は通常、RSVGを1ステップの座標生成として定式化し、小さなオブジェクトのローカライゼーションや複雑なクエリの不安定な予測につながる可能性がある。
これらの課題に対処するため,GeoSearcherは,RSVGをアンカー誘導プログレッシブ推論プロセスとして再構成し,ACR-SFT(Anchor-Centric Reasoning Supervised Fine-Tuning)とPF-GRPO(Process-Faithful Group Relative Policy Optimization)という2つの複合段階を経て実現する。
ACR-SFTでは、アンカー中心の推論データを使用して、重要な視覚的手がかりをアンカーとして表現し、その周りの位置、リレーショナル、属性のヒントを徐々に統合する。
PF-GRPOでは、プロセス・アウェア・リワード(PAR)とReasoning-Informative Sample Selector(RISS)が、重要な推論ステップとターゲットのローカライゼーションを共同で評価し、進歩的推論を改善する上でより有益なサンプルのトレーニングに焦点を合わせながら、この推論挙動を最適化する。
この設計を通じて、GeoSearcherは大規模なビジュアル検索をより制約のあるローカル推論プロセスに変換する。
DIOR-RSVG、OPT-RSVG、VRS-Benchに関する大規模な実験は、GeoSearcherが既存の最先端手法より優れていることを示している。
プロジェクトはhttps://github.com/wangdianyu954-xixi/GeoSearcher.comでリリースされる。
関連論文リスト
- Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing [24.62771308673739]
広帯域衛星画像から構築した大規模マルチツールビジュアル推論データセットであるGeoMTVRを紹介する。
我々はGeoMTVR上のSFTとRLアルゴリズムを組み合わせることで、UHR RSのためのマルチツール視覚推論MLLMであるGeoLensを開発した。
実験の結果、GeoLensは直接推論やシングルツールズームインベースラインよりも一貫して優れていた。
論文 参考訳(メタデータ) (2026-07-28T17:09:16Z) - GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding [13.76788623862368]
超高解像度(UHR)リモートセンシング画像の解釈には、大規模なシーンにわたってスパースで小さな視覚的証拠を探すモデルが必要である。
既存の視覚言語モデルは、ズームとトリミングツールを使用して地域を検査することができるが、ほとんどの探索戦略は、1ショットの焦点または1つのシーケンシャルな軌跡のいずれかに従う。
提案するGeoVistaは,UHRリモートセンシング解釈のための計画駆動型能動認識フレームワークである。
論文 参考訳(メタデータ) (2026-05-14T07:15:46Z) - Thinking with Geometry: Active Geometry Integration for Spatial Reasoning [68.59084007360615]
我々は,能動的知覚にパラダイム・パッシブ・フュージョンをシフトさせるフレームワークであるGeoThinkerを提案する。
特徴混合の代わりに、GeoThinkerはモデルが内部の推論要求に応じて条件付けられた幾何学的証拠を選択的に検索することを可能にする。
その結果,次世代の空間知能には,空間構造を積極的に統合する能力が不可欠であることが示唆された。
論文 参考訳(メタデータ) (2026-02-05T18:59:32Z) - RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning [61.84363374647606]
リモートセンシングビジュアルグラウンドディング(RSVG)は、自然言語記述に基づく大規模空中画像における対象物体のローカライズを目的としている。
これらの記述はしばしば位置的手がかりに大きく依存しており、空間的推論においてMLLM(Multimodal Large Language Models)に固有の課題を提起している。
空間理解の高度化を図るために,textbfRSGround-R1 と呼ばれる推論誘導型位置認識後学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T12:35:57Z) - GRASP: Guided Region-Aware Sparse Prompting for Adapting MLLMs to Remote Sensing [50.961694646995376]
GRASP(Guid Region-Aware Sparse Prompting)と呼ばれるパラメータ効率細調整(PEFT)戦略を提案する。
GRASPは、凍結した視覚的トークングリッドから抽出された空間ブロックに関連する空間的構造化されたソフトプロンプトを導入する。
複数のRSVQAベンチマークの実験では、GRASPは既存の微調整やプロンプトベースの手法と比較して競争性能が向上している。
論文 参考訳(メタデータ) (2026-01-23T10:12:59Z) - GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding [23.253648429114236]
リモートセンシング視覚接地のためのプログレッシブ検索・推論フレームワークGeoViSを提案する。
我々はGeoViSが、主要な視覚的グラウンドリング指標を越えて既存の手法を一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2025-12-02T12:45:52Z) - GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization [53.080882980294795]
エージェント視覚推論に関する最近の研究は、深いマルチモーダル理解を可能にするが、主に画像操作ツールに焦点を当てている。
そこで本研究では,視覚的グラウンディングだけでなく,仮説の検証や修正のためにWeb検索も必要とするジオローカライゼーションタスクを再考する。
既存のジオローカライゼーションベンチマークは、高解像度画像の必要性と深部エージェント推論の局所化課題を満たすことができないため、GeoBenchをキュレートする。
推論ループ内にツールの実行をシームレスに統合するエージェントモデルであるGeoVistaを提案し,興味のある領域を拡大するイメージズームインツールと関連する領域を検索するWeb検索ツールを提案する。
論文 参考訳(メタデータ) (2025-11-19T18:59:22Z) - Exploring Efficient Open-Vocabulary Segmentation in the Remote Sensing [55.291219073365546]
Open-Vocabulary Remote Sensing Image (OVRSIS)は、OVS(Open-Vocabulary)をリモートセンシング(RS)ドメインに適応させる新しいタスクである。
textbfRSKT-Segは、リモートセンシングに適した新しいオープン語彙セグメンテーションフレームワークである。
RSKT-Segは高いOVSベースラインを+3.8 mIoUと+5.9 mACCで上回り、効率的なアグリゲーションによって2倍高速な推論を実現している。
論文 参考訳(メタデータ) (2025-09-15T15:24:49Z) - Swarm Intelligence in Geo-Localization: A Multi-Agent Large Vision-Language Model Collaborative Framework [51.26566634946208]
smileGeoは、新しい視覚的ジオローカライゼーションフレームワークである。
エージェント間のコミュニケーションによって、SmithGeoはこれらのエージェントの固有の知識と、検索された情報を統合する。
その結果,本手法は現在の最先端手法よりも優れていた。
論文 参考訳(メタデータ) (2024-08-21T03:31:30Z) - Remote Sensing Cross-Modal Text-Image Retrieval Based on Global and
Local Information [15.32353270625554]
リモートセンシング(RS)画像の高速かつ柔軟な情報抽出を可能にするため,クロスモーダルリモートセンシングテキスト画像検索(RSCTIR)は近年,緊急な研究ホットスポットとなっている。
まず,グローバル・ローカル情報(GaLR)に基づく新しいRSCTIRフレームワークを提案し,多レベル情報ダイナミックフュージョン(MIDF)モジュールを設計し,異なるレベルの機能を効果的に統合する。
公開データセットの実験は、RSCTIRタスク上でのGaLR法の最先端性能を強く実証している。
論文 参考訳(メタデータ) (2022-04-21T03:18:09Z) - Learning to Aggregate Multi-Scale Context for Instance Segmentation in
Remote Sensing Images [28.560068780733342]
特徴抽出のプロセスを改善するために,新しいコンテキスト集約ネットワーク(CATNet)を提案する。
提案モデルは,高密度特徴ピラミッドネットワーク(DenseFPN),空間コンテキストピラミッド(SCP),階層的関心抽出器(HRoIE)の3つの軽量プラグアンドプレイモジュールを利用する。
論文 参考訳(メタデータ) (2021-11-22T08:55:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。