論文の概要: Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing
- arxiv url: http://arxiv.org/abs/2607.25993v1
- Date: Tue, 28 Jul 2026 17:09:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.944228
- Title: Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing
- Title(参考訳): Zoomingを超えて:超高解像度リモートセンシングのためのマルチツールビジュアル推論学習
- Authors: Fengxiang Wang, Jiangnan Huang, Mingshuo Chen, Yueying Li, Yang Shi, Junwei Luo, Haoyu Wang, Yansheng Li, Jing Zhang, Haiyan Zhao, Wenjing Yang,
- Abstract要約: 広帯域衛星画像から構築した大規模マルチツールビジュアル推論データセットであるGeoMTVRを紹介する。
我々はGeoMTVR上のSFTとRLアルゴリズムを組み合わせることで、UHR RSのためのマルチツール視覚推論MLLMであるGeoLensを開発した。
実験の結果、GeoLensは直接推論やシングルツールズームインベースラインよりも一貫して優れていた。
- 参考スコア(独自算出の注目度): 24.62771308673739
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Ultra-high-resolution (UHR) remote-sensing (RS) imagery provides fine-grained Earth-observation evidence over city-scale scenes, but poses a fundamental challenge for multimodal large language models (MLLMs): task-relevant evidence is often sparse, local, and spatially dispersed across extremely large visual contexts. A natural solution is to equip MLLMs with zoom-in tools for active local inspection. However, through a pilot study on XLRS-Bench, we find that zoom-in is only partially effective: it resolves easy and medium-level tasks with locally recoverable evidence, but saturates on hard cases requiring global search, multi-region comparison, path planning, or dispersed-evidence reasoning. Motivated by this finding, we move beyond single-tool zoom-in and introduce GeoMTVR, a large-scale Geospatial Multi-Tool Visual Reasoning dataset built from wide-area satellite imagery. GeoMTVR contains 13K UHR VQA samples with interleaved reasoning trajectories, diverse visual tool calls, and returned visual observations, enabling models to learn question decomposition, tool selection, regional inspection, object-level grounding, auxiliary visual reasoning, and cross-tool evidence integration. Beyond supervised fine-tuning, we propose a tool-attention-focused reinforcement learning algorithm that concentrates optimization on critical tool-use decisions, including when to invoke tools, which tool to select, where to apply it, and how to interpret tool outputs. By combining SFT on GeoMTVR with our RL algorithm, we develop GeoLens, a multi-tool visual reasoning MLLM for UHR RS. Experiments show that GeoLens consistently outperforms direct reasoning and single-tool zoom-in baselines, achieving stronger accuracy, better evidence grounding, and more efficient tool-use trajectories.
- Abstract(参考訳): 超高解像度(UHR)リモートセンシング(英語版)画像は、都市規模のシーンに対してきめ細かい地球観測の証拠を提供するが、マルチモーダルな大規模言語モデル(MLLM)には根本的な課題をもたらす。
自然な解決策は、能動的局所検査のためのズームインツールをMLLMに装備することである。
しかし、XLRS-Benchの試験的な研究により、ズームインは局所的に回復可能な証拠で容易かつ中程度のタスクを解決するが、グローバル検索、マルチリージョン比較、パス計画、分散証拠推論を必要とするハードケースで飽和する。
この発見に触発されて、我々はシングルツールズームインを超えて、広域衛星画像から構築された大規模Geospatial Multi-Tool Visual ReasoningデータセットであるGeoMTVRを導入しました。
GeoMTVRには13KのUHR VQAサンプルが含まれており、インターリーブされた推論軌道、多様な視覚的ツールコール、返却された視覚的観察により、モデルが質問の分解、ツールの選択、地域検査、オブジェクトレベルの接地、補助的な視覚的推論、およびツール間のエビデンス統合を学ぶことができる。
教師付き微調整以外にも,ツールをいつ呼び出すか,どのツールを適用すべきか,ツールアウトプットの解釈方法など,重要なツール使用判断に最適化を集中させるツールアテンション型強化学習アルゴリズムを提案する。
我々はGeoMTVR上のSFTとRLアルゴリズムを組み合わせることで、UHR RSのためのマルチツール視覚推論MLLMであるGeoLensを開発した。
実験によると、GeoLensは直接推論とシングルツールズームインベースラインを一貫して上回り、より正確で、証拠の根拠が良く、より効率的なツール使用トラジェクトリを実現している。
関連論文リスト
- GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision [12.717046652815027]
高解像度のリモートセンシング画像は、通常大規模なシーンをカバーし、ターゲットは極端に小さく、多くの視覚的に類似した邪魔者に囲まれている。
既存のMLLMベースの手法は通常、RSVGを1ステップの座標生成として定式化し、小さなオブジェクトのローカライゼーションや複雑なクエリの不安定な予測につながる可能性がある。
提案するGeoSearcherは, RSVGをアンカー誘導プログレッシブ推論プロセスとして再構成し, 2つの組み合わせの段階を通して実現する。
ACR-SFTでは、アンカー中心の推論データを使用して、重要な視覚的手がかりをアンカーとして表現し、位置、リレーショナル、属性を段階的に統合する。
論文 参考訳(メタデータ) (2026-07-01T15:12:51Z) - GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding [13.76788623862368]
超高解像度(UHR)リモートセンシング画像の解釈には、大規模なシーンにわたってスパースで小さな視覚的証拠を探すモデルが必要である。
既存の視覚言語モデルは、ズームとトリミングツールを使用して地域を検査することができるが、ほとんどの探索戦略は、1ショットの焦点または1つのシーケンシャルな軌跡のいずれかに従う。
提案するGeoVistaは,UHRリモートセンシング解釈のための計画駆動型能動認識フレームワークである。
論文 参考訳(メタデータ) (2026-05-14T07:15:46Z) - GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery [69.05066425853326]
シンキング・ウィズ・イメージ」パラダイムは、マルチモーダルな大規模言語モデル(MLLM)がズームインツールを使って視覚的なシーンを積極的に探索することを可能にする。
これは超高分解能(UHR)リモートセンシングVQAにおいて必須であり、タスク関連キューは疎小である。
筆者らは,(1)冷間開始型SFTデータセット, UHR-CoZ(UHR-CoZ)を多種多様なズームレジームをカバーするトレーニングフレームワークであるGeoEyes,(2)エージェント強化学習手法であるAdaZoom-GRPOを提案する。
論文 参考訳(メタデータ) (2026-02-15T15:50:55Z) - GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization [53.080882980294795]
エージェント視覚推論に関する最近の研究は、深いマルチモーダル理解を可能にするが、主に画像操作ツールに焦点を当てている。
そこで本研究では,視覚的グラウンディングだけでなく,仮説の検証や修正のためにWeb検索も必要とするジオローカライゼーションタスクを再考する。
既存のジオローカライゼーションベンチマークは、高解像度画像の必要性と深部エージェント推論の局所化課題を満たすことができないため、GeoBenchをキュレートする。
推論ループ内にツールの実行をシームレスに統合するエージェントモデルであるGeoVistaを提案し,興味のある領域を拡大するイメージズームインツールと関連する領域を検索するWeb検索ツールを提案する。
論文 参考訳(メタデータ) (2025-11-19T18:59:22Z) - ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks [49.99788276124186]
既存の動的解像度とトークンプルーニング法は受動的知覚パラダイムによって制約される。
本稿では,UHR RS処理におけるアクティブな認識に適した大規模ベンチマークデータセット LRS-GRO を提案する。
ZoomEarthは,より詳細なガイダンスを提供する新しい地域誘導報酬を用いた適応的収穫・造粒フレームワークである。
論文 参考訳(メタデータ) (2025-11-15T15:47:46Z) - ThinkGeo: Evaluating Tool-Augmented Agents for Remote Sensing Tasks [64.86209459039313]
ThinkGeoは、構造化ツールの使用とマルチステップ計画を通じて、リモートセンシングタスクにおけるツール拡張エージェントを評価するために設計されたエージェントベンチマークである。
我々はReActスタイルの対話ループを実装し,486 個の構造化エージェントタスク上でのオープンソース LLM とクローズドソース LLM の両方を1,773 個の専門家が検証した推論ステップで評価する。
分析の結果、ツールの精度とモデル間の計画整合性に顕著な相違が明らかになった。
論文 参考訳(メタデータ) (2025-05-29T17:59:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。