論文の概要: TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation
- arxiv url: http://arxiv.org/abs/2603.19039v1
- Date: Thu, 19 Mar 2026 15:38:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 17:19:06.232894
- Title: TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation
- Title(参考訳): TerraScope:地球観測のためのピクセルを取り囲むビジュアル推論
- Authors: Yan Shu, Bin Ren, Zhitong Xiong, Xiao Xiang Zhu, Begüm Demir, Nicu Sebe, Paolo Rota,
- Abstract要約: TerraScopeは、ピクセル地上の地理空間的推論を提供する統合視覚言語モデルである。
また,画素接地による空間的推論のための最初のベンチマークであるTerraScope-Benchを提案する。
- 参考スコア(独自算出の注目度): 71.39112735716172
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) have shown promise in earth observation (EO), yet they struggle with tasks that require grounding complex spatial reasoning in precise pixel-level visual representations. To address this problem, we introduce TerraScope, a unified VLM that delivers pixel-grounded geospatial reasoning with two key capabilities: (1) modality-flexible reasoning: it handles single-modality inputs (optical or SAR) and adaptively fuses different modalities into the reasoning process when both are available; (2) multi-temporal reasoning: it integrates temporal sequences for change analysis across multiple time points. In addition, we curate Terra-CoT, a large-scale dataset containing 1 million samples with pixel-level masks embedded in reasoning chains across multiple sources. We also propose TerraScope-Bench, the first benchmark for pixel-grounded geospatial reasoning with six sub-tasks that evaluates both answer accuracy and mask quality to ensure authentic pixel-grounded reasoning. Experiments show that TerraScope significantly outperforms existing VLMs on pixel-grounded geospatial reasoning while providing interpretable visual evidence.
- Abstract(参考訳): 視覚言語モデル(VLM)は、地球観測(EO)において有望であるが、正確なピクセルレベルの視覚表現において複雑な空間的推論を必要とするタスクに苦慮している。
この問題に対処するために, 1 つの重要な特徴を持つ画素接地された地理空間的推論を提供する統合VLM TerraScopeを紹介した。(1) モーダリティフレキシブル推論: 単一モード入力(光学またはSAR)を処理し, 両方が利用可能である場合, 異なるモーダリティを推論プロセスに適応的に融合する; (2) マルチ時間的推論: 複数の時間点にわたる変化解析のための時間的シーケンスを統合する。
さらに、複数のソースにまたがる推論チェーンに画素レベルのマスクが埋め込まれた100万のサンプルを含む大規模データセットであるTerra-CoTをキュレートする。
また,6つのサブタスクによる画素接地推論のための最初のベンチマークであるTerraScope-Benchを提案する。
実験により、TerraScopeは既存のVLMをピクセル地上の空間的推論において著しく上回り、解釈可能な視覚的証拠を提供することが示された。
関連論文リスト
- OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks [17.287931287864982]
VLM(Vision-Language Models)は、汎用ドメインタスクにおいて効果的な知覚と推論能力を示す。
実地観測シナリオ下でRSVLMを評価するためのベンチマークであるOmniEarthを紹介する。
論文 参考訳(メタデータ) (2026-03-10T10:22:01Z) - EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery [16.896854321525918]
既存の地球画像のベンチマークは主に2次元空間接地、画像キャプション、粗い空間関係に焦点を当てている。
我々は,地球画像上のMLLMの空間的推論を評価するための総合的なベンチマークである textbfEarthSpatialBench を提案する。
1)空間距離と方向に関する定性的かつ定量的な推論、(2)系統的トポロジカルな関係、(3)単目的クエリ、オブジェクトペアクエリ、および合成集約グループクエリ、(4)テキスト記述、ビジュアルオーバーレイ、および2次元境界ボックス、ポリライン、ポリゴンを含む明示的な幾何学座標によって表現されるオブジェクト参照。
論文 参考訳(メタデータ) (2026-02-17T06:08:43Z) - EarthVL: A Progressive Earth Vision-Language Understanding and Generation Framework [37.80969053377522]
マルチタスクデータセット(EarthVLSet)と意味誘導ネットワーク(EarthVLNet)を含む、プログレッシブアースビジョン言語理解フレームワークを提案する。
EarthVLSetには10.9kのサブメートル解像度のリモートセンシング画像、ランドカバーマスク、761.5kのテキストペアが含まれる。
オブジェクト中心の方法では、セマンティックセグメンテーション、リレーショナル推論、包括的な理解を徐々に達成するためにEarthVLNetが提案されている。
論文 参考訳(メタデータ) (2026-01-06T07:41:44Z) - GLEAM: Learning to Match and Explain in Cross-View Geo-Localization [66.11208984986813]
CVGL(Cross-View Geo-Localization)は、同じ地理的位置の異なる視点から撮影された画像間の対応を識別することに焦点を当てている。
GLEAM-Cは、UAV画像、ストリートマップ、パノラマ画像、地上写真を含む複数のビューとモダリティを衛星画像のみに合わせる基本CVGLモデルである。
従来のCVGL手法では解釈可能性の欠如に対処するため,クロスビュー対応予測と説明可能な推論を組み合わせたGLEAM-Xを提案する。
論文 参考訳(メタデータ) (2025-09-09T07:14:31Z) - EarthMind: Leveraging Cross-Sensor Data for Advanced Earth Observation Interpretation with a Unified Multimodal LLM [103.7537991413311]
地球観測(EO)データ分析は、環境と人間の動態のモニタリングに不可欠である。
最近のMultimodal Large Language Models (MLLM) は、EO理解の可能性を秘めているが、シングルセンサー入力に限定されている。
我々は、シングルセンサーとクロスセンサーの両方の入力を処理する統合視覚言語フレームワークであるEarthMindを提案する。
論文 参考訳(メタデータ) (2025-06-02T13:36:05Z) - SegEarth-R1: Geospatial Pixel Reasoning via Large Language Model [61.97017867656831]
暗黙的な問合せと推論を可能にし,対象領域のマスクを生成する新しいタスク,すなわち地理空間的画素推論を導入する。
我々は,5,434枚の手動アノテート画像マスクと3万枚以上の暗黙的な質問応答ペアからなる,EarthReasonという,最初の大規模ベンチマークデータセットを構築し,リリースする。
SegEarth-R1は、推論タスクと参照セグメンテーションタスクの両方で最先端のパフォーマンスを実現し、従来のLCMベースのセグメンテーション手法よりも大幅に優れている。
論文 参考訳(メタデータ) (2025-04-13T16:36:47Z) - GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks [84.86699025256705]
本稿では,地理空間的タスクの視覚言語モデル(VLM)を評価するためのベンチマークであるGEOBench-VLMを提案する。
私たちのベンチマークでは、手動で検証された命令が1万以上あり、さまざまな視覚条件、オブジェクトタイプ、スケールにまたがっています。
地理空間固有の課題における性能を評価するために,いくつかの最先端のVLMを評価した。
論文 参考訳(メタデータ) (2024-11-28T18:59:56Z) - Deep Multimodal Fusion for Semantic Segmentation of Remote Sensing Earth Observation Data [0.08192907805418582]
本稿では,セマンティックセグメンテーションのための後期融合深層学習モデル(LF-DLM)を提案する。
1つのブランチは、UNetFormerがキャプチャした空中画像の詳細なテクスチャと、ViT(Multi-Axis Vision Transformer)バックボーンを統合する。
もう一方のブランチは、U-ViNet(U-TAE)を用いてSentinel-2衛星画像Max時系列から複雑な時間ダイナミクスをキャプチャする。
論文 参考訳(メタデータ) (2024-10-01T07:50:37Z) - EarthVQA: Towards Queryable Earth via Relational Reasoning-Based Remote
Sensing Visual Question Answering [11.37120215795946]
本研究では,多モードマルチタスクVQAデータセット(EarthVQA)を開発した。
EarthVQAデータセットには6000の画像、対応するセマンティックマスク、都市と農村のガバナンス要件を組み込んだ208,593のQAペアが含まれている。
本稿では,オブジェクト中心の方法でVQAを進めるためのセマンティックオブジェクト認識フレームワーク(SOBA)を提案する。
論文 参考訳(メタデータ) (2023-12-19T15:11:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。