論文の概要: RS-RIE-Bench: Benchmarking Reasoning-Guided Remote Sensing Image Editing
- arxiv url: http://arxiv.org/abs/2607.20197v1
- Date: Wed, 22 Jul 2026 14:20:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.110778
- Title: RS-RIE-Bench: Benchmarking Reasoning-Guided Remote Sensing Image Editing
- Title(参考訳): RS-RIE-Bench:Reasoning-Guided Remote Sensing ImageEditingのベンチマーク
- Authors: Zihan Qin, Boao Xu, Zhao Dong, Yingping Sun, Ziheng Jiao, Junying Wang, Hongwei Wang,
- Abstract要約: 推論誘導型リモートセンシング画像編集のための最初のベンチマークであるRS-RIE-Benchを紹介する。
RS-RIE-Benchは、タスクを時間的推論、因果推論、空間的推論の3つのカテゴリに分類する。
RS-RIE-Benchは、地理的推論、地域制御、センサ一貫性生成において、現在のモデルの限界を効果的に明らかにすることができることを示す。
- 参考スコア(独自算出の注目度): 12.884320589072985
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Remote sensing image editing aims to modify remote sensing images according to natural language instructions while preserving geographic rules and sensor observation characteristics. Existing benchmarks mainly target natural images or general visual scenes, and thus may not fully capture the reasoning, regional control, and sensor-consistency abilities required in remote sensing editing. To fill this gap, we introduce RS-RIE-Bench, the first benchmark for reasoning-guided remote sensing image editing. RS-RIE-Bench organizes tasks into three categories: temporal reasoning, causal reasoning, and spatial reasoning. These categories capture temporal evolution, causal consequence, and spatial imaging consistency in remote sensing scenes. The evaluation protocol covers three dimensions: target region plausibility, non-target region preservation, and image quality consistency. We further demonstrate the feasibility of MLLM-based evaluation through cross-judge consistency analysis and stratified expert review. Systematic evaluation on eight open-source and closed-source image editing models shows that current models still have clear limitations in reasoning-guided remote sensing editing. Even the strongest model achieves only 24.28\% overall accuracy under the strict joint-satisfaction criterion, while the mean relaxed joint-4 success rate across all eight models is 32.23\%. Causal reasoning and spatial reasoning remain especially challenging, and several open-source models are close to zero in some categories. These results show that RS-RIE-Bench can effectively reveal the limitations of current models in geographic reasoning, regional control, and sensor-consistent generation. It also provides a standardized benchmark and a clear research direction for future remote sensing intelligent editing models.
- Abstract(参考訳): リモートセンシング画像編集は、地理的規則とセンサ観察特性を保ちながら、自然言語の指示に従ってリモートセンシング画像を修正することを目的としている。
既存のベンチマークは、主に自然画像や一般的な視覚シーンをターゲットにしているため、リモートセンシング編集に必要な推論、地域制御、センサ一貫性の能力を完全には捉えていない可能性がある。
このギャップを埋めるために、推論誘導型リモートセンシング画像編集のための最初のベンチマークであるRS-RIE-Benchを紹介する。
RS-RIE-Benchは、タスクを時間的推論、因果推論、空間的推論の3つのカテゴリに分類する。
これらのカテゴリは、リモートセンシングシーンにおける時間的進化、因果関係、空間的画像の一貫性を捉えている。
評価プロトコルは,対象領域の可視性,非対象領域の保存,画質の整合性という3つの次元を網羅する。
さらに, MLLMに基づく評価の実現可能性について, クロスジャッジの整合性解析と階層化された専門家レビューにより検証した。
8つのオープンソースおよびクローズドソース画像編集モデルの体系的評価は、現在のモデルには推論誘導リモートセンシング編集における明確な制限があることを示している。
最強モデルでさえ、厳密なジョイントサファクト基準の下での全体的な精度は24.28\%に過ぎず、平均的な8モデル間でのジョイント4の成功率は32.23\%である。
因果推論と空間的推論は依然として特に困難であり、いくつかのオープンソースモデルはいくつかのカテゴリにおいてゼロに近い。
これらの結果から、RS-RIE-Benchは、地理的推論、地域制御、センサ一貫性生成における現在のモデルの限界を効果的に明らかにすることができる。
また、将来のリモートセンシングインテリジェントな編集モデルに対して、標準化されたベンチマークと明確な研究方向を提供する。
関連論文リスト
- ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning [8.61070160184202]
ROVERは、効率的なグローバルな視覚的エビデンスルーティングのための学習可能なプラグインである。
本手法は,MM-GCoT と VideoEspresso で最高の性能を実現する。
論文 参考訳(メタデータ) (2026-05-27T04:52:42Z) - RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning [61.84363374647606]
リモートセンシングビジュアルグラウンドディング(RSVG)は、自然言語記述に基づく大規模空中画像における対象物体のローカライズを目的としている。
これらの記述はしばしば位置的手がかりに大きく依存しており、空間的推論においてMLLM(Multimodal Large Language Models)に固有の課題を提起している。
空間理解の高度化を図るために,textbfRSGround-R1 と呼ばれる推論誘導型位置認識後学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T12:35:57Z) - MMGR: Multi-Modal Generative Reasoning [97.44203203196481]
本稿では,5つの推論能力に基づく基本的評価フレームワークMMGRを紹介する。
MMGRは、抽象推論(Abstract Reasoning)、体操ナビゲーション(Embodied Navigation)、物理コモンセンス(Physical Commonsense)の3つの領域にわたる生成的推論を評価する。
主要映像モデル(Veo-3, Sora-2, Wan-2.2)と画像モデル(Nano-banana, Nano-banana Pro, GPT-4o-image, Qwen-image)をベンチマークする。
論文 参考訳(メタデータ) (2025-12-16T18:58:04Z) - RS-ISRefiner: Towards Better Adapting Vision Foundation Models for Interactive Segmentation of Remote Sensing Images [17.648922817109224]
RS-ISRefinerは、リモートセンシング画像に適したクリックベースのIISフレームワークである。
セグメンテーション精度、効率、相互作用コストの点で、最先端IIS法を一貫して上回っている。
論文 参考訳(メタデータ) (2025-11-30T04:12:43Z) - PIGUIQA: A Physical Imaging Guided Perceptual Framework for Underwater Image Quality Assessment [59.9103803198087]
水中画像品質評価(UIQA)のための物理画像ガイド型知覚フレームワークを提案する。
水中放射移動理論を応用して、物理に基づく画像推定を統合して、これらの歪みの定量的な測定値を確立する。
提案モデルは,画像品質のスコアを正確に予測し,最先端の性能を実現する。
論文 参考訳(メタデータ) (2024-12-20T03:31:45Z) - Manifold Constraint Regularization for Remote Sensing Image Generation [34.68714863219855]
GAN(Generative Adversarial Networks)は、リモートセンシング領域における顕著な成果を示している。
本稿では,リモートセンシング画像の特徴を分析し,多様体制約正規化を提案する。
論文 参考訳(メタデータ) (2023-05-31T02:35:41Z) - AGO-Net: Association-Guided 3D Point Cloud Object Detection Network [86.10213302724085]
ドメイン適応によるオブジェクトの無傷な特徴を関連付ける新しい3D検出フレームワークを提案する。
我々は,KITTIの3D検出ベンチマークにおいて,精度と速度の両面で最新の性能を実現する。
論文 参考訳(メタデータ) (2022-08-24T16:54:38Z) - Textural-Structural Joint Learning for No-Reference Super-Resolution
Image Quality Assessment [59.91741119995321]
我々は、TSNetと呼ばれる品質予測のためのテキスト情報と構造情報を共同で探索するデュアルストリームネットワークを開発した。
画像の重要な領域に注意を払っている人間の視覚システム(HVS)を模倣することにより、視覚に敏感な領域をより区別しやすくするための空間的注意機構を開発する。
実験の結果,提案したTSNetは現状のIQA法よりも視覚的品質を正確に予測し,人間の視点との整合性を示した。
論文 参考訳(メタデータ) (2022-05-27T09:20:06Z) - Cross-Sensor Adversarial Domain Adaptation of Landsat-8 and Proba-V
images for Cloud Detection [1.5828697880068703]
同様の特徴を持つ光学センサーを搭載した地球観測衛星の数は、常に増え続けている。
抽出された放射能の差は精度を著しく低下させ、センサー間の知識と情報共有を損なう。
本稿では,2つの衛星センサ間の画像の統計的差異を低減し,転送学習モデルの性能を向上させるための領域適応を提案する。
論文 参考訳(メタデータ) (2020-06-10T16:16:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。