論文の概要: SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
- arxiv url: http://arxiv.org/abs/2605.10576v1
- Date: Mon, 11 May 2026 13:48:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.860687
- Title: SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
- Title(参考訳): SenseBench: 大規模視覚言語モデルにおけるリモートセンシング低レベル視覚知覚と記述のためのベンチマーク
- Authors: Chen Zhong, Xiao An, Jiaxing Sun, Zihan Gui, Guangyi Yang, Wei He,
- Abstract要約: 低レベルの視覚知覚は、信頼できるリモートセンシング(RS)画像解析の基盤となる。
現在の画像品質評価(IQA)手法は、物理駆動RS劣化を特徴付けるのではなく、解釈不能なスカラースコアを出力する。
SenseBenchは、RS低レベル視覚知覚と記述のための最初の専用診断ベンチマークである。
- 参考スコア(独自算出の注目度): 9.606452752502708
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Low-level visual perception underpins reliable remote sensing (RS) image analysis, yet current image quality assessment (IQA) methods output uninterpretable scalar scores rather than characterizing physics-driven RS degradations, deviating markedly from the diagnostic needs of RS experts. While Vision-Language Models (VLMs) present a compelling alternative by delivering language-grounded IQA, their visual priors are heavily biased toward ground-level natural images. Consequently, whether VLMs can overcome this domain gap to perceive and articulate RS artifacts remains insufficiently studied. To bridge this gap, we propose \textbf{SenseBench}, the first dedicated diagnostic benchmark for RS low-level visual perception and description. Driven by a physics-based hierarchical taxonomy that unifies both non-reference and reference-based paradigms, SenseBench features over 10K meticulously curated instances across 6 major and 22 fine-grained RS degradation categories. Specifically, two complementary protocols are designed for evaluation: objective low-level visual \textit{perception} and subjective diagnostic \textit{description}. Comprehensive evaluation of 29 state-of-the-art VLMs reveals not only skewed domain priors and multi-distortion collapse, but also \textit{fluency illusion} and a \textit{perception-description inversion} effect. We hope SenseBench provides a robust evaluation testbed and high-quality diagnostic data to advance the development of VLMs in RS low-level perception. Code and datasets are available \href{https://github.com/Zhong-Chenchen/SenseBench}{\textcolor{blue}{here}}.
- Abstract(参考訳): 低レベルの視覚知覚は、信頼性のあるリモートセンシング(RS)画像解析を基盤としていますが、現在の画像品質評価(IQA)手法は、物理駆動のRS劣化を特徴付けるのではなく、解釈不能なスカラースコアを出力します。
VLM(Vision-Language Models)は、言語基底IQAを提供することによって、魅力的な代替手段を提供するが、その視覚的前提は、地上レベルの自然画像に大きく偏っている。
したがって、VLMがこの領域ギャップを克服し、RSアーティファクトを知覚し、明瞭化するか否かは、まだ十分に研究されていない。
このギャップを埋めるために、我々は、RS低レベル視覚知覚と記述のための最初の専用の診断ベンチマークである \textbf{SenseBench} を提案する。
SenseBenchは、非参照パラダイムと参照ベースパラダイムの両方を統一する物理ベースの階層的分類によって駆動され、主要な6つのRS分解カテゴリと22のきめ細かいRS分解カテゴリに10K以上の細かなキュレートされたインスタンスを特徴付ける。
具体的には、2つの補完プロトコルが評価のために設計されている: 客観的な低レベル視覚的 \textit{perception} と主観的診断 \textit{description} である。
29個の最先端VLMの包括的評価は、歪んだドメイン先行と多歪み崩壊だけでなく、 \textit{fluency illusion} や \textit{perception-description inversion} 効果も示している。
SenseBenchは、RS低レベル知覚におけるVLMの開発を促進するために、堅牢な評価テストベッドと高品質な診断データを提供することを期待している。
コードとデータセットは \href{https://github.com/Zhong-Chenchen/SenseBench}{\textcolor{blue}{here}} で入手できる。
関連論文リスト
- Towards Realistic Open-Vocabulary Remote Sensing Segmentation: Benchmark and Baseline [52.65099689153431]
オープンボキャブラリリモートセンシングイメージセグメンテーション(OVRSIS)は、データセットの断片化、トレーニングの多様性の制限、評価ベンチマークの欠如などにより、まだ探索されていない。
我々はOVRSISの大規模かつアプリケーション指向のベンチマークである textitOVRSISBenchV2 を提案する。
以上の結果から,リアルなベンチマーク設計の重要性と,OVRSISの摂動型転送の有効性が示唆された。
論文 参考訳(メタデータ) (2026-04-17T02:49:46Z) - Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing [76.2602505940467]
既存のモデルは、しばしば視覚的に密集したチャートに苦しむため、データの欠落、修正ミス、幻覚などのエラーにつながる。
複雑なチャートを読む際の精度を確保するために指を視覚アンカーとして使うという人間の戦略に触発され、視覚自己認識(VSR)と呼ばれる新しいパラダイムを提案する。
VSRの中核となる考え方は、モデルがピクセルレベルのローカライゼーション出力を生成し、それらを視覚化し、それらの視覚化を自身にフィードバックし、直感的にその潜在的な視覚的認識エラーを検査し修正できるようにすることである。
論文 参考訳(メタデータ) (2026-02-18T13:40:53Z) - Text Before Vision: Staged Knowledge Injection Matters for Agentic RLVR in Ultra-High-Resolution Remote Sensing Understanding [78.26501371437013]
超高解像度(UHR)リモートセンシング(RS)のためのマルチモーダル推論は通常、視覚的エビデンス取得によってボトルネックとなる。
標準的な強化学習は、ドメインの事前構造がなくても、これらの広大な視覚空間をナビゲートするのに苦労している。
本研究では,(1)スケーラブルで知識グラフで検証された地球科学のテキストQAで冷間開始して推論構造を挿入し,(2)SFT中に同じ硬いUHR画像テキストの例で事前ウォーミングを行い,その後のツールベースのRLを安定化・増幅する,段階的な知識注入レシピを提案する。
論文 参考訳(メタデータ) (2026-02-15T16:40:33Z) - Route, Retrieve, Reflect, Repair: Self-Improving Agentic Framework for Visual Detection and Linguistic Reasoning in Medical Imaging [3.6136448489318695]
医用イメージングを4つの協調エージェントに分解するエージェントフレームワークであるR4を提案する。
R4 は LLM-as-a-Judge のスコアを約 +1.7-2.5 で、mAP50 は 2.5-+3.5 の絶対点を強い単VLM ベースライン上で連続的に引き上げる。
論文 参考訳(メタデータ) (2026-01-13T03:44:06Z) - Investigate the Low-level Visual Perception in Vision-Language based Image Quality Assessment [7.969076042774561]
低レベルの歪み知覚タスクを導入し、モデルが特定の歪みタイプを分類する必要がある。
解析の結果,MLLMは構造的にそのような歪みを表現できるが,トレーニングテンプレートに適合しがちであることがわかった。
視覚エンコーダのアライメントを改善することで、歪み認識精度が劇的に向上し、14.92%から84.43%に向上することを示す。
論文 参考訳(メタデータ) (2025-12-10T12:06:47Z) - XBench: A Comprehensive Benchmark for Visual-Language Explanations in Chest Radiography [6.447908430647854]
胸部X線におけるクロスモーダル解釈性を評価するための最初の体系的ベンチマークを示す。
我々は,クロスアテンションと類似性に基づくローカライズマップを用いた視覚的説明を生成する。
複数の病理組織を横断する放射線診断領域とのアライメントを定量的に評価した。
論文 参考訳(メタデータ) (2025-10-22T13:52:19Z) - BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models [2.526146573337397]
眼科診断に触発された新しい評価手法を提案する。
合成画像のプロシージャ生成を用いて視覚特性の制御を行う。
この診断は、系統的なストレステストときめ細かい故障解析を可能にする。
論文 参考訳(メタデータ) (2025-06-05T12:43:10Z) - TokBench: Evaluating Your Visual Tokenizer before Visual Generation [75.38270351179018]
さまざまな画像トークンやVAEに対して,テキストと顔の復元品質をさまざまな尺度で分析する。
以上の結果から, 現代の視覚トークン化器は, 特に小規模では, 細粒度保存に苦慮していることが明らかとなった。
論文 参考訳(メタデータ) (2025-05-23T17:52:16Z) - Multi-Modal Prompt Learning on Blind Image Quality Assessment [65.0676908930946]
画像品質評価(IQA)モデルは意味情報から大きな恩恵を受け、異なる種類のオブジェクトを明瞭に扱うことができる。
十分な注釈付きデータが不足している従来の手法では、セマンティックな認識を得るために、CLIPイメージテキスト事前学習モデルをバックボーンとして使用していた。
近年のアプローチでは、このミスマッチに即時技術を使って対処する試みがあるが、これらの解決策には欠点がある。
本稿では、IQAのための革新的なマルチモーダルプロンプトベースの手法を提案する。
論文 参考訳(メタデータ) (2024-04-23T11:45:32Z) - Dense Label Encoding for Boundary Discontinuity Free Rotation Detection [69.75559390700887]
本稿では,分類に基づく比較的研究の少ない方法論について検討する。
我々は2つの側面でフロンティアを推し進めるための新しい手法を提案する。
航空画像のための大規模公開データセットの実験と視覚解析は,我々のアプローチの有効性を示している。
論文 参考訳(メタデータ) (2020-11-19T05:42:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。