論文の概要: JL1-CC&QA: Extending the JL1-CD Benchmark with Change Captioning and Question Answering
- arxiv url: http://arxiv.org/abs/2606.31745v1
- Date: Tue, 30 Jun 2026 14:37:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.272091
- Title: JL1-CC&QA: Extending the JL1-CD Benchmark with Change Captioning and Question Answering
- Title(参考訳): JL1-CC&QA:JL1-CDベンチマークの拡張
- Authors: Ziyuan Liu, Ruifei Zhu, Ouqiao Ma, Yuantao Gu,
- Abstract要約: i)JL1-CC、(i)JL1-QA、(ii)JL1-QA、(ii)8種類の質問に対して20,060の質問応答対を提供する。
JL1-CC&QAは、バイナリ変更マスク、変更キャプション、変更指向のQAを同じイメージセット上で統合するベンチマークとして、コミュニティがマルチ化を進める上で価値のあるリソースになることを期待しています。
- 参考スコア(独自算出の注目度): 12.737778296936773
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Remote sensing change detection (CD) traditionally focuses on pixel-level binary segmentation, which identifies where changes occur but neither what nor why. To bridge this semantic gap, we introduce JL1-CC&QA, a multi-task benchmark that extends the JL1-CD dataset with two complementary annotation layers: change captioning (CC) and change question answering (QA). Built upon 5,000 bi-temporal image pairs acquired by the Jilin-1 satellite at 0.5-0.75m ground sample distance, the benchmark comprises: (i) JL1-CC, providing 17,021 quality-verified captions that describe diverse land-cover transformations; and (ii) JL1-QA, offering 20,060 question-answer pairs across eight question types, enabling fine-grained, interactive interrogation of surface changes. All annotations are produced via a three-stage pipeline consisting of multi-modal large language model (LLM) generation, vision-grounded LLM judging, and human expert verification. We hope that JL1-CC&QA, as a benchmark unifying binary change masks, change captions, and change-oriented QA over the same image set, will serve as a valuable resource for the community to advance multi-task change understanding in remote sensing. The dataset is available at https://github.com/circleLZY/JL1-CD.
- Abstract(参考訳): リモートセンシング変化検出(CD)は、伝統的にピクセルレベルのバイナリセグメンテーションに重点を置いている。
このセマンティックギャップを埋めるために、JL1-CC&QAというマルチタスクのベンチマークを導入し、JL1-CDデータセットを2つの補完的なアノテーション層(CC)と変更質問応答(QA)で拡張する。
地lin-1衛星が0.5-0.75mの地上サンプルで取得した5000枚のバイテンポラル画像対に基づいて構築されたこのベンチマークは、以下の通りである。
(i)JL1-CC 多様な土地被覆の変容を記載した17,021字幕
(ii)JL1-QAは,8種類の質問に対して20,060の質問応答ペアを提供する。
すべてのアノテーションは、マルチモーダルな大言語モデル(LLM)生成、視覚的なLLM判定、人間の専門家による検証からなる3段階のパイプラインで作成される。
JL1-CC&QAは、バイナリ変更マスク、変更キャプション、変更指向のQAを同じイメージセット上で統合するベンチマークとして、リモートセンシングにおけるマルチタスク変更理解を促進する上で、コミュニティにとって貴重なリソースとなることを期待する。
データセットはhttps://github.com/circleLZY/JL1-CDで公開されている。
関連論文リスト
- CCRC: A Change-Aware Captioning and Reasoning Chain for Image Change Captioning and Segmentation [22.23249458077542]
Change-Aware Captioning and Reasoning Chain (CCRC)は、空間分割から意味論的推論を分離する二重鎖フレームワークである。
CCRCは、合成および実世界の変更検出ベンチマークの両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-06-27T04:07:31Z) - Decoupling Semantics from Distortions: Multi-Scale Two-Stream Vision-Language Alignment for AI-Generated Image Quality Assessment [0.4790056963046066]
MST-CLIPIQAは、明示的な表現分離によって階層的な視覚言語アライメントを実現するマルチスケールの2ストリームフレームワークである。
アーキテクチャは2つのCLIPエンコーダを補完的なパッチの粒度で利用し、グローバルなセマンティックコヒーレンスをキャプチャする。
実験によって新しい最先端の結果が確立され、品質では1.11パーセントのSRCC、テキスト画像対応予測では2.35パーセントのSRCCが平均的に改善された。
論文 参考訳(メタデータ) (2026-06-15T14:40:30Z) - An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation [55.291219073365546]
textbfMulti-temporal Referring (MTRS) は,多時間画像から言語記述の時間変化を分割することを目的とした新しいタスクである。
MTRSは、時間対応推論、言語接地、ピクセルレベルのマスク予測を共同で要求することで、従来の参照セグメンテーションと変更検出を拡張している。
MTRefSeg-R1は,既存のLVLMベースラインと比較して,強靭かつしばしば優れた性能を示す。
論文 参考訳(メタデータ) (2026-05-31T04:01:10Z) - RSRCC: A Remote Sensing Regional Change Comprehension Benchmark Constructed via Retrieval-Augmented Best-of-N Ranking [0.2446672595462589]
RSRCCは126kの質問を含むリモートセンシング変更質問応答のための新しいベンチマークである。
私たちの知る限りでは、これは、きめ細かい推論に基づく監督のために明示的に設計された、リモートセンシングによる質問応答ベンチマークとしては初めてのものです。
論文 参考訳(メタデータ) (2026-04-22T14:38:41Z) - Referring Change Detection in Remote Sensing Imagery [49.841833753558575]
本稿では、自然言語のプロンプトを利用してリモートセンシング画像の変化の特定のクラスを検出するReferring Change Detection (RCD)を紹介する。
我々は, (I) textbfRCDNet, (II) textbfRCDGen, (II) 拡散型合成データ生成パイプラインからなる2段階のフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-12T16:57:12Z) - GLEAM: Learning to Match and Explain in Cross-View Geo-Localization [66.11208984986813]
CVGL(Cross-View Geo-Localization)は、同じ地理的位置の異なる視点から撮影された画像間の対応を識別することに焦点を当てている。
GLEAM-Cは、UAV画像、ストリートマップ、パノラマ画像、地上写真を含む複数のビューとモダリティを衛星画像のみに合わせる基本CVGLモデルである。
従来のCVGL手法では解釈可能性の欠如に対処するため,クロスビュー対応予測と説明可能な推論を組み合わせたGLEAM-Xを提案する。
論文 参考訳(メタデータ) (2025-09-09T07:14:31Z) - DeltaVLM: Interactive Remote Sensing Image Change Analysis via Instruction-guided Difference Perception [0.846600473226587]
本稿では, リモートセンシング画像変化解析(RSICA)を, 変化検出の強みと視覚的質問応答を組み合わせた新しいパラダイムとして導入する。
対話型RSICAに適したエンドツーエンドアーキテクチャであるDeltaVLMを提案する。
DeltaVLMは, 時間差を捉えた微調整バイテンポラルビジョンエンコーダ, 変化を解釈する相互関係測定機構を備えた視覚差分認識モジュール, クエリ関連差分情報を効果的に抽出する命令誘導Q-フォーマの3つのイノベーションを特徴とする。
論文 参考訳(メタデータ) (2025-07-30T03:14:27Z) - Show Me What and Where has Changed? Question Answering and Grounding for Remote Sensing Change Detection [82.65760006883248]
我々は,CDQAG (Change Detection Question Answering and Grounding) という新しいタスクを導入する。
CDQAGは、解釈可能なテキスト回答と直感的な視覚的証拠を提供することで、従来の変更検出タスクを拡張している。
QAG-360Kと呼ばれる最初のCDQAGベンチマークデータセットを構築し、360K以上の質問、テキスト回答、およびそれに対応する高品質な視覚マスクを含む。
論文 参考訳(メタデータ) (2024-10-31T11:20:13Z) - Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs [71.07108539262721]
低レベルの視覚に関連する人間の言語応答をエミュレートするためのベンチマーク設定を設計する。
我々は,MLLMの低レベルの認識関連質問応答と記述評価を,単一画像から画像ペアへ拡張する。
複数のMLLMが単一の画像に対して十分な低レベルの視覚能力を持つことを示したが、GPT-4Vのみが人間よりも高い精度で比較できる。
論文 参考訳(メタデータ) (2024-02-11T06:44:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。