論文の概要: RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning
- arxiv url: http://arxiv.org/abs/2606.28266v1
- Date: Fri, 26 Jun 2026 16:57:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.543123
- Title: RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning
- Title(参考訳): RSICCLLM:リモートセンシング画像変更キャプションのためのマルチモーダル大言語モデル
- Authors: Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu,
- Abstract要約: リモートセンシング画像変化キャプション(RSICC)は、双方向のリモートセンシング画像間の変化を記述することを目的としている。
我々はRSICCLLMを提案する。RSICCLLMはRSSICCにおける大規模視覚言語モデルのための最初の後学習フレームワークである。
- 参考スコア(独自算出の注目度): 49.24254347822435
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Remote Sensing Image Change Captioning (RSICC) aims to describe changes between bi-temporal remote sensing images and holds significant research and application value. However, most existing methods rely on conventional deep learning architectures, and the limited model capacity constrains performance. Although large-model post-training techniques have achieved great success in general domains, their direct transfer to RSICC remains challenging due to data scarcity and the need for fine-grained change understanding. To address this, we propose RSICCLLM, the first post-training framework for large vision-language models in RSICC. Specifically, we design a data generation paradigm, release the instruction dataset RSICI, and establish a task-specific RSICC benchmark. We further introduce Difference-aware Supervised Fine-tuning to explicitly extract change representations and guide the model in perceiving and understanding temporal differences. In addition, we propose Dual-Negative Preference Optimization (DNPO), which employs two complementary negative-sample construction strategies to construct the preference dataset RSICP and further refine model performance. Extensive experiments validate the superior capability of RSICCLLM, which achieves outstanding results with only 7B parameters, surpassing models of substantially larger scales. The code and dataset will be made publicly available at https://github.com/keaill/RSICCLLM.
- Abstract(参考訳): リモートセンシング画像変化キャプション(RSICC)は、双方向のリモートセンシング画像間の変化を記述し、重要な研究と応用価値を保持することを目的としている。
しかし、既存のほとんどの手法は従来のディープラーニングアーキテクチャに依存しており、モデルキャパシティの制限により性能が制限される。
大規模モデルのポストトレーニング技術は一般的なドメインでは大きな成功を収めてきたが、データ不足ときめ細かい変更理解の必要性のため、RSICCへの直接移行は依然として困難である。
そこで我々はRSICCLLMを提案する。RSICCLLMはRSSICCにおける大規模視覚言語モデルのための最初の後学習フレームワークである。
具体的には、データ生成パラダイムを設計し、命令データセット RSICI をリリースし、タスク固有の RSICC ベンチマークを確立する。
さらに、変化表現を明示的に抽出し、時間差の知覚と理解においてモデルを導出するために、差認識監視ファインタニングを導入する。
さらに,2つの相補的な負サンプル構成戦略を用いて,優先データセット RSICP の構築とモデル性能の向上を図るDNPOを提案する。
大規模な実験によりRSICCLLMの優れた性能が検証され、これは7Bパラメータしか持たず、かなり大きなスケールのモデルを上回っている。
コードとデータセットはhttps://github.com/keaill/RSICCLLMで公開されている。
関連論文リスト
- Dual-domain Adaptation Networks for Realistic Image Super-resolution [81.34345637776408]
現実画像超解像(SR)は、現実世界の低解像度(LR)画像を高解像度(HR)画像に変換することに焦点を当てている。
現在の手法は、限られた現実世界のLR-HRデータと競合し、基本的な画像特徴の学習に影響を及ぼす。
我々は、シミュレーションされた画像SRモデルを実世界のデータセットに効率よく適応できる新しいアプローチを提案する。
論文 参考訳(メタデータ) (2025-11-21T12:57:23Z) - Bayesian Natural Gradient Fine-Tuning of CLIP Models via Kalman Filtering [4.681301898136104]
視覚言語による事前学習モデルにおいて、最適性能を達成する上で大きな課題となる微調整は少ない。
本稿では,CLIPモデルに対するカルマンフィルタを用いた自然明度(NGD)のベイズ近似を提案する。
我々のアルゴリズムは、最先端のベースラインよりも優れた、もしくは同等のID性能を一貫して達成する。
論文 参考訳(メタデータ) (2025-11-03T16:00:45Z) - CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning [93.05917922306196]
Composed Image Retrieval (CIR) は、参照画像と修正テキストから対象画像を見つけることを目的としている。
CIR-CoTは、明示的なChain-of-Thought (CoT)推論を統合するために設計された最初のエンドツーエンド検索指向MLLMである。
論文 参考訳(メタデータ) (2025-10-09T09:41:45Z) - Superpixel-informed Continuous Low-Rank Tensor Representation for Multi-Dimensional Data Recovery [17.554617777765866]
低ランクテンソル表現(LRTR)は多次元データ処理の強力なツールとして登場した。
Superpixel-informed Continuous Low-rank Representation (SCTR)フレームワークは、多次元データの連続的かつ柔軟なモデリングを可能にする。
SCTRは、マルチスペクトル画像、ビデオ、カラー画像にまたがる既存のLRTR法よりも3~5dBのPSNRの改善を実現している。
論文 参考訳(メタデータ) (2025-08-17T06:58:42Z) - RS-MoE: A Vision-Language Model with Mixture of Experts for Remote Sensing Image Captioning and Visual Question Answering [23.699493284403967]
本稿では,リモートセンシングに特化してカスタマイズされた,最初のMixture of ExpertベースのVLMであるRS-MoEを提案する。
従来のMoEモデルとは異なり、RS-MoEのコアとなるMoEブロックは、新しいインストラクションルータと複数の軽量言語モデル(LLM)をエキスパートモデルとして組み込んだものである。
本モデルでは, 精度, 文脈に関連のあるキャプションを生成する際に, 最先端の性能を実現する。
論文 参考訳(メタデータ) (2024-11-03T15:05:49Z) - Iterative Soft Shrinkage Learning for Efficient Image Super-Resolution [91.3781512926942]
画像超解像(SR)は、CNNからトランスフォーマーアーキテクチャへの広範なニューラルネットワーク設計を目撃している。
本研究は,市販のネットワーク設計を生かし,基礎となる計算オーバーヘッドを低減するため,超高解像度イテレーションにおけるネットワークプルーニングの可能性について検討する。
本研究では, ランダムネットワークのスパース構造を最適化し, 重要でない重みを小さめに微調整することにより, 反復型軟収縮率(ISS-P)法を提案する。
論文 参考訳(メタデータ) (2023-03-16T21:06:13Z) - CoMAE: Single Model Hybrid Pre-training on Small-Scale RGB-D Datasets [50.6643933702394]
本稿では,RGBと深度変調のための単一モデル自己教師型ハイブリッド事前学習フレームワークについて述べる。
我々のCoMAEは、コントラスト学習とマスク画像モデリングという2つの一般的な自己教師付き表現学習アルゴリズムを統合するためのカリキュラム学習戦略を提示している。
論文 参考訳(メタデータ) (2023-02-13T07:09:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。