論文の概要: From Coordinates to Candidate Regions: Temporal Change Localization via Region Selection in Remote Sensing Multimodal LLMs
- arxiv url: http://arxiv.org/abs/2609.08391v1
- Date: Tue, 08 Sep 2026 07:59:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 16:38:25.577295
- Title: From Coordinates to Candidate Regions: Temporal Change Localization via Region Selection in Remote Sensing Multimodal LLMs
- Title(参考訳): コーディネートから候補地域へ:リモートセンシングマルチモーダルLLMにおける領域選択による時間的変化の局在
- Abstract要約: マルチモーダル大言語モデル (RS-MLLM) は、衛星画像に対する高度なシーン理解と視覚的質問応答を持つ。
本稿では,自然画像MLLMで探索された領域選択パラダイムのRS特異的な定式化について述べる。
本フレームワークでは,テキスト条件付き領域提案モジュールを用いて,各候補を空間的および時間的手がかりに富んだフレーム単位の視覚的特徴を持つ特別なトークンとして符号化する。
- 参考スコア(独自算出の注目度): 48.93485452013392
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Remote sensing multimodal large language models (RS-MLLMs) have advanced scene understanding and visual question answering over satellite imagery, yet localizing specific objects or changed regions remains challenging. Existing approaches rely on generating bounding box coordinates as token sequences, which is fragile for the small, densely packed objects common in remote sensing and increasingly error-prone when multiple targets must be localized simultaneously. In this work, we present an RS-specific formulation of the region selection paradigm, previously explored in natural-image MLLMs, and extend it to temporal change localization over multi-image sequences. Our framework employs a text-conditioned region proposal module, encodes each candidate as special tokens carrying per-frame visual features enriched with spatial and temporal cues, and lets the LLM localize targets by selecting region tokens in its response. We construct a multi-task training and evaluation suite spanning localization, referring expression, visual grounding, and understanding tasks across single-image and multi-temporal settings. Experiments show that our approach substantially outperforms coordinate-generation baselines on temporal change localization, while improving single-image visual grounding and maintaining competitive understanding performance. Oracle analysis decomposes the contributions of the region proposer and the LLM selector, providing diagnostic insight unique to this framework. Our code will be available at https://github.com/juwan-kr/RS-RegionSelect.
- Abstract(参考訳): リモートセンシング型マルチモーダル大言語モデル (RS-MLLM) は、衛星画像に対する高度なシーン理解と視覚的質問応答を有するが、特定の物体や変化領域の局所化は依然として困難である。
既存のアプローチでは、トークンシーケンスとしてバウンディングボックス座標を生成することに依存しており、リモートセンシングに共通する小さくて密度の高いオブジェクトには脆弱であり、複数のターゲットを同時にローカライズする必要がある場合にエラーが発生しやすい。
本研究では,自然画像MLLMにおいてこれまで検討されていた領域選択パラダイムのRS特異的な定式化と,それを複数画像列上の時間的変化ローカライゼーションに拡張する。
本フレームワークでは,テキスト条件付き領域提案モジュールを用いて,各候補を空間的および時間的手がかりに富んだフレーム単位の視覚特徴を持つ特別なトークンとしてエンコードし,LLMが応答中の領域トークンを選択してターゲットをローカライズする。
複数タスクのトレーニングと評価スイートを構築し,局所化,表現,視覚的グラウンド化,タスクの理解を単一画像と複数時間設定で行う。
実験により,この手法は時間的変化の局所化における座標生成ベースラインを大幅に上回るとともに,単一画像の視覚的グラウンド化を改善し,競争的理解性能を維持していることが示された。
Oracle分析は、リージョンプロジェクタとLCMセレクタのコントリビューションを分解し、このフレームワーク特有の診断的洞察を提供する。
私たちのコードはhttps://github.com/juwan-kr/RS-RegionSelectで公開されます。
関連論文リスト
- PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle [31.234013315817858]
PixVLは、ピクセルレベルのマルチモーダルな大規模言語モデルのための自己教師付きポストトレーニングフレームワークである。
地域記述を生成し、自己検証し、ラベルのないデータから学習する。
実験によりPixVLは領域理解とセグメンテーションの両方を改善することが示された。
論文 参考訳(メタデータ) (2026-08-02T16:13:52Z) - One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting [51.09550363815034]
シーンテキストスポッティングはテキスト認識と空間的局所化の間に高精度なアライメントを必要とする。
本研究では,個々のテキストインスタンスを単一のアンカー視覚トークンでルーティングする視覚中心のフレームワークであるSingle-Patch Text Spotting (SPaTS)を提案する。
SPaTS はフロンティアのクローズドソースMLLM と OCR MLLM の両方で一貫した性能を示し,その性能を著しく向上させる。
論文 参考訳(メタデータ) (2026-07-30T09:17:48Z) - Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO [43.173161414861966]
Cycle Group Relative Policy Optimization (CycleGRPO) は、マルチモーダル大言語モデル(MLLM)の領域理解とローカライゼーションを共同で最適化する。
1つのMLLMはまずアクターとして地域キャプションを生成し、その後すぐに批評家に移行し、生成されたテキストを空間領域に戻す。
テキストキャプションのセマンティックな識別性を評価するために、品質を意識したトークンレベルのサイクル一貫性報酬を用いる。
論文 参考訳(メタデータ) (2026-07-13T14:00:57Z) - VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models [33.748083718525756]
テキスト・ツー・ポイント・クラウド(T2P)のローカライゼーションは、自然言語記述から3次元ポイント・クラウドマップ内の正確な空間位置を推定することを目的としている。
大規模視覚言語モデルの空間的推論能力を活用するフレームワークであるVLM-Locを提案する。
CityLocの実験では、VLM-Locは最先端の手法に比べて精度と堅牢性に優れていた。
論文 参考訳(メタデータ) (2026-03-10T15:48:25Z) - GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning [8.819428500071007]
視覚言語事前学習モデルは、自然言語によるリモートセンシング画像のブリッジにおいて大きな進歩を遂げている。
リモートセンシングタスクにおける微粒なアライメントを実現する統合フレームワークGeoAlignCLIPを提案する。
RSFG-100kはシーン記述、地域レベルのアノテーション、難易度の高いサンプルを含む微粒なリモートセンシングデータセットである。
論文 参考訳(メタデータ) (2026-03-10T12:12:11Z) - Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought [55.65577137924979]
本稿では,連続的な数値座標を用いたMLLM画像の推論を可能にするフレームワークを提案する。
NV-CoTはMLLM作用空間を離散語彙トークンから連続ユークリッド空間へと拡張する。
3つのベンチマーク実験により、NV-CoTは局所化精度と最終回答精度を大幅に向上することが示された。
論文 参考訳(メタデータ) (2026-02-27T12:04:07Z) - GRASP: Guided Region-Aware Sparse Prompting for Adapting MLLMs to Remote Sensing [50.961694646995376]
GRASP(Guid Region-Aware Sparse Prompting)と呼ばれるパラメータ効率細調整(PEFT)戦略を提案する。
GRASPは、凍結した視覚的トークングリッドから抽出された空間ブロックに関連する空間的構造化されたソフトプロンプトを導入する。
複数のRSVQAベンチマークの実験では、GRASPは既存の微調整やプロンプトベースの手法と比較して競争性能が向上している。
論文 参考訳(メタデータ) (2026-01-23T10:12:59Z) - Teaching VLMs to Localize Specific Objects from In-context Examples [56.797110842152]
現在、視覚言語モデル(VLM)には、状況を考慮した特定の物体をシーン内でローカライズする学習という、基本的な認知能力がないことが分かっています。
この研究は、VLMのパーソナライズされた数ショットのローカライゼーションを探索し、ベンチマークした初めてのものである。
論文 参考訳(メタデータ) (2024-11-20T13:34:22Z) - R-MAE: Regions Meet Masked Autoencoders [113.73147144125385]
我々は、自己教師付き画像表現学習のための単語の潜在的な視覚的類似として領域を探索する。
生成前トレーニングベースラインであるMasked Autoencoding (MAE) に触発されて, 画素群や領域群から学習するためのマスク付き領域オートエンコーディングを提案する。
論文 参考訳(メタデータ) (2023-06-08T17:56:46Z) - Progressive Localization Networks for Language-based Moment Localization [56.54450664871467]
本稿では,言語に基づくモーメントローカライゼーションの課題に焦点を当てる。
既存のほとんどの手法は、まず時間長の候補モーメントをサンプリングし、そのモーメントを決定するために与えられたクエリとマッチングする。
本稿では,ターゲットモーメントを粗い方法で段階的に局所化する多段階プログレッシブ・ローカライゼーション・ネットワーク(PLN)を提案する。
論文 参考訳(メタデータ) (2021-02-02T03:45:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。