論文の概要: UAV as Urban Construction Change Monitor: A New Benchmark and Change Captioning Model
- arxiv url: http://arxiv.org/abs/2605.04409v1
- Date: Wed, 06 May 2026 02:04:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.60277
- Title: UAV as Urban Construction Change Monitor: A New Benchmark and Change Captioning Model
- Title(参考訳): 都市建設変化モニターとしてのUAV:新しいベンチマークと変更キャプションモデル
- Abstract要約: リモートセンシング画像変化キャプション(RSICC)は、両時間画像からシーンの進化に関する空間的基盤を持つ自然言語記述を生成することを目的としている。
現在のメソッドは、構造化された変更セマンティクスを明示的にモデル化することなく、暗黙的な特徴差に頼っている。
共同字幕と検出のためのプロトタイプ誘導フレームワークPTNetを提案する。
- 参考スコア(独自算出の注目度): 17.995187387417563
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Remote Sensing Image Change Captioning (RSICC) aims to generate spatially grounded natural language descriptions of scene evolution from bi-temporal imagery, moving beyond binary change masks toward semantic-level understanding. However, existing methods rely on implicit feature differencing without explicitly modeling structured change semantics, and struggle to reconcile the conflicting representation demands of change detection and caption generation. In addition, current benchmarks provide limited coverage of high-resolution urban construction scenarios. To address these challenges, we propose PTNet, a prototype-guided task-adaptive framework for joint change captioning and detection. PTNet explicitly models structured change semantics through a learnable prototype bank that guides cross-temporal interaction, disentangles task-specific representations via multi-head gating, and injects detection-derived spatial priors into caption generation, enabling coherent semantic correspondence while preserving fine-grained spatial sensitivity. Furthermore, we construct UCCD, a large-scale UAV-based benchmark comprising 9,000 high-resolution image pairs and 45,000 annotated sentences for urban construction monitoring. Extensive experiments on UCCD and WHU-CDC demonstrate that PTNet consistently outperforms existing methods. The dataset and source code are publicly available at https://github.com/G124556/ptnet.
- Abstract(参考訳): Remote Sensing Image Change Captioning (RSICC) は、二項変化マスクを超えて意味レベルの理解へと移行し、両時間画像からシーンの進化に関する空間的基盤を持つ自然言語記述を生成することを目的としている。
しかし、既存の手法は、構造的変化意味論を明示的にモデル化することなく、暗黙的な特徴差に頼っており、変化検出とキャプション生成の矛盾する表現要求を再現するのに苦労している。
さらに、現在のベンチマークでは、高解像度の都市建設シナリオを限定的にカバーしている。
これらの課題に対処するため、PTNetは、共同変更キャプションと検出のためのプロトタイプ化されたタスク適応型フレームワークである。
PTNetは、時間的相互作用をガイドする学習可能なプロトタイプバンクを通じて構造化された変更セマンティクスを明示的にモデル化し、マルチヘッドゲーティングを介してタスク固有の表現を切り離し、検出から派生した空間的事前をキャプション生成に注入し、きめ細かい空間的感度を維持しながらコヒーレントなセマンティクス対応を可能にする。
さらに,都市建設監視のために,9000の高解像度画像対と45,000の注釈文からなる大規模UAVベースのベンチマークUCCDを構築した。
UCCDとWHU-CDCの大規模な実験は、PTNetが既存の手法より一貫して優れていることを示した。
データセットとソースコードはhttps://github.com/G124556/ptnet.comで公開されている。
関連論文リスト
- Spot-the-shift: Evaluating Grounded Image Difference Captioning of Long-term Changes [60.0903155031313]
同じ場所のイメージからの長期的変化の理解は、マップメンテナンスや都市インフラ監視の応用において難しい課題である。
本研究では,現実世界の運転シーンの長期的変化を示す画像差分キャプションの人間検証ベンチマークであるSPOT-the-SHIFTを紹介する。
本研究では,人間の研究によって検証されたモデルのキャプション能力を確実に評価する評価プロトコルを提案する。
論文 参考訳(メタデータ) (2026-09-09T15:52:04Z) - Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - Scene Change Detection with Vision-Language Representation Learning [11.186360973626114]
LangSCDはシーン変化検出のための視覚言語フレームワークで、言語による意味論的推論を取り入れている。
我々は,ニューヨークで収集された8,122個の実世界のイメージペアの大規模データセットであるNYC-CDを紹介した。
論文 参考訳(メタデータ) (2026-04-13T12:43:35Z) - GazeCLIP: Gaze-Guided CLIP with Adaptive-Enhanced Fine-Grained Language Prompt for Deepfake Attribution and Detection [80.12497948980378]
現在のディープフェイク属性やディープフェイク検出作業は、新しい生成方法への一般化が不十分である傾向にある。
適応型きめ細粒度言語プロンプトを用いた新しい視線誘導型CLIPを提案する。
拡散モデルや流れモデルのような新しい発電機上でのネットワークのDFAD性能を評価するために, 新規できめ細かなベンチマークを行う。
CLIPをベースとした視線認識モデルを導入し,顔偽造攻撃の一般化を図った。
論文 参考訳(メタデータ) (2026-03-31T05:59:59Z) - Referring Change Detection in Remote Sensing Imagery [49.841833753558575]
本稿では、自然言語のプロンプトを利用してリモートセンシング画像の変化の特定のクラスを検出するReferring Change Detection (RCD)を紹介する。
我々は, (I) textbfRCDNet, (II) textbfRCDGen, (II) 拡散型合成データ生成パイプラインからなる2段階のフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-12T16:57:12Z) - DiffRIS: Enhancing Referring Remote Sensing Image Segmentation with Pre-trained Text-to-Image Diffusion Models [9.109484087832058]
DiffRISは、RRSISタスクのための事前訓練されたテキスト-画像拡散モデルのセマンティック理解機能を利用する新しいフレームワークである。
我々のフレームワークは、文脈認識アダプタ(CP-adapter)とクロスモーダル推論デコーダ(PCMRD)の2つの重要なイノベーションを導入している。
論文 参考訳(メタデータ) (2025-06-23T02:38:56Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z) - Detect Changes like Humans: Incorporating Semantic Priors for Improved Change Detection [52.62459671461816]
本稿では,視覚基盤モデルからのセマンティックな先入観を取り入れ,変化を検出する能力の向上について検討する。
人間の視覚パラダイムにインスパイアされた新しいデュアルストリーム特徴デコーダは、意味認識特徴と差認識特徴を組み合わせることで変化を区別するために導出される。
論文 参考訳(メタデータ) (2024-12-22T08:27:15Z) - Semantic-CC: Boosting Remote Sensing Image Change Captioning via Foundational Knowledge and Semantic Guidance [19.663899648983417]
本稿では,基礎知識と意味指導に基づく新しい変更キャプション(CC)手法を提案する。
提案手法を LEVIR-CC および LEVIR-CD データセット上で検証する。
論文 参考訳(メタデータ) (2024-07-19T05:07:41Z) - Improving Diversity in Zero-Shot GAN Adaptation with Semantic Variations [61.132408427908175]
0ショットのGAN適応は、よく訓練されたジェネレータを再利用して、目に見えないターゲットドメインの画像を合成することを目的としている。
実際の画像の代わりに1つの代表的テキスト機能しか持たないため、合成された画像は徐々に多様性を損なう。
そこで本研究では,CLIP空間における対象テキストの意味的変化を見つけるための新しい手法を提案する。
論文 参考訳(メタデータ) (2023-08-21T08:12:28Z) - Joint Spatio-Temporal Modeling for the Semantic Change Detection in
Remote Sensing Images [22.72105435238235]
両時間RSI間の「から」意味遷移を明示的にモデル化するための意味変化(SCanFormer)を提案する。
次に,SCDタスクに忠実な Transformer 時間制約を活用する意味学習手法を導入し,意味変化の学習を指導する。
結果として得られたネットワーク(SCanNet)は、決定的意味変化の検出と、得られた両時間的結果のセマンティック一貫性の両方において、ベースライン法より優れている。
論文 参考訳(メタデータ) (2022-12-10T08:49:19Z) - HSVA: Hierarchical Semantic-Visual Adaptation for Zero-Shot Learning [74.76431541169342]
ゼロショット学習(ZSL)は、目に見えないクラス認識の問題に取り組み、目に見えないクラスから目に見えないクラスに意味的な知識を移す。
本稿では,意味領域と視覚領域を協調させる新しい階層型意味視覚適応(HSVA)フレームワークを提案する。
4つのベンチマークデータセットの実験では、HSVAは従来のZSLと一般的なZSLの両方で優れた性能を示す。
論文 参考訳(メタデータ) (2021-09-30T14:27:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。