論文の概要: CogVis: Must Open-Vocabulary Change Detection Perceive the Scene Anew for Every Query?
- arxiv url: http://arxiv.org/abs/2608.06150v1
- Date: Thu, 06 Aug 2026 15:18:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.941292
- Title: CogVis: Must Open-Vocabulary Change Detection Perceive the Scene Anew for Every Query?
- Title(参考訳): CogVis: クエリ毎に新たなシーンを認識するには,オープン語彙変更検出が必要か?
- Abstract要約: 地球表面モニタリングは、任意の意味圏を認識できる変化検出モデルを必要とする。
Open-Vocabulary Change Detection (OVCD)はこのニーズに対処する。
我々は,OVCDを認知メモリ検証パラダイムとして再構成する認知記憶誘導フレームワークであるCogVisを提案する。
- 参考スコア(独自算出の注目度): 12.117404924867804
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Earth-surface monitoring requires change detection models capable of recognizing arbitrary semantic categories. Open-Vocabulary Change Detection (OVCD) addresses this need. However, existing methods often entangle temporal perception, semantic discrimination, and region verification, causing unstable results and redundant computation. Inspired by human visual change perception, we propose CogVis, a cognitive memory-guided framework that reformulates OVCD as a perception-memory-verification paradigm. CogVis first employs a Scene Change Perceptron (SCP) to extract a reusable, category-agnostic change prior from frozen bi-temporal features, thereby decoupling temporal evidence from semantic category decisions. A Semantic Memory Calibrator (SMC) then compensates for category-dependent score shifts by dynamically estimating an image-query-specific decision threshold. Finally, an Adaptive Region Filter (ARF) filters connected candidates using learned semantic, temporal, and structural reliability. Experiments on seven benchmarks spanning semantic change detection, binary change localization, and building-damage assessment show that CogVis achieves state-of-the-art performance across all evaluated datasets. By sharing scene-level change perception, CogVis further avoids repeating category-agnostic temporal perception across queries and improves inference throughput by 28.50%.
- Abstract(参考訳): 地球表面モニタリングは、任意の意味圏を認識できる変化検出モデルを必要とする。
Open-Vocabulary Change Detection (OVCD)はこのニーズに対処する。
しかし、既存の手法はしばしば時間的知覚、意味的識別、領域検証を絡め、不安定な結果と冗長な計算を引き起こす。
人間の視覚的変化知覚に触発され,OVCDを認知メモリ検証パラダイムとして再構成する認知記憶誘導フレームワークであるCogVisを提案する。
CogVisはまず、凍結した両時間的特徴から再利用可能なカテゴリ非依存的な変化を抽出するために、Scene Change Perceptron (SCP)を使用しており、これにより、意味的カテゴリー決定から時間的証拠を分離する。
次に、セマンティックメモリ校正器(SMC)は、画像クエリ固有の決定しきい値を動的に推定することにより、カテゴリ依存のスコアシフトを補償する。
最後に、アダプティブリージョンフィルタ(ARF)は、学習されたセマンティクス、時間的、構造的信頼性を使って、接続された候補をフィルタリングする。
セマンティックチェンジ検出、バイナリチェンジローカライゼーション、ビルディングダメージアセスメントを含む7つのベンチマークの実験は、CogVisがすべての評価データセットで最先端のパフォーマンスを達成することを示している。
シーンレベルの変化知覚を共有することで、CagVisはさらにクエリ間でカテゴリに依存しない時間知覚の繰り返しを回避し、推論スループットを28.50%向上させる。
関連論文リスト
- ReA-OVCD: Reliability-Aware Open-Vocabulary Change Detection via Semantic and Spatial Refinement [8.855406881644702]
本稿では, 信頼性に配慮したオープンボキャブラリ変化検出フレームワークを提案する。
まず、ピクセル単位のセマンティックな違いから候補変更領域を導出し、フレキシブルで詳細なローカライゼーションを保証する。
次に、意味的視点と空間的視点の両方から変化の妥当性を明示的にモデル化するための協調的な改善戦略を導入する。
論文 参考訳(メタデータ) (2026-06-18T10:05:45Z) - MemOVCD: Training-Free Open-Vocabulary Change Detection via Cross-Temporal Memory Reasoning and Global-Local Adaptive Rectification [25.164480665248792]
Open-vocabulary Change Detectionは、定義済みのカテゴリを使わずに、両時間的リモートセンシング画像の意味的変化を特定することを目的としている。
本稿では,時間外メモリ推論とグローバル局所適応補正に基づく学習自由なオープン語彙変化検出フレームワークであるMemOVCDを提案する。
論文 参考訳(メタデータ) (2026-04-29T15:05:37Z) - Seeking Consensus: Geometric-Semantic On-the-Fly Recalibration for Open-Vocabulary Remote Sensing Semantic Segmentation [27.476148859056114]
SeeCoは、リモートセンシング画像におけるトレーニング不要のOVSSモデルのパフォーマンスを向上させるための、プラグアンドプレイフレームワークである。
デュアルコンセンサスを求めることにより、任意のOVSSモデルをオンザフライで再分類する。
8つのリモートセンシングOVSSベンチマークの実験は、一貫した利得を示している。
論文 参考訳(メタデータ) (2026-04-29T01:57:21Z) - Seg2Change: Adapting Open-Vocabulary Semantic Segmentation Model for Remote Sensing Change Detection [5.3514684920696824]
既存の変更検出方法は、トレーニングデータセットの事前定義されたクラスに限られる。
オープン語彙セマンティックセグメンテーションモデルに適応して検出タスクを変更するためのアダプタであるSeg2Changeを提案する。
我々のフレームワークは最先端のOVCD性能を実現する。
論文 参考訳(メタデータ) (2026-04-13T09:35:14Z) - OpenDPR: Open-Vocabulary Change Detection via Vision-Centric Diffusion-Guided Prototype Retrieval for Remote Sensing Imagery [22.361232756908095]
Open-vocabulary Change Detection (OVCD) は、定義済みクラスの固定セットを超えた一般化を可能にすることで、任意の関心の変化を認識することを目指している。
まず、SAMやDINOv2のような視覚基盤モデル(VFM)を用いてクラスに依存しない変更提案を生成し、CLIPのような視覚言語モデル(VLM)を用いてカテゴリ識別を行う。
トレーニング不要な視覚中心拡散誘導型プロトタイプ検索フレームワークOpenDPRを提案する。
論文 参考訳(メタデータ) (2026-03-29T11:43:02Z) - Referring Change Detection in Remote Sensing Imagery [49.841833753558575]
本稿では、自然言語のプロンプトを利用してリモートセンシング画像の変化の特定のクラスを検出するReferring Change Detection (RCD)を紹介する。
我々は, (I) textbfRCDNet, (II) textbfRCDGen, (II) 拡散型合成データ生成パイプラインからなる2段階のフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-12T16:57:12Z) - Crane: Context-Guided Prompt Learning and Attention Refinement for Zero-Shot Anomaly Detection [50.343419243749054]
異常検出は、医学診断や工業的欠陥検出などの分野において重要である。
CLIPの粗粒化画像テキストアライメントは、微粒化異常に対する局所化と検出性能を制限する。
クレーンは最先端のZSADを2%から28%に改善し、画像レベルとピクセルレベルの両方で、推論速度では競争力を維持している。
論文 参考訳(メタデータ) (2025-04-15T10:42:25Z) - Detect Changes like Humans: Incorporating Semantic Priors for Improved Change Detection [52.62459671461816]
本稿では,視覚基盤モデルからのセマンティックな先入観を取り入れ,変化を検出する能力の向上について検討する。
人間の視覚パラダイムにインスパイアされた新しいデュアルストリーム特徴デコーダは、意味認識特徴と差認識特徴を組み合わせることで変化を区別するために導出される。
論文 参考訳(メタデータ) (2024-12-22T08:27:15Z) - Show Me What and Where has Changed? Question Answering and Grounding for Remote Sensing Change Detection [82.65760006883248]
我々は,CDQAG (Change Detection Question Answering and Grounding) という新しいタスクを導入する。
CDQAGは、解釈可能なテキスト回答と直感的な視覚的証拠を提供することで、従来の変更検出タスクを拡張している。
QAG-360Kと呼ばれる最初のCDQAGベンチマークデータセットを構築し、360K以上の質問、テキスト回答、およびそれに対応する高品質な視覚マスクを含む。
論文 参考訳(メタデータ) (2024-10-31T11:20:13Z) - Fine-grained Recognition with Learnable Semantic Data Augmentation [68.48892326854494]
きめ細かい画像認識は、長年続くコンピュータビジョンの課題である。
本稿では,識別領域損失問題を軽減するため,特徴レベルのトレーニングデータを多様化することを提案する。
本手法は,いくつかの人気分類ネットワーク上での一般化性能を著しく向上させる。
論文 参考訳(メタデータ) (2023-09-01T11:15:50Z) - Adversarial Feature Augmentation and Normalization for Visual
Recognition [109.6834687220478]
最近のコンピュータビジョンの進歩は、分類モデルの一般化能力を改善するために、逆データ拡張を利用する。
本稿では,中間的特徴埋め込みにおける敵対的拡張を提唱する効率的かつ効率的な代替手法を提案する。
代表的なバックボーンネットワークを用いて,多様な視覚認識タスクにまたがる提案手法を検証する。
論文 参考訳(メタデータ) (2021-03-22T20:36:34Z) - Dense Label Encoding for Boundary Discontinuity Free Rotation Detection [69.75559390700887]
本稿では,分類に基づく比較的研究の少ない方法論について検討する。
我々は2つの側面でフロンティアを推し進めるための新しい手法を提案する。
航空画像のための大規模公開データセットの実験と視覚解析は,我々のアプローチの有効性を示している。
論文 参考訳(メタデータ) (2020-11-19T05:42:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。