論文の概要: Different Changes Require Different Reasoning: Change-Type-Specialized Experts for Robust Change Captioning
- arxiv url: http://arxiv.org/abs/2609.01136v1
- Date: Tue, 01 Sep 2026 12:11:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.619024
- Title: Different Changes Require Different Reasoning: Change-Type-Specialized Experts for Robust Change Captioning
- Title(参考訳): 異なる変更は異なる推論を必要とする:ロバストな変更キャプションのための変更型特化専門家
- Authors: Jiyoung Park, InJae Oh, Jung Uk Kim,
- Abstract要約: MEDIC(Multi-Expert Diagnosis for Image Change)は、変化カテゴリを明示的にモデル化することによって変化型認識を導入する新しいフレームワークである。
MEDICはタイプ特殊化メモリの専門家を採用しており、入力に条件付けられたタイプ関連視覚パターンを動的に検索する。
タイプ特殊化の専門家間で入力をソフトにルーティングし、変更カテゴリごとに専用の表現を学ぶことで、MEDICはより正確でタイプ対応な変更記述を生成する。
- 参考スコア(独自算出の注目度): 19.418830080403122
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Change captioning is the task of generating natural language descriptions that explain the changes between a pair of images. Although different change types (e.g., color shifts, object additions) exhibit distinct visual cues and require specialized reasoning processes, existing methods often overlook these distinctions. To address this limitation, we propose Multi-Expert Diagnosis for Image Change (MEDIC), a novel framework that introduces change-type awareness by explicitly modeling change categories. MEDIC employs type-specialized memory experts that dynamically retrieve type-relevant visual patterns conditioned on the input. This design enables each expert to capture diverse variations within its change type while focusing on the most informative visual cues. By softly routing inputs across type-specialized experts and learning dedicated representations for each change category, MEDIC generates more precise and type-aware change descriptions. Extensive experiments demonstrate that the proposed MEDIC consistently outperforms existing methods across diverse and challenging datasets. The code is available at \href{https://github.com/VisualAIKHU/MEDIC}{GitHub}.
- Abstract(参考訳): 変更キャプションは、一対のイメージ間の変更を説明する自然言語記述を生成するタスクである。
異なる変更タイプ(例えば、色シフト、オブジェクトの追加)は異なる視覚的手がかりを示し、特別な推論プロセスを必要とするが、既存の手法はしばしばこれらの区別を見落としている。
この制限に対処するために,変化カテゴリを明示的にモデル化して変化型認識を導入する新しいフレームワークであるMEDICを提案する。
MEDICはタイプ特殊化メモリの専門家を採用しており、入力に条件付けられたタイプ関連視覚パターンを動的に検索する。
この設計により、各専門家は、最も有意義な視覚的手がかりに注目しながら、変更タイプのさまざまなバリエーションをキャプチャできる。
タイプ特殊化の専門家間で入力をソフトにルーティングし、変更カテゴリごとに専用の表現を学ぶことで、MEDICはより正確でタイプ対応な変更記述を生成する。
大規模な実験により、提案されたMEDICは、多種多様な挑戦的なデータセットで既存のメソッドを一貫して上回っていることが示された。
コードは \href{https://github.com/VisualAIKHU/MEDIC}{GitHub} で公開されている。
関連論文リスト
- DFM: Difference Feature Modeling with Text-Guided Gated Contrastive Loss for Remote Sensing Image Change Captioning [30.75534244211688]
リモートセンシング画像変化キャプション(RSICC)のエンコーダは、異なる時刻にキャプチャされたリモートセンシング画像間の変化を自動生成する。
本稿では,1つの自己回帰生成パラダイムを置き換えるための差分特徴モデリング(DFM)フレームワークを提案する。
特に,テキストモダルの観点から重要な特徴を抽出するビジョンを導くために,テキストガイド付きGated Contrastive Loss (TGCL)を導入する。
論文 参考訳(メタデータ) (2026-06-25T11:49:21Z) - Semantic Browsing: Controllable Diversity for Image Generation [51.503726779537]
本稿では,セマンティックブラウズを可能にする多様性制御手法を提案する。
我々は、最近のテキスト・ツー・イメージモデルが精巧なキャプションで訓練されているという事実を活用している。
これはパラダイムシフトを可能にします – テキスト・ツー・イメージモデル内のバリエーションに頼るのではなく,テキストレベルで直接多様性を誘導します。
論文 参考訳(メタデータ) (2026-06-22T17:59:17Z) - Referring Change Detection in Remote Sensing Imagery [49.841833753558575]
本稿では、自然言語のプロンプトを利用してリモートセンシング画像の変化の特定のクラスを検出するReferring Change Detection (RCD)を紹介する。
我々は, (I) textbfRCDNet, (II) textbfRCDGen, (II) 拡散型合成データ生成パイプラインからなる2段階のフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-12T16:57:12Z) - Detect Changes like Humans: Incorporating Semantic Priors for Improved Change Detection [52.62459671461816]
本稿では,視覚基盤モデルからのセマンティックな先入観を取り入れ,変化を検出する能力の向上について検討する。
人間の視覚パラダイムにインスパイアされた新しいデュアルストリーム特徴デコーダは、意味認識特徴と差認識特徴を組み合わせることで変化を区別するために導出される。
論文 参考訳(メタデータ) (2024-12-22T08:27:15Z) - Enhancing Perception of Key Changes in Remote Sensing Image Change Captioning [49.24306593078429]
KCFI(Key Change Features and Instruction-tuned)によるリモートセンシング画像変換キャプションのための新しいフレームワークを提案する。
KCFIは、バイテンポラルリモートセンシング画像特徴を抽出するViTsエンコーダと、重要な変化領域を識別するキー特徴知覚器と、画素レベルの変化検出デコーダとを含む。
提案手法の有効性を検証するため,LEVIR-CCデータセット上のいくつかの最新の変更キャプション手法との比較を行った。
論文 参考訳(メタデータ) (2024-09-19T09:33:33Z) - Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training [11.129868018236445]
VQA(Visual Question Answering)をマルチモーダル・プレトレーニングに利用して,対象とする病態の特徴に着目したフレームワークのガイドを行う。
また,視覚的特徴をテキスト領域に近い準テキスト空間に変換するためのモジュールである準テキスト特徴変換器を用いた新しい事前学習フレームワークを提案する。
論文 参考訳(メタデータ) (2024-03-30T02:56:54Z) - MS-Former: Memory-Supported Transformer for Weakly Supervised Change
Detection with Patch-Level Annotations [50.79913333804232]
弱い教師付き変化検出のためのメモリ支援トランス (MS-Former) を提案する。
MS-Former は双方向注意ブロック (BAB) とパッチレベルの監視スキーム (PSS) から構成される。
3つのベンチマークデータセットの実験結果から,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2023-11-16T09:57:29Z) - Neighborhood Contrastive Transformer for Change Captioning [80.10836469177185]
本研究では,異なる環境下での様々な変化に対するモデルの知覚能力を向上させるために,近傍のコントラスト変換器を提案する。
提案手法は,変化シナリオの異なる3つの公開データセットに対して,最先端の性能を実現する。
論文 参考訳(メタデータ) (2023-03-06T14:39:54Z) - Finding It at Another Side: A Viewpoint-Adapted Matching Encoder for
Change Captioning [41.044241265804125]
本稿では,変化字幕タスクにおける意味的変化と視点的変化を明確に区別する新しいビジュアルエンコーダを提案する。
また,言語評価報酬を直接微調整する新たな強化学習手法を提案する。
提案手法は,Spot-the-DiffデータセットとCLEVR-Changeデータセットの両方において,最先端のアプローチよりも大きなマージンで優れている。
論文 参考訳(メタデータ) (2020-09-30T00:13:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。