論文の概要: Targeted Visual Counterfactual Explanations for Contrastive Vision-Language Model
- arxiv url: http://arxiv.org/abs/2609.37638v2
- Date: Wed, 30 Sep 2026 09:19:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.314332
- Title: Targeted Visual Counterfactual Explanations for Contrastive Vision-Language Model
- Title(参考訳): コントラスト視覚・言語モデルのための視覚的対実的説明
- Abstract要約: MACE (Mask-guided Adaptive Counterfactual Explanations) は、CLIPのゼロショット分類用に設計された。
我々は、ImageNet、Food-101、Oxford Pets、CUB-200データセット上でMACEを評価する。
- 参考スコア(独自算出の注目度): 6.030162209405975
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Current explanation methods for contrastive vision-language models such as CLIP mainly identify important regions without showing how to change the input in order to get a target prediction. We introduce Mask-guided Adaptive Counterfactual Explanations (MACE), a targeted visual counterfactual method designed specifically for CLIP zero-shot classification. MACE constructs an editable region from either source attribution or source-target attribution differences and expands the mask only when needed to reach a specified target class. A latent diffusion inpainting model then modifies the selected region, while a frozen CLIP model provides modification guidance and anchors the remaining image content to the original input. We evaluate MACE on ImageNet, Food-101, Oxford Pets, and CUB-200. The source-mask variant achieves the highest target top-1 success rate across all four datasets, while the difference-mask variant produces the smallest pixel level and perceptual changes and the best realism scores. Both variants improve proximity and realism over a Stable Diffusion-only baseline using the same generative backbone. These results show that adaptive mask-guided editing produces effective CLIP counterfactuals. They further reveal a tradeoff between counterfactual validity and source-image preservation.
- Abstract(参考訳): CLIPのような対照的な視覚言語モデルの現在の説明法は、主に、ターゲット予測を得るために入力を変更する方法を示すことなく、重要な領域を識別する。
本稿では,CLIPゼロショット分類に特化して設計された視覚的対実法であるMask-guided Adaptive Counterfactual Explanations (MACE)を紹介する。
MACEは、ソース属性またはソースターゲット属性の違いから編集可能な領域を構築し、特定のターゲットクラスに到達するために必要な場合にのみマスクを拡張する。
遅延拡散塗装モデルが選択された領域を修正し、凍結したCLIPモデルが修正ガイダンスを提供し、残りの画像内容を元の入力に固定する。
我々はImageNet,Food-101,Oxford Pets,CUB-200でMACEを評価した。
ソースマスクの変種は4つのデータセットで最高のターゲットトップ1の成功率を達成する一方、差マスクの変種は最小のピクセルレベルと知覚的変化と最高のリアリズムスコアを生成する。
どちらの変種も、同じ生成バックボーンを用いて、安定拡散のみのベースラインの近接性とリアリズムを改善している。
これらの結果から,適応型マスクガイド編集はCLIP対策に有効であることが示唆された。
彼らはさらに、反ファクトの妥当性とソースイメージの保存のトレードオフを明らかにしている。
関連論文リスト
- Source-Agnostic Image Translation Based on Latent Aware Adaptive Masking [2.0673681624647844]
本稿では,逆拡散過程を通じて二項マスクを動的に洗練する情報源に依存しないフレームワークを提案する。
本手法では,経験的平均値と予測誤差の標準偏差から得られた時間依存統計的しきい値決定手法を提案する。
本手法は, 各種ソース分布の高精度かつ自動的ローカライゼーションとシームレスな翻訳を, 特別な訓練を伴わずに実現している。
論文 参考訳(メタデータ) (2026-08-14T07:51:40Z) - LatRef-Diff: Latent and Reference-Guided Diffusion for Facial Attribute Editing and Style Manipulation [78.6161238980415]
条件付きGANは進歩しているものの、精度の問題やトレーニング不安定性によって制限されている。
これらの制約に対処する新しい拡散ベースのフレームワークであるLatRef-Diffを提案する。
本稿では,LatRef-Diffが定性評価と定量的評価の両方において最先端の性能を達成することを示す。
論文 参考訳(メタデータ) (2026-04-23T04:47:40Z) - Seeing What Matters: Empowering CLIP with Patch Generation-to-Selection [54.21851618853518]
本稿では,CLIPのトレーニング効率を高めるために,パッチ生成と選択という簡潔で効果的なアプローチを提案する。
私たちのアプローチであるCLIP-PGSは、ゼロショット分類と検索タスクにおいて、新しい最先端結果を設定する。
論文 参考訳(メタデータ) (2025-03-21T12:10:38Z) - MaskInversion: Localized Embeddings via Optimization of Explainability Maps [49.50785637749757]
MaskInversionは、テスト時にマスクによって指定されたクエリ画像領域に対するコンテキスト認識の埋め込みを生成する。
オープン語彙のクラス検索、表現理解の参照、局所的なキャプションや画像生成など、幅広いタスクに使用することができる。
論文 参考訳(メタデータ) (2024-07-29T14:21:07Z) - Guided Interpretable Facial Expression Recognition via Spatial Action Unit Cues [55.97779732051921]
オーキューを分類器学習に明示的に組み込むための新しい学習戦略が提案されている。
分類性能を劣化させることなく階層的解釈性を向上させることができることを示す。
論文 参考訳(メタデータ) (2024-02-01T02:13:49Z) - Diffusion Visual Counterfactual Explanations [51.077318228247925]
VCE(Visual Counterfactual Explanations)は、画像の決定を理解するための重要なツールである。
VCEの生成に対する現在のアプローチは、逆向きに堅牢なモデルに制限されており、しばしば非現実的なアーティファクトを含んでいる。
本稿では、任意のイメージネット分類器に対して、視覚拡散対実説明(DVCE)を生成することでこれを克服する。
論文 参考訳(メタデータ) (2022-10-21T09:35:47Z) - Open-Vocabulary Semantic Segmentation with Mask-adapted CLIP [45.81698881151867]
Open-vocabulary semantic segmentationは、トレーニング中に見られなかったかもしれないテキスト記述に従って、イメージをセマンティック領域に分割することを目的としている。
最近の2段階の手法では、まずクラスに依存しないマスクの提案を生成し、次にCLIPなどの事前訓練された視覚言語モデルを利用してマスク付き領域を分類する。
マスクされた画像領域とその対応するテキスト記述の集合上でCLIPを微調整する。
特に、COCOで訓練しADE20K-150で評価すると、我々の最良のモデルは29.6% mIoUであり、これは以前の状態より+8.5%高い。
論文 参考訳(メタデータ) (2022-10-09T02:57:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。