論文の概要: CV-DCLR: Causal-Visual Dynamic Label Refinement for Robust Zero-Shot Learning
- arxiv url: http://arxiv.org/abs/2607.02601v1
- Date: Wed, 01 Jul 2026 12:45:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.346012
- Title: CV-DCLR: Causal-Visual Dynamic Label Refinement for Robust Zero-Shot Learning
- Title(参考訳): CV-DCLR:ロバストゼロショット学習のためのCausal-Visual Dynamic Label Refinement
- Authors: Can Wang, Jiangnan Li, Mingyu Li, Yining Song, Kangrui Ren, Min Gan, Jinfu Fan,
- Abstract要約: 本稿ではCausal-Visual Dynamic Label Refinementフレームワークを提案する。
二重ストリーム相互補正機構を用いて視覚的意味的関連を補正する。
CUB、SUN、AWA2ベンチマークの実験では、CV-DCLRは高いあいまいさのシナリオで最先端の手法を大幅に上回っている。
- 参考スコア(独自算出の注目度): 25.21342780360303
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Zero-Shot Learning (ZSL) facilitates knowledge transfer via shared semantic spaces. However, a critical bottleneck in this paradigm is Semantic Entanglement, where visual representations are inevitably conflated with visually similar semantic concepts, such as distinguishing the intrinsic traits of a Wolf from the shared features of a Husky. Existing global alignment methods often indiscriminately maximize correlations between visual and semantic modalities, leading models to overfit spurious similarities rather than capturing distinctive class identities. To address this fundamental limitation, we propose the Causal-Visual Dynamic Label Refinement (CV-DCLR) framework. Unlike traditional approaches that rely on superficial visual statistics, CV-DCLR recalibrates visual-semantic associations via a Dual-Stream Mutual Correction Mechanism. This includes a Visual Likelihood Stream to model observational patterns and a Causal Importance Stream that verifies the structural necessity of candidate prototypes through Counterfactual Intervention. Acting as a logical filter, our adaptive gating mechanism dynamically modulates feature responses to amplify genuine causal traits while suppressing visually plausible but structurally irrelevant distractors. Extensive experiments on the CUB, SUN, and AWA2 benchmarks under a rigorous Semantic Entanglement Injection protocol demonstrate that CV-DCLR significantly outperforms state-of-the-art methods in high-ambiguity scenarios. Specifically, while existing models suffer catastrophic degradation under entanglement, our framework maintains robust performance, effectively disentangling true class identities from semantic confounders.
- Abstract(参考訳): Zero-Shot Learning (ZSL)は、共有意味空間による知識伝達を容易にする。
しかし、このパラダイムにおける重要なボトルネックはセマンティック・エンタングルメント(Semantic Entanglement)であり、視覚表現は必然的に視覚的に類似したセマンティックな概念と混同される。
既存のグローバルアライメント手法は、視覚的モダリティと意味的モダリティの相関関係を無差別に最大化し、特異なクラスアイデンティティを捉えるのではなく、急激な類似性に過度に適合する。
この基本的な制限に対処するために,Causal-Visual Dynamic Label Refinement (CV-DCLR) フレームワークを提案する。
表面的な視覚統計に依存する従来のアプローチとは異なり、CV-DCLRはデュアルストリーム相互補正機構を介して視覚的意味関係を再分類する。
これには、観察パターンをモデル化するVisual Likelihood Streamと、非現実的介入を通じて候補プロトタイプの構造的必要性を検証するCausal Importance Streamが含まれる。
適応ゲーティング機構は論理フィルタとして機能し,特徴応答を動的に変調し,真の因果特性を増幅すると同時に,視覚的に可視だが構造的に無関係な乱れを抑える。
厳密なセマンティック・エンタングルメント・インジェクション(Semantic Entanglement Injection)プロトコルの下でのCUB、SUN、AWA2ベンチマークの大規模な実験により、CV-DCLRは高曖昧なシナリオにおいて最先端の手法よりも大幅に優れていることが示された。
具体的には、既存のモデルは絡み合った状態で破滅的な劣化を被るが、我々のフレームワークは堅牢な性能を維持し、セマンティックな共同設立者から真のクラスアイデンティティを効果的に遠ざけている。
関連論文リスト
- Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - Hyperbolic Enhanced Representation Learning for Incomplete Multi-view Clustering [57.38215918201251]
本稿では,不完全なマルチビュークラスタリングのためのハイパーボリック拡張表現学習フレームワークであるHERLを提案する。
ポアンカレボール内で操作すると、HERLは表現学習を強化するために構造を意識した潜在空間を構築する。
HERLは最先端のアプローチよりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-04-18T10:50:46Z) - Enhancing CLIP Robustness via Cross-Modality Alignment [54.01929554563447]
視覚言語モデルのための最適なトランスポートベースフレームワークであるクロスモダリティアライメントを提案する。
COLAは、グローバルな画像テキストアライメントと特徴空間における局所的な構造的一貫性を復元する。
COLAはトレーニングフリーで、既存の微調整モデルと互換性がある。
論文 参考訳(メタデータ) (2025-10-28T03:47:44Z) - DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models [55.30555646945055]
テキスト・ツー・イメージ(T2I)モデルはセマンティック・リークに対して脆弱である。
DeLeakerは、モデルのアテンションマップに直接介入することで、漏洩を緩和する軽量なアプローチである。
SLIMはセマンティックリークに特化した最初のデータセットである。
論文 参考訳(メタデータ) (2025-10-16T17:39:21Z) - Understanding and evaluating computer vision models through the lens of counterfactuals [2.2819712364325047]
この論文は、視覚分類器および生成モデルにおけるバイアスの説明、監査、緩和に反事実を使用するフレームワークを開発する。
体系的に意味のある属性を体系的に変更し、他の属性を固定することで、これらの手法は突発的な相関を明らかにする。
これらの貢献は、識別モデルと生成モデルの両方において、解釈可能性、公正性、因果性のための統一レンズとして反事実を示す。
論文 参考訳(メタデータ) (2025-08-28T15:11:49Z) - Causal Disentanglement and Cross-Modal Alignment for Enhanced Few-Shot Learning [11.752632557524969]
Causal CLIP Adapter(CCA)は、CLIPから抽出された視覚的特徴を明示的に分離する新しいフレームワークである。
本手法は, 分散シフトに対する数ショット性能とロバスト性の観点から, 常に最先端の手法より優れる。
論文 参考訳(メタデータ) (2025-08-05T05:30:42Z) - Mitigating Attention Hacking in Preference-Based Reward Modeling via Interaction Distillation [62.14692332209628]
インタラクション蒸留(Interaction Distillation)は、注意レベル最適化によるより適切な嗜好モデリングのための新しいトレーニングフレームワークである。
最先端のRM最適化法と比較して、より安定で一般化可能な報酬信号を提供する。
論文 参考訳(メタデータ) (2025-08-04T17:06:23Z) - Towards Context-Aware Emotion Recognition Debiasing from a Causal Demystification Perspective via De-confounded Training [14.450673163785094]
文脈認識感情認識(CAER)は、対象者の感情を認識するための貴重な意味的手がかりを提供する。
現在のアプローチは、コンテキストから知覚的に重要な表現を抽出する洗練された構造を設計することに集中している。
共同設立者を非難するためのCCIM(Contextual Causal Intervention Module)を提案する。
論文 参考訳(メタデータ) (2024-07-06T05:29:02Z) - Context De-confounded Emotion Recognition [12.037240778629346]
コンテキストアウェア感情認識(CAER)は、対象者の感情状態を文脈情報で知覚することを目的としている。
長年見過ごされてきた問題は、既存のデータセットのコンテキストバイアスが感情状態のかなり不均衡な分布をもたらすことである。
本稿では、そのようなバイアスの影響からモデルを切り離し、CAERタスクにおける変数間の因果関係を定式化する因果関係に基づく視点を提供する。
論文 参考訳(メタデータ) (2023-03-21T15:12:20Z) - Towards Robust and Adaptive Motion Forecasting: A Causal Representation
Perspective [72.55093886515824]
本稿では,3つの潜伏変数群からなる動的過程として,運動予測の因果的形式化を導入する。
我々は、因果グラフを近似するために、不変なメカニズムやスタイルの共創者の表現を分解するモジュラーアーキテクチャを考案する。
合成および実データを用いた実験結果から,提案した3つの成分は,学習した動き表現の頑健性と再利用性を大幅に向上することが示された。
論文 参考訳(メタデータ) (2021-11-29T18:59:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。