論文の概要: When Modalities Fail to Tango: Conformal Backdoor Detection in Multimodal Contrastive Learning
- arxiv url: http://arxiv.org/abs/2608.04052v1
- Date: Tue, 04 Aug 2026 10:20:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.478949
- Title: When Modalities Fail to Tango: Conformal Backdoor Detection in Multimodal Contrastive Learning
- Title(参考訳): マルチモーダル・コントラスト学習におけるマルチモーダル・コントラスト学習におけるコンフォーマル・バックドア検出
- Abstract要約: マルチモーダルコントラスト学習(MCL)におけるバックドア攻撃は近年注目を集めている。
既存の検出ベースの防御は、主にCLIPScoreメトリックに依存している。
CSCADEは,2段階の連続型バックドア検出フレームワークである。
- 参考スコア(独自算出の注目度): 22.47689018895596
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Backdoor attacks in multimodal contrastive learning (MCL) have garnered growing attention in recent years, as many downstream tasks critically depend on pre-trained MCL models. Existing detection-based defenses predominantly rely on the CLIPScore metric, under the assumption that poisoned pairs exhibit lower semantic similarity between the image and the caption. However, we identify two critical flaws remaining in existing methods: (1) the substantial overlap between CLIPScore distributions of benign and poisoned pairs undermines the reliability of this metric, and (2) fixed-threshold detection cannot provide statistical guarantees for ambiguous samples within overlapping regions. To overcome these limitations, we propose integrating conformal prediction (CP), a statistical framework that quantifies uncertainty through nonconformity scores (NCSs), to establish provable confidence bounds for detecting poisoned image-caption pairs. Building on CP, we introduce CASCADE, a novel two-stage Coarse-to-Fine Conformal Backdoor Detection framework. The coarse-grained stage uses cross-modality consistency to identify high-confidence benign and poisoned pairs. In the fine-grained stage, a reference set is constructed from high-confidence poisoned pairs, and instance-level NCSs based on text-space similarity are computed for each sample in the unidentified subset. These NCSs measure conformity to the poisoning distribution and enable precise identification of latent poisoned pairs within the unidentified subset. Extensive experiments on the large-scale CC3M dataset demonstrate that CASCADE achieves an average FPR of 5.79% at 100% TPR and an average AUROC of 0.9867 across diverse attacks, while remaining effective against adaptive attacks.
- Abstract(参考訳): マルチモーダル・コントラッシブ・ラーニング(MCL)におけるバックドア・アタック(バックドア・アタック)は近年注目を集めている。
既存の検出に基づく防御は、画像とキャプションのセマンティックな類似性が低いという仮定のもと、CLIPScoreメートル法に大きく依存している。
しかし, 従来の手法では, 1) 良性および有毒なペアのCLIPScore分布の重なりが, 信頼性を損なうこと, (2) 固定閾値検出は重複領域内の不明瞭なサンプルに対して統計的に保証することができないこと, の2つの重大な欠陥を同定した。
これらの制限を克服するために,不整合度スコア(NCS)による不確実性を定量化する統計フレームワークであるコンフォメーション予測(CP)の統合を提案し,有毒な撮像対を検出するための信頼性境界を確立する。
CP上に構築されたCASCADEは,2段階の連続型バックドア検出フレームワークである。
粗粒化段階は、高信頼の良性および有毒なペアを特定するために、相互モダリティの整合性を利用する。
詳細な段階では、高信頼の有毒なペアから参照セットを構築し、未同定サブセットの各サンプルに対して、テキスト空間の類似性に基づくインスタンスレベルのNASを算出する。
これらのNCSは、毒の分布に適合し、未同定サブセット内の潜伏毒のペアの正確な同定を可能にする。
大規模なCC3Mデータセットに関する大規模な実験は、CASCADEが平均FPRを100%TPRで5.79%、AUROCを0.9867で達成し、適応攻撃に対して有効であることを示した。
関連論文リスト
- Fusing Spectral Signatures and Activation Clustering for Backdoor Detection in Healthcare Imaging Models: Method, Implementation, and Evaluation [0.0]
本稿では,クラスごとのスペクトルランクとアクティベーションクラスタリングフラグを組み合わせたスコアレベルの融合ルールを,単一サンプルごとの中毒スコアとモデルレベルの合意統計に貢献する。
公衆医用画像ベンチマークとCIFAR-10の合成毒性変異株に対するパイプラインの評価を行った。
論文 参考訳(メタデータ) (2026-09-13T05:19:12Z) - CADRE: Stable, Parameter Efficient Adaptation of Medical Vision Language Models with Bounded Forgetting and Prior Drift [0.10742675209112622]
新しい画像モダリティのためのデプロイモデルの更新は、患者を傷つける2つの方法で静かに失敗する可能性がある。
本研究は,これらの2つの特性によるパラメータ効率の連続的適応について,リーダーボードの精度を忘れることなく検討する。
CADRE は低ランク適応 (LoRA) とオンラインの自己スケーリング,類似性を考慮した弾性重み付けという用語を組み合わせたフリーズバックボーンフレームワークである。
論文 参考訳(メタデータ) (2026-06-22T15:34:32Z) - Post-hoc Selective Classification for Reliable Synthetic Image Detection [5.743750345138882]
ディープニューラルネットワークベースの合成画像検出器(SID)は、デプロイメントの信頼性を欠いている。
本稿では,SIDが低信頼度予測を行なわないようにすることで,選択的分類(SC)戦略を提案する。
本稿では,各層から抽出した信頼度を最終信頼度推定に集約する選好最適化アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-05-09T00:25:22Z) - Quantifiable Uncertainty: A Stochastic Consensus Multi-Agent RAG Framework for Robust Malware Detection [1.2183405753834562]
本稿では,マルウェア解析をセマンティックコード検索と確率的検証に分離するフレームワークMAGMAを提案する。
MAGMAは98.4%の検知率を示し,既存の解よりもかなり高い値を示した。
論文 参考訳(メタデータ) (2026-05-08T18:46:24Z) - Towards Trustworthy Depression Estimation via Disentangled Evidential Learning [50.22167852149165]
EviDepはうつ病の重症度を共同で定量化する明らかな学習フレームワークである。
EviDepは、堅牢な証拠合成を保証するために厳密な情報整合性を強制する。
最先端の予測精度と優れた不確実性校正を実現し、信頼できる臨床スクリーニングのための堅牢なフェールセーフメカニズムを提供する。
論文 参考訳(メタデータ) (2026-04-17T13:27:11Z) - Probabilistic Feature Imputation and Uncertainty-Aware Multimodal Federated Aggregation [0.2283362795949404]
Probabilistic Feature Imputation Network は不確実性推定をインプット特徴とともに生成する。
CheXpert,NIH Open-I,PadChestを用いた人工胸部X線分類実験は決定論的基準線よりも一貫した改善を示した。
論文 参考訳(メタデータ) (2026-04-14T17:03:14Z) - Neural Uncertainty Principle: A Unified View of Adversarial Fragility and LLM Hallucination [60.197429875410286]
大規模言語モデルにおける視覚と幻覚の対立的脆弱性は、伝統的に別の問題と見なされている。
損失誘起状態下でのニューラル不確実性原理(NUP)の定式化により, ほぼバウンド状態においては, さらなる圧縮は感度分散の増大を伴うことが判明した。
視覚では、高度に結合したコンポーネントをマスキングすることで、コストのかかる敵の訓練なしに堅牢性を向上させる。
言語では、任意の応答トークンを生成する前に、同じプレフィルステージプローブが幻覚リスクを検出する。
論文 参考訳(メタデータ) (2026-03-20T02:07:10Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - The Eminence in Shadow: Exploiting Feature Boundary Ambiguity for Robust Backdoor Attacks [51.468144272905135]
深層ニューラルネットワーク(DNN)は、バックドア攻撃に対して脆弱なままでも重要なアプリケーションを支える。
バックドア攻撃を標的とした理論的解析を行い,不均質なモデル操作を実現するための疎い決定境界に着目した。
エミネンス(Eminence)は、理論的な保証と固有なステルス特性を持つ、説明可能で堅牢なブラックボックスバックドアフレームワークである。
論文 参考訳(メタデータ) (2025-12-11T08:09:07Z) - VALID: a Validated Algorithm for Learning in Decentralized Networks with Possible Adversarial Presence [13.612214163974459]
不均一なデータを持つ非方向性ネットワークに対して、検証された分散学習のパラダイムを導入する。
VALIDプロトコルは、検証された学習保証を達成した最初のプロトコルである。
興味深いことに、VALIDは敵のない環境での最適なパフォーマンス指標を維持している。
論文 参考訳(メタデータ) (2024-05-12T15:55:43Z) - Conservative Prediction via Data-Driven Confidence Minimization [70.93946578046003]
機械学習の安全性クリティカルな応用においては、モデルが保守的であることが望ましいことが多い。
本研究では,不確実性データセットに対する信頼性を最小化するデータ駆動信頼性最小化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:05:36Z) - Hierarchical Semi-Supervised Contrastive Learning for
Contamination-Resistant Anomaly Detection [81.07346419422605]
異常検出は、通常のデータ分布から逸脱したサンプルを特定することを目的としている。
コントラスト学習は、異常の効果的な識別を可能にする表現のサンプル化に成功している。
汚染耐性異常検出のための新しい階層型半教師付きコントラスト学習フレームワークを提案する。
論文 参考訳(メタデータ) (2022-07-24T18:49:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。