論文の概要: The Platonic Defense: Backdoor Defense for Self-Supervised Encoders in the Era of Large Scale Pre-training
- arxiv url: http://arxiv.org/abs/2606.29451v1
- Date: Sun, 28 Jun 2026 15:16:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.916596
- Title: The Platonic Defense: Backdoor Defense for Self-Supervised Encoders in the Era of Large Scale Pre-training
- Title(参考訳): プラトニックディフェンス:大規模プレトレーニング時代の自己監督型エンコーダのバックドアディフェンス
- Authors: Tuo Chen, Minjing Dong, Benlei Cui, Jian Liu, Jie Gui,
- Abstract要約: 自己教師付き学習(SSL)事前学習モデルは、視覚表現学習において支配的なパラダイムとなっているが、バックドア攻撃には弱い。
我々は,emphPlatonic Representation Defenseと呼ばれる,攻撃非依存,モデル非依存,モダリティ非依存のブラックボックステスト時防衛パラダイムを提案する。
本研究では,複数の自己教師型エンコーダと10以上の攻撃に対して,本手法の有効性を実証する。
- 参考スコア(独自算出の注目度): 41.266464913728335
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Self-supervised learning (SSL) pretrained models have become a dominant paradigm for visual representation learning, but they are vulnerable to backdoor attacks. Existing defenses struggle to defend against such attacks in a fully black-box setting because they often require access to labels, attack patterns, or training data. To tackle this issue, we propose a new attack-agnostic, model-agnostic, and modality-agnostic black-box test-time defense paradigm, called \emph{Platonic Representation Defense}. It is inspired by the Platonic Representation Hypothesis, which suggests that large-scale independently trained encoders converge toward compatible projections of the same underlying reality. We formalize this idea as a conditional energy function defined over source representations and a set of reference representations. The energy function is trained for detection through noise-contrastive estimation and for representation purification through denoising score matching. Theoretically, the energy gap between matched and mismatched samples is lower bounded by the mutual information between source and reference representations. We demonstrate the effectiveness of our method on multiple self-supervised encoders and more than 10 attacks. The method can perform both representation detection and purification, and achieves substantial performance gains across multiple attacks. Code is available \href{https://github.com/jsrdcht/Platonic-Representation-Defense}{here}.
- Abstract(参考訳): 自己教師付き学習(SSL)事前学習モデルは、視覚表現学習において支配的なパラダイムとなっているが、バックドア攻撃には弱い。
既存の防衛は、ラベル、アタックパターン、トレーニングデータへのアクセスを必要とすることが多いため、完全にブラックボックス設定でそのような攻撃に対して防御するのに苦労する。
この問題に対処するため,我々は,emph{Platonic Representation Defense} と呼ばれる,攻撃非依存,モデル非依存,モダリティ非依存のブラックボックステスト時防衛パラダイムを提案する。
これはプラトン表現仮説(Platonic Representation hypothesis)に触発され、これは、大規模に独立に訓練されたエンコーダが、同じ基礎となる現実の互換性のある射影に向かって収束することを示唆している。
我々は、このアイデアを、ソース表現と参照表現のセットの上に定義された条件付きエネルギー関数として定式化する。
エネルギー関数は、ノイズコントラスト推定による検出と、ノイズスコアマッチングによる表現浄化のために訓練される。
理論的には、一致したサンプルとミスマッチしたサンプルのエネルギーギャップは、ソースと参照表現の相互情報によって制限される。
本研究では,複数の自己教師型エンコーダと10以上の攻撃に対して,本手法の有効性を実証する。
この方法は、表現検出と浄化の両方を行い、複数の攻撃に対して実質的な性能向上を達成する。
コードは href{https://github.com/jsrdcht/Platonic-Representation-Defense}{here} で入手できる。
関連論文リスト
- Improving Large Language Model Safety with Contrastive Representation Learning [92.79965952162298]
大規模言語モデル(LLM)は、社会に深い影響を与える強力なツールである。
多様な制御されていない入力に対する応答を生成する能力は、敵の攻撃に対して脆弱である。
対照的な表現学習問題としてモデルディフェンスを定式化するディフェンスフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-13T16:42:09Z) - Mind the Gap: Detecting Black-box Adversarial Attacks in the Making through Query Update Analysis [3.795071937009966]
アドリアックは機械学習(ML)モデルの整合性を損なう可能性がある。
本稿では,逆ノイズインスタンスが生成されているかどうかを検出するフレームワークを提案する。
適応攻撃を含む8つの最先端攻撃に対するアプローチを評価する。
論文 参考訳(メタデータ) (2025-03-04T20:25:12Z) - Improving Adversarial Robustness via Decoupled Visual Representation Masking [65.73203518658224]
本稿では,特徴分布の観点から,ロバストな特徴の2つの新しい特性を強調した。
現状の防衛手法は、上記の2つの問題にうまく対処することを目的としている。
具体的には、分離された視覚的表現マスキングに基づく、シンプルだが効果的な防御法を提案する。
論文 参考訳(メタデータ) (2024-06-16T13:29:41Z) - Blending adversarial training and representation-conditional purification via aggregation improves adversarial robustness [6.484231366444063]
CARSOは、防御のために考案された適応的なエンドツーエンドのホワイトボックス攻撃から自身を守ることができる。
提案手法は,Cifar-10,Cifar-100,TinyImageNet-200の最先端技術により改善されている。
論文 参考訳(メタデータ) (2023-05-25T09:04:31Z) - Towards A Conceptually Simple Defensive Approach for Few-shot
classifiers Against Adversarial Support Samples [107.38834819682315]
本研究は,数発の分類器を敵攻撃から守るための概念的簡便なアプローチについて検討する。
本稿では,自己相似性とフィルタリングの概念を用いた簡易な攻撃非依存検出法を提案する。
ミニイメージネット(MI)とCUBデータセットの攻撃検出性能は良好である。
論文 参考訳(メタデータ) (2021-10-24T05:46:03Z) - Online Alternate Generator against Adversarial Attacks [144.45529828523408]
ディープラーニングモデルは、実際の画像に準知覚可能なノイズを加えることによって合成される敵の例に非常に敏感である。
対象ネットワークのパラメータをアクセスしたり変更したりする必要のない,ポータブルな防御手法であるオンライン代替ジェネレータを提案する。
提案手法は,入力画像のスクラッチから別の画像をオンライン合成することで,対向雑音を除去・破壊する代わりに機能する。
論文 参考訳(メタデータ) (2020-09-17T07:11:16Z) - A Self-supervised Approach for Adversarial Robustness [105.88250594033053]
敵対的な例は、ディープニューラルネットワーク(DNN)ベースの視覚システムにおいて破滅的な誤りを引き起こす可能性がある。
本稿では,入力空間における自己教師型対向学習機構を提案する。
これは、反逆攻撃に対する強力な堅牢性を提供する。
論文 参考訳(メタデータ) (2020-06-08T20:42:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。