論文の概要: Anti-Backdoor Coreset Selection via Cumulative Entropy
- arxiv url: http://arxiv.org/abs/2607.25502v1
- Date: Tue, 28 Jul 2026 09:37:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.788547
- Title: Anti-Backdoor Coreset Selection via Cumulative Entropy
- Title(参考訳): 累積エントロピーによる反バックドアコアセットの選択
- Abstract要約: ニューラルバックドアに対する最近の訓練時間防衛は、有害なデータから良性の部分集合を分離し、そこからバックドアのないモデルを学ぶ。
本稿では,この防衛戦略をコアセット選択問題として定式化し,いわゆる「アンティバックドアコアセット選択」を実現する。
提案手法は, バックドア攻撃が自然性能に悪影響を及ぼすことなく, 連続的に軽減可能であることを示す。
- 参考スコア(独自算出の注目度): 24.356232051335894
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent training-time defenses against neural backdoors isolate a benign subset from poisoned training data, to learn a backdoor-free model from it. In this paper, we formulate this defense strategy as a coreset selection problem, giving rise to so-called "Anti-Backdoor Coreset Selection." Since poisonous samples have (a) lower prediction uncertainty and are (b) less frequent than benign samples, coreset selection naturally focuses more on samples associated with benign functionality than the backdoor functionality. We use the Cumulative Entropy as selection criterion to further facilitate this effect. The metric tracks the learning dynamics of training samples and allowing us to select benign samples with high informativeness for the coreset. Additionally, we unlearn the chosen samples in each epoch to facilitate the separability between benign and poisonous samples. Together, this yields an exceptionally effective training-time defense that constructs a benign coreset to train a backdoor-free model. Unlike prior defenses that compromise natural accuracy and fail against certain attacks, our method mitigates backdooring attacks consistently with a negligible impact on natural performance.
- Abstract(参考訳): ニューラルバックドアに対する最近の訓練時間防衛は、有毒なトレーニングデータから良質なサブセットを分離し、そこからバックドアのないモデルを学ぶ。
本稿では,この防衛戦略をコアセット選択問題として定式化し,いわゆる「アンティバックドアコアセット選択」を実現する。
有毒なサンプルがあるので
(a)予測の不確実性が低く、かつ
b) 良性サンプルよりも頻度が低いため,コアセットの選択はバックドア機能よりも良性機能に関連するサンプルに特化している。
我々は、この効果をさらに促進するために、累積エントロピーを選択基準として用いる。
このメトリクスは、トレーニングサンプルの学習ダイナミクスを追跡し、コアセットに対して高い情報性で良質なサンプルを選択できるようにします。
さらに,各エポックで選択したサンプルを解放し,良性試料と有毒試料の分離を容易にする。
これにより、バックドアのないモデルをトレーニングするための良心的なコアセットを構築する、非常に効果的なトレーニングタイムディフェンスが得られる。
自然の精度を妥協し、特定の攻撃に対して失敗する以前の防御とは異なり、我々の手法は、自然のパフォーマンスに無視できない影響で、バックドア攻撃を継続的に軽減する。
関連論文リスト
- Two Sides of the Same Coin: Learning the Backdoor to Remove the Backdoor [24.356232051335894]
良性サンプルではなく有毒の託宣を学習するための新しい手法を提案する。
Harveyは、アタックタイプ、データセット、アーキテクチャにわたって、関連するアプローチを大幅に上回る。
論文 参考訳(メタデータ) (2026-07-07T02:11:08Z) - Backdoor Unlearning by Linear Task Decomposition [69.91984435094157]
ファンデーションモデルは、敵の摂動と標的のバックドア攻撃に非常に敏感である。
既存のバックドア除去アプローチは、有害な振る舞いをオーバーライドするために、コストのかかる微調整に依存している。
このことは、バックドアがモデルの一般的な能力を損なうことなく取り除けるかどうかという問題を提起する。
論文 参考訳(メタデータ) (2025-10-16T16:18:07Z) - Neural Antidote: Class-Wise Prompt Tuning for Purifying Backdoors in CLIP [51.04452017089568]
CBPT(Class-wise Backdoor Prompt Tuning)は、テキストプロンプトでCLIPを間接的に浄化する効率的な防御機構である。
CBPTは、モデルユーティリティを保持しながら、バックドアの脅威を著しく軽減する。
論文 参考訳(メタデータ) (2025-02-26T16:25:15Z) - Efficient Backdoor Defense in Multimodal Contrastive Learning: A Token-Level Unlearning Method for Mitigating Threats [52.94388672185062]
本稿では,機械学習という概念を用いて,バックドアの脅威に対する効果的な防御機構を提案する。
これは、モデルがバックドアの脆弱性を迅速に学習するのを助けるために、小さな毒のサンプルを戦略的に作成することを必要とする。
バックドア・アンラーニング・プロセスでは,新しいトークン・ベースの非ラーニング・トレーニング・システムを提案する。
論文 参考訳(メタデータ) (2024-09-29T02:55:38Z) - SEEP: Training Dynamics Grounds Latent Representation Search for Mitigating Backdoor Poisoning Attacks [53.28390057407576]
現代のNLPモデルは、様々なソースから引き出された公開データセットでしばしば訓練される。
データ中毒攻撃は、攻撃者が設計した方法でモデルの振る舞いを操作できる。
バックドア攻撃に伴うリスクを軽減するために、いくつかの戦略が提案されている。
論文 参考訳(メタデータ) (2024-05-19T14:50:09Z) - Unlearning Backdoor Threats: Enhancing Backdoor Defense in Multimodal Contrastive Learning via Local Token Unlearning [49.242828934501986]
マルチモーダルコントラスト学習は高品質な機能を構築するための強力なパラダイムとして登場した。
バックドア攻撃は 訓練中に モデルに 悪意ある行動を埋め込む
我々は,革新的なトークンベースの局所的忘れ忘れ学習システムを導入する。
論文 参考訳(メタデータ) (2024-03-24T18:33:15Z) - Stealthy Backdoor Attack via Confidence-driven Sampling [49.72680157684523]
バックドア攻撃は、悪質なトリガをDNNモデルに過剰に挿入することを目的としており、テストシナリオ中に不正な制御を許可している。
既存の方法では防衛戦略に対する堅牢性が欠如しており、主に無作為な試薬を無作為に選別しながら、引き金の盗難を強化することに重点を置いている。
信頼性スコアの低いサンプルを選別し、これらの攻撃を識別・対処する上で、守備側の課題を著しく増大させる。
論文 参考訳(メタデータ) (2023-10-08T18:57:36Z) - Boosting Backdoor Attack with A Learnable Poisoning Sample Selection
Strategy [32.5734144242128]
データポゾンベースのバックドア攻撃は、ターゲットモデルのトレーニングプロセスを制御することなく、トレーニングデータセットを操作することによって、モデルにバックドアを挿入することを目的としている。
そこで本研究では,min-max最適化を用いて,マスクとモデルパラメータを併用して学習可能な毒素サンプル選択手法を提案する。
ベンチマークデータセットの実験では、バックドア攻撃性能を高めるためのアプローチの有効性と効率が示されている。
論文 参考訳(メタデータ) (2023-07-14T13:12:21Z) - Defending Against Backdoor Attacks by Layer-wise Feature Analysis [11.465401472704732]
ディープニューラルネットワーク(DNN)のトレーニングは通常、大量のトレーニングデータと計算リソースを必要とする。
新たな訓練時間攻撃(バックドア攻撃)は、敵の特定トリガーパターンを含む入力サンプルの誤分類を誘導することを目的としている。
臨界層における不審試料と良性試料の特徴差を解析し, 簡易かつ効果的に汚染試料をろ過する方法を提案する。
論文 参考訳(メタデータ) (2023-02-24T17:16:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。