論文の概要: Mitigating Backdoors via Decoy Shortcuts and Knowledge Decoupling
- arxiv url: http://arxiv.org/abs/2608.00732v1
- Date: Sat, 01 Aug 2026 16:07:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 21:56:46.37259
- Title: Mitigating Backdoors via Decoy Shortcuts and Knowledge Decoupling
- Title(参考訳): デコイショートカットと知識疎結合によるバックドアの緩和
- Abstract要約: バックドア攻撃はディープニューラルネットワークに深刻な脅威をもたらす。
本研究では,メインネットワークと共同でトレーニングする場合,バックドア動作は単純な並列分岐によって吸収される傾向があることを示す。
バックドア知識のトラップとして,軽量なショートカットブランチを"ホットポット"として導入する,トレーニング時の防御システムであるTrpping and Removing(TR)を提案する。
- 参考スコア(独自算出の注目度): 11.741261492240207
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Backdoor attacks pose a serious threat to deep neural networks, especially when training relies on third-party data, allowing adversaries to inject malicious behaviors through data poisoning. In this work, we reveal that backdoor behaviors tend to be absorbed by a simpler parallel branch when jointly trained with the main network. Motivated by this insight, we propose Trapping and Removing (TR), a simple yet effective training-time defense that introduces a lightweight shortcut branch as a "honeypot" to trap backdoor knowledge. After training, backdoors can be removed by discarding the shortcut, without requiring any additional data. To further enhance backdoor isolation while maintaining benign performance, we design a knowledge decoupling strategy with entropy-based weight assignment, encouraging poisoned samples to flow through the honeypot while guiding the main network to focus on benign learning. In addition, we introduce an automatic shortcut generation strategy to improve generalization across model architectures. Extensive experiments on four benchmark datasets and five model architectures demonstrate that our approach effectively mitigates a wide range of backdoor attacks while preserving performance on benign data. Code: https://github.com/Zixuan-Zhu/TR}{github.com/Zixuan-Zhu/TR.
- Abstract(参考訳): バックドア攻撃はディープニューラルネットワークにとって深刻な脅威となり、特にトレーニングがサードパーティのデータに依存している場合、敵対者はデータ中毒によって悪意ある行動を注入できる。
本研究では,メインネットワークと共同でトレーニングする場合,バックドア動作は単純な並列分岐によって吸収される傾向があることを示す。
この知見に触発されて、我々は、バックドア知識をトラップするために、軽量ショートカットブランチを"ホットポット"として導入する、シンプルで効果的なトレーニングタイムディフェンスであるTraping and Removing (TR)を提案する。
トレーニング後のバックドアは、追加のデータを必要とせずに、ショートカットを破棄することで取り除くことができる。
そこで,本研究では,ハニーポット内の有害試料の流出を促すとともに,本ネットワークの良心学習を指導しながら,エントロピーに基づく重み付けによる知識疎結合戦略を設計した。
さらに、モデルアーキテクチャ間の一般化を改善するために、自動ショートカット生成戦略を導入する。
4つのベンチマークデータセットと5つのモデルアーキテクチャに関する大規模な実験により、我々のアプローチは、良質なデータのパフォーマンスを維持しながら、幅広いバックドア攻撃を効果的に軽減することを示した。
コード:https://github.com/Zixuan-Zhu/TR}{github.com/Zixuan-Zhu/TR
関連論文リスト
- Kill it with FIRE: On Leveraging Latent Space Directions for Runtime Backdoor Mitigation in Deep Neural Networks [1.9517610560768623]
よく知られた脆弱性は、有毒なトレーニングデータや悪意のあるトレーニングプロセスによってニューラルネットワークに導入されたバックドアである。
提案手法はFIRE (Inference-time backdoor mitigation approach) である。
我々はトリガーを、推論機構を補正するために逆に適用できる層間の潜伏空間の方向と見なす。
論文 参考訳(メタデータ) (2026-02-11T12:13:25Z) - Backdoor Unlearning by Linear Task Decomposition [69.91984435094157]
ファンデーションモデルは、敵の摂動と標的のバックドア攻撃に非常に敏感である。
既存のバックドア除去アプローチは、有害な振る舞いをオーバーライドするために、コストのかかる微調整に依存している。
このことは、バックドアがモデルの一般的な能力を損なうことなく取り除けるかどうかという問題を提起する。
論文 参考訳(メタデータ) (2025-10-16T16:18:07Z) - Enhancing the Effectiveness and Durability of Backdoor Attacks in Federated Learning through Maximizing Task Distinction [30.129506166655418]
フェデレーション学習は、複数の参加者がプライベートデータを共有せずに、協力的に中央モデルをトレーニングすることを可能にする。
バックドア攻撃により 攻撃者は 悪意のある行動を世界モデルに 埋め込むことができる 良心的な入力を 高い精度で維持する
本稿では,バックドアトリガを動的に最適化することにより,バックドアタスクをメインタスクから切り離す手法を提案する。
論文 参考訳(メタデータ) (2025-09-23T11:59:29Z) - Efficient Backdoor Defense in Multimodal Contrastive Learning: A Token-Level Unlearning Method for Mitigating Threats [52.94388672185062]
本稿では,機械学習という概念を用いて,バックドアの脅威に対する効果的な防御機構を提案する。
これは、モデルがバックドアの脆弱性を迅速に学習するのを助けるために、小さな毒のサンプルを戦略的に作成することを必要とする。
バックドア・アンラーニング・プロセスでは,新しいトークン・ベースの非ラーニング・トレーニング・システムを提案する。
論文 参考訳(メタデータ) (2024-09-29T02:55:38Z) - Unified Neural Backdoor Removal with Only Few Clean Samples through Unlearning and Relearning [4.623498459985644]
ULRL(UnLearn and ReLearn for backdoor removal)を提案する。
提案手法はまず,ネットワークの損失を小さなクリーンデータセット上で意図的に最大化する未学習フェーズを用いる。
再学習段階では、これらの疑わしいニューロンは、標的の再初期化とコサイン類似性規則化を用いて再分類される。
論文 参考訳(メタデータ) (2024-05-23T16:49:09Z) - BackdoorBox: A Python Toolbox for Backdoor Learning [67.53987387581222]
このPythonツールボックスは、代表的で高度なバックドア攻撃と防御を実装している。
研究者や開発者は、ベンチマークやローカルデータセットで、さまざまなメソッドを簡単に実装し、比較することができる。
論文 参考訳(メタデータ) (2023-02-01T09:45:42Z) - Backdoor Defense via Suppressing Model Shortcuts [91.30995749139012]
本稿では,モデル構造の角度からバックドア機構を探索する。
攻撃成功率 (ASR) は, キースキップ接続の出力を減少させると著しく低下することを示した。
論文 参考訳(メタデータ) (2022-11-02T15:39:19Z) - Architectural Backdoors in Neural Networks [27.315196801989032]
モデルアーキテクチャの内部に隠れる新しい種類のバックドアアタックを導入します。
これらのバックドアの実装は簡単で、例えばバックドアモデルアーキテクチャ用のオープンソースコードを公開している。
私たちは、モデルアーキテクチャのバックドアが真の脅威であり、他のアプローチとは異なり、ゼロから完全な再トレーニングに耐えられることを実証しています。
論文 参考訳(メタデータ) (2022-06-15T22:44:03Z) - Anti-Backdoor Learning: Training Clean Models on Poisoned Data [17.648453598314795]
ディープニューラルネットワーク(DNN)に対するセキュリティ上の脅威としてバックドア攻撃が出現
提案手法は,バックドア・ポゾンデータを用いたアンファンクレーンモデルの学習を目的とした,アンファンティ・バックドア学習の概念を導入する。
バックドアポゾンデータ上でのABL学習モデルは、純粋にクリーンなデータでトレーニングされたのと同じ性能を実証的に示す。
論文 参考訳(メタデータ) (2021-10-22T03:30:48Z) - Black-box Detection of Backdoor Attacks with Limited Information and
Data [56.0735480850555]
モデルへのクエリアクセスのみを用いてバックドア攻撃を同定するブラックボックスバックドア検出(B3D)手法を提案する。
バックドア検出に加えて,同定されたバックドアモデルを用いた信頼性の高い予測手法を提案する。
論文 参考訳(メタデータ) (2021-03-24T12:06:40Z) - Backdoor Learning: A Survey [75.59571756777342]
バックドア攻撃はディープニューラルネットワーク(DNN)に隠れたバックドアを埋め込む
バックドア学習は、急速に成長する研究分野である。
本稿では,この領域を包括的に調査する。
論文 参考訳(メタデータ) (2020-07-17T04:09:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。