論文の概要: Why Backdooring Neural Networks is so Easy?
- arxiv url: http://arxiv.org/abs/2609.36117v1
- Date: Mon, 28 Sep 2026 18:50:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.959267
- Title: Why Backdooring Neural Networks is so Easy?
- Title(参考訳): なぜバックドアニューラルネットワークがそんなに簡単なのか?
- Abstract要約: バックドア攻撃に対する現代のAIシステムの安全性は、依然としてオープンな課題である。
ニューラルネットワークを強力にするのと同じ機能学習ダイナミクスが、バックドアに対してより脆弱になることも示しています。
- 参考スコア(独自算出の注目度): 5.721159563445718
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Securing modern AI systems against backdoor attacks remains an open challenge and requires fundamentally principled estimates of the adversary's budget -- the poison fraction $π$ and trigger strength $α$ needed to construct successful yet stealthy attacks. Motivated by recent empirical evidence that poisoning large language models can require a nearly constant number of malicious samples even as clean datasets grow, we derive an exact closed-form analysis of a quadratic neuron trained on a poisoned Gaussian mixture. We show, perhaps counterintuitively, that the same feature-learning dynamics that make neural networks powerful can also make them more vulnerable to backdoors. Specifically, with clean accuracy preserved to first order, $O(π)$, we demonstrate that lazy learning imposes the inverse-square-root scaling $α\propto π^{-1/2}$ for a successful attack, while feature learning induces a quadratic detector whose loss margin scales as $O(α^4)$, improving the attack budget to $α\propto π^{-1/4}$. Consequently, nonlinear feature learning substantially reduces the trigger strength required at small poison fractions, thereby in a sense making feature learners more backdoor vulnerable. These results provide a theoretical mechanism consistent with large-scale empirical observations and demonstrate that security audits based on linear heuristics can systematically underestimate backdoor vulnerability in the widely adopted feature-learning regimes.
- Abstract(参考訳): バックドア攻撃に対する現代のAIシステムの安全な確保は、依然としてオープンな課題であり、敵の予算を基本的に見積もる必要がある。
大規模な言語モデルに毒を盛るには、クリーンなデータセットが成長しても、ほぼ一定の数の悪意のあるサンプルを必要とするという最近の実証的な証拠によって、我々は、有毒なガウス混合物で訓練された二次ニューロンの正確なクローズドフォーム分析を導出する。
ニューラルネットワークを強力にするのと同じ機能学習ダイナミクスが、バックドアに対してより脆弱になることも示しています。
具体的には、第1次オーダーである$O(π)$に対して、遅延学習が攻撃を成功させるために逆二乗根スケーリング$α\propto π^{-1/2}$を課し、一方特徴学習は損失マージンが$O(α^4)$となる二次検出器を誘導し、攻撃予算を$α\propto π^{-1/4}$に改善することを示した。
これにより、非線形特徴学習は、少量の毒分で要求されるトリガー強度を大幅に低減し、特徴学習者がよりバックドアに脆弱になる。
これらの結果は大規模な経験的観察と一致した理論的メカニズムを提供し、線形ヒューリスティックに基づくセキュリティ監査が、広く採用されている特徴学習体制におけるバックドア脆弱性を体系的に過小評価できることを示した。
関連論文リスト
- Circumventing Backdoor Space via Weight Symmetry [23.660787542798197]
深層ニューラルネットワークは、トレーニング中に悪意のある振る舞いを埋め込むバックドア攻撃に対して脆弱である。
本研究では,データ形式とは独立して動作し,少量のクリーンサンプルしか必要としない新しいバックドア浄化防御である2段シンメトリ・コネクティビティ(TSC)を提案する。
論文 参考訳(メタデータ) (2025-06-09T06:21:35Z) - Efficient Backdoor Defense in Multimodal Contrastive Learning: A Token-Level Unlearning Method for Mitigating Threats [52.94388672185062]
本稿では,機械学習という概念を用いて,バックドアの脅威に対する効果的な防御機構を提案する。
これは、モデルがバックドアの脆弱性を迅速に学習するのを助けるために、小さな毒のサンプルを戦略的に作成することを必要とする。
バックドア・アンラーニング・プロセスでは,新しいトークン・ベースの非ラーニング・トレーニング・システムを提案する。
論文 参考訳(メタデータ) (2024-09-29T02:55:38Z) - Provable Robustness of (Graph) Neural Networks Against Data Poisoning and Backdoor Attacks [50.87615167799367]
グラフニューラルネットワーク(GNN)は、特定のグラフのノード特徴をターゲットとして、バックドアを含む有毒な攻撃に対して認証する。
コンボリューションベースのGNNとPageRankベースのGNNの最悪の動作におけるグラフ構造の役割とその接続性に関する基本的な知見を提供する。
論文 参考訳(メタデータ) (2024-07-15T16:12:51Z) - Unified Neural Backdoor Removal with Only Few Clean Samples through Unlearning and Relearning [4.623498459985644]
ULRL(UnLearn and ReLearn for backdoor removal)を提案する。
提案手法はまず,ネットワークの損失を小さなクリーンデータセット上で意図的に最大化する未学習フェーズを用いる。
再学習段階では、これらの疑わしいニューロンは、標的の再初期化とコサイン類似性規則化を用いて再分類される。
論文 参考訳(メタデータ) (2024-05-23T16:49:09Z) - Backdoor Defense via Deconfounded Representation Learning [17.28760299048368]
我々は、信頼性の高い分類のための非定型表現を学ぶために、因果性に着想を得たバックドアディフェンス(CBD)を提案する。
CBDは、良性サンプルの予測において高い精度を維持しながら、バックドアの脅威を減らすのに有効である。
論文 参考訳(メタデータ) (2023-03-13T02:25:59Z) - Backdoor Defense via Suppressing Model Shortcuts [91.30995749139012]
本稿では,モデル構造の角度からバックドア機構を探索する。
攻撃成功率 (ASR) は, キースキップ接続の出力を減少させると著しく低下することを示した。
論文 参考訳(メタデータ) (2022-11-02T15:39:19Z) - Few-shot Backdoor Defense Using Shapley Estimation [123.56934991060788]
我々は、深層ニューラルネットワークに対するバックドア攻撃を軽減するために、Shapley Pruningと呼ばれる新しいアプローチを開発した。
ShapPruningは、感染した数少ないニューロン(全ニューロンの1%以下)を特定し、モデルの構造と正確性を保護する。
様々な攻撃やタスクに対して,本手法の有効性とロバスト性を示す実験を行った。
論文 参考訳(メタデータ) (2021-12-30T02:27:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。