論文の概要: The Power of Backdoor Absorption in Community Training
- arxiv url: http://arxiv.org/abs/2607.06643v1
- Date: Tue, 07 Jul 2026 15:19:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.165767
- Title: The Power of Backdoor Absorption in Community Training
- Title(参考訳): コミュニティトレーニングにおけるバックドア吸収の力
- Authors: Issam Seddik, Sami Souihi, Mohamed Tamaazousti, Sara Tucci Piergiovanni,
- Abstract要約: バックドア攻撃は大規模なAIモデルに深刻な脅威を与える。
伝統的に、これらの攻撃を検出するには、トレーニングステップの完全な再計算が必要である。
ビザンティンスケジューラによる連続最適化のレジリエンスについて検討する。
- 参考スコア(独自算出の注目度): 6.18527094818381
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Backdoor attacks severely threaten large-scale AI models. When model owners delegate training to external compute providers within a decentralized training paradigm, adversaries can craft stealthy, low-frequency triggers to inject malicious behavior while evading standard audits. Traditionally, detecting these attacks requires a full re-computation of the training steps--a prohibitive overhead that directly contradicts the owner's resource constraints. To address this, we investigate the resilience of continuous optimization dynamics under Byzantine perturbations, where adversaries are forced to compete against a continuous influx of honest updates. Under a threat model where an adversary compromises f out of n total trainers, we quantify the minimum auditing overhead required by the model owner to probabilistically bound the attack success rate. We formalize this injection-absorption dynamic as a Discrete-Time Markov Chain (DTMC). Using this framework, we prove that the success probability of any bounded adversary asymptotically collapses to zero under a defense strategy combining natural absorption, a randomized scheduler, and lazy verification oracle. Empirical results demonstrate significant backdoor suppression with zero utility degradation even when invoking the verification oracle on merely 10% of the total training steps. This approach yields a provably sound and computationally efficient defense for safety-critical AI.
- Abstract(参考訳): バックドア攻撃は大規模なAIモデルに深刻な脅威を与える。
モデルオーナが非集中的なトレーニングパラダイム内で外部コンピューティングプロバイダにトレーニングを委譲する場合、敵はステルスで低周波なトリガーを作成でき、標準監査を避けながら悪意ある振る舞いを注入できる。
従来、これらの攻撃を検出するには、トレーニングステップの完全な再計算が必要です。
これを解決するために、ビザンチン摂動下での連続最適化力学のレジリエンスについて検討する。
脅威モデルでは, モデル所有者が要求する最小監査オーバーヘッドを定量化し, 攻撃成功率を確率的に拘束する。
我々はこの注入吸収ダイナミクスを離散時間マルコフ連鎖 (DTMC) として定式化する。
この枠組みを用いて, 自然吸収, ランダム化スケジューラ, 遅延検証オラクルを組み合わせた防衛戦略の下で, 任意の有界敵の漸近的成功確率がゼロに崩壊することを示す。
実証実験の結果,全トレーニングステップの10%にのみ,検証オラクルを呼び出す場合においても,実用性ゼロのバックドア抑制効果が認められた。
このアプローチは、安全クリティカルなAIに対する、証明可能な健全で効率的な防御をもたらす。
関連論文リスト
- SCRUB-FL: Sanitizing and Cleansing Representations via Unlearning of Backdoors [9.273743530407977]
Federated Learning (FL)は、生データを共有せずに協調的なモデルトレーニングを可能にする。
悪意のあるクライアントがモデル予測を操作するために、ローカルのトレーニングデータに隠れたトリガーを埋め込むバックドア攻撃に対して脆弱である。
SCRUB-FL, SCRUB-FLを提案する。
論文 参考訳(メタデータ) (2026-06-21T22:34:34Z) - Backdoor Unlearning by Linear Task Decomposition [69.91984435094157]
ファンデーションモデルは、敵の摂動と標的のバックドア攻撃に非常に敏感である。
既存のバックドア除去アプローチは、有害な振る舞いをオーバーライドするために、コストのかかる微調整に依存している。
このことは、バックドアがモデルの一般的な能力を損なうことなく取り除けるかどうかという問題を提起する。
論文 参考訳(メタデータ) (2025-10-16T16:18:07Z) - Efficient Backdoor Defense in Multimodal Contrastive Learning: A Token-Level Unlearning Method for Mitigating Threats [52.94388672185062]
本稿では,機械学習という概念を用いて,バックドアの脅威に対する効果的な防御機構を提案する。
これは、モデルがバックドアの脆弱性を迅速に学習するのを助けるために、小さな毒のサンプルを戦略的に作成することを必要とする。
バックドア・アンラーニング・プロセスでは,新しいトークン・ベースの非ラーニング・トレーニング・システムを提案する。
論文 参考訳(メタデータ) (2024-09-29T02:55:38Z) - Unlearning Backdoor Threats: Enhancing Backdoor Defense in Multimodal Contrastive Learning via Local Token Unlearning [49.242828934501986]
マルチモーダルコントラスト学習は高品質な機能を構築するための強力なパラダイムとして登場した。
バックドア攻撃は 訓練中に モデルに 悪意ある行動を埋め込む
我々は,革新的なトークンベースの局所的忘れ忘れ学習システムを導入する。
論文 参考訳(メタデータ) (2024-03-24T18:33:15Z) - Perturbation-Invariant Adversarial Training for Neural Ranking Models:
Improving the Effectiveness-Robustness Trade-Off [107.35833747750446]
正統な文書に不可避な摂動を加えることで 敵の例を作れます
この脆弱性は信頼性に関する重大な懸念を生じさせ、NRMの展開を妨げている。
本研究では,NRMにおける有効・損耗トレードオフに関する理論的保証を確立する。
論文 参考訳(メタデータ) (2023-12-16T05:38:39Z) - FLIP: A Provable Defense Framework for Backdoor Mitigation in Federated
Learning [66.56240101249803]
我々は,クライアントの強固化がグローバルモデル(および悪意のあるクライアント)に与える影響について検討する。
本稿では, 逆エンジニアリングによる防御手法を提案するとともに, 堅牢性を保証して, 改良を実現できることを示す。
競合する8つのSOTA防御法について, 単発および連続のFLバックドア攻撃に対して, 提案手法の実証的優位性を示した。
論文 参考訳(メタデータ) (2022-10-23T22:24:03Z) - Certified Federated Adversarial Training [3.474871319204387]
我々は、労働者のクォーラムが完全に悪意のある場合、FLシステムに敵の訓練を施すシナリオに取り組む。
我々は、モデルに毒を盛ったアタッカーをモデル化し、そのモデルが明らかに敵の堅牢性を示すように、敵の訓練に弱点を挿入する。
この防御は、アダプティブアタックに対してさえも、敵の堅牢性を維持することができることを示す。
論文 参考訳(メタデータ) (2021-12-20T13:40:20Z) - Policy Smoothing for Provably Robust Reinforcement Learning [109.90239627115336]
入力のノルム有界対向摂動に対する強化学習の証明可能な堅牢性について検討する。
我々は、スムーズなポリシーによって得られる全報酬が、入力の摂動のノルムバウンドな逆数の下で一定の閾値以下に収まらないことを保証した証明書を生成する。
論文 参考訳(メタデータ) (2021-06-21T21:42:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。