論文の概要: Lilith: Backdoor Generalization under Training-Inference Trigger Shift
- arxiv url: http://arxiv.org/abs/2607.26099v1
- Date: Tue, 28 Jul 2026 06:23:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.427207
- Title: Lilith: Backdoor Generalization under Training-Inference Trigger Shift
- Title(参考訳): Lilith: トレーニング-推論トリガーシフトによるバックドアの一般化
- Abstract要約: データ・ポゾン・アタックのためのブラックボックス・アンカー・ツー・ファミリー・フレームワークであるLilithを紹介します。
この結果から,Lilithは汎用性に限界があり,トリガの一般化のギャップが小さく,家庭的にも高い攻撃効果を達成できることが示唆された。
- 参考スコア(独自算出の注目度): 52.38172980217982
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Machine-learning services increasingly rely on public data, third-party providers, and outsourced training, creating opportunities for data-poisoning attacks that implant persistent malicious behavior while preserving benign utility. However, existing backdoor studies largely evaluate exact trigger reuse, training-exposed trigger diversity, or variations along predefined transformation axes. They therefore leave a critical blind spot: whether a backdoor learned from one training-time trigger can generalize to an inference-time trigger family absent from victim training. We formulate this problem as backdoor generalization under training--inference trigger shift and introduce Lilith, a black-box anchor-to-family framework. Using only disjoint surrogate resources, Lilith first induces a compact target-side vulnerability with a single training anchor, then constructs a bounded inference-only family that preserves the anchor-induced representation geometry. We characterize this mechanism through anchor clearance and family reach, deriving sufficient conditions for family-wise target preservation under local regularity and bounded surrogate--victim discrepancy. Experiments across datasets, architectures, poisoning rates, and defenses show that Lilith achieves high family-wise attack success with limited utility degradation and a small trigger generalization gap. Additional analyses show that family activation depends on representation alignment rather than the proposal mechanism, exposing a broader threat overlooked by exact-trigger evaluation.
- Abstract(参考訳): マシンラーニングサービスは、公開データやサードパーティプロバイダ、アウトソーストレーニングにますます依存して、悪意のあるユーティリティを保ちながら、永続的な悪意のある振る舞いを埋め込む、データ中毒攻撃の機会を生み出している。
しかし、既存のバックドア研究は、正確なトリガーの再利用、トレーニングが露呈したトリガーの多様性、あるいは事前定義された変換軸に沿ったバリエーションを概ね評価している。
つまり、あるトレーニングタイムのトリガーから学んだバックドアが、被害者のトレーニングに欠席した推論タイムのトリガーファミリーに一般化できるかどうかである。
我々は、トレーニング-推論トリガシフトの下でのバックドア一般化としてこの問題を定式化し、ブラックボックス・アンカー・ツー・ファミリーフレームワークであるLilithを紹介した。
切り離されたサロゲートリソースのみを使用して、Lilithは最初、単一のトレーニングアンカーでコンパクトなターゲットサイド脆弱性を誘導し、その後、アンカーによって引き起こされる表現幾何学を保存する境界付き推論のみのファミリを構築する。
我々はこのメカニズムをアンカークリアランスと家族のリーチによって特徴付け、局所正規性と有界サロゲート-ビクターの相違による家族的標的保存のための十分な条件を導出する。
データセット、アーキテクチャ、中毒率、防御に関する実験によると、Lilithは、限られたユーティリティ劣化と小さなトリガ一般化ギャップで、家庭的に高い攻撃成功を達成している。
さらなる分析により、家族の活性化は、提案機構よりも表現アライメントに依存することが示され、正確なトリガー評価によって見落とされたより広い脅威が明らかにされる。
関連論文リスト
- SCRUB-FL: Sanitizing and Cleansing Representations via Unlearning of Backdoors [9.273743530407977]
Federated Learning (FL)は、生データを共有せずに協調的なモデルトレーニングを可能にする。
悪意のあるクライアントがモデル予測を操作するために、ローカルのトレーニングデータに隠れたトリガーを埋め込むバックドア攻撃に対して脆弱である。
SCRUB-FL, SCRUB-FLを提案する。
論文 参考訳(メタデータ) (2026-06-21T22:34:34Z) - Steganographic Backdoor Attacks in NLP: Ultra-Low Poisoning and Defense Evasion [33.35232947017276]
トランスフォーマーモデルは自然言語処理(NLP)アプリケーションの基礎であるが、バックドア攻撃には弱い。
我々はステガノBackdoorを導入し、ステルステクニックを実用的な脅威モデルに適合させる。
SteganoBackdoorの攻撃成功率は99%を超えている。
論文 参考訳(メタデータ) (2025-11-18T09:56:16Z) - BackWeak: Backdooring Knowledge Distillation Simply with Weak Triggers and Fine-tuning [2.324987745098552]
BackWeakはシンプルで代理なしの攻撃パラダイムです。
弱引き金で良心的な教師を微調整するだけで、強力なバックドアを埋め込むことができることを示す。
BackWeakは、従来の精巧なアプローチよりも効率的で、シンプルで、しばしばステルス性が高い。
論文 参考訳(メタデータ) (2025-11-15T05:53:15Z) - Visual Backdoor Attacks on MLLM Embodied Decision Making via Contrastive Trigger Learning [89.1856483797116]
MLLMをベースとした組込みエージェントに視覚的バックドアを注入する最初のフレームワークであるBEATを紹介する。
テキストトリガーとは異なり、オブジェクトトリガーは視点や照明の幅が広いため、確実に移植することは困難である。
BEATは攻撃の成功率を最大80%まで達成し、強い良識のあるタスクパフォーマンスを維持します。
論文 参考訳(メタデータ) (2025-10-31T16:50:49Z) - Backdoor Unlearning by Linear Task Decomposition [69.91984435094157]
ファンデーションモデルは、敵の摂動と標的のバックドア攻撃に非常に敏感である。
既存のバックドア除去アプローチは、有害な振る舞いをオーバーライドするために、コストのかかる微調整に依存している。
このことは、バックドアがモデルの一般的な能力を損なうことなく取り除けるかどうかという問題を提起する。
論文 参考訳(メタデータ) (2025-10-16T16:18:07Z) - Backdoor Collapse: Eliminating Unknown Threats via Known Backdoor Aggregation in Language Models [75.29749026964154]
Ourmethodは、複数のベンチマークで平均的な攻撃成功率を4.41%に下げる。
クリーンな精度と実用性はオリジナルのモデルの0.5%以内に保存される。
防衛はさまざまな種類のバックドアをまたいで一般化し、実際のデプロイメントシナリオにおける堅牢性を確認します。
論文 参考訳(メタデータ) (2025-10-11T15:47:35Z) - Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models [6.182793047410624]
バックドア型事前学習言語モデルの内部挙動について検討する。
本稿では,トークンレベルの注意と勾配情報を組み合わせることで,異常スコアを構成する推論時間ディフェンスを提案する。
論文 参考訳(メタデータ) (2025-10-05T20:15:56Z) - AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases [73.04652687616286]
本稿では,RAG とRAG をベースとした LLM エージェントを標的とした最初のバックドア攻撃である AgentPoison を提案する。
従来のバックドア攻撃とは異なり、AgentPoisonは追加のモデルトレーニングや微調整を必要としない。
エージェントごとに、AgentPoisonは平均攻撃成功率を80%以上達成し、良質なパフォーマンスに最小限の影響を与える。
論文 参考訳(メタデータ) (2024-07-17T17:59:47Z) - Demystifying Poisoning Backdoor Attacks from a Statistical Perspective [35.30533879618651]
バックドア攻撃は、そのステルス性や潜在的に深刻な影響により、重大なセキュリティリスクを引き起こす。
本稿では,一定のトリガを組み込んだバックドア攻撃の有効性を評価する。
我々の導出した理解は、識別モデルと生成モデルの両方に適用できる。
論文 参考訳(メタデータ) (2023-10-16T19:35:01Z) - Poisoned classifiers are not only backdoored, they are fundamentally
broken [84.67778403778442]
一般的に研究されている、分類モデルに対するバックドア中毒攻撃の下で、攻撃者はトレーニングデータのサブセットに小さなトリガーを追加する。
毒を盛った分類器は、引き金を持つ敵のみに弱いと推定されることが多い。
本稿では,このバックドア型分類器の考え方が誤りであることを実証的に示す。
論文 参考訳(メタデータ) (2020-10-18T19:42:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。