論文の概要: Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks
- arxiv url: http://arxiv.org/abs/2609.15029v1
- Date: Mon, 14 Sep 2026 04:44:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:06.074937
- Title: Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks
- Title(参考訳): より強力なLSMバックドアアタックにポゾンセットを選ばせる方法
- Abstract要約: バックドアの毒殺攻撃は、さもなければクリーンな微調整データに有毒な例を付加する。
これは最悪のケースの脆弱性を過小評価する可能性がある。
SAILS (Set-level Audit-Informed Iterative Learned Selection) を導入する。
- 参考スコア(独自算出の注目度): 52.041551928780244
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Backdoor poisoning attacks add poisoned examples to otherwise-clean finetuning data, pairing a trigger with a target behavior that the model learns to produce when the trigger appears. Existing evaluations typically fix the number of poisoned examples and sample them at random from a candidate pool. We show that this can severely underestimate worst-case vulnerability: across three LLaMA-3-8B backdoor settings, holding the model, clean data, and poison count fixed, attack success ranges from 3% to 80% depending only on which poison set is chosen. We formalize poison selection as oracle-budgeted set optimization and introduce SAILS (Set-level Audit-Informed Iterative Learned Selection), which learns a set scorer from a few hundred finetune-and-evaluate runs, ranks millions of candidate sets, and audits only a small shortlist. SAILS improves held-out attack success by 30 percentage points on average over the strongest influence baselines, transfers from small-scale to full-scale finetuning, and extends to code-generation, agentic, and API-only backdoors.
- Abstract(参考訳): バックドア中毒攻撃は、他のクリーンな微調整データに有毒な例を加え、トリガーとターゲットの振る舞いを組み合わせ、トリガーが現れたときにモデルが生成することを学ぶ。
既存の評価では、通常、有毒なサンプルの数を固定し、候補プールからランダムにサンプリングする。
3つのLLaMA-3-8Bバックドア設定、モデル保持、クリーンデータ、毒素数固定、攻撃成功率は、どの毒素セットが選択されたかによって3%から80%である。
SAILS (Set-level Audit-Informed Iterative Learned Selection) を導入し、数百の微調整・評価ランからセットスコアを学習し、数百万の候補セットをランク付けし、小さなショートリストのみを監査する。
SAILSは、最強の影響力ベースラインよりも平均30パーセントの攻撃成功率向上、小規模からフルスケールのファインタニングへの移行、コード生成、エージェント、APIのみのバックドアへの拡張を実現している。
関連論文リスト
- Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples [81.67041843907371]
この研究は、データセットのサイズに関わらず、毒殺攻撃がほぼ一定数のドキュメントを必要とすることを初めて実証した。
250の有毒なドキュメントも同様に、すべてのモデルとデータセットサイズにわたってモデルを妥協している。
以上の結果から,データ中毒によるバックドア注入は,従来考えられていたよりも大型モデルの方が容易である可能性が示唆された。
論文 参考訳(メタデータ) (2025-10-08T16:25:05Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - Neural Antidote: Class-Wise Prompt Tuning for Purifying Backdoors in CLIP [51.04452017089568]
CBPT(Class-wise Backdoor Prompt Tuning)は、テキストプロンプトでCLIPを間接的に浄化する効率的な防御機構である。
CBPTは、モデルユーティリティを保持しながら、バックドアの脅威を著しく軽減する。
論文 参考訳(メタデータ) (2025-02-26T16:25:15Z) - SEEP: Training Dynamics Grounds Latent Representation Search for Mitigating Backdoor Poisoning Attacks [53.28390057407576]
現代のNLPモデルは、様々なソースから引き出された公開データセットでしばしば訓練される。
データ中毒攻撃は、攻撃者が設計した方法でモデルの振る舞いを操作できる。
バックドア攻撃に伴うリスクを軽減するために、いくつかの戦略が提案されている。
論文 参考訳(メタデータ) (2024-05-19T14:50:09Z) - Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning [57.50274256088251]
パラメータ効率のよい微調整(PEFT)は,重み付けによるバックドア攻撃の影響を受けやすいことを示す。
PEFTを利用したPSIM(Poisoned Sample Identification Module)を開発した。
テキスト分類タスク,5つの微調整戦略,および3つの重み付けバックドア攻撃手法について実験を行った。
論文 参考訳(メタデータ) (2024-02-19T14:22:54Z) - Boosting Backdoor Attack with A Learnable Poisoning Sample Selection
Strategy [32.5734144242128]
データポゾンベースのバックドア攻撃は、ターゲットモデルのトレーニングプロセスを制御することなく、トレーニングデータセットを操作することによって、モデルにバックドアを挿入することを目的としている。
そこで本研究では,min-max最適化を用いて,マスクとモデルパラメータを併用して学習可能な毒素サンプル選択手法を提案する。
ベンチマークデータセットの実験では、バックドア攻撃性能を高めるためのアプローチの有効性と効率が示されている。
論文 参考訳(メタデータ) (2023-07-14T13:12:21Z) - Data-Efficient Backdoor Attacks [14.230326737098554]
ディープニューラルネットワークはバックドア攻撃に弱い。
本稿では,その選択による毒性データ効率の向上について定式化する。
同じ攻撃成功率は、有毒サンプル量のわずか47%から75%で達成できる。
論文 参考訳(メタデータ) (2022-04-22T09:52:22Z) - Under-confidence Backdoors Are Resilient and Stealthy Backdoors [35.57996363193643]
バックドア攻撃は、被害者モデルが事前に設計されたバックドアで注入された任意の入力に対して設計された出力を生成することを目的としている。
高攻撃成功率を達成するため、既存の攻撃手法のほとんどは、汚染されたサンプルのラベルをターゲットクラスに変更している。
この慣行は、しばしば被害者モデルをバックドアに過度に適合させ、攻撃は出力制御に非常に効果的であるが、人間の検査や自動防御アルゴリズムによって容易に識別できる。
論文 参考訳(メタデータ) (2022-02-19T01:31:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。