論文の概要: Understanding and Enhancing Backdoor Persistency in LLM Agent Post-Training
- arxiv url: http://arxiv.org/abs/2610.07510v1
- Date: Mon, 05 Oct 2026 23:23:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.705194
- Title: Understanding and Enhancing Backdoor Persistency in LLM Agent Post-Training
- Title(参考訳): LLMエージェントポストトレーニングにおけるバックドアの持続性理解と強化
- Abstract要約: 攻撃者がバックドアでモデルを供給するサプライチェーンの脅威について検討する。
このようなバックドアが、ディベロッパの監督された微調整とその後のタスクレベルの強化学習を生き残るかどうかを問う。
以上の結果から, バックドアは, 良心的なポストトレーニングを通じて活動を続けることができ, 敵の永続性は意図的に向上する可能性が示唆された。
- 参考スコア(独自算出の注目度): 9.062286323463672
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Developers can build LLM agents by adapting third-party models through benign post-training. We study a supply-chain threat in which an attacker supplies a model with a backdoor: hidden behavior that produces malicious outputs when a particular input pattern appears. Focusing on software-engineering agents, we ask whether such backdoors survive the developer's supervised fine-tuning (SFT) and subsequent task-level reinforcement learning (RL). We observe that benign SFT substantially reduces attack success, but subsequent RL often preserves the residual behavior and sometimes even increases attack success. Our analysis of backdoor erosion during SFT identifies two factors that may favor survival: initial backdoor strength and gradient compatibility with benign training. These factors motivate PersistBD, which refines an already-backdoored model before release to improve its persistency through the benign post-training process. On Qwen2.5-Coder-7B, PersistBD raises attack success from 20% to 74% after SFT and from 20% to 76% after SFT-RL, while maintaining comparable benign task performance. Together, our results show that backdoors can remain active through benign post-training and that adversaries can deliberately increase their persistence. This highlights a supply-chain risk for AI developers and motivates stronger techniques for detecting and mitigating inherited backdoors when adapting third-party models into agents. Our code is available at https://github.com/uiuc-kang-lab/PersistBD.
- Abstract(参考訳): 開発者は、良心的なポストトレーニングを通じてサードパーティモデルを適用することで、LCMエージェントを構築することができる。
本研究では,攻撃者が特定の入力パターンが現れると悪意のある出力を生成する隠された動作をモデルにバックドアで供給するサプライチェーンの脅威について検討する。
ソフトウェア・エンジニアリング・エージェントに焦点をあてて、そのようなバックドアがディベロッパの監督された微調整(SFT)とその後のタスクレベル強化学習(RL)を生き残るかどうかを問う。
良性SFTは攻撃成功を著しく減少させるが、その後のRLは残留挙動を保ち、時には攻撃成功を増大させる。
SFTにおけるバックドア侵食の分析では,初期バックドア強度と良性トレーニングとの勾配適合性の2つの要因を同定した。
これらの要因はPersistBDを動機付け、リリース前にすでにバックドアされたモデルを洗練し、良質なポストトレーニングプロセスを通じて持続性を改善する。
Qwen2.5-Coder-7Bでは、PersistBDは攻撃成功率をSFTの20%から74%、SFT-RLの20%から76%に引き上げ、同等の良質なタスク性能を維持している。
また,本研究の結果から,バックドアは訓練後の良質な姿勢を保ち,敵の永続性を高めることができることがわかった。
これはAI開発者にとってのサプライチェーンリスクを強調し、サードパーティのモデルをエージェントに適合させる際に、継承されたバックドアを検出し緩和する強力なテクニックを動機付けている。
私たちのコードはhttps://github.com/uiuc-kang-lab/PersistBD.comで公開されています。
関連論文リスト
- Self-Purification Mitigates Backdoors in Multimodal Diffusion Language Models [74.1970982768771]
確立されたデータポゾンパイプラインは,MDLMにバックドアを埋め込むことに成功した。
拡散自己浄化(Diffusion Self-Purification)と呼ばれるMDLMのバックドア防御フレームワークについて紹介する。
論文 参考訳(メタデータ) (2026-02-24T15:47:52Z) - Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs [33.568493008851746]
組込みバックドアが多段階後細調整によって持続するかどうかについて検討した。
P-Trojanは、繰り返し更新するバックドアの永続性を明示的に最適化するトリガーベースの攻撃アルゴリズムである。
論文 参考訳(メタデータ) (2025-12-12T11:40:51Z) - Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models [71.44858461725893]
信頼できない第三者によって微調整されたモデルを考えると、モデルがバックドアで注入されたかどうかが重要で難しい問題である。
既存の検出方法は通常、トレーニングデータセット、バックドアトリガー、ターゲットの事前知識に依存する。
このような事前知識を伴わずに動作する新しいモデルレベルの検出フレームワークであるAssimilation Matters in DETection (AMDET)を紹介する。
論文 参考訳(メタデータ) (2025-11-29T06:20:00Z) - Backdoor Unlearning by Linear Task Decomposition [69.91984435094157]
ファンデーションモデルは、敵の摂動と標的のバックドア攻撃に非常に敏感である。
既存のバックドア除去アプローチは、有害な振る舞いをオーバーライドするために、コストのかかる微調整に依存している。
このことは、バックドアがモデルの一般的な能力を損なうことなく取り除けるかどうかという問題を提起する。
論文 参考訳(メタデータ) (2025-10-16T16:18:07Z) - Behavior Backdoor for Deep Learning Models [95.50787731231063]
我々は,行動訓練されたバックドアモデルトレーニング手順として定義された行動バックドアアタックに向けた第一歩を踏み出す。
本稿では,行動バックドアを実装する最初のパイプライン,すなわち量子バックドア(QB)攻撃を提案する。
さまざまなモデル、データセット、タスクで実験が行われ、この新たなバックドア攻撃の有効性が実証された。
論文 参考訳(メタデータ) (2024-12-02T10:54:02Z) - Flatness-aware Sequential Learning Generates Resilient Backdoors [7.969181278996343]
近年、バックドア攻撃は機械学習モデルのセキュリティに対する新たな脅威となっている。
本稿では,連続学習(CL)技術を活用して,バックドアのCFに対処する。
レジリエントなバックドアを生成可能な,SBL(Sequential Backdoor Learning)という新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-07-20T03:30:05Z) - Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models [42.19147076519423]
生成型大規模言語モデル(LLM)は、理解から推論まで、様々な自然言語処理(NLP)タスクを支配している。
悪意のある敵は、毒データをオンラインで公開し、毒データに基づいて事前訓練された被害者のLSMに対するバックドア攻撃を行うことができる。
生成LDMの不要なバックドアマッピングを除去するためにSANDE(Simulate and Eliminate)を提案する。
論文 参考訳(メタデータ) (2024-05-13T11:53:42Z) - Backdoor Learning on Sequence to Sequence Models [94.23904400441957]
本稿では,シークエンス・ツー・シークエンス(seq2seq)モデルがバックドア攻撃に対して脆弱かどうかを検討する。
具体的には、データセットの0.2%のサンプルを注入するだけで、Seq2seqモデルに指定されたキーワードと文全体を生成することができる。
機械翻訳とテキスト要約に関する大規模な実験を行い、提案手法が複数のデータセットやモデルに対して90%以上の攻撃成功率を達成することを示した。
論文 参考訳(メタデータ) (2023-05-03T20:31:13Z) - Backdoor Defense via Suppressing Model Shortcuts [91.30995749139012]
本稿では,モデル構造の角度からバックドア機構を探索する。
攻撃成功率 (ASR) は, キースキップ接続の出力を減少させると著しく低下することを示した。
論文 参考訳(メタデータ) (2022-11-02T15:39:19Z) - Backdoors Stuck At The Frontdoor: Multi-Agent Backdoor Attacks That
Backfire [8.782809316491948]
複数の攻撃者が同時に被害者モデルをバックドアしようとするマルチエージェントバックドア攻撃シナリオについて検討する。
エージェントが集団攻撃の成功率の低いゲームで一貫したバックファイリング現象が観察される。
その結果,実践環境におけるバックドア・ディフェンス研究の再評価の動機となった。
論文 参考訳(メタデータ) (2022-01-28T16:11:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。