論文の概要: SkillPoison: Progressive Skill Poisoning via Successful Experiences
- arxiv url: http://arxiv.org/abs/2610.07645v1
- Date: Tue, 06 Oct 2026 02:38:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.761952
- Title: SkillPoison: Progressive Skill Poisoning via Successful Experiences
- Title(参考訳): SkillPoison: 成功した経験によるプログレッシブスキル中毒
- Abstract要約: 自己改善型LLMエージェントは、成功経験を持続的で再利用可能なスキルに蒸留する傾向にある。
既存のスキルアタック手法は、悪意のあるトリガー、行動、偽の事実を個々の経験や抽出されたスキルに注入することで、この学習パイプラインを破損させる。
SkillPoisonは、経験を通じてスキルを徐々に害する新しいフレームワークである。
- 参考スコア(独自算出の注目度): 16.556161320731967
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-improving LLM agents increasingly distill successful experiences into persistent, reusable skills. Existing skill attack methods corrupt this learning pipeline by injecting malicious triggers, behaviors, or false facts into individual experiences or extracted skills. However, such attacks are easily detected, and the injected malicious behaviors often fail to accumulate as persistent skills. In this paper, we show that skill poisoning can arise even from verified successful experiences, without making any individual trajectory malicious. Based on this insight, we propose SkillPoison, a novel framework that progressively poisons skill via successful experiences. SkillPoison first constructs a set of successful experiences that reinforce a target behavior, and then removes the contextual conditions that constrain when the behavior applies. Rather than injecting malicious content, SkillPoison shapes how the skill extractor generalizes, allowing useful behavior to support task success while inducing harmful behavior when they are misapplied. Extensive experiments on three benchmarks show that SkillPoison achieves 95.71% attack success rates, while all injected experiences remain task-correct and pass verification and lexical inspection. Our code, data and implementation details are available for the community at https://github.com/DEEP-JLU/SkillPoison.
- Abstract(参考訳): 自己改善型LLMエージェントは、成功経験を持続的で再利用可能なスキルに蒸留する傾向にある。
既存のスキルアタック手法は、悪意のあるトリガー、行動、偽の事実を個々の経験や抽出されたスキルに注入することで、この学習パイプラインを破損させる。
しかし、このような攻撃は容易に検出され、注入された悪意のある振る舞いは永続的なスキルとして蓄積されないことが多い。
本稿では, 個別の軌跡を悪用することなく, 評価された経験からでも, スキル中毒が発生しうることを示す。
この知見に基づいて、我々は、成功経験を通じてスキルを徐々に害する新しいフレームワークであるSkillPoisonを提案する。
SkillPoisonはまず、ターゲットの振る舞いを強化する一連の成功体験を構築し、次に、振る舞いが適用されるときに制約されるコンテキスト条件を取り除きます。
SkillPoisonは悪意のあるコンテンツを注入するのではなく、スキル抽出器がいかに一般化するかを形作る。
3つのベンチマークの大規模な実験は、SkillPoisonが95.71%の攻撃成功率を達成したことを示している。
私たちのコード、データ、実装の詳細は、https://github.com/DEEP-JLU/SkillPoison.comでコミュニティに公開されています。
関連論文リスト
- Demystifying Agent Skills: Why They Work-Until They Don't [58.92875630998418]
既存の評価は、スキルが集約されたタスクの成功を改善するかどうかを主に測定する。
我々は、表現、結果アノテーション、検索難易度、スキルのクロスフレームワークの影響を分離する。
我々はこれらの観察を3つの高レベルカテゴリと12のスキルユースモードの分類に集約する。
論文 参考訳(メタデータ) (2026-08-14T07:26:38Z) - When Experience Becomes Instruction: Trajectory Poisoning in Self-Evolving Agent Skill Systems [9.77811063571131]
SES (Self-evolving skill) システムは、信頼できない経験を信頼できない指導にすることを可能にした。
本稿では,この促進プロセスに対するトラジェクティブ・ポジショニング・アタックであるPoisonedEvolutionを紹介する。
スキルヴィジブルなブラックボックス攻撃者は、目標とするスキルを検査し、有界な証拠を提供することができるが、プライベートプールや進化ロジックを観察したり、スキルバンクを編集することはできない。
論文 参考訳(メタデータ) (2026-08-06T03:32:43Z) - SkillJack: Persistent Skill Backdoors in Self-Evolving Agents [5.713807329849712]
textbfSkillJackは、自己進化エージェントの体験からスキルへのパイプラインを利用する最初の攻撃である。
ランタイムコンテキストを直接操作する代わりに、SkillJackはエージェント自身の学習プロセスをハイジャックして、悪意のある振る舞いを再利用可能なスキルレパートリーに埋め込む。
以上の結果から,新たな攻撃面としてのスキル進化と,スキルライフサイクル保護のモチベーションが示された。
論文 参考訳(メタデータ) (2026-08-04T11:51:23Z) - SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - On the Exploitability of Instruction Tuning [103.8077787502381]
そこで本研究では,モデルの動作を変えるための命令チューニングを,相手がどのように活用できるかを検討する。
自動データ中毒パイプラインである textitAutoPoison を提案する。
結果から、AutoPoisonは、少数のデータだけを中毒することで、敵がモデルの振る舞いを変えることを可能にする。
論文 参考訳(メタデータ) (2023-06-28T17:54:04Z) - Accumulative Poisoning Attacks on Real-time Data [56.96241557830253]
我々は、よく設計されたが簡単な攻撃戦略が、中毒効果を劇的に増幅できることを示します。
我々の研究は、よく設計されたが簡単な攻撃戦略が、中毒効果を劇的に増幅できることを検証する。
論文 参考訳(メタデータ) (2021-06-18T08:29:53Z) - Provable Defense Against Delusive Poisoning [64.69220849669948]
本研究は, 対人訓練が妄想性中毒に対する防御法であることを示す。
これは、敵の訓練が妄想的中毒に対する原則的な防御方法であることを意味している。
論文 参考訳(メタデータ) (2021-02-09T09:19:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。