論文の概要: SkillJack: Persistent Skill Backdoors in Self-Evolving Agents
- arxiv url: http://arxiv.org/abs/2608.03509v2
- Date: Fri, 07 Aug 2026 07:07:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 14:11:30.983766
- Title: SkillJack: Persistent Skill Backdoors in Self-Evolving Agents
- Title(参考訳): SkillJack: 自己進化エージェントの永続的なスキルバックドア
- Authors: Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo,
- Abstract要約: textbfSkillJackは、自己進化エージェントの体験からスキルへのパイプラインを利用する最初の攻撃である。
ランタイムコンテキストを直接操作する代わりに、SkillJackはエージェント自身の学習プロセスをハイジャックして、悪意のある振る舞いを再利用可能なスキルレパートリーに埋め込む。
以上の結果から,新たな攻撃面としてのスキル進化と,スキルライフサイクル保護のモチベーションが示された。
- 参考スコア(独自算出の注目度): 5.713807329849712
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-evolving agents increasingly convert interaction histories into reusable skills that persist beyond individual tasks. While prior work studies memory and retrieval poisoning, such attacks only affect agents when poisoned records are retrieved as context. We uncover a new and more fundamental risk: poisoned experiences can be transformed by the agent itself into durable behavioral artifacts. We present \textbf{SkillJack}, the first attack that exploits the experience-to-skill pipeline of self-evolving agents. Instead of directly manipulating runtime context, SkillJack hijacks the agent's own learning process to implant malicious behaviors into its reusable skill repertoire. We identify three key properties of this transformation: \emph{sanitization whitewashing}, where malicious intent is obscured during skill extraction; \emph{cross-layer promotion}, where transient experiences become persistent capabilities; and \emph{persistence isolation}, where the attack survives removal of its original source records. We evaluate SkillJack on two representative systems, SkillX and Anything2Skill, using a shared dataset of 150 trajectories across four policy-risk categories. Results show that skill extraction substantially reduces attack detectability: in SkillX, safety detection drops from 98.5\% for poisoned trajectories to 11.4\% for extracted skills, while Anything2Skill shows a similar effect. Meanwhile, the implanted skills remain effective, achieving attack success rates of 56.2\% and 89.2\% on the two systems, respectively. Furthermore, 80.0\% of skill-mediated attacks persist after deleting the original poisoned records, and some skills unintentionally activate on benign queries. Our findings reveal skill evolution as a new attack surface and motivate provenance-aware skill lifecycle protection. Our code is available at https://github.com/Tencent/AI-Infra-Guard/research/skilljack.
- Abstract(参考訳): 自己進化型エージェントは、インタラクション履歴を、個々のタスクを超えて継続する再利用可能なスキルに変換する傾向にある。
以前の研究では記憶と回復中毒が研究されていたが、これらの攻撃は、中毒記録がコンテキストとして回収された場合にのみ、エージェントに影響を及ぼす。
有毒な体験は、エージェント自身によって、耐久性のある行動アーティファクトに変換される。
我々は、自己進化エージェントの体験からスキルへのパイプラインを利用する最初の攻撃である \textbf{SkillJack} を提示する。
ランタイムコンテキストを直接操作する代わりに、SkillJackはエージェント自身の学習プロセスをハイジャックして、悪意のある振る舞いを再利用可能なスキルレパートリーに埋め込む。
スキル抽出中に悪意のある意図が隠蔽される「emph{sanitization whitewashing」、過渡的な経験が永続的な能力となる「emph{cross-layer promotion」、攻撃が元のソースレコードの削除を生き残る「emph{persistence isolation」の3つの重要な特性を識別する。
我々はSkillJackをSkillXとAnything2Skillの2つの代表的なシステムで評価し、4つのポリシーリスクカテゴリにわたる150のトラジェクトリの共有データセットを用いて評価した。
その結果、スキル抽出は攻撃検出性を著しく低下させ、SkillXでは、毒道の安全性は98.5\%から抽出スキルの11.4\%に低下し、Anything2Skillも同様の効果を示した。
一方、移植された技術は有効であり、2つのシステムでそれぞれ56.2\%と89.2\%の攻撃成功率を達成した。
さらに、元の有毒レコードを削除した後、スキル介在する攻撃の80.0\%が持続し、一部のスキルは意図しないクエリで意図せずに活性化する。
以上の結果から,新たな攻撃面としてのスキル進化と,スキルライフサイクル保護のモチベーションが示された。
私たちのコードはhttps://github.com/Tencent/AI-Infra-Guard/research/skilljack.comから入手可能です。
関連論文リスト
- SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - SkillOS: Learning Skill Curation for Self-Evolving Agents [67.94374107466957]
本稿では,自己進化エージェントのスキルキュレーションを学習するための,経験駆動型RLトレーニングレシピであるSkillOSを提案する。
SkillOSは、凍結したエージェントエグゼキュータとトレーニング可能なスキルキュレーターを組み合わせて、蓄積したエクスペリエンスから外部SkillRepoを更新する。
SkillOSは、メモリフリーと強力なメモリベースラインを、有効性と効率の両方で一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-07T17:31:50Z) - HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents? [20.305306682682083]
エージェント生態系における有害なスキルの大規模測定を初めて行った。
スキルの4.93%(4,858)が有害であり、ClawHubは8.84%、Skills.Restは3.49%である。
そして、現実的なエージェントコンテキストにおける有害なスキルに対するエージェント安全性を評価するための最初のベンチマークであるHarmfulSkillBenchを構築します。
論文 参考訳(メタデータ) (2026-04-16T17:31:52Z) - BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning [34.60596020541521]
我々はBadSkillを紹介します。BadSkillは、モデル・イン・スキル脅威サーフェスをターゲットとするバックドア攻撃の定式化です。
BadSkillでは、敵が隠れペイロードをアクティベートするために、組み込まれたモデルがバックドアで調整された、一見良心的なスキルを公開している。
ベンチマークは8つのトリガータスクと5つの非トリガー制御スキルを含む13のスキルにまたがっており、主な評価セットは571の負のクラスクエリと396のトリガー整列クエリである。
BadSkillは8つのトリガースキルの平均攻撃成功率(ASR)を99.5%まで達成し、負のクラスのクエリに対して強い良識的な精度を維持している。
論文 参考訳(メタデータ) (2026-04-10T14:48:29Z) - SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems [28.8194560427555]
SkillTrojanは、モデルパラメータやトレーニングデータではなく、スキル実装をターゲットにしたバックドア攻撃である。
さまざまなスキルパターンとトリガー-ペイロード構成にまたがる、3000以上のキュレートされたバックドアスキルのデータセットをリリースします。
以上の結果から, スキルレベルのバックドアは, 良性行動の低下を最小限に抑え, 極めて効果的であることが示唆された。
論文 参考訳(メタデータ) (2026-04-08T08:24:48Z) - SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement [66.44008181092832]
LLMベースのエージェントシステムは、その能力を拡張するためにオープンレジストリからのエージェントスキルにますます依存している。
SkillAttackは、敵のプロンプトを通じて、スキル脆弱性の脆弱性を検証できるフレームワークである。
論文 参考訳(メタデータ) (2026-04-05T06:25:11Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - Malicious Agent Skills in the Wild: A Large-Scale Security Empirical Study [47.60135753021306]
サードパーティのエージェントスキルは、LLMベースのエージェントを拡張して、命令ファイルとユーザのマシン上で動作する実行可能なコードを生成する。
結果として生じる脅威を特徴づけるために、地中真実のデータセットは存在しない。
我々は,98,380のスキルを行動検証することで,悪質なエージェントスキルのラベル付きデータセットを構築した。
論文 参考訳(メタデータ) (2026-02-06T09:52:27Z) - Textual Backdoor Attacks Can Be More Harmful via Two Simple Tricks [58.0225587881455]
本稿では,既存のテキストバックドア攻撃をより有害にするための2つの簡単な手法を見出す。
最初のトリックは、被害者モデルのトレーニング中に毒や清潔なデータを識別するための追加のトレーニングタスクを追加することです。
2つ目は、汚染データに対応する元のクリーンデータを削除するのではなく、すべてのクリーンなトレーニングデータを使用することである。
論文 参考訳(メタデータ) (2021-10-15T17:58:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。