論文の概要: When Experience Becomes Instruction: Trajectory Poisoning in Self-Evolving Agent Skill Systems
- arxiv url: http://arxiv.org/abs/2608.05563v2
- Date: Fri, 07 Aug 2026 09:49:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 14:11:31.090577
- Title: When Experience Becomes Instruction: Trajectory Poisoning in Self-Evolving Agent Skill Systems
- Title(参考訳): 体験が指導されるとき--自己進化型エージェントスキルシステムにおける軌道中毒
- Authors: Jialuo Chen, Lingqi Jiang, Xinhao Deng, Xiaohu Du, Jianan Ma, Yunhao Feng, Yuqi Qing, Zhihao Yuan, Linkang Du, Jingyi Wang,
- Abstract要約: SES (Self-evolving skill) システムは、信頼できない経験を信頼できない指導にすることを可能にした。
本稿では,この促進プロセスに対するトラジェクティブ・ポジショニング・アタックであるPoisonedEvolutionを紹介する。
スキルヴィジブルなブラックボックス攻撃者は、目標とするスキルを検査し、有界な証拠を提供することができるが、プライベートプールや進化ロジックを観察したり、スキルバンクを編集することはできない。
- 参考スコア(独自算出の注目度): 9.77811063571131
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-evolving skill (SES) systems distill agent trajectories into persistent skills, allowing untrusted experience to become trusted instruction. We introduce PoisonedEvolution, a trajectory-poisoning attack on this promotion process. Our skill-visible black-box attacker can inspect a target skill and contribute bounded evidence, but cannot observe private pools or evolution logic or edit the skill bank. Artifact poisoning requires Inclusion, Evolution Attribution, and Realization. Attribution is the distinctive bottleneck: the target behavior must appear causally useful, recurrent, and generalizable before promotion. We evaluate four representative security-effect families using inert canary specifications. At 10% attacker support, across six mainstream LLM evolvers in SkillClaw, PoisonedEvolution embeds target behaviors in 546/600 trials (91.0% SER). On the structurally different Trace2Skill pipeline at the same ratio, it embeds target behaviors in 369/600 trials (61.5% SER), demonstrating transfer across evolution architectures. In a representative controlled study, three consistent attacker records suffice in a 30-record batch, whereas a single record is much weaker. Ablations identify recurring support, causal framing, and domain-aligned encoding as the main determinants of success. These findings expose evidence promotion as a security boundary for self-evolving agents.
- Abstract(参考訳): SES (Self-evolving skill) システムは、信頼できない経験を信頼できない指導にすることを可能にした。
本稿では,この促進プロセスに対するトラジェクティブ・ポジショニング・アタックであるPoisonedEvolutionを紹介する。
スキルヴィジブルなブラックボックス攻撃者は、目標とするスキルを検査し、有界な証拠を提供することができるが、プライベートプールや進化ロジックを観察したり、スキルバンクを編集することはできない。
アーティファクト中毒には包摂性、進化的帰属性、実現性が必要である。
属性は特徴的なボトルネックであり、ターゲットの振る舞いは、宣伝の前に因果的に有用で、繰り返し、一般化可能でなければならない。
不活性なカナリア仕様を用いて,4つの代表的なセキュリティ・エフェクト・ファミリーを評価した。
10%のアタッカーサポートで、SkillClawの6つの主要なLLM進化型にまたがって、PoisonedEvolutionは546/600のトライアル(91.0% SER)にターゲットの動作を組み込む。
構造的に異なるTrace2Skillパイプラインでは、ターゲットの動作を369/600トライアル(61.5% SER)に埋め込む。
代表的な対照研究では、3つの一貫した攻撃記録が30レコードのバッチで十分であるのに対して、1つの記録はより弱い。
アブレーションは、成功の主要な決定要因として、繰り返しの支持、因果フレーミング、ドメイン整合性エンコーディングを識別する。
これらの知見は、自己進化型エージェントのセキュリティ境界としてのエビデンス促進を示唆している。
関連論文リスト
- SkillJack: Persistent Skill Backdoors in Self-Evolving Agents [5.713807329849712]
textbfSkillJackは、自己進化エージェントの体験からスキルへのパイプラインを利用する最初の攻撃である。
ランタイムコンテキストを直接操作する代わりに、SkillJackはエージェント自身の学習プロセスをハイジャックして、悪意のある振る舞いを再利用可能なスキルレパートリーに埋め込む。
以上の結果から,新たな攻撃面としてのスキル進化と,スキルライフサイクル保護のモチベーションが示された。
論文 参考訳(メタデータ) (2026-08-04T11:51:23Z) - Agent Skills Matter: Inferring Proprietary Skills from Execution Trajectories [28.506562107355652]
本稿では,エージェント動作におけるスキルシグネチャの繰り返しを利用するフレームワークであるSigLeakを紹介する。
多様な、意思決定に富んだ診断タスクを構築し、スキル対応とスキル障害のトラジェクトリとを対比し、分離されたパターンから再構築されたスキルを反復的に洗練する。
平均的なスキル障害参照よりも成功率を6.88ポイント引き上げ、総合スキルシムを達成している。
論文 参考訳(メタデータ) (2026-07-28T10:40:59Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry [49.83108591873481]
SKILL.md - エージェントスキルライフサイクルの3つのステージを対象とするアタックのみを調査する。
SKILL.mdは受動的ドキュメントではなく、サードパーティのエージェントが発見し、信頼し、使用する機能を形成する運用テキストであることを示す。
論文 参考訳(メタデータ) (2026-05-12T02:11:54Z) - BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning [34.60596020541521]
我々はBadSkillを紹介します。BadSkillは、モデル・イン・スキル脅威サーフェスをターゲットとするバックドア攻撃の定式化です。
BadSkillでは、敵が隠れペイロードをアクティベートするために、組み込まれたモデルがバックドアで調整された、一見良心的なスキルを公開している。
ベンチマークは8つのトリガータスクと5つの非トリガー制御スキルを含む13のスキルにまたがっており、主な評価セットは571の負のクラスクエリと396のトリガー整列クエリである。
BadSkillは8つのトリガースキルの平均攻撃成功率(ASR)を99.5%まで達成し、負のクラスのクエリに対して強い良識的な精度を維持している。
論文 参考訳(メタデータ) (2026-04-10T14:48:29Z) - Intentional Deception as Controllable Capability in LLM Agents [0.0]
本稿では,マルチエージェントシステムにおいて,意図的騙しを工学的能力として体系的に研究する。
本研究では,ターゲットエージェントの特徴を推定し,その信念や動機に反する行動に対して,意図的反応を操る2段階のシステムについて検討する。
認知的介入は、一様分布ではなく、特定の行動プロファイルに集中する差分効果を生じさせる。
論文 参考訳(メタデータ) (2026-03-08T23:48:49Z) - Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents [58.69865074060139]
エージェントの自己進化が意図しない方法で逸脱し、望ましくない結果や有害な結果に至る場合について検討する。
我々の経験から、誤進化は広範囲にわたるリスクであり、最上位のLSM上に構築されたエージェントにも影響を及ぼすことが判明した。
我々は、より安全で信頼性の高い自己進化型エージェントを構築するためのさらなる研究を促すための潜在的な緩和戦略について議論する。
論文 参考訳(メタデータ) (2025-09-30T14:55:55Z) - Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models [53.416234157608]
本稿では,タスク命令付きクラウドソースデータセット上でモデルが訓練され,優れたパフォーマンスを実現するという,創発的命令チューニングパラダイムのセキュリティ上の懸念について検討する。
本研究は、悪意のある指示をほとんど出さず、データ中毒によるモデル行動を制御することによって、攻撃者がバックドアを注入できることを実証する。
論文 参考訳(メタデータ) (2023-05-24T04:27:21Z) - Provable Defense Against Delusive Poisoning [64.69220849669948]
本研究は, 対人訓練が妄想性中毒に対する防御法であることを示す。
これは、敵の訓練が妄想的中毒に対する原則的な防御方法であることを意味している。
論文 参考訳(メタデータ) (2021-02-09T09:19:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。