論文の概要: Chaining Skills to Hijack LLM Agents
- arxiv url: http://arxiv.org/abs/2610.01564v1
- Date: Thu, 01 Oct 2026 12:28:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.112101
- Title: Chaining Skills to Hijack LLM Agents
- Title(参考訳): ハイジャックLDMエージェントのチェインスキル
- Abstract要約: LLMエージェントは、特定のタスクのパフォーマンスを改善するためにスキルを使用する。
スキルはオープンソースリポジトリから生まれる可能性があるため、このハンドオフはアタッカーが管理するクレームを後から行うことができる。
本稿では,ユーザタスクやアタッカーが選択したアクションに合わせて,敵のスキルチェーンを構築し,洗練するAPEXを紹介する。
- 参考スコア(独自算出の注目度): 13.991514285520788
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM agents use skills to improve performance on specialized tasks. To complete a user request, an agent may invoke several skills in sequence, allowing information produced under one skill to guide the next. Because skills may come from open-source repositories, this handoff can also carry attacker-controlled claims into later decisions. In this paper, we introduce APEX, which constructs and refines adversarial skill chains tailored to a user task and an attacker-selected action. The key insight is that an agent-written record of genuine task progress can carry a false claim of user approval across skills: an upstream skill induces the agent to create the record, and a downstream skill uses it to direct the attacker-selected action. Across four targeted-action families and six models on SkillsBench, the chains induce the selected action in 512 of 690 attempts (74.2%). On GPT-5.4, the full chain succeeds in 84.3% of attempts, compared with 17.4% when the workflow is merged into one skill. We further evaluate a prompting defense that asks the agent to check skill-produced files against the original request. On GPT-5.4, it lowers targeted-action success from 84.3% to 59.1%, while the verifier test-pass rate across 72 benign native-skill tasks falls from 86.7% to 56.3%. These results highlight the need for defenses that prevent attacker-directed actions while preserving legitimate task performance.
- Abstract(参考訳): LLMエージェントは、特定のタスクのパフォーマンスを改善するためにスキルを使用する。
ユーザ要求を完了させるために、エージェントは複数のスキルを順番に起動し、1つのスキルで生成された情報が次のスキルを導くことができる。
スキルはオープンソースのリポジトリから生まれる可能性があるため、このハンドオフはアタッカーが管理するクレームを後から行うこともできる。
本稿では,ユーザタスクやアタッカーが選択したアクションに合わせて,敵のスキルチェーンを構築し,洗練するAPEXを紹介する。
アップストリームスキルは、エージェントにレコードを作成するように誘導し、ダウンストリームスキルは、攻撃者が選択したアクションを指示するためにそれを使用する。
SkillsBenchの4つのターゲットアクションファミリーと6つのモデルで、チェーンは690回中512回(74.2%)に選択されたアクションを誘導する。
GPT-5.4では、ワークフローが1つのスキルにマージされた場合の17.4%と比較して、完全なチェーンは84.3%の試行で成功する。
さらに、エージェントに対して、元の要求に対して、スキル生成ファイルのチェックを依頼するプロンプトディフェンスも評価する。
GPT-5.4では、ターゲットアクションの成功率が84.3%から59.1%に低下し、72の良質なネイティブスキルタスクにおける検証テストパス率は86.7%から56.3%に低下した。
これらの結果は、正当なタスク性能を維持しながら攻撃者指向のアクションを防止するための防御の必要性を強調している。
関連論文リスト
- MMSkillRisk: Can Agents Stay Safe When Multimodal Skills Become Traps? [20.554629787408754]
我々はMMSkillRiskを紹介した。MMSkillRiskは、マルチモーダルスキルにおける画像による攻撃のエンドツーエンド安全性評価のための最初のベンチマークである。
28のキュレートされたクリーンスキルから構築されたMMSkillRiskには、36のアタックパッケージと、5つのアタック目標にまたがる108の実行可能なケースが含まれている。
攻撃成功率は36.5%で、GPT-5.6-solは72.2%、Codexは72.2%だった。
論文 参考訳(メタデータ) (2026-09-28T08:07:45Z) - Task-Conditioned Least-Privilege Learning for Executable Terminal and MCP Agents [45.88028371034407]
ツールを使用する大規模言語モデルエージェントは、ユーザが許可しなかったり、タスクが不要であったりする権限を行使しながらタスクを完了することができる。
本研究では,6次元のリスクを伴って各行動が実行前および観測結果から監査される枠組みを提案する。
このフレームワークを1500以上のタスクでQwen3.5-4Bでトレーニングした後、選択された種子は2,896回の評価エピソードで98.48%の安全成功に達した。
論文 参考訳(メタデータ) (2026-08-18T22:07:23Z) - TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation [13.298401993417611]
TRUSSは、機能的で安全性の高いエージェントスキルを生成するためのエビデンスガイド付きフレームワークである。
我々は,SkillGenBenchの168個のSkillInjectアーティファクト,155個のSkillSafetyBenchケース,および187個のタスクについてTRUSSを評価した。
スキル生成では、TRUSSはタスク効率を17.11%から52.94%に引き上げ、ベンチマークセキュリティ率は50.80%から100.00%に向上した。
論文 参考訳(メタデータ) (2026-08-18T09:52:57Z) - Demystifying Agent Skills: Why They Work-Until They Don't [58.92875630998418]
既存の評価は、スキルが集約されたタスクの成功を改善するかどうかを主に測定する。
我々は、表現、結果アノテーション、検索難易度、スキルのクロスフレームワークの影響を分離する。
我々はこれらの観察を3つの高レベルカテゴリと12のスキルユースモードの分類に集約する。
論文 参考訳(メタデータ) (2026-08-14T07:26:38Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - SkillGuard: A Permission Framework for Agent Skills [14.787581333168859]
我々はスキル中心のパーミッションフレームワークであるSkillGuardを紹介した。
SkillGuardを実世界の315のスキルとSkillInjectで評価した。
論文 参考訳(メタデータ) (2026-06-02T02:01:53Z) - SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry [49.83108591873481]
SKILL.md - エージェントスキルライフサイクルの3つのステージを対象とするアタックのみを調査する。
SKILL.mdは受動的ドキュメントではなく、サードパーティのエージェントが発見し、信頼し、使用する機能を形成する運用テキストであることを示す。
論文 参考訳(メタデータ) (2026-05-12T02:11:54Z) - SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement [66.44008181092832]
LLMベースのエージェントシステムは、その能力を拡張するためにオープンレジストリからのエージェントスキルにますます依存している。
SkillAttackは、敵のプロンプトを通じて、スキル脆弱性の脆弱性を検証できるフレームワークである。
論文 参考訳(メタデータ) (2026-04-05T06:25:11Z) - ContractSkill: Repairable Contract-Based Skills for Multimodal Web Agents [13.2889725132666]
私たちは、ドラフトスキルをコントラクト化された実行可能なアーティファクトに変換するフレームワークであるContractSkillを紹介します。
この表現は、決定論的検証、ステップレベルのフォールトローカライゼーション、最小限のパッチベースの修復を可能にする。
論文 参考訳(メタデータ) (2026-03-20T09:25:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。