論文の概要: SkillSecurer: Detecting and Patching Prompt-Injection Vulnerabilities in AI Agent Skills
- arxiv url: http://arxiv.org/abs/2609.14079v1
- Date: Sat, 12 Sep 2026 17:52:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.652089
- Title: SkillSecurer: Detecting and Patching Prompt-Injection Vulnerabilities in AI Agent Skills
- Title(参考訳): SkillSecurer:AIエージェントスキルにおけるプロンプト注入脆弱性の検出とパッチング
- Abstract要約: SkillSecurerは、エージェントスキルのセキュリティリスクの生成、検出、ローカライズ、更新を行うフレームワークである。
レッドエージェントは、正確な修正を記録しながら、9つの脅威タイプにわたるコンテキスト互換のインジェクションを生成する。
ブルーエージェントは完全なスキルパッケージを分析し、根拠付きエビデンスを生成し、パッチを提案する。
- 参考スコア(独自算出の注目度): 0.6263481844384228
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent skills extend AI agents with reusable instructions, scripts, and configuration, but are also open to new attacks to influence an agent's decisions and actions. To address these risks, we present SkillSecurer, a fully agentic framework for generating, detecting, localising, and remediating security risks in agent skills. Its red agent generates context-compatible injections across nine threat types while recording the exact modification; its blue agent analyses complete skill packages, produces grounded evidence, and proposes patches. For controlled instances, a verifier compares findings and patches with the recorded injection, enabling injection-level evaluation. We thoroughly evaluate SkillSecurer by selecting the best backend LLM, comparing it with competitors, and manually cross-validating each evaluation stage. With its best performing backend, SkillSecurer is the only scanner to achieve a 100% injection detection rate. Next, we analyse popular skills from skills.sh, finding latent vulnerabilities in more than 17% of the skills examined. Testing some of those skills, we trigger actual incidents, showing the risks of running unverified skills. Our results show that context-aware LLM analysis can provide reliable injection localisation and actionable remediation beyond skill-level flagging alone.
- Abstract(参考訳): エージェントスキルは、再利用可能な命令、スクリプト、設定でAIエージェントを拡張するが、エージェントの決定とアクションに影響を与える新たな攻撃にも開放される。
これらのリスクに対処するために、エージェントスキルにおけるセキュリティリスクの生成、検出、ローカライズ、即時更新のための完全にエージェント的なフレームワークであるSkillSecurerを紹介します。
レッドエージェントは9種類の脅威タイプにまたがってコンテキスト互換の注入を生成し、ブルーエージェントは完全なスキルパッケージを分析し、根拠付きエビデンスを生成し、パッチを提案する。
制御されたインスタンスの場合、検証者は記録されたインジェクションと結果とパッチを比較し、インジェクションレベルの評価を可能にする。
我々は、SkillSecurerを最高のバックエンドLLMを選択し、競合他社と比較し、各評価ステージを手動で相互検証することで、徹底的に評価する。
最高のパフォーマンスのバックエンドを持つSkillSecurerは、100%インジェクション検出率を達成する唯一のスキャナである。
次に、スキル.shから人気のスキルを分析し、調査対象のスキルの17%以上に潜伏する脆弱性を見つけます。
これらのスキルの一部をテストすると、実際のインシデントを引き起こし、検証されていないスキルを実行するリスクを示しています。
以上の結果から,LLM分析は,スキルレベルフラグングだけでなく,信頼性の高いインジェクションローカライゼーションと実用的な修復を可能にする可能性が示唆された。
関連論文リスト
- ALIBI: Adaptive Agentic Attacks on LLM-Based Vulnerability Detectors via Adversarial Code Comments [12.021872048536766]
大きな言語モデルは、脆弱性検出やコードレビューといったセキュリティに敏感なタスクに対して、ますますデプロイされている。
ソースコードに埋め込まれた自然言語コンテキストへの依存は、これまで探索されていなかったアタックサーフェスを露呈する。
本稿では,自動適応ブラックボックス攻撃フレームワークであるALIBIについて述べる。
論文 参考訳(メタデータ) (2026-07-27T18:13:28Z) - OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills [14.078280127843108]
サードパーティのスキルには、実際の実行時にのみ発生する、潜伏する安全リスクが含まれる。
本研究では,現在のエージェントシステムがどのようにリスクを認識し,回避しているかを体系的に調査する。
定量的かつ質的な評価を支援するために,263のリスクスキルを含む専用安全ベンチマークOpenSkillRiskを構築した。
論文 参考訳(メタデータ) (2026-07-22T13:24:09Z) - SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry [49.83108591873481]
SKILL.md - エージェントスキルライフサイクルの3つのステージを対象とするアタックのみを調査する。
SKILL.mdは受動的ドキュメントではなく、サードパーティのエージェントが発見し、信頼し、使用する機能を形成する運用テキストであることを示す。
論文 参考訳(メタデータ) (2026-05-12T02:11:54Z) - SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement [66.44008181092832]
LLMベースのエージェントシステムは、その能力を拡張するためにオープンレジストリからのエージェントスキルにますます依存している。
SkillAttackは、敵のプロンプトを通じて、スキル脆弱性の脆弱性を検証できるフレームワークである。
論文 参考訳(メタデータ) (2026-04-05T06:25:11Z) - Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks [27.120130204872325]
SkillInjectは、広く使われているLLMエージェントの、スキルファイルによるインジェクションに対する感受性を評価するベンチマークである。
SkillInjectには、明らかに悪意のあるインジェクションから、その他の正当な命令に隠された微妙なコンテキスト依存的なアタックまで、202のインジェクションタスクペアが含まれている。
以上の結果から,今日のエージェントは,フロンティアモデルによる攻撃成功率の最大80%に対して,非常に脆弱であることが示唆された。
論文 参考訳(メタデータ) (2026-02-23T18:59:27Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents [54.29555239363013]
本稿では,間接的なインジェクション脆弱性を自動的に検出し,悪用するための汎用的なブラックボックスファジリングフレームワークであるAgentVigilを提案する。
我々はAgentVigilをAgentDojoとVWA-advの2つの公開ベンチマークで評価し、o3-miniとGPT-4oに基づくエージェントに対して71%と70%の成功率を達成した。
攻撃を現実世界の環境に適用し、悪質なサイトを含む任意のURLに誘導するエージェントをうまく誘導する。
論文 参考訳(メタデータ) (2025-05-09T07:40:17Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。