論文の概要: AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills
- arxiv url: http://arxiv.org/abs/2605.13940v1
- Date: Wed, 13 May 2026 17:04:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.430034
- Title: AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills
- Title(参考訳): AgentTrap: サードパーティのエージェントスキルにおける実行時の信頼障害の測定
- Authors: Haomin Zhuang, Hanwen Xing, Yujun Zhou, Yuchen Ma, Yue Huang, Yili Shen, Yufei Han, Xiangliang Zhang,
- Abstract要約: サードパーティのスキルがLLMエージェントのパッケージエコシステムになりつつある。
悪質なスキルは、明らかに有害なアクションを実行するためにモデルを尋ねる必要はありません。
代わりに、ルーチンワークフローの一部として有害な振る舞いを偽装することができる。
本稿では,LLMエージェントが悪意のある実行動作に抵抗しながら,サードパーティのスキルを活用できるかどうかを評価するベンチマークであるAgentTrapを紹介する。
- 参考スコア(独自算出の注目度): 32.24433022603674
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Third-party skills are becoming the package ecosystem for LLM agents. They package natural-language instructions, helper scripts, templates, documents, and service configuration into reusable workflows. This makes skills useful, but it also introduces a new security problem: a malicious skill does not need to ask the model to perform an obviously harmful action. Instead, it can disguise the harmful behavior as part of a routine workflow, relying on the agent to execute that workflow with high-value permissions and limited human supervision. We introduce AgentTrap, a dynamic benchmark for evaluating whether LLM agents can use third-party skills while resisting malicious runtime behavior. AgentTrap contains 141 tasks: 91 malicious tasks and 50 benign utility tasks, covering 16 security-impact dimensions grounded in agent-skill supply-chain threats. In each task, the agent receives an ordinary user request, runs with installed skills that may contain malicious workflow elements, and is executed in a sandboxed environment. AgentTrap then judges complete trajectories for attack success, blocked or refused behavior, attack-not-triggered cases, and no-attack-evidence outcomes. Our central finding is that the most informative failures are not simple jailbreaks. Models often complete the visible user task while treating unsafe side effects introduced by the skill as part of the normal workflow. This motivates runtime evaluation of the concrete model--framework--workspace environment in which users actually delegate work. Code and data are available at https://github.com/zhmzm/AgentTrap and https://huggingface.co/datasets/zhmzm/AgentTrap.
- Abstract(参考訳): サードパーティのスキルがLLMエージェントのパッケージエコシステムになりつつある。
自然言語命令、ヘルパースクリプト、テンプレート、ドキュメント、サービス構成を再利用可能なワークフローにパッケージする。
悪意のあるスキルは、明らかに有害なアクションを実行するためにモデルに尋ねる必要はありません。
代わりに、通常のワークフローの一部として有害な振る舞いを偽装し、そのワークフローを実行するエージェントに依存して、高い価値のパーミッションと限定された人間の監督を行う。
本稿では,LLMエージェントが悪意のある実行動作に抵抗しながら,サードパーティのスキルを活用できるかどうかを評価するための動的ベンチマークであるAgentTrapを紹介する。
AgentTrapには141のタスクが含まれている。91の悪意のあるタスクと50の良質なユーティリティタスクで、エージェントスキルのサプライチェーンの脅威に根ざした16のセキュリティ影響をカバーしている。
各タスクでは、エージェントは通常のユーザリクエストを受け取り、悪意のあるワークフロー要素を含むようなインストールされたスキルで実行され、サンドボックス環境で実行される。
次にAgentTrapは、攻撃の成功、ブロックされたり拒否されたり、攻撃しないケース、攻撃の証拠のない結果について完全な軌道を判断する。
私たちの中心的な発見は、最も情報に富んだ失敗は単なる脱獄ではないということです。
モデルはしばしば、通常のワークフローの一部としてスキルによって導入された安全でない副作用を扱いながら、可視的なユーザタスクを完了します。
これは、ユーザが実際に仕事を委譲する、具体的なモデル-フレームワーク-ワークスペース環境のランタイム評価を動機付けます。
コードとデータはhttps://github.com/zhmzm/AgentTrapとhttps://huggingface.co/datasets/zhmzm/AgentTrapで入手できる。
関連論文リスト
- ClawSafety: "Safe" LLMs, Unsafe Agents [25.729388843970014]
OpenClawのようなパーソナルAIエージェントは、ユーザのローカルマシンで高機能で動作する。
ClawSAFETYは、3次元(ハームドメイン、アタックベクター、有害アクションタイプ)に沿って編成された120の逆テストシナリオのベンチマークである。
各テストケースは、通常の作業中にエージェントが遭遇する3つのチャネルのうちの1つに、相手のコンテンツを埋め込む。
論文 参考訳(メタデータ) (2026-04-01T22:24:24Z) - Tracking Capabilities for Safer Agents [2.9897366166831265]
ツールを直接呼び出す代わりに、エージェントは機能安全な言語でコードとして意図を表現している。
Scalaの型システムは静的に機能を追跡し、エージェントができることをきめ細かいコントロールを提供する。
実験の結果,エージェントはタスク性能を著しく損なうことなく,機能セーフなコードを生成することができることがわかった。
論文 参考訳(メタデータ) (2026-03-01T08:39:37Z) - AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification [25.817251923574286]
大規模言語モデル(LLM)エージェントのための新しい推論時間検出・緩和フレームワークを提案する。
AgentSentryは、時間的因果的テイクオーバーとしてマルチターンIPIをモデル化する最初の推論時防御である。
我々は, textscAgentDojo ベンチマークにおいて, 4つのタスクスイート, 3つの IPI 攻撃ファミリー, 複数のブラックボックス LLM に対する AgentSentry の評価を行った。
論文 参考訳(メタデータ) (2026-02-26T07:59:10Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - Defeating Prompt Injections by Design [79.00910871948787]
CaMeLは、Large Language Modelsを中心とした保護システムレイヤを作成する堅牢なディフェンスである。
CaMeLは、(信頼された)クエリから制御とデータフローを明示的に抽出する。
セキュリティをさらに改善するため、CaMeLは、権限のないデータフロー上のプライベートデータの流出を防止する機能の概念を使用している。
論文 参考訳(メタデータ) (2025-03-24T15:54:10Z) - AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents [84.96249955105777]
LLMエージェントは誤用された場合、より大きなリスクを引き起こすが、その堅牢性は未発見のままである。
我々は, LLMエージェント誤用の研究を容易にするために, AgentHarmと呼ばれる新しいベンチマークを提案する。
主要なLLMは、ジェイルブレイクなしで悪意のあるエージェント要求に驚くほど準拠している。
論文 参考訳(メタデータ) (2024-10-11T17:39:22Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。