論文の概要: POISE: Position-Aware Undetectable Skill Injection on LLM Agents
- arxiv url: http://arxiv.org/abs/2606.07943v1
- Date: Sat, 06 Jun 2026 02:10:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:05.55423
- Title: POISE: Position-Aware Undetectable Skill Injection on LLM Agents
- Title(参考訳): POISE:LLMエージェントにおける位置認識不能スキル注入
- Authors: Haochang Hao, Dehai Min, Zhifang Zhang, Yunbei Zhang, Miao Xu, Yingqiang Ge, Lu Cheng,
- Abstract要約: 我々は、位置認識型攻撃であるPOISEを導入し、トリガーを1つの良質なボディインストラクションに圧縮する。
codex+gpt-5.2のスキルインジェクションでは、POISEは89.3%のASR、28.0ポイントはランダム配置のボディーベースライン、そして2.6ポイントはYAMLのみのベースラインである。
- 参考スコア(独自算出の注目度): 23.2593923733415
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent skills provide a lightweight mechanism for extending general-purpose agents, but their open format exposes them to skill-poisoning attacks. A practically dangerous injection must stay invisible: if executing the payload derails the user's legitimate task, the resulting failure signal invites inspection of the skill. We therefore evaluate attacks by Attack Success Rate, which requires the injected payload to execute and the user's task to still pass its verifier in the same trial. Prior skill-poisoning attacks face a reliability-stealth trade-off under this lens: YAML-header injections are reliably loaded but easily inspected, whereas stealthier body injections that place explicit malicious commands in the skill prose are less reliable because out-of-context commands invite the agent's own suspicion. We introduce POISE, a position-aware attack that compresses the trigger into a single, benign-looking body instruction, placing it at a feasible position and using a context-aware generator to blend it with nearby setup or prerequisite steps. On Skill-Inject with codex+gpt-5.2, POISE achieves an 89.3% ASR, 28.0 points above a random-placement body baseline and 2.6 points above a YAML-only baseline, while retaining the stealth advantage of body placement. That stealth is the decisive margin: because legitimate skill bodies naturally require privileged tool operations, LLM scanners are hyper-sensitive, falsely flagging 74.6% of clean skills on average across four judges and both benchmarks. Blending into these false alarms, POISE causes only 5.6% of poisoned variants to gain a new high-risk alert over their clean baselines, rendering current static defenses ineffective.
- Abstract(参考訳): エージェントスキルは汎用エージェントを拡張するための軽量なメカニズムを提供する。
ペイロードの実行がユーザの正当なタスクを損なうと、結果として発生する障害信号がスキルの検査を招待する。
そこで我々は,攻撃成功率(Attack Success Rate)による攻撃の評価を行った。
YAMLヘッダインジェクションは確実にロードされるが、容易に検査できるが、スキルプロスに明示的な悪意のあるコマンドを配置するステルスボディインジェクションは、文脈外コマンドがエージェント自身の疑念を呼ぶため、信頼性が低い。
我々は、位置認識攻撃(POISE)を導入し、トリガーを単一の良質なボディインストラクションに圧縮し、それを実行可能な位置に配置し、コンテキスト認識ジェネレータを使用して、近くの設定や必要なステップとブレンドする。
codex+gpt-5.2のスキルインジェクションでは、POISEは89.3%のASR、28.0ポイントはランダム配置のボディーベースラインより上、2.6ポイントはYAMLのみのベースラインより上であり、ボディ配置のステルス優位性を維持している。
合法的な技術機関は当然特権的なツール操作を必要とするため、LCMスキャナーは過敏であり、4人の審査員と両方のベンチマークで平均74.6%のクリーンスキルを誇示している。
これらの誤報に潜むと、POISEは毒性のある変種のうち5.6%しか発生せず、その清潔なベースラインに対して新たなリスクの高い警告を受け、現在の静的防御は効果がない。
関連論文リスト
- MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills [24.371534406647978]
MalSkillBenchは、悪質なエージェントスキルの最初のランタイム検証ベンチマークである。
コードインジェクションは94.5%に達するが、迅速なインジェクションは75.8%に過ぎない。
データセット、パイプライン、ベースライン、結果をリリースしています。
論文 参考訳(メタデータ) (2026-06-05T10:43:19Z) - SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks [27.120130204872325]
SkillInjectは、広く使われているLLMエージェントの、スキルファイルによるインジェクションに対する感受性を評価するベンチマークである。
SkillInjectには、明らかに悪意のあるインジェクションから、その他の正当な命令に隠された微妙なコンテキスト依存的なアタックまで、202のインジェクションタスクペアが含まれている。
以上の結果から,今日のエージェントは,フロンティアモデルによる攻撃成功率の最大80%に対して,非常に脆弱であることが示唆された。
論文 参考訳(メタデータ) (2026-02-23T18:59:27Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - CausalArmor: Efficient Indirect Prompt Injection Guardrails via Causal Attribution [49.689452243966315]
ツールコール機能を備えたAIエージェントは、IPI(Indirect Prompt Injection)攻撃の影響を受けやすい。
本稿では,選択防衛フレームワークCausalArmorを提案する。
AgentDojoとDoomArenaの実験は、CausalArmorが攻撃的な防御のセキュリティと一致することを示した。
論文 参考訳(メタデータ) (2026-02-08T11:34:08Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents [54.29555239363013]
本稿では,間接的なインジェクション脆弱性を自動的に検出し,悪用するための汎用的なブラックボックスファジリングフレームワークであるAgentVigilを提案する。
我々はAgentVigilをAgentDojoとVWA-advの2つの公開ベンチマークで評価し、o3-miniとGPT-4oに基づくエージェントに対して71%と70%の成功率を達成した。
攻撃を現実世界の環境に適用し、悪質なサイトを含む任意のURLに誘導するエージェントをうまく誘導する。
論文 参考訳(メタデータ) (2025-05-09T07:40:17Z) - AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases [73.04652687616286]
本稿では,RAG とRAG をベースとした LLM エージェントを標的とした最初のバックドア攻撃である AgentPoison を提案する。
従来のバックドア攻撃とは異なり、AgentPoisonは追加のモデルトレーニングや微調整を必要としない。
エージェントごとに、AgentPoisonは平均攻撃成功率を80%以上達成し、良質なパフォーマンスに最小限の影響を与える。
論文 参考訳(メタデータ) (2024-07-17T17:59:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。