論文の概要: Will the User Ever Know? Covert Indirect Prompt Injection Attacks on Tool-Using LLM Agents
- arxiv url: http://arxiv.org/abs/2608.30362v2
- Date: Tue, 01 Sep 2026 02:14:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.664292
- Title: Will the User Ever Know? Covert Indirect Prompt Injection Attacks on Tool-Using LLM Agents
- Title(参考訳): LLMエージェントを用いた間接的プロンプトインジェクション攻撃
- Authors: Yunseok Lee, Yunji Kim, Woojin Lee,
- Abstract要約: アタック成功率(ASR)は、インジェクションが成功するかどうかをカウントするが、エージェントの最終応答でユーザが気付くものを無視する。
エージェントは通常の応答を返しながらインジェクションを実行するか、最終応答でインジェクションされたアクションを報告する。
ICoAはインジェクションの実行後にエージェントをユーザタスクに戻して隠蔽結果を誘導するIPI攻撃である。
- 参考スコア(独自算出の注目度): 13.14142411989141
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As LLM agents take real-world actions through tools, indirect prompt injection (IPI) has emerged as a serious threat. The standard metric, Attack Success Rate (ASR), counts whether an injection succeeds but ignores what the user notices in the agent's final response. Looking at successful injection traces, we find two distinct outcomes: the agent executes the injection while returning an otherwise normal response, or reports the injected action in its final response, giving the user a chance to notice. We call these covert and overt successes. From the user's perspective, we decompose ASR into the Covert Success Rate (CSR), counting successes leaving no trace in the final response, and the Overt Success Rate (OSR), counting successes the user can detect. To understand what drives the gap, we analyze successful trajectories and find that the agent's behavior after the injection separates covert from overt: covert traces hand control back to the user task before ending, while overt traces end at the attack itself. This split follows from the ReAct format, where the final response summarizes the most recent action. Building on this observation, we propose ICoA (Induced Covert Attack), an IPI attack designed to induce covert outcomes by steering the agent back to the user task after executing the injection. Across four target models on AgentDojo, ICoA achieves the highest CSR, with gains of 3.79-12.01 percentage points over the strongest baseline.
- Abstract(参考訳): LLMエージェントがツールを介して現実世界のアクションを行うにつれ、間接的プロンプトインジェクション(IPI)が深刻な脅威として浮上している。
標準的な指標であるアタック成功率(ASR)は、インジェクションが成功するかどうかをカウントするが、エージェントの最終応答でユーザが気付くものを無視する。
エージェントは通常の応答を返しながらインジェクションを実行するか、最終応答でインジェクションされたアクションを報告し、ユーザに通知する機会を与える。
私たちはこれらの秘密と過剰な成功を呼んでいます。
ユーザの視点からは、ASRをカバー成功率(CSR)に分解し、最終応答に痕跡を残しない成功をカウントし、ユーザが検出できる成功をカウントするオーバート成功率(OSR)をカウントする。
このギャップを駆動する要因を理解するために、我々は成功した軌跡を分析し、インジェクション後のエージェントの動作がovertからovertを分離することを発見した。
この分離は、最後のレスポンスが最新のアクションを要約するReActフォーマットから続く。
本研究は,ICoA(インジェクション・カバート・アタック)を用いて,インジェクションの実行後にエージェントをユーザタスクに戻して隠蔽結果を誘導するIPI攻撃を提案する。
AgentDojoの4つのターゲットモデルの中で、ICoAは最高CSRを達成し、最強ベースラインで3.79-12.01ポイントを獲得した。
関連論文リスト
- SIR: Self-improving Red-teaming for Compute Use Agents [71.71987044117371]
コンピュータ・ユース・エージェント(CUA、Computer use agent)は、マウス、キーボード、端末を通じて画面を認識し、実際のオペレーティングシステムに作用する視覚言語モデルである。
操作中に信頼できないコンテンツに晒されるため、間接的プロンプトインジェクション(IPI)に弱い。
SIRは,平易な言語で記述された再利用原則の小さなライブラリからステルスインジェクションを構成するブラックボックスIPIアタックである。
論文 参考訳(メタデータ) (2026-08-31T03:39:43Z) - ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection [61.4148196085256]
本稿では,信頼という構造概念に根ざしたROPE(Routed Origin Policy Enforcement)について述べる。
提案手法では,(1)軌道の各段階において,攻撃可能コンテンツのみを起点とする値が,原点保護パラメータに到達しない,(2)注入のリワードがない,という2つの保証が認められている。
論文 参考訳(メタデータ) (2026-08-27T01:22:14Z) - Beyond Attack-Success Rate: Action-Graded Severity Scale for Tool-Using AI Agents [0.0]
エージェントのレッドチームベンチマークは、インジェクトされたエージェントが単一ビットとして侵入されたかどうかを報告している。
このバイナリ・アタック・サクセス・レートは、ディフェンダーが最も必要とする情報、すなわち、結果として生じるアクションがどれほど有害であるかを破棄する。
本研究では,7段階の順序尺度(L0〜L6)でエージェントのツールコール軌跡をスコアし,実行された動作が可逆性であったか,他者への到達範囲を超えたか,特権を拡大したかに応じて,アクショングレード調和ルーリックを導入する。
論文 参考訳(メタデータ) (2026-07-08T14:38:01Z) - AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification [25.817251923574286]
大規模言語モデル(LLM)エージェントのための新しい推論時間検出・緩和フレームワークを提案する。
AgentSentryは、時間的因果的テイクオーバーとしてマルチターンIPIをモデル化する最初の推論時防御である。
我々は, textscAgentDojo ベンチマークにおいて, 4つのタスクスイート, 3つの IPI 攻撃ファミリー, 複数のブラックボックス LLM に対する AgentSentry の評価を行った。
論文 参考訳(メタデータ) (2026-02-26T07:59:10Z) - ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction [24.416258744287166]
ICONは、タスクの連続性を維持しながら攻撃を中和する、調査と軽減のためのフレームワークである。
ICONは競争力のある0.4%のASRを達成し、商業グレード検出器と一致し、50%以上のタスクユーティリティーゲインを得る。
論文 参考訳(メタデータ) (2026-02-24T09:13:05Z) - MELON: Provable Defense Against Indirect Prompt Injection Attacks in AI Agents [60.30753230776882]
LLMエージェントは間接的プロンプトインジェクション(IPI)攻撃に対して脆弱であり、ツール検索情報に埋め込まれた悪意のあるタスクはエージェントをリダイレクトして不正なアクションを取ることができる。
マスク機能によって修正されたマスク付きユーザでエージェントの軌道を再実行することで攻撃を検知する新しいIPIディフェンスであるMELONを提案する。
論文 参考訳(メタデータ) (2025-02-07T18:57:49Z) - Breaking ReAct Agents: Foot-in-the-Door Attack Will Get You In [5.65782619470663]
本稿では,直感的かつ効果的な手法でReActエージェントをどのように活用できるかを検討する。
実験の結果,間接的プロンプトインジェクション攻撃は,後続の悪意ある行為を行うエージェントの可能性を著しく高めることができることがわかった。
この脆弱性を軽減するために,エージェントが実行中の動作の安全性を再評価する簡単なリフレクション機構の実装を提案する。
論文 参考訳(メタデータ) (2024-10-22T12:24:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。