論文の概要: Depth-Dependent Indirect Prompt Injection in Tool-Calling ReAct Agents: Injection Depth, Payload Framing, and Turn-Budget Sensitivity
- arxiv url: http://arxiv.org/abs/2605.30686v1
- Date: Fri, 29 May 2026 00:28:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.305284
- Title: Depth-Dependent Indirect Prompt Injection in Tool-Calling ReAct Agents: Injection Depth, Payload Framing, and Turn-Budget Sensitivity
- Title(参考訳): ツールカートリング試薬の深さ依存性間接プロンプト注入:注入深さ, 負荷フラーミング, ターン予算感度
- Authors: Mohammadreza Rashidi,
- Abstract要約: GPT-4o-miniとClaude Haikuに対して,0.36 USD以下のAPIコストで460のトライアルを実施した。
実験1では, GPT-4o-miniに対するASRは深さ1%から5。
研究2は、保守的なツール呼び出しと真の命令抵抗を組み合わせることで、すべての深さで0%のASRを達成するクロード俳句の深さ実験を再現する。
調査4では,ASRがターンキャップ3,5,7で安定であることを確認し,ターン予算がリスク要因ではないことを示した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: ReAct agents that interleave chain-of-thought reasoning with tool calls are increasingly deployed for real tasks such as scheduling, file retrieval, and data access. Their tool observation loop creates a direct attack surface: an adversary who controls any tool's return value can embed instructions that redirect the agent away from the user's goal, a threat known as indirect prompt injection. Existing benchmarks evaluate attack success rate (ASR) at a fixed injection position under fixed conditions, leaving three risk dimensions unexplored: where in the tool sequence the payload appears (injection depth), what rhetorical register it uses (framing), and how many turns the agent is permitted (turn cap). We conduct four controlled studies on 20 scenarios spanning five attack categories, totalling 460 trials against GPT-4o-mini and Claude Haiku at a combined API cost under 0.36 USD. Study 1 shows that ASR against GPT-4o-mini decays from 60% at depth 1 to 0% at depths 4 and 5 (Cramer's V = 0.58, p < 0.001; restricted to within-sequence depths 1-3: V = 0.47, p = 0.0013), driven by model resistance at depth 1 and task completion before payload encounter at deeper positions. Study 2 replicates the depth experiment on Claude Haiku, which achieves 0% ASR at every depth through a combination of conservative tool invocation and genuine instruction resistance. Study 3 shows that framing modulates ASR between 25% (neutral) and 75% (persona) at depth 1, a 50-percentage-point range that does not reach statistical significance at N = 20 per condition. Study 4 confirms that ASR is stable across turn caps of 3, 5, and 7, indicating the turn budget is not a risk factor in this setting. Our results establish injection depth as the dominant variable and show that sanitising only the first tool observation captures 67% of measured injection successes.
- Abstract(参考訳): ツールコールによる連鎖推論をインターリーブするReActエージェントは、スケジューリングやファイル検索、データアクセスといった実際のタスクに対して、ますます多くデプロイされている。
ツールの戻り値を制御する敵は、エージェントをユーザの目標から切り離す命令を埋め込むことができ、間接的なプロンプトインジェクションと呼ばれる脅威になる。
既存のベンチマークでは、固定された条件下での攻撃成功率(ASR)を評価し、3つのリスク次元を未探索のまま残している: ツールシーケンスにペイロードが現れる場所(注入深さ)、それが使用するレトリックレジスタ(フレーミング)、エージェントが許されるターン数(ターンキャップ)。
GPT-4o-miniとClaude Haikuに対する合計460の試験を合計0.36USD以下のAPIコストで実施した。
実験1では、GPT-4o-miniに対するASRは深さ4と5で60%から0%(クラマーのV = 0.58, p < 0.001; 列内深さ 1-3: V = 0.47, p = 0.0013)で崩壊し、深度1でのモデル抵抗とペイロードが深度1で遭遇する前のタスク完了によって引き起こされた。
研究2は、保守的なツール呼び出しと真の命令抵抗を組み合わせることで、すべての深さで0%のASRを達成するクロード俳句の深さ実験を再現する。
研究3では、フレーミングは深度1において25%(中性)から75%(人格)の間でASRを調節することを示した。
調査4では,ASRがターンキャップ3,5,7で安定であることを確認し,ターン予算がリスク要因ではないことを示した。
以上の結果から,第1報のみの衛生検査で測定された注射成功率の67%は,注射深度が支配的な変数であることが示唆された。
関連論文リスト
- Can LLM Agents Respond to Disasters? Benchmarking Heterogeneous Geospatial Reasoning in Emergency Operations [55.251494694783894]
災害対応エージェントベンチマーク(DORA)は、エンド・ツー・エンドの災害対応のための最初のエージェントベンチマークである。
タスクは、災害認識、空間関係分析、救助・避難計画、時間的進化推論、マルチモーダルレポート合成という、災害対応パイプラインをカバーする5つの次元にまたがる。
DORAは、運用上の信頼性の高い災害対応エージェントのための厳格なテストベッドを確立する。
論文 参考訳(メタデータ) (2026-05-12T06:57:41Z) - Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs [5.478971182058342]
安全評価はほとんどの場合、プロンプトベースのペルソナのみを研究する。
プロンプトとアクティベーションのステアリングは *different*,アーキテクチャに依存した脆弱性プロファイルを公開します。
論文 参考訳(メタデータ) (2026-04-13T07:34:02Z) - Kill-Chain Canaries: Stage-Level Tracking of Prompt Injection Across Attack Surfaces and Model Safety Tiers [0.0]
そこで本研究では,5種類のLDM剤に対する即時注射攻撃のステージ分解分析を行った。
暗号カナリアトークン(SECRET-[A-F0-9]8)を4つのキルチェーンステージで追跡する。
我々の中心的な発見は、モデル安全性は、敵のコンテンツが見えるかどうかではなく、パイプラインのステージにまたがって伝播されるかどうかによって決定されるということである。
論文 参考訳(メタデータ) (2026-03-30T04:07:18Z) - Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models [68.45272703833209]
現状のPRMは、逆最適化圧力下で体系的に利用可能であることを示す。
これらの脆弱性を定量化するために、敵の圧力を増大させる3段階の診断フレームワークを導入する。
我々は、PRM-BiasBenchと診断ツールキットをリリースし、デプロイ前にロバストネスの評価を可能にする。
論文 参考訳(メタデータ) (2026-02-20T23:38:03Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - Quantifying Return on Security Controls in LLM Systems [0.0]
本稿では、残留リスクを定量化するための意思決定指向フレームワークを提案する。
敵のプローブの結果を金融リスク推定と戻り制御の指標に変換する。
論文 参考訳(メタデータ) (2025-12-17T04:58:09Z) - Generating Natural-Language Surgical Feedback: From Structured Representation to Domain-Grounded Evaluation [66.7752700084159]
外科的トレーナーからの高品質なフィードバックは,訓練者のパフォーマンス向上と長期的スキル獲得に不可欠である。
本稿では,実際の訓練者-訓練者間の文書から外科的行動オントロジーを学習する構造対応パイプラインを提案する。
論文 参考訳(メタデータ) (2025-11-19T06:19:34Z) - Shoot First, Ask Questions Later? Building Rational Agents that Explore and Act Like People [81.63702981397408]
限られたリソースを前提として、言語モデル(LM)に基づいたエージェントは、どの程度合理的に行動するのか?
エージェント情報探索をベンチマークし,強化する手法を開発し,人間の行動から洞察を抽出する。
Spotterエージェントでは、LMのみのベースラインよりも14.7%の精度で精度を向上し、Captainエージェントでは、期待情報ゲイン(EIG)を0.227ビット(達成可能なノイズ天井の94.2%)まで引き上げる。
論文 参考訳(メタデータ) (2025-10-23T17:57:28Z) - Robust Deep Reinforcement Learning through Adversarial Loss [74.20501663956604]
近年の研究では、深層強化学習剤は、エージェントの入力に対する小さな逆方向の摂動に弱いことが示されている。
敵攻撃に対する堅牢性を向上した強化学習エージェントを訓練するための原則的フレームワークであるRADIAL-RLを提案する。
論文 参考訳(メタデータ) (2020-08-05T07:49:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。