論文の概要: Toward Metacognitive One-Shot Indirect Prompt Injection: Strategy Abstraction Via Outcome-Conditioned Reflection
- arxiv url: http://arxiv.org/abs/2608.08795v1
- Date: Sun, 09 Aug 2026 16:19:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.952597
- Title: Toward Metacognitive One-Shot Indirect Prompt Injection: Strategy Abstraction Via Outcome-Conditioned Reflection
- Title(参考訳): メタ認知的ワンショット間接プロンプト注入に向けて:アウトカム・コンディションド・リフレクションによる戦略抽象化
- Authors: Sihan Hou, Xinmeng Hou, Zhijun Zhang, Zehao Wang, Xuhong Ren, Sibo Qin, Kuntharrgyal Khysru, Qing Guo,
- Abstract要約: ツール利用大型言語モデル(LLM)エージェントは間接的プロンプトインジェクション(IPI)に対して脆弱である
既存のアダプティブアタックのほとんどは、ターゲットエージェントに対する繰り返しクエリと精製に依存している。
本研究では,攻撃適応を試験時間からオフライン戦略蒸留に移行するSAVORを提案する。
- 参考スコア(独自算出の注目度): 17.713444943152506
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool-using large language model (LLM) agents are vulnerable to indirect prompt injection (IPI), in which malicious instructions embedded in external observations manipulate subsequent agent decisions and actions. Most existing adaptive attacks rely on repeatedly querying and refining against the target agent, whereas realistic attackers may have only a single opportunity to interact with an unknown target agent. We propose SAVOR (Strategy Abstraction Via Outcome-Conditioned Reflection), which shifts attack adaptation from test-time iteration to offline strategy distillation. SAVOR performs outcome-conditioned reflection over successful and failed trajectories collected from disjoint training environments, validates context-conditioned candidate strategies, and iteratively consolidates them into a reusable strategy memory. At test time, the frozen memory guides the generation of a single payload for each unseen target, requiring only one target-agent query and no target-agent feedback. Across two benchmarks and three victim models, SAVOR attains the highest average attack success rate in all six settings, leading the strongest prior attack by 2.5 to 11.8 points and the same injection channel without strategy learning by 23.1 points on Agent Security Bench, which holds out attacker tools, and 28.6 points on OpenClaw-IPI, an executable benchmark we introduce that holds out attack goals and verifies attacks through tool interactions and execution receipts. A memory learned under one defense also transfers to another.
- Abstract(参考訳): ツール利用大型言語モデル(LLM)エージェントは間接的プロンプトインジェクション(IPI)に対して脆弱であり、外部の観察に埋め込まれた悪意のある命令がその後のエージェント決定やアクションを操作できる。
既存のアダプティブアタックのほとんどは、ターゲットエージェントに対する繰り返しのクエリと精製に依存しているが、現実的なアタックは未知のターゲットエージェントと対話する単一の機会しか持たない。
SAVOR(Strategy Abstraction Via Outcome-Conditioned Reflection)を提案する。
SAVORは、不連続なトレーニング環境から収集された結果条件の反映を行い、コンテキスト条件の候補戦略を検証するとともに、それらを再利用可能な戦略記憶に反復的に統合する。
テスト時には、凍結メモリは、未確認のターゲット毎に単一のペイロードを生成し、ターゲットエージェントのクエリを1つだけ必要とし、ターゲットエージェントのフィードバックをまったく必要としない。
2つのベンチマークと3つの犠牲者モデルで、SAVORは6つの設定すべてで平均的な攻撃成功率を達成し、2.5から11.8ポイント、戦略学習なしの同じインジェクションチャネルを23.1ポイント、攻撃ツールを保有するエージェントセキュリティベンチを28.6ポイント、攻撃目標を達成し、ツールインタラクションと実行レシートを通じて攻撃を検証する実行可能なベンチマークであるOpenClaw-IPIの28.6ポイントを達成した。
1つの防御下で学んだ記憶も別の防衛に転送される。
関連論文リスト
- Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks [56.45762972211923]
マルチターン攻撃に対するLDMの安全性を確保するためのプロアクティブ・ディフェンス・フレームワークを提案する。
特殊なエージェントが補完的な防衛戦略を実行するような、協調的なマルチエージェントアーキテクチャを採用している。
マルチターン攻撃における進化戦略をシミュレートするEMRAデータセットを提案する。
論文 参考訳(メタデータ) (2026-07-31T14:04:49Z) - Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents [0.0]
最近の研究は、間接的プロンプトインジェクションに対するツール使用 LLM エージェントの防御戦略に集約されている。
我々はこれらのアウト・オブ・バンド・ディフェンスを古典的整合性保護の事例として整理する。
我々は、このプロトコルを、Progent自身の適応攻撃解析の独立した複製と拡張として実行している。
論文 参考訳(メタデータ) (2026-06-25T00:35:23Z) - Analyzing Defensive Misdirection Against Model-Guided Automated Attacks on Agentic AI Systems [0.0]
エージェントAIシステムは、命令を解釈し、外部データを処理し、ツールを呼び出し、他のエージェントと調整するための言語モデルコンポーネントにますます依存している。
本研究は、標的システムの確率モデル、防御機構、および攻撃者の自動判断による攻撃防御設定を解析する。
論文 参考訳(メタデータ) (2026-06-18T16:50:28Z) - Defending against Adaptive Prompt Injection Attacks via Reasoning-enabled Task Alignment [25.752599132396437]
間接的なプロンプトインジェクションは、エージェントがタスク実行中に検索するサードパーティデータに悪意のある命令を埋め込むことによって、LLMベースのエージェントをハイジャックする。
既存のディフェンスでは、静的なベンチマークでほぼゼロの攻撃成功率を報告しているが、最近のアダプティブ評価では、攻撃者がデプロイされたディフェンスに対して最適化を許せば、これらの結果は崩壊する。
本稿では,攻撃者が制御するデータではなく,ユーザタスクに対する防衛判断を基礎としたトレーニングベースのRETAを提案する。
論文 参考訳(メタデータ) (2026-06-13T19:15:44Z) - GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives [48.545980031973556]
GAMBITは、インポスタ検出器を評価するための3つの評価モードと2つの独立したスコアを持つベンチマークである。
ベンチマークには、240の共進化型インポスタ戦略にまたがる27,804のラベル付きインスタンスのデータセットが付属している。
論文 参考訳(メタデータ) (2026-05-09T16:07:23Z) - AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases [73.04652687616286]
本稿では,RAG とRAG をベースとした LLM エージェントを標的とした最初のバックドア攻撃である AgentPoison を提案する。
従来のバックドア攻撃とは異なり、AgentPoisonは追加のモデルトレーニングや微調整を必要としない。
エージェントごとに、AgentPoisonは平均攻撃成功率を80%以上達成し、良質なパフォーマンスに最小限の影響を与える。
論文 参考訳(メタデータ) (2024-07-17T17:59:47Z) - Object-fabrication Targeted Attack for Object Detection [54.10697546734503]
物体検出の敵攻撃は 標的攻撃と未標的攻撃を含む。
新たなオブジェクトファブリケーションターゲット攻撃モードは、特定のターゲットラベルを持つ追加の偽オブジェクトをファブリケートする検出器を誤解させる可能性がある。
論文 参考訳(メタデータ) (2022-12-13T08:42:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。