論文の概要: The Framing Gap: Indirect Prompt-Injection Exfiltration Defeats Surface-Level Defenses in Tool-Using Agents
- arxiv url: http://arxiv.org/abs/2608.27092v1
- Date: Thu, 27 Aug 2026 13:12:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.41086
- Title: The Framing Gap: Indirect Prompt-Injection Exfiltration Defeats Surface-Level Defenses in Tool-Using Agents
- Title(参考訳): フレーミングギャップ:間接プロンプト注入エミッションは工具使用剤の表面防御を損なう
- Authors: Md Habibur Rahman, Jaeho Kim,
- Abstract要約: 攻撃者が制御するWebコンテンツを読み取るツール使用のLLMエージェントは間接的なプロンプトインジェクションである。
10のオーバートインジェクションクラスが拒否される(gpt-4o 0%)が、同じリークを必須整合性シグネチャとして無視する。
アブレーションは、そのメカニズムが命令/データの混乱であり、アライメントを損なわないことを示している。
- 参考スコア(独自算出の注目度): 2.45357121165634
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A tool-using LLM agent that reads attacker-controlled web content while holding a secret faces indirect prompt injection: the content may make it exfiltrate the secret. In a safe synthetic lab (canary secret, mock tools, matched clean-vs-poisoned metric) we report the framing gap: across six models, ten overt injection classes are refused (gpt-4o 0%), but reframing the identical leak as a mandatory integrity signature, config field, or look-alike "trusted" host drives gpt-4o 0% to 100%. The attack is cheap, and its cost is three-level: paraphrasing a known mechanism is trivial (96% at 3 wordings), swapping the field inside a known-effective template is also cheap (up to 60%), while authoring a fresh page around a new mechanism is hard (0/130) -- the reusable asset is the template, not the mechanism. An ablation shows the mechanism is instruction/data confusion, not defeated alignment: removing the confidentiality policy leaves base attacks at 0% and moves reframing only 31.9% to 38.1%. What closes the gap is payload-blind checks: a destination allow-list (0%, when destinations are closed) and a capability-isolating planner/reader split (0%). A broad "in any form" policy clause also closes it at the acting model (to 0%) but is brittle (dropping the catch-all reopens it to 48.8%). A published fine-tuning defense (SecAlign, CCS 2025) does not close it on a tool agent (32.5%, positive-control-validated), nor does channel separation (38.8%); an output-normalizing guard loses to a held-out encoding (ROT13, 100%). Robustness comes from constraining the destination or isolating the capability, not from the acting model recognizing the attack.
- Abstract(参考訳): シークレットフェイスを間接的に注入しながらアタッカーが制御するWebコンテンツを読み取るツールの使用 LLM エージェント。
安全な合成ラボ(カナリアシークレット、モックツール、マッチしたクリーンvs-poisoned metric)では、フレーミングギャップを報告します。6つのモデルにおいて、10のオーバートインジェクションクラスが拒否される(gpt-4o 0%)が、同じリークを必須整合性シグネチャ、設定フィールド、ルックライクな"信頼"ホストがgpt-4o 0%から100%を駆動しています。
既知のメカニズムのパラフレーズ化は簡単(3つのワードで96%)で、既知の有効テンプレート内のフィールドの交換も安価(最大60%)で、新しいメカニズムに関する新しいページの執筆は困難(0/130)で、再利用可能なアセットはメカニズムではなくテンプレートである。
機密性ポリシーの削除はベースアタックを0%にし、31.9%から38.1%にしかリフレーミングしない。
このギャップを埋めるのはペイロードの盲点チェックである。宛先許容リスト(0%、宛先がクローズされたとき)と機能分離プランナー/リーダ分割(0%)である。
広範に「あらゆる形態」のポリシー条項は、演技モデル(0%まで)でそれを閉じるが、脆い(キャッチオールが48.8%まで開く)。
公表された微調整防御(SecAlign, CCS 2025)は、ツールエージェント(32.5%、ポジティブコントロールバリデーション)に閉じたり、チャンネル分離(38.8%)を閉じたりせず、出力正規化ガードは保持された符号化(ROT13,100%)に負ける。
ロバスト性は、攻撃を認識する行為モデルからではなく、目的地の制約や能力の分離に由来する。
関連論文リスト
- ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems [0.0]
本稿では,すべてのエージェント間チャネルに情報コンテナゲートを配置するフレームワークであるChannelGuardを紹介する。
ChannelGuardは、Azure GPT-5, Anthropic Sonnet 4.5, Anthropic Haiku 4.5をまたいで、アプリケーション層で30の30のツールポゾンをブロックする。
また、プロンプト・インジェクションの攻撃成功率を半分(0.333から0.167)下げ、GSM8Kの精度(0.867)を正確に保持する。
論文 参考訳(メタデータ) (2026-07-20T19:11:17Z) - Reason Less, Verify More: Deterministic Gates Recover a Silent Policy-Violation Failure Mode in Tool-Using LLM Agents [1.6567880228735357]
ポリシーを許容する環境では、対応する状態遷移がドメインポリシーによって禁じられている場合であっても、ツールはよくできた呼び出しを実行できる。
我々は、この障害モードを2ドルの航空会社ドメインで研究する。
我々は、決定論的かつリードオンリーの事前実行ゲートという、軽量な介入を評価する。
論文 参考訳(メタデータ) (2026-07-08T13:38:54Z) - Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens [65.53494487819053]
クローのようなAIエージェント(OpenClawなど)は、認証情報、ファイル、ツール、外部サービスへの永続的なアクセスを伴う、常にオンのプロセスである。
我々はClawのようなエージェントをエージェントコンピュータシステムとして扱い、そのゲートウェイランタイムがOSのような仲介の役割を担っている。
我々は、4つの攻撃面にわたる406の敵タスクのベンチマークであるSafeClawArenaを開発した。
論文 参考訳(メタデータ) (2026-06-29T18:00:45Z) - Owner-Harm: A Missing Threat Model for AI Agent Safety [0.0]
既存のAI安全性ベンチマークは、一般的な犯罪被害に焦点を当てている。
本稿では,8つのカテゴリのエージェント動作がデプロイを損なう,正式な脅威モデルである Owner-Harm を提案する。
論文 参考訳(メタデータ) (2026-04-20T10:11:26Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw [87.97230960702274]
本稿では,OpenClawの安全性評価について紹介する。
エージェントの永続状態を3次元に統一するCIK分類法を導入する。
評価では、ライブOpenClawインスタンス上の12のアタックシナリオをカバーしています。
論文 参考訳(メタデータ) (2026-04-06T15:27:05Z) - Agent Privilege Separation in OpenClaw: A Structural Defense Against Prompt Injection [0.0]
オープンソースマルチツールエージェントプラットフォームであるOpenClaw内で動作している現在の世代モデルに対して、Microsoft LLMail-Injectベンチマークを複製します。
提案する防御機構は,エージェント分離を特権分離した2エージェントパイプラインとして実装したツールパーティショニングと,アクションエージェントが処理する前にパーサシブフレーミングを除去する構造化された出力を生成するフォーマッティングの2つを組み合わせたものである。
論文 参考訳(メタデータ) (2026-03-13T02:03:00Z) - AI Security Beyond Core Domains: Resume Screening as a Case Study of Adversarial Vulnerabilities in Specialized LLM Applications [71.27518152526686]
大きな言語モデル(LLM)はテキストの理解と生成に優れており、コードレビューやコンテンツモデレーションといった自動タスクに最適である。
LLMは履歴書やコードなどの入力データに隠された「逆命令」で操作でき、意図したタスクから逸脱する。
本稿では,特定の攻撃タイプに対して80%以上の攻撃成功率を示すとともに,この脆弱性を再開スクリーニングで評価するためのベンチマークを提案する。
論文 参考訳(メタデータ) (2025-12-23T08:42:09Z) - BountyBench: Dollar Impact of AI Agent Attackers and Defenders on Real-World Cybersecurity Systems [62.17474934536671]
我々は、現実世界のシステムを進化させる際に、攻撃的かつ防御的なサイバー能力を捕獲する最初の枠組みを紹介する。
脆弱性ライフサイクルを捉えるために、3つのタスクタイプを定義します。検出(新たな脆弱性の検出)、エクスプロイト(特定の脆弱性の探索)、パッチ(特定の脆弱性のパッチ)。
Claude Code,OpenAI Codex CLI with o3-high and o4-mini,カスタムエージェント with o3-high, GPT-4.1, Gemini 2.5 Pro Preview, Claude 3.7 Sonnet Thinking, DeepSeek-R1。
論文 参考訳(メタデータ) (2025-05-21T07:44:52Z) - Red Pill and Blue Pill: Controllable Website Fingerprinting Defense via Dynamic Backdoor Learning [93.44927301021688]
Webサイト指紋(WF)攻撃は、訪問するWebページを特定するために、ユーザーのコミュニケーションを秘密裏に監視する。
既存のWFディフェンスは、ユニークなトラフィックパターンを乱すことで攻撃者の精度を低下させようとする。
バックドア学習に基づく新しい防衛視点である制御可能なWebサイトフィンガープリントディフェンス(CWFD)を紹介した。
論文 参考訳(メタデータ) (2024-12-16T06:12:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。