論文の概要: Prismata: Confining Cross-Site Prompt Injection in Web Agents
- arxiv url: http://arxiv.org/abs/2607.08147v1
- Date: Thu, 09 Jul 2026 06:37:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.426476
- Title: Prismata: Confining Cross-Site Prompt Injection in Web Agents
- Title(参考訳): Prismata: Webエージェントにおけるクロスサイトプロンプトインジェクションの完成
- Abstract要約: クロスサイトスクリプティングは、信頼できるコンテンツと信頼できないコンテンツを混在させることが危険であることを証明した。
エージェントは、自然言語を命令として解釈し、サードパーティやユーザ生成コンテンツがエージェントを乗っ取ることによって、このリスクを再認識する。
我々は、Webエージェントのコンテキスト最小特権を強制する防衛であるPrismataを提示する。
- 参考スコア(独自算出の注目度): 10.127091687983482
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autonomous web agents promise to automate everyday browsing tasks, but inherit one of the web's oldest attack surfaces. Cross-Site Scripting proved that mixing trusted and untrusted content is dangerous, even on benign pages. Agents resurface this risk by interpreting natural language as instructions, allowing third-party and user-generated content to hijack the agent via prompt injection. The core challenge is that deriving a task-specific security policy requires reasoning over page structure that is entangled with the attacker's content. We present Prismata, a defense enforcing contextual least privilege for web agents, constraining both what the agent sees and what it can do. Prismata's dynamic trust derivation produces permission labels for page content, with structural confinement guarantees, inspired by classical integrity models, that bound any labeling errors so that labels can only decrease in privilege and mislabelings are bounded. Prismata's mechanical confinement enforces these labels by redacting content and restricting agent capabilities. Importantly, these mechanisms require no developer annotations, so Prismata supports the long tail of websites. Across recent published web agent attacks, including adaptive variants, Prismata substantially reduces attack success while preserving benign task utility.
- Abstract(参考訳): 自律的なWebエージェントは、日々のブラウジングタスクを自動化することを約束するが、Webで最も古い攻撃面の1つを継承する。
クロスサイトスクリプティングは、信頼できるコンテンツと信頼できないコンテンツを混在させることが危険であることを証明した。
エージェントは自然言語を命令として解釈することでこのリスクを再認識し、サードパーティやユーザ生成コンテンツがプロンプトインジェクションを通じてエージェントをハイジャックすることを可能にする。
主な課題は、タスク固有のセキュリティポリシーを導出するには、攻撃者のコンテンツに絡み合ったページ構造を推論する必要があることである。
私たちはPrismataを紹介します。Prismataは、Webエージェントのコンテキスト最小特権を強制する防御であり、エージェントが見ているものとできることの両方を制約します。
プリシュマタの動的信頼の導出は、古典的な整合性モデルにインスパイアされた構造的制限の保証を持つページコンテンツの許可ラベルを生成し、ラベルが特権を減らし、誤ラベルが有界であるようにラベルの誤りを境界付ける。
プリマタの機械的閉じ込めは、これらのラベルをコンテンツを再活性化し、エージェントの能力を制限することで強制する。
重要なことは、これらのメカニズムは開発者アノテーションを必要としないため、Prismataはウェブサイトの長い尾をサポートする。
適応的な変種を含む最近公開されたWebエージェント攻撃全体で、Prismataは、良質なタスクユーティリティを保持しながら、攻撃の成功を大幅に削減する。
関連論文リスト
- Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents [93.19140872946842]
大規模言語モデル(LLM)によって駆動されるWebエージェントは、現実の環境にますますデプロイされる。
これにより、一見良質なコンテンツがエージェントの振る舞いを操作する敵の命令を埋め込む、プロンプト・インジェクション・アタックに対して脆弱になる。
実世界のWebエージェントシステムにおいて,損害を体系的に分類し,属性付けするベンチマークである textbfsysname を導入する。
論文 参考訳(メタデータ) (2026-06-11T14:12:43Z) - WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents [117.65855863464863]
Webエージェントはインジェクション攻撃に対して非常に脆弱である。
システム・プロンプト・ディフェンス(英語版)やエージェントの直接微調整を含む既存の防御は、効果が限られている。
本稿では,WebAgentGuardを導入し,インジェクション検出のためのマルチモーダルガードモデルを提案する。
論文 参考訳(メタデータ) (2026-04-14T04:50:35Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - ceLLMate: Sandboxing Browser AI Agents [16.060034673487287]
本稿では,ブラウザレベルのサンドボックスフレームワークであるceLLMateを提案する。
ceLLMateは、ウェブサイトが発行する必須ポリシーと、ユーザの自然言語タスクからこれらのポリシーを適応およびインスタンス化する自動ポリシー予測レイヤをペアリングする。
エージェントに依存しないブラウザ拡張としてceLLMateを実装し、サンドボックスポリシーによって様々な種類のプロンプトインジェクション攻撃を無視可能なオーバーヘッドで効果的にブロックできることを実証する。
論文 参考訳(メタデータ) (2025-12-14T08:25:31Z) - FocusAgent: Simple Yet Effective Ways of Trimming the Large Context of Web Agents [76.12500510390439]
大規模言語モデル(LLM)を利用したWebエージェントは、ユーザの目標を達成するために、長いWebページの観察を処理しなければならない。
既存のプルーニング戦略は、関連するコンテンツを捨てるか、無関係なコンテキストを保持するかのいずれかであり、最適以下の行動予測につながる。
FocusAgentは軽量LCMレトリバーを利用してアクセシビリティツリー(AxTree)観測から最も関連性の高い線を抽出するシンプルで効果的なアプローチである。
論文 参考訳(メタデータ) (2025-10-03T17:41:30Z) - A Whole New World: Creating a Parallel-Poisoned Web Only AI-Agents Can See [0.0]
悪意のあるWebサイトは、受信した要求をAIエージェントから派生したものとして識別し、そのコンテンツの異なる“クラック”バージョンを動的に提供する。
人間のユーザーは良心的なWebページを見るが、エージェントには、隠された悪意のある命令が埋め込まれた視覚的に同一のページが表示される。
この研究は脅威モデルを形式化し、エージェントフィンガープリントとクローキングの仕組みを詳述し、エージェントAIの将来に対する深刻なセキュリティへの影響について論じる。
論文 参考訳(メタデータ) (2025-08-29T08:14:52Z) - Mind the Web: The Security of Web Use Agents [11.075673765065103]
本稿では,Webページに悪意のあるコンテンツを埋め込むことで,攻撃者がWeb利用エージェントを利用する方法を示す。
本稿では,悪質なコマンドをタスクガイダンスとしてフレーム化するタスクアラインインジェクション手法を提案する。
本稿では,監視機構,実行制約,タスク認識推論技術などを含む包括的緩和戦略を提案する。
論文 参考訳(メタデータ) (2025-06-08T13:59:55Z) - AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents [54.29555239363013]
本稿では,間接的なインジェクション脆弱性を自動的に検出し,悪用するための汎用的なブラックボックスファジリングフレームワークであるAgentVigilを提案する。
我々はAgentVigilをAgentDojoとVWA-advの2つの公開ベンチマークで評価し、o3-miniとGPT-4oに基づくエージェントに対して71%と70%の成功率を達成した。
攻撃を現実世界の環境に適用し、悪質なサイトを含む任意のURLに誘導するエージェントをうまく誘導する。
論文 参考訳(メタデータ) (2025-05-09T07:40:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。