論文の概要: Untrusted Content Masking for Web Agents with Security Guarantees
- arxiv url: http://arxiv.org/abs/2607.05277v1
- Date: Mon, 06 Jul 2026 16:22:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.238729
- Title: Untrusted Content Masking for Web Agents with Security Guarantees
- Title(参考訳): セキュリティ保証付きWebエージェントのための信頼できないコンテンツマスキング
- Authors: Kristina Nikolić, Egor Zverev, Javier Rando, Matthew Jagielski, Edoardo Debenedetti, Florian Tramèr,
- Abstract要約: 迅速なインジェクション攻撃に対するセキュリティ保証を提供する防衛は、信頼された命令と信頼できないデータの間の厳格な隔離に依存している。
Intrusted Content Masking (UCM) はWeb環境におけるこの境界を復元するシンプルで効果的な手法である。
我々のフレームワークは、エージェントに到達する前に信頼できないリージョンを再実行し、厳格な特権分離を伴うサンドボックスインターフェースを介してインタラクションをルーティングすることでこれを活用します。
- 参考スコア(独自算出の注目度): 44.248119613944226
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Defenses that provide security guarantees against prompt injection attacks rely on strict isolation between trusted instructions and untrusted data. In text-based environments such as tool-use APIs, this separation arises naturally: agents can reason from interface definitions without ever processing untrusted content. Extending these guarantees to web agents faces a fundamental challenge: to perceive and interact with their environment, web agents must first observe the rendered page, which intermingles trusted content with untrusted content. This structural entanglement removes the trust boundary on which security guarantees depend, undermining provable defenses for web agents. In this paper, we present Untrusted Content Masking (UCM), a simple and effective approach that restores this boundary in web environments. We leverage a key structural insight: a webpage's Document Object Model (DOM) encodes sufficient information to distinguish trusted from untrusted regions without reading their content. Our framework exploits this by redacting untrusted regions before they reach the agent and routing interaction through a sandboxed interface with strict privilege separation, thereby enabling agents to observe and interact with their environment while remaining isolated from adversarial content. The code is publicly available.
- Abstract(参考訳): 迅速なインジェクション攻撃に対するセキュリティ保証を提供する防衛は、信頼された命令と信頼できないデータの間の厳格な隔離に依存している。
ツール利用APIのようなテキストベースの環境では、この分離が自然に発生する。
これらの保証をWebエージェントに拡張することは、基本的な課題に直面する: 彼らの環境を知覚し、相互作用するために、Webエージェントは、まず、信頼できないコンテンツと混在する、レンダリングされたページを観察しなければならない。
この構造的絡み合いは、セキュリティ保証が依存する信頼境界を排除し、Webエージェントの証明可能な防御を損なう。
本稿では、Web環境におけるこの境界を復元するシンプルで効果的なアプローチであるUntrusted Content Masking(UCM)を提案する。
ウェブページのドキュメントオブジェクトモデル(DOM)は、信頼できない領域と信頼できない領域をコンテンツを読むことなく識別するのに十分な情報をエンコードする。
我々のフレームワークは、エージェントがエージェントに到達する前に信頼できない領域を再実行し、厳格な特権分離でサンドボックスインターフェースを介して相互作用をルーティングすることで、エージェントが敵のコンテンツから隔離されたまま環境を観察し、相互作用できるようにする。
コードは公開されている。
関連論文リスト
- Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents [93.19140872946842]
大規模言語モデル(LLM)によって駆動されるWebエージェントは、現実の環境にますますデプロイされる。
これにより、一見良質なコンテンツがエージェントの振る舞いを操作する敵の命令を埋め込む、プロンプト・インジェクション・アタックに対して脆弱になる。
実世界のWebエージェントシステムにおいて,損害を体系的に分類し,属性付けするベンチマークである textbfsysname を導入する。
論文 参考訳(メタデータ) (2026-06-11T14:12:43Z) - Securing LLM Agents Need Intent-to-Execution Integrity [49.490963596514185]
我々は, LLMエージェントの確保には, エージェントの実行がユーザの意図を忠実に反映した場合に規定するエンドツーエンドの正当性を定義する必要があると主張している。
LLMエージェントはコンパイラと構造的に類似しており、セキュリティ違反はユーザ意図を保存しない誤った実行に対応する。
emphTool整合性、emph命令整合性、emphJudgment整合性、emphData整合性。
論文 参考訳(メタデータ) (2026-05-16T12:53:31Z) - WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents [117.65855863464863]
Webエージェントはインジェクション攻撃に対して非常に脆弱である。
システム・プロンプト・ディフェンス(英語版)やエージェントの直接微調整を含む既存の防御は、効果が限られている。
本稿では,WebAgentGuardを導入し,インジェクション検出のためのマルチモーダルガードモデルを提案する。
論文 参考訳(メタデータ) (2026-04-14T04:50:35Z) - Sharing is caring: Attestable and Trusted Workflows out of Distrustful Components [5.561558661997071]
私たちは、機密性と信頼を分離する機密コンピューティングアーキテクチャであるMicaを紹介します。
Micaは、コンポーネント間のすべての通信パスを定義し、制限し、検証するための明示的なメカニズムをテナントに提供する。
我々の評価によると、Micaは信頼性の高いコンピューティング基盤をわずかに増やすだけで、現実的なクラウドパイプラインをサポートする。
論文 参考訳(メタデータ) (2026-03-03T14:53:48Z) - Building the Web for Agents: A Declarative Framework for Agent-Web Interaction [0.7116403133334644]
我々は、WebサイトがAIエージェントの信頼性、監査可能、プライバシ保護機能を公開できるWebネイティブフレームワークVOIXを紹介した。
VOIXはツール>とコンテキスト>タグを導入し、開発者は利用可能なアクションと関連する状態を明確に定義できる。
16人の開発者を対象とした3日間のハッカソン研究で,本フレームワークの実用性,学習性,表現性を評価した。
論文 参考訳(メタデータ) (2025-11-14T13:23:34Z) - DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents [52.92354372596197]
大規模言語モデル(LLM)は、強力な推論と計画能力のため、エージェントシステムの中心となってきています。
この相互作用は、外部ソースからの悪意のある入力がエージェントの振る舞いを誤解させる可能性がある、インジェクション攻撃のリスクも引き起こす。
本稿では,信頼に値するエージェントシステムのための動的ルールベースの分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-13T05:01:09Z) - The Hidden Dangers of Browsing AI Agents [0.0]
本稿では,複数のアーキテクチャ層にまたがるシステム的脆弱性に着目し,このようなエージェントの総合的なセキュリティ評価を行う。
本研究は,ブラウジングエージェントのエンド・ツー・エンドの脅威モデルについて概説し,実環境への展開を確保するための実用的なガイダンスを提供する。
論文 参考訳(メタデータ) (2025-05-19T13:10:29Z) - ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web Agents [3.09793323158304]
既存のベンチマークは、エージェントがタスクを完了したか、それが安全に行われているか、あるいは企業が信頼できる方法で行われているかを無視するのみである。
textbftextscST-WebAgentBenchを紹介します。
222のタスクはそれぞれ、制約を符号化する簡潔なルールであるSTポリシーと組み合わせられ、6次元(例えば、ユーザの同意、堅牢性)に沿ってスコアされる。
論文 参考訳(メタデータ) (2024-10-09T09:13:38Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。