論文の概要: Agent Security Needs Redefinition through a Holistic Framework
- arxiv url: http://arxiv.org/abs/2607.22024v1
- Date: Fri, 24 Jul 2026 06:43:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.066947
- Title: Agent Security Needs Redefinition through a Holistic Framework
- Title(参考訳): エージェントセキュリティは全体論的なフレームワークを通じて再定義を必要とする
- Abstract要約: 被告は、命令が悪意あるように見えるかどうかを問う。ベンチマークは、エージェントが有害な鳴き声を行うかどうかを問う。
我々は,エージェントの軌道全体にわたって連続的に評価されなければならない4つの特性を通じて,コンテキストセキュリティを運用する。
- 参考スコア(独自算出の注目度): 46.88917910966891
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agent security is widely treated as a question about action content. Defenses ask whether an instruction looks malicious. Benchmarks ask whether an agent performs a harmful sounding action. \textbf{We argue that agent security is fundamentally a contextual problem, and that the current content based framing systematically misdefines it.} A command to ``delete user data'' might be a routine administrative request or a prompt injection attacking production systems, and the content alone cannot distinguish the two. Authorization context can. Across every injection task in AgentDojo and WASP, the same action is one an authenticated user would plausibly request in a routine workflow, which makes the conflation a structural property of evaluating security through content. We operationalize contextual security through four properties that must hold jointly and be evaluated continuously across the agent's trajectory. Source Authorization asks who issued the command. Task Alignment specifies the agent's authorized objective. Action Alignment evaluates whether each action serves that objective. Data Isolation governs information flows across privilege boundaries. Under this reframing, indirect prompt injection becomes a Source Authorization violation. Snapshot benchmarks are structurally incapable of evaluating Data Isolation. Existing defenses are reorganized around the property they actually approximate. The contextual reframing changes which defenses are coherent, which evaluations measure something useful, and which attack patterns evaluation can see at all.
- Abstract(参考訳): エージェントセキュリティは、アクションコンテンツに関する問題として広く扱われている。
被告は命令が悪意のあるように見えるかどうかを問う。
ベンチマークは、エージェントが有害な発声動作を行うかどうかを問う。
エージェントセキュリティは基本的にコンテキストの問題であり、現在のコンテンツベースのフレーミングが体系的にそれを誤定義している、と私たちは主張します。
コマンドは、通常の管理要求や、プロダクションシステムへのインジェクションのインジェクションであり、コンテンツだけでは2つを区別できない。
認証のコンテキストを指定できる。
AgentDojoとWASPのすべてのインジェクションタスクにおいて、同じアクションは認証されたユーザがルーチンワークフローで確実に要求するものである。
我々は,エージェントの軌道全体にわたって連続的に評価されなければならない4つの特性を通じて,コンテキストセキュリティを運用する。
ソースオーソライゼーションは、誰がコマンドを発行するかを問う。
タスクアライメントは、エージェントの承認された目的を指定する。
アクションアライメントは、それぞれのアクションがその目的を達成するかどうかを評価する。
データ分離は、特権境界を越えて情報の流れを管理する。
このリフレーミングの下で、間接的なプロンプトインジェクションはソース認証違反となる。
スナップショットベンチマークは、構造的にデータ分離を評価することができない。
既存の防御は、実際に近似した資産を中心に再編成される。
防御がコヒーレントで、評価が何か有用なものを計測し、どの攻撃パターンが全く見えないかという文脈的リフレーミングの変化。
関連論文リスト
- ActGuard: Pre-execution Action Auditing against Indirect Prompt Injection in LLM Agents [11.495797074855703]
本稿では,事前実行動作監査フレームワークであるActGuardを提案する。
外部コンテンツが本質的に疑わしいかどうかを判断する代わりに、ActGuardは現在のアクションが合理的な期待から逸脱するかどうかを評価する。
検証者はその後、局所化された証拠を調べ、マスクは悪意のあるものとのみ確認され、衛生化された文脈からアクションを再生する。
論文 参考訳(メタデータ) (2026-09-14T03:47:05Z) - ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection [61.4148196085256]
本稿では,信頼という構造概念に根ざしたROPE(Routed Origin Policy Enforcement)について述べる。
提案手法では,(1)軌道の各段階において,攻撃可能コンテンツのみを起点とする値が,原点保護パラメータに到達しない,(2)注入のリワードがない,という2つの保証が認められている。
論文 参考訳(メタデータ) (2026-08-27T01:22:14Z) - SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response [38.89333299127352]
我々は、インシデント-レスポンス後のワークフローにおいて、LLM(Large Language Model)エージェントを評価するための最初のベンチマークであるSecRespondを紹介する。
私たちはこのタスクを10のサイバー範囲でインスタンス化します。
実験の結果, 現行のエージェントは警報が発する問題を確実に発見できるが, サイレント侵入の円盤を積極的に調査することは困難であることがわかった。
論文 参考訳(メタデータ) (2026-07-29T11:32:23Z) - Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response [0.0]
サイバー対応AIエージェントは、言語モデルとツール、メモリ、実行環境を組み合わせて、攻撃的なセキュリティタスクを実行する。
このレビューでは、その境界における5つの脆弱性クラスを合成する。マルチステップ攻撃チェーン、サンドボックス境界と競合する目的、サプライチェーンとクレデンシャル露出、永続的なコマンド・アンド・コントロール、自動アクションのスピード。
論文 参考訳(メタデータ) (2026-07-28T07:34:37Z) - AutoDojo: Adaptive Black-Box Attacks Reveal the Limits of IPI Defenses and Task-Specification Effects in LLM Agents [57.34566159148893]
間接的プロンプトインジェクション(IPI)は、LLMを動力とするエージェントに対する主要なセキュリティ脅威である。
我々は、特定の防御に対してIPIを最適化するAgentDojoの適応的な拡張であるAutoDojoを開発した。
論文 参考訳(メタデータ) (2026-06-13T02:09:08Z) - Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents [93.19140872946842]
大規模言語モデル(LLM)によって駆動されるWebエージェントは、現実の環境にますますデプロイされる。
これにより、一見良質なコンテンツがエージェントの振る舞いを操作する敵の命令を埋め込む、プロンプト・インジェクション・アタックに対して脆弱になる。
実世界のWebエージェントシステムにおいて,損害を体系的に分類し,属性付けするベンチマークである textbfsysname を導入する。
論文 参考訳(メタデータ) (2026-06-11T14:12:43Z) - Aligning Provenance with Authorization: A Dual-Graph Defense for LLM Agents [11.867868278947524]
LLMベースのエージェントは、Eメール管理、金融トランザクション、コード実行など、ハイテイクなシナリオにますますデプロイされている。
2つの相補グラフを構成するデュアルグラフアライメント・ディフェンス・フレームワークであるAuthGraphを提案する。
AgentDojoでは、AuthGraphが攻撃成功率を40%から1%に削減し、GPT-4oでは76%のタスク完了率を維持している。
論文 参考訳(メタデータ) (2026-05-26T03:20:23Z) - AgentSecBench: Measuring Prompt Injection, Privacy Leakage, and Tool-Use Integrity in LLM Agents [0.2864713389096699]
本稿では,AgentSecBenchを,この問題に対する正式なセキュリティフレームワークの実証的なインスタンス化として紹介する。
3つのゲーム・インストラクション・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)を定めている。
これは、承認された観察と能力に対するプロジェクションとしてのアプリケーションポリシーを表し、プロジェクションの即時アノテーションとプロジェクションの強化を区別し、敵のアドバンテージと、防衛が生成前に関連するモデル可視チャネルを閉鎖するかどうかを計測する。
論文 参考訳(メタデータ) (2026-05-25T18:53:22Z) - Securing LLM Agents Need Intent-to-Execution Integrity [49.490963596514185]
我々は, LLMエージェントの確保には, エージェントの実行がユーザの意図を忠実に反映した場合に規定するエンドツーエンドの正当性を定義する必要があると主張している。
LLMエージェントはコンパイラと構造的に類似しており、セキュリティ違反はユーザ意図を保存しない誤った実行に対応する。
emphTool整合性、emph命令整合性、emphJudgment整合性、emphData整合性。
論文 参考訳(メタデータ) (2026-05-16T12:53:31Z) - Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw [9.193028511327851]
本稿では,OpenClawにおけるコンテキスト脆弱性の自動検出フレームワークであるDeepTrapについて述べる。
DeepTrapはリスク実現、良質なタスク保存、ステルスのバランスをとる。
その結果、コンテキスト妥協は、ユーザ対応タスクの完了を保ちながら、かなりの安全でない振る舞いを誘発することが示された。
論文 参考訳(メタデータ) (2026-05-11T13:20:02Z) - ARGUS: Defending LLM Agents Against Context-Aware Prompt Injection [28.414099578635373]
AgentLureは、コンテキスト依存タスクとコンテキスト認識インジェクション攻撃をキャプチャするベンチマークである。
この制限に対処するため,我々は,LDMエージェントの事前判定監査を実施する防衛機構であるARGUSを提案する。
論文 参考訳(メタデータ) (2026-05-05T05:37:00Z) - A Framework for Formalizing LLM Agent Security [46.86073273904095]
LLMエージェントのセキュリティは本質的にコンテキスト的です。
LLMエージェントに対する既存のセキュリティ攻撃の定義は、しばしばこの文脈の性質を捉えない。
本稿では,文脈的セキュリティの観点から,既存の攻撃と防御を体系化するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-19T21:01:49Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。