論文の概要: What's in Your Agent's Context? Context Privilege Escalation Attacks against AI Agent Harness
- arxiv url: http://arxiv.org/abs/2609.01222v1
- Date: Tue, 01 Sep 2026 13:26:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.682757
- Title: What's in Your Agent's Context? Context Privilege Escalation Attacks against AI Agent Harness
- Title(参考訳): エージェントのコンテキストには何があるのか?AIエージェントのHarnessに対するコンテキストプライヴィリエジエスカレーション攻撃
- Authors: Zichuan Li, Jian Cui, Ashley Chen, Xiaojing Liao, Luyi Xing,
- Abstract要約: 現実の高名なAIエージェントハーネスは、しばしばコンテキストアセンブリのベンダプライエタリな設計や不透明な設計に依存している。
実世界のAIエージェントハーネスにおけるコンテキストアセンブリ設計のシステマティック分析について述べる。
- 参考スコア(独自算出の注目度): 21.867202793364665
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Real-world, high-profile AI agent harnesses often rely on vendor-proprietary or opaque designs for context assembly, leaving the sources and underlying logic of assembled context poorly understood and the resulting security risks largely unexplored. In this paper, we present the first systematic analysis of context assembly designs in real-world AI agent harnesses. We study and uncover how an agent harness is designed to collect and assemble context from diverse sources, and identify a set of practical attack vectors arising from these designs. Our analysis brings to light two novel categories of attacks in the context assembly of real-world harnesses: (1) MessageRole Context Privilege Escalation (M-CPE), which occurs when attacker-controlled content originating from a low-privileged context is incorporated into a higher-privileged message role. (2) Cross-Scope Context Privilege Escalation (X-CPE), which occurs when attacker-controlled content persists beyond the context in which it was introduced. We performed a systemic security analysis of the CPE attacks against 12 real-world agent harnesses, including Claude Code and Codex. The resulting consequences include full agent compromise, remote code execution, denial of service, and manipulated tool or skill invocations, etc.
- Abstract(参考訳): 現実の、高名なAIエージェントハーネスは、しばしばベンダーが所有する、あるいは不透明な設計をコンテキストアセンブリに頼り、組み立てられたコンテキストのソースと基礎となるロジックを十分に理解しておらず、結果として生じるセキュリティリスクはほとんど調査されていない。
本稿では,実世界のAIエージェントハーネスにおけるコンテキストアセンブリ設計のシステマティック解析について述べる。
本研究では,エージェント・ハーネスが様々なソースからコンテキストを収集・集合するように設計されていることを明らかにするとともに,これらの設計から生じる実用的な攻撃ベクトルの集合を同定する。
実世界のハーネスのコンテキストアセンブリにおける攻撃の2つの新しいカテゴリは、(1)低特権のコンテキストから派生した攻撃制御されたコンテンツが高特権のメッセージロールに組み込まれた場合に発生する、MessageRole Context Privilege Escalation (M-CPE)である。
2) クロススコープ・コンテキスト・プリヴィリエジ・エスカレーション(X-CPE)は,攻撃者が制御したコンテンツが導入したコンテキストを超えて持続する時に発生する。
我々は、Claude CodeやCodexを含む12の現実世界のエージェントハーネスに対するCPE攻撃のシステムセキュリティ解析を行った。
その結果、完全なエージェントの妥協、リモートコードの実行、サービス拒否、操作されたツールやスキルの呼び出しなどが実現します。
関連論文リスト
- The Anatomy of a Prompt Injection: A Component Model for Structured Analysis [0.0]
本稿では,プロンプトインジェクションの構造を形式化し,攻撃のラベル付け,比較,変更を可能にする。
大きな言語モデルは、自然言語の実現を同じ実行可能なアクションに変化させるため、ラベル付けは攻撃者の意図を追跡する必要がある。
我々は、明確なラベリングルール、産業用CTIスキーマに直接マッピングする論理解析レコード、実証的なエージェントフローチャートを提供する。
論文 参考訳(メタデータ) (2026-08-07T23:16:35Z) - Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents [93.19140872946842]
大規模言語モデル(LLM)によって駆動されるWebエージェントは、現実の環境にますますデプロイされる。
これにより、一見良質なコンテンツがエージェントの振る舞いを操作する敵の命令を埋め込む、プロンプト・インジェクション・アタックに対して脆弱になる。
実世界のWebエージェントシステムにおいて,損害を体系的に分類し,属性付けするベンチマークである textbfsysname を導入する。
論文 参考訳(メタデータ) (2026-06-11T14:12:43Z) - Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents [64.80318459073526]
敵のコンテンツは、同一のエージェントによって提供される相互作用にまたがって持続できることを示し、そのような脅威を検知し緩和することを困難にしている。
具体的には、敵対的コンテンツはエージェント状態に留まり、相互作用をまたいだ休眠状態に留まり、その後、良心的なユーザクエリによって活性化される。
我々は、このタイプの安全脅威をスリーパー攻撃として形式化し、評価するために、現実世界の有害な結果6つ、攻撃戦略3つ、エージェント状態の目標3つをカバーする1,896件のベンチマークを構築した。
論文 参考訳(メタデータ) (2026-05-27T09:25:37Z) - Benchmarking Autonomous Agents against Temporal, Spatial, and Semantic Evasions [15.535628544812326]
LLMをベースとしたエージェントシステムを対象とした,新しい多次元回避フレームワークを提案する。
これらの脅威を定量化するために,2,254個の実世界のエージェント実行軌跡からなる総合ベンチマークであるA3S-Benchを構築した。
我々の回避フレームワークは平均リスクトリガー率を28.3%から52.6%に引き上げる。
論文 参考訳(メタデータ) (2026-05-21T11:07:51Z) - ARGUS: Defending LLM Agents Against Context-Aware Prompt Injection [28.414099578635373]
AgentLureは、コンテキスト依存タスクとコンテキスト認識インジェクション攻撃をキャプチャするベンチマークである。
この制限に対処するため,我々は,LDMエージェントの事前判定監査を実施する防衛機構であるARGUSを提案する。
論文 参考訳(メタデータ) (2026-05-05T05:37:00Z) - Agent2Agent Threats in Safety-Critical LLM Assistants: A Human-Centric Taxonomy [4.058281338403478]
本稿では,攻撃経路解析から資産識別を分離するAgentHeLLMという脅威モデリングフレームワークを提案する。
我々は、調和指向の「市民モデリング」から派生した人間中心の資産分類を導入し、人権の普遍宣言に触発された。
本稿では,オープンソースのアタックパス提案ツールであるAgentHeLLMアタックパスジェネレータを用いて,フレームワークの実用性を示す。
論文 参考訳(メタデータ) (2026-02-05T16:53:41Z) - Cuckoo Attack: Stealthy and Persistent Attacks Against AI-IDE [64.47951172662745]
Cuckoo Attackは、悪意のあるペイロードを構成ファイルに埋め込むことで、ステルス性と永続的なコマンド実行を実現する新しい攻撃である。
攻撃パラダイムを初期感染と持続性という2つの段階に分類する。
当社は、ベンダーが製品のセキュリティを評価するために、実行可能な7つのチェックポイントを提供しています。
論文 参考訳(メタデータ) (2025-09-19T04:10:52Z) - Towards Unifying Quantitative Security Benchmarking for Multi Agent Systems [0.0]
AIシステムの進化 自律エージェントが協力し、情報を共有し、プロトコルを開発することでタスクを委譲するマルチエージェントアーキテクチャをますます展開する。
そのようなリスクの1つはカスケードリスクである。あるエージェントの侵入はシステムを通してカスケードし、エージェント間の信頼を利用して他人を妥協させる。
ACI攻撃では、あるエージェントに悪意のあるインプットまたはツールエクスプロイトが注入され、そのアウトプットを信頼するエージェント間でカスケードの妥協とダウンストリーム効果が増幅される。
論文 参考訳(メタデータ) (2025-07-23T13:51:28Z) - AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents [54.29555239363013]
本稿では,間接的なインジェクション脆弱性を自動的に検出し,悪用するための汎用的なブラックボックスファジリングフレームワークであるAgentVigilを提案する。
我々はAgentVigilをAgentDojoとVWA-advの2つの公開ベンチマークで評価し、o3-miniとGPT-4oに基づくエージェントに対して71%と70%の成功率を達成した。
攻撃を現実世界の環境に適用し、悪質なサイトを含む任意のURLに誘導するエージェントをうまく誘導する。
論文 参考訳(メタデータ) (2025-05-09T07:40:17Z) - Illusions of Relevance: Using Content Injection Attacks to Deceive Retrievers, Rerankers, and LLM Judges [52.96987928118327]
検索,リランカー,大型言語モデル(LLM)の埋め込みモデルは,コンテンツインジェクション攻撃に対して脆弱であることがわかった。
主な脅威は,(1) 意味不明な内容や有害な内容の挿入,(2) 関連性を高めるために,問合せ全体あるいはキークエリ用語の挿入,の2つである。
本研究は, 注射内容の配置や関連物質と非関連物質とのバランスなど, 攻撃の成功に影響を与える要因を系統的に検討した。
論文 参考訳(メタデータ) (2025-01-30T18:02:15Z) - Compromising Embodied Agents with Contextual Backdoor Attacks [69.71630408822767]
大型言語モデル(LLM)は、エンボディドインテリジェンスの発展に変化をもたらした。
本稿では,このプロセスにおけるバックドアセキュリティの重大な脅威を明らかにする。
ほんの少しの文脈的デモンストレーションを毒殺しただけで、攻撃者はブラックボックスLDMの文脈的環境を隠蔽することができる。
論文 参考訳(メタデータ) (2024-08-06T01:20:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。