論文の概要: Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
- arxiv url: http://arxiv.org/abs/2605.11047v1
- Date: Mon, 11 May 2026 13:20:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.328054
- Title: Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
- Title(参考訳): Red-Teaming Agent Execution Contexts: OpenClawのオープンワールドセキュリティ評価
- Authors: Hongwei Yao, Yiming Liu, Yiling He, Bingrun Yang,
- Abstract要約: 本稿では,OpenClawにおけるコンテキスト脆弱性の自動検出フレームワークであるDeepTrapについて述べる。
DeepTrapはリスク実現、良質なタスク保存、ステルスのバランスをとる。
その結果、コンテキスト妥協は、ユーザ対応タスクの完了を保ちながら、かなりの安全でない振る舞いを誘発することが示された。
- 参考スコア(独自算出の注目度): 9.193028511327851
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agentic language-model systems increasingly rely on mutable execution contexts, including files, memory, tools, skills, and auxiliary artifacts, creating security risks beyond explicit user prompts. This paper presents DeepTrap, an automated framework for discovering contextual vulnerabilities in OpenClaw. DeepTrap formulates adversarial context manipulation as a black-box trajectory-level optimization problem that balances risk realization, benign-task preservation, and stealth. It combines risk-conditioned evaluation, multi-objective trajectory scoring, reward-guided beam search, and reflection-based deep probing to identify high-value compromised contexts. We construct a 42-case benchmark spanning six vulnerability classes and seven operational scenarios, and evaluate nine target models using attack and utility grading scores. Results show that contextual compromise can induce substantial unsafe behavior while preserving user-facing task completion, demonstrating that final-response evaluation is insufficient. The findings highlight the need for execution-centric security evaluation of agentic AI systems. Our code is released at: https://github.com/ZJUICSR/DeepTrap
- Abstract(参考訳): エージェント言語モデルシステムは、ファイル、メモリ、ツール、スキル、補助的なアーティファクトを含む、変更可能な実行コンテキストにますます依存し、明示的なユーザープロンプトを超えたセキュリティリスクを生み出している。
本稿では,OpenClawにおけるコンテキスト脆弱性の自動検出フレームワークであるDeepTrapについて述べる。
DeepTrapは、リスク実現、良質なタスク保存、ステルスのバランスをとるブラックボックス軌道レベルの最適化問題として、敵のコンテキスト操作を定式化している。
リスク条件付き評価、多目的軌道スコア、報酬誘導ビームサーチ、反射に基づく深層探索を組み合わせて、高価値な妥協状況を特定する。
6つの脆弱性クラスと7つの運用シナリオにまたがる42ケースのベンチマークを構築し、攻撃とユーティリティグレーティングスコアを用いて9つのターゲットモデルを評価する。
その結果、コンテキスト妥協は、ユーザ側のタスク完了を保ちながら、かなりの安全でない振る舞いを誘発し、最終応答評価が不十分であることを示す。
この結果は、エージェントAIシステムの実行中心のセキュリティ評価の必要性を強調している。
私たちのコードは、https://github.com/ZJUICSR/DeepTrapでリリースされています。
関連論文リスト
- Automation-Exploit: A Multi-Agent LLM Framework for Adaptive Offensive Security with Digital Twin-Based Risk-Mitigated Exploitation [0.05729426778193397]
本稿では,完全自律型マルチエージェントシステム(MAS)フレームワークであるAutomance-Exploitを紹介する。
これは、自律的に実行可能ファイルを表示することで、偵察と搾取の間の抽象的なギャップを埋める。
高リスクメモリ破壊欠陥に対する条件付き同型検証を採用している。
論文 参考訳(メタデータ) (2026-04-24T10:38:40Z) - Trojan's Whisper: Stealthy Manipulation of OpenClaw through Injected Bootstrapped Guidance [23.059379933610163]
ガイダンスインジェクション(Guidance Injection)は、ブートストラップのガイダンスファイルに敵の運用ストーリーを埋め込むステルス攻撃ベクターである。
エクスプロイト,ワークスペース破壊,特権エスカレーション,持続的バックドア設置など,13の攻撃カテゴリにまたがる26の悪意あるスキルを構築した。
我々の攻撃は16.4%から64.2%の確率で成功し、悪意のある行動の大半はユーザーの確認なしに自律的に実行される。
論文 参考訳(メタデータ) (2026-03-20T14:17:56Z) - CIBER: A Comprehensive Benchmark for Security Evaluation of Code Interpreter Agents [27.35968236632966]
LLMベースのコードインタプリタエージェントは、ますます重要な状況にデプロイされている。
既存のベンチマークでは、動的コード実行、ツールインタラクション、マルチターンコンテキストから生じるセキュリティリスクをキャプチャできない。
動的アタック生成、分離されたセキュアサンドボックス、状態認識評価を組み合わせた自動ベンチマークであるCIBERを紹介する。
論文 参考訳(メタデータ) (2026-02-23T06:41:41Z) - Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs [65.6660735371212]
textbftextscJustAskは,インタラクションのみで効果的な抽出戦略を自律的に発見するフレームワークである。
これは、アッパー信頼境界に基づく戦略選択と、原子プローブと高レベルのオーケストレーションにまたがる階層的なスキル空間を用いて、オンライン探索問題として抽出を定式化する。
この結果から,現代のエージェントシステムにおいて,システムプロンプトは致命的ではあるがほぼ無防備な攻撃面であることがわかった。
論文 参考訳(メタデータ) (2026-01-29T03:53:25Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - Automated Red-Teaming Framework for Large Language Model Security Assessment: A Comprehensive Attack Generation and Detection System [4.864011355064205]
本稿では,大規模言語モデル(LLM)におけるセキュリティ脆弱性を明らかにするための,敵のプロンプトを生成し,実行し,評価する自動リピートフレームワークを提案する。
本フレームワークは,メタプロンプトに基づく攻撃合成,マルチモーダル脆弱性検出,および6つの主要な脅威カテゴリにまたがる標準化された評価プロトコルを統合する。
GPT-OSS-20Bモデルの実験では、21の重大度と12の新たな攻撃パターンを含む47の異なる脆弱性が明らかになった。
論文 参考訳(メタデータ) (2025-12-21T19:12:44Z) - The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search [58.8834056209347]
大規模言語モデル(LLM)は、有害な出力を誘導するために安全ガードレールをバイパスするジェイルブレイク攻撃に弱いままである。
CKA-Agent(Correlated Knowledge Attack Agent)は、ターゲットモデルの知識基盤の適応的木構造探索としてジェイルブレイクを再構成する動的フレームワークである。
論文 参考訳(メタデータ) (2025-12-01T07:05:23Z) - OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety [58.201189860217724]
OpenAgentSafetyは,8つの危機リスクカテゴリにまたがるエージェントの動作を評価する包括的なフレームワークである。
従来の作業とは異なり、我々のフレームワークは、Webブラウザ、コード実行環境、ファイルシステム、bashシェル、メッセージングプラットフォームなど、実際のツールと対話するエージェントを評価します。
ルールベースの分析とLSM-as-judgeアセスメントを組み合わせることで、過度な行動と微妙な不安全行動の両方を検出する。
論文 参考訳(メタデータ) (2025-07-08T16:18:54Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。