論文の概要: Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response
- arxiv url: http://arxiv.org/abs/2607.25379v2
- Date: Sat, 01 Aug 2026 10:03:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:23.926782
- Title: Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response
- Title(参考訳): サイバー能力を持つAIエージェント:脆弱性、評価内容、防御的応答
- Authors: Abu Bakar Siddik,
- Abstract要約: サイバー対応AIエージェントは、言語モデルとツール、メモリ、実行環境を組み合わせて、攻撃的なセキュリティタスクを実行する。
このレビューでは、その境界における5つの脆弱性クラスを合成する。マルチステップ攻撃チェーン、サンドボックス境界と競合する目的、サプライチェーンとクレデンシャル露出、永続的なコマンド・アンド・コントロール、自動アクションのスピード。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cyber-capable AI agents combine language models with tools, memory, and execution environments to perform multi-step offensive-security tasks. Existing work separately measures cyber capability and catalogs attacks against agent components, but provides less guidance on containing a capable agent within the environments used to evaluate it. This review synthesizes five vulnerability classes at that boundary: multi-step offensive chains, objectives that conflict with sandbox boundaries, supply-chain and credential exposure, persistent command-and-control, and the speed of automated action. We use two separate preliminary incident records: the reported July 2026 Hugging Face/OpenAI evaluation breach and Anthropic's subsequent three-incident evaluation review. A comparative evidence protocol distinguishes record-specific factual claims from the shared systems lesson: the evaluation environment is itself part of the security boundary. Across the taxonomy and records, we examine controls for containment, privilege separation, provenance, and responder access, including the dual-use problem that defensive artifacts may also enable misuse. The review identifies practical priorities for evaluating cyber capability together with the security of the environment in which that capability is exercised.
- Abstract(参考訳): サイバー対応AIエージェントは、言語モデルとツール、メモリ、実行環境を組み合わせて、多段階の攻撃的セキュリティタスクを実行する。
既存の作業は、エージェントコンポーネントに対するサイバー能力とカタログ攻撃を別々に測定するが、それを評価するために使用される環境に有能なエージェントを含むためのガイダンスは少ない。
このレビューでは、その境界における5つの脆弱性クラスを合成する。マルチステップ攻撃チェーン、サンドボックス境界と競合する目的、サプライチェーンとクレデンシャル露出、永続的なコマンド・アンド・コントロール、自動アクションのスピード。
私たちは、2026年7月に報告されたHugging Face/OpenAI評価違反と、その後のArthropicの3件のインシデント評価の2つの予備的なインシデント記録を使用します。
比較エビデンスプロトコルは、記録固有の事実主張と共有システムの教訓を区別する。
分類学と記録の全体にわたって、防御アーティファクトが誤用を可能にするという二重利用問題を含む、封じ込め、特権分離、証明、応答アクセスの制御について検討する。
本レビューでは,サイバー能力を評価するための実践的優先事項と,その能力が行使される環境のセキュリティについて述べる。
関連論文リスト
- Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents [93.19140872946842]
大規模言語モデル(LLM)によって駆動されるWebエージェントは、現実の環境にますますデプロイされる。
これにより、一見良質なコンテンツがエージェントの振る舞いを操作する敵の命令を埋め込む、プロンプト・インジェクション・アタックに対して脆弱になる。
実世界のWebエージェントシステムにおいて,損害を体系的に分類し,属性付けするベンチマークである textbfsysname を導入する。
論文 参考訳(メタデータ) (2026-06-11T14:12:43Z) - ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks? [92.21756459993695]
低レベルのプログラム推論を必要とするため、爆発は難しい作業です。
その重要性と診断価値にもかかわらず、搾取は未評価のままである。
ExploitGymは、AIエージェントのエクスプロイト能力に関する大規模で多様な、現実的なベンチマークである。
論文 参考訳(メタデータ) (2026-05-11T18:00:14Z) - Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses [168.50301366360344]
Embodied AI (Embodied AI) は、知覚、認知、計画、相互作用を、安全クリティカルな環境で機能するエージェントに統合する。
デジタルAIシステムとは異なり、エンボディエージェントは不確実な検知、不完全な知識、動的な人間とロボットの相互作用の下で行動しなければならない。
この調査は、エンボディされたAIにおける安全性研究の包括的なレビューを提供し、完全なエンボディされたパイプラインにわたる攻撃と防御を調査している。
論文 参考訳(メタデータ) (2026-03-28T13:21:44Z) - Agents of Chaos [50.53354213047402]
実験室環境に展開する自律言語モデルを用いたエージェントの探索的再チームの研究を報告する。
20人のAI研究者が、良心的および敵対的な条件下でエージェントと対話した。
我々の発見は、現実的なデプロイメント設定におけるセキュリティ、プライバシ、ガバナンスに関連する脆弱性の存在を確立します。
論文 参考訳(メタデータ) (2026-02-23T16:28:48Z) - Securing AI Agents in Cyber-Physical Systems: A Survey of Environmental Interactions, Deepfake Threats, and Defenses [2.6726842616701703]
この調査は、サイバー物理システムにおけるAIエージェントをターゲットにしたセキュリティ脅威の包括的なレビューを提供する。
我々は、環境相互作用、ディープフェイクによる攻撃、MCPによる脆弱性に焦点を当てる。
タイミング、騒音、偽陽性がいかに制約可能な防御を犠牲にするかを定量的に説明する。
論文 参考訳(メタデータ) (2026-01-28T02:33:24Z) - Hiding in the AI Traffic: Abusing MCP for LLM-Powered Agentic Red Teaming [0.0]
本稿では,モデルコンテキストプロトコル(MCP)を利用した新しいコマンド・アンド・コントロール(C2)アーキテクチャを導入し,適応型偵察エージェントを網羅的に協調する。
私たちのアーキテクチャは、システム全体のゴール指向の振る舞いを改善するだけでなく、コマンドとコントロールの振る舞いを完全に検出および防止するために使用できる主要なホストやネットワークアーティファクトを排除します。
論文 参考訳(メタデータ) (2025-11-20T02:51:04Z) - Servant, Stalker, Predator: How An Honest, Helpful, And Harmless (3H) Agent Unlocks Adversarial Skills [3.0620527758972496]
本稿では,モデルコンテキストプロトコルに基づくエージェントシステムにおいて,新たな脆弱性クラスを特定し,解析する。
このアタックチェーンは、有害な緊急行動を生み出すために、個々に認可された個々のタスクをどのように編成するかを説明し、実証する。
論文 参考訳(メタデータ) (2025-08-27T01:11:59Z) - Passive Hack-Back Strategies for Cyber Attribution: Covert Vectors in Denied Environment [0.2538209532048867]
本稿では,直接攻撃を起こさずに隠蔽属性と情報収集を可能にするパッシブ・ハックバック手法の戦略的価値について検討する。
主なベクタとしては、ビーコンの追跡、ハネトケン、環境固有のペイロード、流出または漏洩した資産に埋め込まれたサプライチェーンベースのトラップなどがある。
また、受動的ハックバック操作の強化における人工知能(AI)の役割についても検討する。
論文 参考訳(メタデータ) (2025-08-17T16:43:23Z) - OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety [58.201189860217724]
OpenAgentSafetyは,8つの危機リスクカテゴリにまたがるエージェントの動作を評価する包括的なフレームワークである。
従来の作業とは異なり、我々のフレームワークは、Webブラウザ、コード実行環境、ファイルシステム、bashシェル、メッセージングプラットフォームなど、実際のツールと対話するエージェントを評価します。
ルールベースの分析とLSM-as-judgeアセスメントを組み合わせることで、過度な行動と微妙な不安全行動の両方を検出する。
論文 参考訳(メタデータ) (2025-07-08T16:18:54Z) - Compromising Embodied Agents with Contextual Backdoor Attacks [69.71630408822767]
大型言語モデル(LLM)は、エンボディドインテリジェンスの発展に変化をもたらした。
本稿では,このプロセスにおけるバックドアセキュリティの重大な脅威を明らかにする。
ほんの少しの文脈的デモンストレーションを毒殺しただけで、攻撃者はブラックボックスLDMの文脈的環境を隠蔽することができる。
論文 参考訳(メタデータ) (2024-08-06T01:20:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。