論文の概要: StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents
- arxiv url: http://arxiv.org/abs/2607.26314v1
- Date: Tue, 28 Jul 2026 22:23:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.491325
- Title: StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents
- Title(参考訳): StealthBench: 自律的攻撃安全エージェントにおける操作ステルスの測定
- Abstract要約: 我々は、自律的な攻撃セキュリティエージェントの運用ステルスを測定するベンチマークであるStealthBenchを紹介する。
我々は、実際のバグ報奨金とレッドチームトラジェクトリから11の手作業検証OPSECインシデントを抽出し、14のドーッカ化されたタスクシナリオに拡張した。
本稿では, 3 モデル大言語モデル (LLM) 判定パネルを用いたエージェントトラジェクトリの評価, 安全成功率 (解決とステルス) , Stealth@ データセット (解決とステルス) , 無謀な解決率 (解決だが, 隠蔽) を用いたエージェントトラジェクトリの評価を行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Stealth, the discipline of achieving an objective without revealing your presence, capabilities, or collected intelligence, is what separates sophisticated operators from detectable ones. Elite security researchers and advanced persistent threats achieve their objectives unnoticed; autonomous agents increasingly inherit the same offensive tasks, but do they inherit the tradecraft? We introduce StealthBench,a benchmark that measures operational stealth in autonomous offensive-security agents across six operational security (OPSEC) dimensions. We extract 11 hand-verified OPSEC incidents from real bug-bounty and red-team trajectories, expanded into 14 dockerized task scenarios, where agents, despite finding real vulnerabilities, committed stealth failures inconsistent with standard operational tradecraft: embedding credentials in public uploads, deleting production resources to prove access, force-adding uninvolved users to demonstrate a race condition. We evaluate agent trajectories using a 3-model large language model (LLM) judge panel with majority-vote aggregation, measuring safe success rate (solved and stealthy), Stealth@Solve (tradecraft quality among successful solves), and reckless solve rate (solved but cover blown). Our results show that no model exceeds 54% safe success rate (the compound metric requiring both task completion and stealth), confirming that OPSEC failures are systematic across model families. We release StealthBench as a public benchmark to support both the development of stealth-aware agents and automated OPSEC monitoring for autonomous offensive-security deployments. The interactive leaderboard, evaluation harness, and dataset are available at https://stealthbench.com.
- Abstract(参考訳): Stealthは、あなたの存在、能力、あるいは収集された知性を明らかにすることなく目的を達成するための規律であり、洗練されたオペレータと検出可能なオペレータを分離する。
自律的なエージェントはますます同じ攻撃的なタスクを継承するが、彼らはそのトレードクラフトを継承するのだろうか?
我々は6つの運用セキュリティ(OPSEC)次元にわたる自律的な攻撃セキュリティエージェントの運用ステルスを測定するベンチマークであるStealthBenchを紹介する。
私たちは、実際のバグ報奨金とレッドチームトラジェクトリから11の認証済みOPSECインシデントを抽出し、14のドーッカ化されたタスクシナリオに拡張しました。
本研究では, 3 モデル大言語モデル (LLM) 判定パネルを用いたエージェントトラジェクトリの評価を行い, 安全成功率 (解決とステルス) , Stealth@Solve (解決と隠蔽) , 無謀な解決率 (解決だが, カバーブロイン) を測定した。
以上の結果から,OPSECの失敗がモデルファミリ全体にわたって体系化されていることを確認するため,安全な成功率(タスク完了とステルスの両方を必要とする複合指標)を54%超えるモデルが存在しないことが示唆された。
我々はステルス対応エージェントの開発と自動OPSEC監視の両方をサポートするための公開ベンチマークとしてStealthBenchをリリースした。
インタラクティブなリーダボード、評価ハーネス、データセットはhttps://stealthbench.com.comで公開されている。
関連論文リスト
- AgentLeak: Cloning Stronger LLM Agent Capabilities onto Weaker Agents Beyond Skill Stealing [18.52239289354215]
より弱いエージェントは、同じスキルを持っているかもしれないが、より強いエージェントによって暗黙的に認識される手続き的行動が欠けているため、失敗する可能性がある。
私たちの重要な洞察は、スキル実行ギャップ自体が、欠落した振る舞いが露呈する漏洩面を形成していることです。
我々は,これらの実行の違いから,機能クリティカルな動作を識別し,攻撃側のスキルに組み込むブラックボックス機能閉鎖攻撃であるAgentLeakを提案する。
論文 参考訳(メタデータ) (2026-09-07T07:30:02Z) - Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents [4.0024223650305695]
我々は,攻撃的Cybench課題と防御的Splunk BOTS v1調査課題に対する低コストレンズによる言語モデルセキュリティエージェントの評価を行った。
結果から,赤と青のチームタスクのスケーリング機構が異なることがわかった。
セキュリティエージェントのベンチマークは、タスクの成功とともに経済効率と運用の適合を測るべきである、と我々は主張する。
論文 参考訳(メタデータ) (2026-07-16T17:54:47Z) - Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents [93.19140872946842]
大規模言語モデル(LLM)によって駆動されるWebエージェントは、現実の環境にますますデプロイされる。
これにより、一見良質なコンテンツがエージェントの振る舞いを操作する敵の命令を埋め込む、プロンプト・インジェクション・アタックに対して脆弱になる。
実世界のWebエージェントシステムにおいて,損害を体系的に分類し,属性付けするベンチマークである textbfsysname を導入する。
論文 参考訳(メタデータ) (2026-06-11T14:12:43Z) - AgentCanary: A Security Evaluation Framework for Autonomous AI Agents in Real Executable Environments [32.982317538632806]
本稿では,自律型AIエージェントの総合的セキュリティ評価フレームワークであるAgentCanaryを提案する。
AgentCanaryは3つのコントリビューションに沿って、システマティックなソリューションを提供する。
我々は,AgentCanaryのフロンティアモデルに対して,複数の確立した敵攻撃手法に対して,幅広いフロンティアモデルを評価する。
論文 参考訳(メタデータ) (2026-06-09T06:55:37Z) - SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents [87.26967184869198]
SeClawは、仕様駆動のセキュリティタスク合成と、自律エージェントの実行ベースのセキュリティ評価を組み合わせたフレームワークである。
ベンチマークは、リソース、ユーザタスク、環境、本質的なエージェントの振る舞いから生じるリスクをカバーしている。
論文 参考訳(メタデータ) (2026-06-01T14:23:42Z) - ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks? [92.21756459993695]
低レベルのプログラム推論を必要とするため、爆発は難しい作業です。
その重要性と診断価値にもかかわらず、搾取は未評価のままである。
ExploitGymは、AIエージェントのエクスプロイト能力に関する大規模で多様な、現実的なベンチマークである。
論文 参考訳(メタデータ) (2026-05-11T18:00:14Z) - Re-Evaluating EVMBench: Are AI Agents Ready for Smart Contract Security? [10.248746359119625]
EVMbenchは、スマートコントラクトセキュリティに関するAIエージェントのための最初の大規模なベンチマークである。
その成果は、完全に自動化されたAI監査が到達範囲内にあるという期待を後押しした。
これらの発見は、完全に自動化されたAI監査が差し迫っているという物語に挑戦する。
論文 参考訳(メタデータ) (2026-03-11T14:07:16Z) - PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach [49.14349403242654]
我々は、リスクを伴う行動に関わるモデルの確率を評価する新しいベンチマークフレームワークであるtextbfPropensityBench$を提示する。
私たちのフレームワークには,サイバーセキュリティ,自己増殖,バイオセキュリティ,化学セキュリティという,リスクの高い4つのドメインにまたがる6,648のツールを備えた,5,874のシナリオが含まれています。
オープンソースとプロプライエタリなフロンティアモデル全体で、私たちは9つの不確実性の兆候を発見しました。
論文 参考訳(メタデータ) (2025-11-24T18:46:44Z) - Security Challenges in AI Agent Deployment: Insights from a Large Scale Public Competition [101.86739402748995]
44の現実的なデプロイメントシナリオを対象とした,22のフロンティアAIエージェントを対象にしています。
Agent Red Teamingベンチマークを構築し、19の最先端モデルで評価します。
私たちの発見は、今日のAIエージェントの重要かつ永続的な脆弱性を浮き彫りにしたものです。
論文 参考訳(メタデータ) (2025-07-28T05:13:04Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。