論文の概要: Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
- arxiv url: http://arxiv.org/abs/2607.15263v1
- Date: Thu, 16 Jul 2026 17:54:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.203152
- Title: Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
- Title(参考訳): 成功率を超えて:攻撃的および防御的セキュリティエージェントのコストアウェア評価
- Authors: Paul Kassianik, Blaine Nelson, Yaron Singer,
- Abstract要約: 我々は,攻撃的Cybench課題と防御的Splunk BOTS v1調査課題に対する低コストレンズによる言語モデルセキュリティエージェントの評価を行った。
結果から,赤と青のチームタスクのスケーリング機構が異なることがわかった。
セキュリティエージェントのベンチマークは、タスクの成功とともに経済効率と運用の適合を測るべきである、と我々は主張する。
- 参考スコア(独自算出の注目度): 4.0024223650305695
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Security-agent evaluations commonly measure peak offensive capability under generous inference budgets, emphasizing vulnerability discovery, exploit development, penetration testing, and CTF completion. Such measurements are useful but incomplete: in operational security, every reasoning step, tool call, telemetry query, and enrichment request consumes budget. We evaluate language-model security agents through this cost-success lens on offensive Cybench challenges and defensive Splunk BOTS v1 investigation challenges. Instead of reporting only best-case success, we compare models at fixed cost levels and decompose performance by inference spend and tool spend. Our results show distinct scalingregimes for red- and blue-team tasks. Offensive CTF performance improves with additional test-time compute, and scaled open-weight models can approach frontier proprietary systems while remaining cost-competitive. Defensive SOC investigation does not scale in the same way: success depends more heavily on disciplined tool use, telemetry navigation, and selective enrichment than on raw reasoning budget alone. We argue that security-agent benchmarks should measure economic efficiency and operational fit alongside task success. Cost-aware, SOC-native evaluations provide a clearer picture of which models are practically useful today and where defensive agents still need to improve. We present an interactive website with our results https://evals.frontier.security.
- Abstract(参考訳): セキュリティエージェントの評価は通常、寛大な推論予算の下でピーク攻撃能力を測定し、脆弱性発見、エクスプロイト開発、侵入テスト、CTF完了を強調する。
運用上のセキュリティでは、すべての推論ステップ、ツールコール、テレメトリクエリ、強化要求が予算を消費する。
我々は,攻撃的Cybench課題と防御的Splunk BOTS v1調査課題に基づく,低コストレンズによる言語モデルセキュリティエージェントの評価を行った。
ベストケースの成功のみを報告するのではなく、固定コストレベルでモデルを比較し、推論の費用とツールの支出によってパフォーマンスを分解します。
結果から,赤と青のチームタスクのスケーリング機構が異なることがわかった。
攻撃的なCTF性能はテスト時間計算の追加で改善され、拡張されたオープンウェイトモデルはコスト競争力を維持しながらフロンティアプロプライエタリなシステムにアプローチすることができる。
成功は、訓練されたツールの使用、テレメトリナビゲーション、選択的な豊かさにのみ依存する。
セキュリティエージェントのベンチマークは、タスクの成功とともに経済効率と運用の適合を測るべきである、と我々は主張する。
コストを意識したSOCネイティブな評価は、現在どのモデルが実際に有用であるか、また防御エージェントが改善する必要があるのかを明確にする。
結果が得られたインタラクティブなWebサイト https://evals.frontier.security.com を提示します。
関連論文リスト
- TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - Security Incentivization: An Empirical Study of how Micropayments Impact Code Security [37.42753138542901]
セキュリティは、目に見える価値を直接生成しないため、開発者の注意を欠くことが多い。
我々は、チームレベルのインセンティブによる、測定可能なセキュリティ改善に関連する対策の評価を行った。
私たちの半自動メカニズムは、Bearer、Detekt、Mobsfscanの静的分析結果を収集し、セキュリティ問題密度を計算し、スプリント間の相対的な改善比率に基づいてチームに報酬を与えます。
論文 参考訳(メタデータ) (2026-05-13T07:12:13Z) - The Verifier Tax: Horizon Dependent Safety Success Tradeoffs in Tool Using LLM Agents [1.3299507495084417]
本研究では, 大規模言語モデル (LLM) エージェントを用いた多段階ツールにおいて, 実行時の安全でない動作に対する強制が, エンドツーエンドのタスクパフォーマンスに与える影響について検討する。
モデル依存相互作用の地平線(15~30ターン)を特定し、その結果を総合成功率(SR)、安全な成功率(SSR)、安全でない成功率(USR)に分解する。
論文 参考訳(メタデータ) (2026-03-18T16:16:34Z) - What Makes a Good LLM Agent for Real-world Penetration Testing? [37.56537537883771]
LLMをベースとした28の浸透試験システムを分析し,複雑性の増大を示す3つのベンチマークで5つの代表的実装を評価した。
我々は、B型障害がLLMの根本原因とほとんど変わらず、エージェントはリアルタイムなタスクの難易度推定を欠いていることを示す。
Excaliburは、強力なツールと困難な計画とを結合した浸透試験エージェントである。
論文 参考訳(メタデータ) (2026-02-19T18:42:40Z) - Verified Critical Step Optimization for LLM Agents [67.05296684575445]
クリティカルステップ最適化は、検証されたクリティカルステップに優先学習を集中する。
メソッドは、専門家のデモンストレーションではなく、失敗するポリシーの軌道から始まります。
GAIA-Text-103とXBench-DeepSearchの実験では、CSOはSFTベースラインよりも37%、相対的に26%改善している。
論文 参考訳(メタデータ) (2026-02-03T11:41:02Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - Budget-Aware Tool-Use Enables Effective Agent Scaling [82.6942342482552]
大規模言語モデル(LLM)におけるタスク間のテスト時間計算のスケーリングによるパフォーマンス向上
本研究では,これらのエージェントを,Web検索エージェントを中心に,明示的なツールコール予算の下で効果的にスケールする方法について検討する。
私たちは、エージェントに継続的な予算意識を提供する軽量プラグインであるBudget Trackerを紹介します。
論文 参考訳(メタデータ) (2025-11-21T07:18:55Z) - Cybersecurity AI Benchmark (CAIBench): A Meta-Benchmark for Evaluating Cybersecurity AI Agents [0.36134114973155557]
既存のベンチマークは、統合されたパフォーマンスではなく、独立したスキルを評価する。
モジュール型メタベンチマークフレームワークであるCAIBench(Cybersecurity AI Benchmark)を紹介する。
適切なマッチは2.6$times$ variance in Attack and Defense CTFsまで改善される。
論文 参考訳(メタデータ) (2025-10-28T11:36:20Z) - When Hallucination Costs Millions: Benchmarking AI Agents in High-Stakes Adversarial Financial Markets [0.3069921776214295]
AI評価において重要な盲点を明らかにするベンチマークであるCAIAを提示する。
我々は178の時間短縮タスクに対して17のモデルを評価し,真理と操作の区別をエージェントに要求した。
ツールがなければ、フロンティアモデルでさえ、ジュニアアナリストが日常的に扱うタスクにおいて28%の精度しか達成できません。
論文 参考訳(メタデータ) (2025-09-30T22:39:06Z) - Security Challenges in AI Agent Deployment: Insights from a Large Scale Public Competition [101.86739402748995]
44の現実的なデプロイメントシナリオを対象とした,22のフロンティアAIエージェントを対象にしています。
Agent Red Teamingベンチマークを構築し、19の最先端モデルで評価します。
私たちの発見は、今日のAIエージェントの重要かつ永続的な脆弱性を浮き彫りにしたものです。
論文 参考訳(メタデータ) (2025-07-28T05:13:04Z) - MISLEADER: Defending against Model Extraction with Ensembles of Distilled Models [56.09354775405601]
モデル抽出攻撃は、クエリアクセスを通じてブラックボックスモデルの機能を複製することを目的としている。
既存のディフェンスでは、アタッカークエリにはオフ・オブ・ディストリビューション(OOD)サンプルがあることを前提としており、不審な入力を検出し破壊することができる。
OOD仮定に依存しない新しい防衛戦略であるMISLEADERを提案する。
論文 参考訳(メタデータ) (2025-06-03T01:37:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。