論文の概要: Design Principles for the Construction of a Benchmark Evaluating Security Operation Capabilities of Multi-agent AI Systems
- arxiv url: http://arxiv.org/abs/2603.28998v1
- Date: Mon, 30 Mar 2026 21:01:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-01 15:25:02.860917
- Title: Design Principles for the Construction of a Benchmark Evaluating Security Operation Capabilities of Multi-agent AI Systems
- Title(参考訳): マルチエージェントAIシステムのセキュリティ運用能力評価ベンチマーク構築のための設計原理
- Authors: Yicheng Cai, Mitchell John DeStefano, Guodong Dong, Pulkit Handa, Peng Liu, Tejas Singhal, Peiyu Tseng, Winston Jen White,
- Abstract要約: 大規模言語モデル(LLM)とマルチエージェントAIシステムは、サイバーセキュリティオペレーションの可能性を増している。
この文献では、コーディネートされたマルチタスク・ブルーチームAIを評価するための体系的なベンチマークは提案されていない。
我々は,大規模なランサムウェア攻撃インシデント応答の文脈において,5つのブルーチームタスクからなるSOC-benchの概念設計を開発した。
- 参考スコア(独自算出の注目度): 3.183568971165364
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As Large Language Models (LLMs) and multi-agent AI systems are demonstrating increasing potential in cybersecurity operations, organizations, policymakers, model providers, and researchers in the AI and cybersecurity communities are interested in quantifying the capabilities of such AI systems to achieve more autonomous SOCs (security operation centers) and reduce manual effort. In particular, the AI and cybersecurity communities have recently developed several benchmarks for evaluating the red team capabilities of multi-agent AI systems. However, because the operations in SOCs are dominated by blue team operations, the capabilities of AI systems & agents to achieve more autonomous SOCs cannot be evaluated without a benchmark focused on blue team operations. To our best knowledge, no systematic benchmark for evaluating coordinated multi-task blue team AI has been proposed in the literature. Existing blue team benchmarks focus on a particular task. The goal of this work is to develop a set of design principles for the construction of a benchmark, which is denoted as SOC-bench, to evaluate the blue team capabilities of AI. Following these design principles, we have developed a conceptual design of SOC-bench, which consists of a family of five blue team tasks in the context of large-scale ransomware attack incident response.
- Abstract(参考訳): 大規模言語モデル(LLM)とマルチエージェントAIシステムがサイバーセキュリティオペレーションのポテンシャルを増しているため、組織、政策立案者、モデル提供者、AIおよびサイバーセキュリティコミュニティの研究者は、このようなAIシステムの能力を定量化し、より自律的なSOC(セキュリティ運用センター)を達成することに興味を持ち、手作業の労力を減らそうとしている。
特に、AIとサイバーセキュリティコミュニティは、最近、マルチエージェントAIシステムのレッドチーム能力を評価するためのいくつかのベンチマークを開発した。
しかし、SOCの運用はブルーチーム操作に支配されているため、より自律的なSOCを実現するAIシステムやエージェントの能力は、ブルーチーム操作に焦点を当てたベンチマークなしで評価することはできない。
我々の知る限り、コーディネートされたマルチタスク・ブルーチームAIを評価するための体系的なベンチマークは文献では提案されていない。
既存のブルーチームのベンチマークは、特定のタスクに重点を置いている。
この研究の目的は、AIのブルーチーム能力を評価するために、SOC-benchと呼ばれるベンチマークを構築するための一連の設計原則を開発することである。
これらの設計原則に従い、大規模なランサムウェア攻撃インシデント応答の文脈において、5つのブルーチームタスクのファミリーからなるSOC-benchの概念設計を開発した。
関連論文リスト
- A Practical Guide to Agentic AI Transition in Organizations [4.085087405595323]
エージェントAIは、組織内でのインテリジェンスの適用方法に大きな変化をもたらします。
本稿では,手動プロセスから自動エージェントAIシステムへ組織機能を移行するための実用的枠組みを提案する。
論文 参考訳(メタデータ) (2026-01-27T10:49:59Z) - Toward Quantitative Modeling of Cybersecurity Risks Due to AI Misuse [50.87630846876635]
我々は9つの詳細なサイバーリスクモデルを開発する。
各モデルはMITRE ATT&CKフレームワークを使用して攻撃をステップに分解する。
個々の見積もりはモンテカルロシミュレーションによって集約される。
論文 参考訳(メタデータ) (2025-12-09T17:54:17Z) - Towards a Playground to Democratize Experimentation and Benchmarking of AI Agents for Network Troubleshooting [48.131257144711576]
ネットワークトラブルシューティングにおけるAIエージェントの適用に焦点を当てる。
標準化され、再現可能で、オープンなベンチマークプラットフォームの必要性について詳しく説明します。
論文 参考訳(メタデータ) (2025-07-01T08:46:37Z) - Report on NSF Workshop on Science of Safe AI [75.96202715567088]
機械学習の新たな進歩は、社会問題に対する技術ベースのソリューションを開発する新たな機会につながっている。
AIの約束を果たすためには、正確でパフォーマンスが高く、安全で信頼性の高いAIベースのシステムを開発する方法に取り組む必要がある。
本報告はワークショップの安全性の異なる側面に対処した作業グループにおける議論の結果である。
論文 参考訳(メタデータ) (2025-06-24T18:55:29Z) - TRiSM for Agentic AI: A Review of Trust, Risk, and Security Management in LLM-based Agentic Multi-Agent Systems [8.683314804719506]
本稿では,エージェントマルチエージェントシステム(AMAS)における信頼・リスク・セキュリティマネジメント(TRiSM)の構造的分析について述べる。
まず、エージェントAIの概念的基礎を調べ、従来のAIエージェントとアーキテクチャ的区別を強調します。
次に、Textit Explainability、ModelOps、Security、Privacy、Textittheirのガバナンスガバナンスといった重要な柱を中心に構築された、エージェントAIのためのAI TRiSMフレームワークを適応して拡張します。
調整失敗から調整失敗まで、エージェントAIのユニークな脅威と脆弱性を捉えるためにリスク分類法が提案されている。
論文 参考訳(メタデータ) (2025-06-04T16:26:11Z) - A Unified Framework for Human AI Collaboration in Security Operations Centers with Trusted Autonomy [10.85035493967822]
本稿では,セキュリティ・オペレーション・センター(SOC)におけるヒューマン・AI連携のための構造化された枠組みについて述べる。
我々は,手動から完全自律までの5段階のAI自律性に基づく,新しい自律型フレームワークを提案する。
これにより、監視、保護、脅威検出、警告トリアージ、インシデント応答を含む、コアSOC関数間の適応的で説明可能なAI統合が可能になる。
論文 参考訳(メタデータ) (2025-05-29T12:35:08Z) - Towards AI-Driven Human-Machine Co-Teaming for Adaptive and Agile Cyber Security Operation Centers [3.959615037146599]
セキュリティオペレーションセンター(SOC)は、大量のアラート、熟練したアナリストの不足、不十分な統合ツールによって、サイバーセキュリティの脅威を管理する上で、ますます難しい課題に直面している。
我々は、脅威インテリジェンス、警告トリアージ、インシデント応答を強化するために、大規模言語モデル(LLM)を活用するAI駆動のヒューマンマシン共同チームパラダイムを導入する。
我々は,LSMをベースとしたAIエージェントが,SOC操作に埋め込まれた暗黙の知識を人間アナリストから学ぶというビジョンを提示する。
論文 参考訳(メタデータ) (2025-05-09T19:38:26Z) - The Rise and Potential of Large Language Model Based Agents: A Survey [91.71061158000953]
大規模言語モデル(LLM)は、人工知能(AGI)の潜在的な火花と見なされる
まず、エージェントの概念を哲学的起源からAI開発まで追跡し、LLMがエージェントに適した基盤である理由を説明します。
単一エージェントシナリオ,マルチエージェントシナリオ,ヒューマンエージェント協調の3つの側面において,LLMベースのエージェントの広範な応用について検討する。
論文 参考訳(メタデータ) (2023-09-14T17:12:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。