論文の概要: Fully Automated End-to-End Adversary Emulation from MITRE ATT\&CK Based Cyber Threat Intelligence Using LLMs
- arxiv url: http://arxiv.org/abs/2607.14566v1
- Date: Thu, 16 Jul 2026 04:48:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.989628
- Title: Fully Automated End-to-End Adversary Emulation from MITRE ATT\&CK Based Cyber Threat Intelligence Using LLMs
- Title(参考訳): LLMを用いたMITRE ATT\&CKベースのサイバー脅威インテリジェンスからの全自動エンド・エンド・エンド・エンド・アドバイザ・エミュレーション
- Authors: Jueon Choi, Seojun Lee, Sanggwon Yun, Kwanghoon Choi, Gunjin Cha,
- Abstract要約: 本稿では,LSMを用いたMITRE ATT&CK対応CTIレポートから,逆エミュレーションのためのエンドツーエンドフレームワークを提案する。
事前に書かれたプレイブックを実行するか、部分的にプレイブック生成を自動化する以前の作業とは異なり、我々のフレームワークは単一のワークフローでプレイブックの生成、実行、障害復旧を統一する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper presents a fully automated end-to-end framework for adversary emulation from MITRE ATT&CK-aligned CTI reports using LLMs. Unlike prior work, which either executes prewritten playbooks or partially automates playbook generation, our framework unifies playbook generation, execution, and failure recovery in a single workflow. In particular, although AURORA, the most recent prior study, generates playbooks from CTI reports, it still requires partial manual intervention and does not revise playbooks based on execution failures. Our framework generates Caldera playbooks from CTI reports, executes them automatically, and revises failed Abilities through a failure-type-aware recovery mechanism. Evaluated on 11 CTI reports with Claude Sonnet 4.5, GPT-4o, Gemini 2.5 Pro, and Grok 4 Fast, the framework achieved its best results with Claude Sonnet 4.5: 27.3 Abilities per playbook, 84.22% execution success after revision, and CTI Precision, Recall, and F1 of 73.95%, 52.48%, and 60.50%, respectively. The failure recovery mechanism consistently improved execution success across all evaluated LLM models by 14.59%p to 17.23%p. On the 10 CTI reports selected from AURORA's dataset, this mechanism further increased the final execution success rate, surpassing that of AURORA, which represents the state-of-the-art adversary emulation system.
- Abstract(参考訳): 本稿では,LSMを用いたMITRE ATT&CKアラインCTIレポートから,完全に自動化されたエンド・ツー・エンドのエミュレーションフレームワークを提案する。
事前に書かれたプレイブックを実行するか、部分的にプレイブック生成を自動化する以前の作業とは異なり、我々のフレームワークは単一のワークフローでプレイブックの生成、実行、障害復旧を統一する。
特に、最新の先行研究であるAURORAは、CTIレポートからプレイブックを生成するが、一部手作業による介入が必要であり、実行障害に基づいたプレイブックの改訂は行わない。
我々のフレームワークはCTIレポートからCalderaのプレイブックを生成し、自動的に実行し、障害型認識回復機構を通じて障害能力を修正します。
Claude Sonnet 4.5、GPT-4o、Gemini 2.5 Pro、Grok 4 Fastの11のCTIレポートで評価され、Claude Sonnet 4.5: 27.3 Abilities per playbook、84.22%の修正後の実行成功、CTIの精度、リコール、F1の73.95%、52.48%、60.50%で最高の結果を得た。
故障復旧機構は、評価された全てのLLMモデルに対して14.59%pから17.23%pまで実行の成功を継続的に改善した。
AURORAのデータセットから選択された10のCTIレポートにおいて、このメカニズムは、最先端の敵エミュレーションシステムを表すAURORAよりも、最終的な実行成功率をさらに高めている。
関連論文リスト
- Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens [65.53494487819053]
クローのようなAIエージェント(OpenClawなど)は、認証情報、ファイル、ツール、外部サービスへの永続的なアクセスを伴う、常にオンのプロセスである。
我々はClawのようなエージェントをエージェントコンピュータシステムとして扱い、そのゲートウェイランタイムがOSのような仲介の役割を担っている。
我々は、4つの攻撃面にわたる406の敵タスクのベンチマークであるSafeClawArenaを開発した。
論文 参考訳(メタデータ) (2026-06-29T18:00:45Z) - How Reliable Are AI Attackers Against a Fixed Vulnerable Target? A 400-Run Empirical Study of LLM Penetration Testing Consistency [0.0]
大規模言語モデル(LLM)は、多段階のサイバー攻撃を自律的に行うことができるが、その攻撃行動の一貫性は調査されていない。
この研究は、Juice Shopをホストする同一のハニーポットに対して400ラン(4モデル、100台)の攻撃一貫性を実証した最初の大規模な実験的な測定結果を示す。
オーケストレータのワンショットの承認が0-1で再発効したコンテントの拒絶は、モデルでは発生しなかった。
論文 参考訳(メタデータ) (2026-05-28T15:39:43Z) - Position: AI Security Policy Should Target Systems, Not Models [2.741152471987327]
本稿では,複数の軽量LCMエージェントが共有メモリを介して協調する,オープンソースの逆テストフレームワークを提案する。
我々の結果は、フロンティアモデルの安全性回避とソフトウェア脆弱性発見の両方が、効果的にゼロコストで達成可能であることを実証している。
論文 参考訳(メタデータ) (2026-05-10T12:27:14Z) - Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw [87.97230960702274]
本稿では,OpenClawの安全性評価について紹介する。
エージェントの永続状態を3次元に統一するCIK分類法を導入する。
評価では、ライブOpenClawインスタンス上の12のアタックシナリオをカバーしています。
論文 参考訳(メタデータ) (2026-04-06T15:27:05Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - CTI-REALM: Benchmark to Evaluate Agent Performance on Security Detection Rule Generation Capabilities [0.0]
CTI-REALMは、AIエージェントがサイバー脅威インテリジェンス(CTI)を解釈し、検出ルールを開発する能力を評価するために設計されたベンチマークである。
この研究は、AIエージェントが検出エンジニアリングの労働集約的な側面をサポートする可能性を実証している。
論文 参考訳(メタデータ) (2026-03-13T18:48:40Z) - AI Security Beyond Core Domains: Resume Screening as a Case Study of Adversarial Vulnerabilities in Specialized LLM Applications [71.27518152526686]
大きな言語モデル(LLM)はテキストの理解と生成に優れており、コードレビューやコンテンツモデレーションといった自動タスクに最適である。
LLMは履歴書やコードなどの入力データに隠された「逆命令」で操作でき、意図したタスクから逸脱する。
本稿では,特定の攻撃タイプに対して80%以上の攻撃成功率を示すとともに,この脆弱性を再開スクリーニングで評価するためのベンチマークを提案する。
論文 参考訳(メタデータ) (2025-12-23T08:42:09Z) - Penetration Testing of Agentic AI: A Comparative Security Analysis Across Models and Frameworks [0.0]
Agentic AIは、従来のLLMセーフガードが対処できないセキュリティ脆弱性を導入する。
エージェントAIシステムの最初の体系的テストと比較評価を行う。
新たな「ハロシントコンプライアンス」戦略を含む6つの防衛行動パターンを同定する。
論文 参考訳(メタデータ) (2025-12-16T19:22:50Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。