論文の概要: Autonomous Active Directory Exploitation via Multi-Model Harness Orchestration: A Benchmark Study with NeuroSploit on GOAD
- arxiv url: http://arxiv.org/abs/2610.04243v1
- Date: Sat, 03 Oct 2026 03:05:14 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:55:52.034018
- Title: Autonomous Active Directory Exploitation via Multi-Model Harness Orchestration: A Benchmark Study with NeuroSploit on GOAD
- Title(参考訳): マルチモデルハーネスオーケストレーションによる自律的アクティブディレクトリ爆発: GOADにおけるNeuroSploitを用いたベンチマーク研究
- Abstract要約: Active Directory (AD) は、エンタープライズ環境におけるアイデンティティとアクセス管理のインフラとして主要な存在である。
近年の研究では、大規模言語モデル(LLM)が、ADに対する仮定漂流試験を自律的に実施できることが示されている。
我々は,オープンソースのRustベースの自律型ペンテストハーネスであるNeuroSploit v4.2.0のベンチマーク評価を行う。
- 参考スコア(独自算出の注目度): 0.0
- License:
- Abstract: Active Directory (AD) remains the predominant identity and access management infrastructure in enterprise environments, and its compromise represents the highest-impact outcome in internal penetration tests. Recent work has shown that large language models (LLMs) can autonomously conduct assumed-breach penetration testing against AD, but these studies employ standalone agents lacking structured guardrails, deterministic validation, and multi-stage chain orchestration. We present a benchmark evaluation of NeuroSploit v4.2.0, an open-source Rust-based autonomous pentest harness, against the Game of Active Directory (GOAD), a deliberately vulnerable multi-forest AD lab maintained by Orange Cyberdefense comprising five virtual machines, two forests, and three domains. The harness orchestrates 22 AD-specific agents and 7 multi-stage attack-chain playbooks covering the full AD kill chain: enumeration, Kerberoasting, AS-REP roasting, NTLM relay and coercion, Kerberos delegation abuse, AD CS exploitation (ESC1-ESC8), MSSQL linked-server pivoting, DCSync, cross-forest trust abuse, and persistence detection. We benchmark nine frontier LLMs (Claude Opus 4.6/4.7/4.8, GPT-6 Astra, GPT-5.6 Sol, Grok 4.6, Qwen 3.8, GLM 5.3, Kimi k3) within the harness, comparing against direct invocation across 14 technique categories and 7 chains. The harness achieves 96-100% technique coverage with 90-97% precision, while direct invocation covers only 21-54% and produces 3.2x more false positives. Time to full three-domain compromise with Opus 4.8 was 134 minutes with guardrail activations preventing lockout-triggering sprays, unauthorized DCSync dumps, and out-of-scope reconnaissance. Results demonstrate that structured harness orchestration with domain-specialized agents, POMDP belief tracking, and cross-model voting substantially outperforms unstructured LLM usage for AD penetration testing.
- Abstract(参考訳): Active Directory(AD)は企業環境におけるアイデンティティとアクセス管理のインフラであり、その妥協は内部侵入テストにおいて最も影響の大きい結果である。
近年の研究では,大規模言語モデル (LLM) がADに対して自律的に潜入試験を行うことが示されているが,これらの研究は,構造的ガードレール,決定論的検証,多段階連鎖オーケストレーションを欠いたスタンドアロンエージェントを用いている。
我々は,5つの仮想マシン,2つの森林,3つのドメインからなるOrange Cyberdefenseが管理する,故意に脆弱な多森林ADラボであるGame of Active Directory(GOAD)に対して,オープンソースのRustベースの自律型ペンテストハーネスであるNeuroSploit v4.2.0のベンチマーク評価を行う。
ハーネスは、列挙、Kerberoasting、AS-REPロースト、NTLMリレーと強制、Kerberosデリゲーション不正、AD CSエクスプロイト(ESC1-ESC8)、MSSQLリンクサーバピボット、DCSync、クロスフォレスト信頼不正、永続化検出を含む、ADキルチェーンの全をカバーする22のAD特異的エージェントと7つのマルチステージアタックチェーンのプレイブックをオーケストレーションする。
我々は、ハーネス内の9つのフロンティアLCM(Claude Opus 4.6/4.7/4.8, GPT-6 Astra, GPT-5.6 Sol, Grok 4.6, Qwen 3.8, GLM 5.3, Kimi k3)をベンチマークし、14のテクニックカテゴリと7つのチェーンの直接的な呼び出しと比較した。
このハーネスは96-100%のテクニックカバレッジを90-97%の精度で達成し、直接呼び出しは21-54%に過ぎず、3.2倍の偽陽性を発生させる。
オプス4.8との3領域妥協までの時間は134分であり、ガードレールのアクティベーションによりロックアウトトリガースプレー、認可されていないDCSyncダンプ、スコープ外偵察が禁止された。
その結果, ドメイン固有化エージェントを用いた構造化ハーネスオーケストレーション, POMDP 信頼度追跡, クロスモデル投票は, AD 浸透試験における非構造化 LLM の使用率を大幅に上回ることを示した。
関連論文リスト
- EvoRiskBench: An Evolving Benchmark for Runtime Security Risks in Workspace Agents [14.26092486614381]
EvoRiskBenchはEP-Path-EFフレームワークを中心に編成された、進化中のベンチマークである。
最初のリスクエントリポイントと,エージェントを介するリスクパスを通じて,ワンホップの技術的効果を関連付ける。
3つのモデルにまたがる9つのモデルハーネス構成を評価した。
論文 参考訳(メタデータ) (2026-10-02T11:22:36Z) - SENTINEL-RL: Offloading Topological Reasoning from LLM Agents in the Security Operations Center [0.0]
Sentinel-RLは、意味論的推論から位相論的推論を分離するエージェントSOCアーキテクチャである。
本稿では,LANL Comprehensive, Multi-Source Cyber-Security Events データセット, インディアナ大学クォーツHPCクラスタ上でシステムをインスタンス化する。
論文 参考訳(メタデータ) (2026-09-03T17:49:12Z) - A Layered Security Framework Against Prompt Injection in RAG-Based Chatbots [1.948261185683419]
推論パイプライン全体を通して直接および間接的なインジェクションをインターセプトする3層フレームワークを提案する。
GPT-4o、Llama 3、Mistral 7Bの5,080サンプルの評価は、このフレームワークが攻撃成功率(ASR)を71.4%から11.3%に下げていることを示している。
論文 参考訳(メタデータ) (2026-06-17T23:59:57Z) - ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning [49.05361955143476]
ClinSeekAgentは動的マルチモーダルエビデンスのための自動エージェントフレームワークである。
ClinSeekAgentは、臨床クエリと生のデータソースへのアクセスのみを前提として、医療知識ベースへの問い合わせ、生のEHRのナビゲート、医療画像ツールの呼び出しによって証拠を集めている。
論文 参考訳(メタデータ) (2026-05-19T17:58:37Z) - Orchard: An Open-Source Agentic Modeling Framework [124.68499958175111]
スケーラブルなエージェントモデリングのためのオープンソースのフレームワークOrchardを紹介します。
Orchard Envは、サンドボックスライフサイクル管理のための再利用可能なプリミティブを提供する軽量環境サービスである。
Orchard Envの上に、3つのエージェントモデリングレシピを構築します。
論文 参考訳(メタデータ) (2026-05-14T16:35:12Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - LanG -- A Governance-Aware Agentic AI Platform for Unified Security Operations [2.1142550386295853]
本稿では,LLM支援ネットワークガバナンス(LanG)について述べる。
プラットフォームはマルチテナントアイソレーション、ロールベースのアクセス、完全にローカルなデプロイメントをサポートする。
精密な異常検出と脅威検出は、侵入検出ベンチマークでそれぞれ99.0%と91.0%の重み付きF1スコアを達成する。
論文 参考訳(メタデータ) (2026-04-07T05:22:25Z) - Governing Dynamic Capabilities: Cryptographic Binding and Reproducibility Verification for AI Agent Tool Use [0.0]
既存のセキュリティレイヤでは、AIエージェントに何ができるか、それが主張するものを実行したのか、マルチエージェントインタラクションで何が起きたのかを検証できない。
既存のフレームワークはこれら2つを詳述し、サイレントな能力のエスカレーションを可能にし、検証済みの証明なしに相互作用を残す。
我々は3つのエージェントガバナンス要件を導出する:能力の完全性(G1)、行動の妥当性(G2)、相互作用監査性(G3)。
基本(Ed25519, SHA-256; 97 us verify)と拡張(BBS+選択開示、Groth16 DV-SNARK; 13.8 ms)の2つの暗号に依存しないインスタンス化で検証する。
論文 参考訳(メタデータ) (2026-03-15T11:46:57Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。