論文の概要: From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World
- arxiv url: http://arxiv.org/abs/2605.10834v1
- Date: Mon, 11 May 2026 16:50:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:51.007886
- Title: From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World
- Title(参考訳): コントロールから野生へ:実世界のペンテスティング・エージェントの評価
- Authors: Pedro Conde, Henrique Branquinho, Valerio Mazzone, Bruno Mendes, André Baptista, Nuno Moniz,
- Abstract要約: 本稿では,タスク完了から検証済みの脆弱性発見へ評価をシフトする実用的評価プロトコルを提案する。
このプロトコルは、AIペンテスティングエージェントのより現実的で運用上の情報的な比較を可能にすることによって、最先端の技術を拡張している。
- 参考スコア(独自算出の注目度): 4.065564250241855
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI pentesting agents are increasingly credible as offensive security systems, but current benchmarks still provide limited guidance on which will perform best in real-world targets. Existing evaluation protocols assess and optimize for predefined goals such as capture-the-flag, remote code execution, exploit reproduction, or trajectory similarity, in simplified or narrow settings. These tools are valuable for measuring bounded capabilities, yet they do not adequately capture the complexity, open-ended exploration, and strategic decision-making required in realistic pentesting. In this paper, we present a practical evaluation protocol that shifts assessment from task completion to validated vulnerability discovery, allowing evaluation in sufficiently complex targets spanning multiple attack surfaces and vulnerability classes. The protocol combines structured ground-truth with LLM-based semantic matching to identify vulnerabilities, bipartite resolution to score findings under realistic ambiguity, continuous ground-truth maintenance, repeated and cumulative evaluation of stochastic agents, efficiency metrics, and reduced-suite selection for sustainable experimentation. This protocol extends the state of the art by enabling a more realistic, operationally informative comparison of AI pentesting agents. To enable reproducibility, we also release expert-annotated ground truth and code for the proposed evaluation protocol: https://github.com/jd0965199-oss/ethibench.
- Abstract(参考訳): AIペンテスティングエージェントは、攻撃的なセキュリティシステムとしてますます信頼性を高めている。
既存の評価プロトコルは、キャプチャー・ザ・フラッグ、リモートコードの実行、再生の活用、あるいは軌跡類似性といった事前定義された目標を、単純化されたあるいは狭い設定で評価し、最適化する。
これらのツールは有界能力を測定するのに有用だが、現実的なテストに必要な複雑さ、オープンエンド探索、戦略的意思決定を適切に捉えていない。
本稿では,複数の攻撃面と脆弱性クラスにまたがる十分に複雑な目標に対して,評価をタスク完了から検証済みの脆弱性発見にシフトさせる実用的評価プロトコルを提案する。
このプロトコルは、構造化された接地構造とLLMに基づくセマンティックマッチングを組み合わせることで、脆弱性の特定、現実的な曖昧さ下での知見の両部分解、継続的な接地構造維持、確率的エージェントの反復的および累積的評価、効率指標、持続的な実験のための縮小的選択を行う。
このプロトコルは、AIペンテスティングエージェントのより現実的で運用上有益な比較を可能にすることによって、最先端のプロトコルを拡張している。
再現性を実現するため、提案した評価プロトコルについて、専門家が注釈付けした真理とコードもリリースしている。
関連論文リスト
- Toward Scalable Automated Repository-Level Datasets for Software Vulnerability Detection [0.0]
本研究では,現実のリポジトリに現実的な脆弱性を注入する自動ベンチマークジェネレータを提案する。
再現可能な脆弱性証明エクスプロイトを合成し、レポレベルの脆弱性検出エージェントをトレーニングおよび評価するための、正確にラベル付けされたデータセットを可能にする。
論文 参考訳(メタデータ) (2026-03-18T17:38:35Z) - DREAM: Deep Research Evaluation with Agentic Metrics [21.555357444628044]
本稿では,DREAM(Deep Research Evaluation with Agentic Metrics)を提案する。
DREAM構造評価は、クエリ非依存のメトリクスとツール呼び出しエージェントが生成する適応的なメトリクスを組み合わせた評価プロトコルを用いて行われる。
制御された評価は、DREAMが既存のベンチマークよりも事実や時間的劣化にかなり敏感であることを示している。
論文 参考訳(メタデータ) (2026-02-21T19:14:31Z) - TRACE: Trajectory-Aware Comprehensive Evaluation for Deep Research Agents [51.30998248590416]
Trajectory-Aware Comprehensive Evaluation (TRACE) は、問題解決の軌道全体を評価するフレームワークである。
私たちのコントリビューションには、TRACEフレームワーク、その新しいメトリクス、および制御可能な複雑さを伴うDeepResearch-Benchが含まれています。
論文 参考訳(メタデータ) (2026-02-05T13:28:57Z) - BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search [72.87861928940929]
バウンダリ・アウェア・ポリシー・オプティマイゼーション(BAPO)は、信頼性の高い境界認識を精度を損なうことなく育成する新しいRLフレームワークである。
BAPOは2つの重要な要素を導入する: (i) グループベースの境界対応報酬(i) 推論が限界に達したときのみIDK応答を促進させる) 適応報酬変調器(ii) 早期探索中にこの報酬を戦略的に停止させ、モデルがIDKをショートカットとして利用するのを防ぐ。
論文 参考訳(メタデータ) (2026-01-16T07:06:58Z) - Robust and Label-Efficient Deep Waste Detection [29.019461511410515]
効率的な廃棄物のソートは持続可能なリサイクルには不可欠だが、この領域でのAI研究は商用システムに遅れを取っている。
本研究では,強力なベースラインを確立し,アンサンブルに基づく半教師付き学習フレームワークを導入することにより,AI駆動型廃棄物検出を推し進める。
論文 参考訳(メタデータ) (2025-08-26T08:34:04Z) - No Regrets: Investigating and Improving Regret Approximations for Curriculum Discovery [53.08822154199948]
非教師なし環境設計(UED)手法は、エージェントがイン・オブ・アウト・ディストリビューションタスクに対して堅牢になることを約束する適応的カリキュラムとして近年注目を集めている。
本研究は,既存のUEDメソッドがいかにトレーニング環境を選択するかを検討する。
本研究では,学習性の高いシナリオを直接訓練する手法を開発した。
論文 参考訳(メタデータ) (2024-08-27T14:31:54Z) - Bi-Level Offline Policy Optimization with Limited Exploration [1.8130068086063336]
我々は、固定された事前コンパイルされたデータセットに基づいて良いポリシーを学習しようとするオフライン強化学習(RL)について研究する。
ポリシー(上層)と値関数(下層)の階層的相互作用をモデル化する2レベル構造化ポリシー最適化アルゴリズムを提案する。
我々は、オフラインRLのための合成、ベンチマーク、実世界のデータセットを混合して評価し、最先端の手法と競合することを示す。
論文 参考訳(メタデータ) (2023-10-10T02:45:50Z) - When Demonstrations Meet Generative World Models: A Maximum Likelihood
Framework for Offline Inverse Reinforcement Learning [62.00672284480755]
本稿では, 専門家エージェントから, 一定の有限個の実演において観測された動作を過小評価する報酬と環境力学の構造を復元することを目的とする。
タスクを実行するための正確な専門知識モデルは、臨床的意思決定や自律運転のような安全に敏感な応用に応用できる。
論文 参考訳(メタデータ) (2023-02-15T04:14:20Z) - WSSOD: A New Pipeline for Weakly- and Semi-Supervised Object Detection [75.80075054706079]
弱機能および半教師付きオブジェクト検出フレームワーク(WSSOD)を提案する。
エージェント検出器は、まず関節データセット上でトレーニングされ、弱注釈画像上で擬似境界ボックスを予測するために使用される。
提案フレームワークはPASCAL-VOC と MSCOCO のベンチマークで顕著な性能を示し,完全教師付き環境で得られたものと同等の性能を達成している。
論文 参考訳(メタデータ) (2021-05-21T11:58:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。