論文の概要: SecProbe: Adaptive Evaluation of Coding Agents on Cybersecurity Vulnerabilities
- arxiv url: http://arxiv.org/abs/2609.33763v1
- Date: Sun, 27 Sep 2026 17:01:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-04 16:57:48.406202
- Title: SecProbe: Adaptive Evaluation of Coding Agents on Cybersecurity Vulnerabilities
- Title(参考訳): SecProbe: サイバーセキュリティ脆弱性に対するコーディングエージェントの適応的評価
- Abstract要約: SecProbeは、アイテム応答理論(IRT)と、脆弱性修復タスクのオンデマンド合成を組み合わせた適応評価のためのフレームワークである。
我々は、6つのプログラミング言語と151のCWE型にまたがる353のタスクを構築し、2つのエージェントハーネスを持つ9つのフロンティアモデルを評価する。
成功率は28.33%に達し、脆弱性の認識と修復のかなりのギャップを浮き彫りにした。
- 参考スコア(独自算出の注目度): 41.05996672274754
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Assessing cybersecurity vulnerability awareness in coding agents requires evaluations that reveal capability gaps and remain informative as models evolve. Static benchmarks offer fixed coverage and difficulty, while scarce vulnerable repositories and costly expert authoring limit their renewal at scale. We introduce SecProbe, a framework for adaptive evaluation that combines Item Response Theory (IRT) with on-demand synthesis of repository-scale vulnerability-repair tasks. From observed performance, \textsc{SecProbe} estimates agent ability and identifies where additional evidence is most informative, selecting existing tasks or synthesizing new ones accordingly. As one use case, we construct 353 tasks spanning six programming languages and 151 CWE types and evaluate nine frontier models with two agent harnesses. Success rates peak at 28.33\%, highlighting substantial gaps in vulnerability recognition and repair. Compared with random and one-shot baselines, \textsc{SecProbe} achieves comparable agent ability estimates while requiring agents to solve up to 29.5\% fewer tasks. These results support adaptive evaluation as an efficient and discriminative approach to assessing cybersecurity vulnerability awareness.
- Abstract(参考訳): コーディングエージェントにおけるサイバーセキュリティの脆弱性の認識を評価するには、能力ギャップを明らかにし、モデルが進化するにつれて情報的であり続ける評価が必要である。
静的ベンチマークは、固定されたカバレッジと難易度を提供するが、脆弱なリポジトリとコストのかかる専門家のオーサリングは、大規模な更新を制限している。
本稿では、アイテム応答理論(IRT)とリポジトリスケールの脆弱性修復タスクのオンデマンド合成を組み合わせた適応評価フレームワークSecProbeを紹介する。
観察されたパフォーマンスから、 \textsc{SecProbe} はエージェント能力を推定し、既存のタスクを選択したり、新しいタスクを合成したりすることで、追加のエビデンスが最も有益な場所を特定する。
1つのユースケースとして、6つのプログラミング言語と151のCWEタイプにまたがる353のタスクを構築し、2つのエージェントハーネスを持つ9つのフロンティアモデルを評価する。
成功率は28.33\%にピークし、脆弱性認識と修復のかなりのギャップを浮き彫りにした。
ランダムとワンショットのベースラインと比較すると、 \textsc{SecProbe} はエージェントの能力推定に匹敵し、エージェントは最大29.5\%のタスクを解決しなければならない。
これらの結果は、サイバーセキュリティの脆弱性認識を評価するための効率的かつ差別的なアプローチとして適応評価を支持する。
関連論文リスト
- Vulnerability Localization Benchmark: Measuring Agentic Security Analysis at Repository Scale [54.83971397981572]
言語モデルエージェントは、ソフトウェアリポジトリ全体を通してますます運用される。
サイバーセキュリティ評価は、関連するコードを見つけることよりも、脆弱性を検出、再生、または修復できるかどうかを測定する。
脆弱性のローカライゼーションについて検討する。弱点クラスと不慣れなリポジトリが与えられた場合、その弱点に関連する実装ファイルを特定する。
論文 参考訳(メタデータ) (2026-09-14T17:44:51Z) - DREA: Decoupled Reasoning and Exploration Agents for Repository-Level Vulnerability Detection [16.007199928732614]
DREAはリポジトリレベルの脆弱性検出のための仮説駆動型フレームワークである。
ゴール指向コンテキスト取得は、この設計における検出改善の主な原因である。
RepoPairBenchは,実世界のプロジェクトから検証済みのPython脆弱性修正ペアの,リポジトリを基盤としたベンチマークである。
論文 参考訳(メタデータ) (2026-07-15T04:49:05Z) - Decoupling Reconnaissance and Exploitation: Measuring the Capability Boundaries of LLM-Based Web Penetration Testing [8.293465530619246]
本稿では,2段階の非結合評価フレームワークを提案する。
我々は、マルチエージェント、モノリシック、グラフ駆動アーキテクチャをカバーする、オープンソースの5つの浸透試験エージェントを実証的に評価する。
論文 参考訳(メタデータ) (2026-06-24T02:51:58Z) - SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization [50.71047638695205]
RLM(Reasoning Language Model)は、プログラミングにおいてますます使われている言語モデルである。
しかし、最先端のRLMでさえ、生成されたコードに重大なセキュリティ脆弱性を頻繁に導入する。
我々は、構造化されたセキュリティ推論を内部化するためのRTMを教える微調整パイプラインであるSecPIを提案する。
論文 参考訳(メタデータ) (2026-04-04T04:29:11Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - Mind the Gap: Evaluating Model- and Agentic-Level Vulnerabilities in LLMs with Action Graphs [1.036334370262262]
本稿では,エージェント実行を粒度のアクションとコンポーネントグラフに分解する可観測性に基づく評価フレームワークであるAgenSeerを紹介する。
モデルレベルとエージェントレベルの脆弱性プロファイルの根本的な違いを示す。
エージェントレベルの評価は、従来の評価には見えないエージェント固有のリスクを明らかにする。
論文 参考訳(メタデータ) (2025-09-05T04:36:17Z) - VulnRepairEval: An Exploit-Based Evaluation Framework for Assessing Large Language Model Vulnerability Repair Capabilities [41.85494398578654]
VulnRepairEvalは、関数型Proof-of-Conceptエクスプロイトに固定された評価フレームワークである。
我々のフレームワークは、再現可能な微分評価を可能にする包括的でコンテナ化された評価パイプラインを提供する。
論文 参考訳(メタデータ) (2025-09-03T14:06:10Z) - Streamlining Security Vulnerability Triage with Large Language Models [0.786186571320448]
セキュリティバグの共通弱さ(CWE)の同定を自動化し,その重症度を評価する新しいアプローチであるCASEYを提案する。
ケーシーはCWE識別精度68%、重度識別精度73.6%、組み合わせ精度51.2%を達成した。
論文 参考訳(メタデータ) (2025-01-31T06:02:24Z) - ASSERT: Automated Safety Scenario Red Teaming for Evaluating the
Robustness of Large Language Models [65.79770974145983]
ASSERT、Automated Safety Scenario Red Teamingは、セマンティックなアグリゲーション、ターゲットブートストラップ、敵の知識注入という3つの方法で構成されている。
このプロンプトを4つの安全領域に分割し、ドメインがモデルの性能にどのように影響するかを詳細に分析する。
統計的に有意な性能差は, 意味的関連シナリオにおける絶対分類精度が最大11%, ゼロショット逆数設定では最大19%の絶対誤差率であることがわかった。
論文 参考訳(メタデータ) (2023-10-14T17:10:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。