論文の概要: VulnGym: Benchmarking Coding Agents for Repository-Level Vulnerability Detection
- arxiv url: http://arxiv.org/abs/2608.02001v1
- Date: Mon, 03 Aug 2026 10:03:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.480741
- Title: VulnGym: Benchmarking Coding Agents for Repository-Level Vulnerability Detection
- Title(参考訳): VulnGym:リポジトリレベル脆弱性検出のためのベンチマークコーディングエージェント
- Abstract要約: VulnGymは、コーディングエージェントによる脆弱性検出を評価するためのリポジトリレベルのベンチマークである。
その中には、23リポジトリにまたがる184のアドバイザリと408の脆弱性エントリが含まれており、各エントリには、ラインレベルのエントリポイント、クリティカルオペレーション、脆弱性トレースが注釈付けされている。
VulnGymは、この微粒な基底真理を用いて、コードローカライゼーションとエビデンス構築の限界を共同で評価する、エンドツーエンド検出タスクと3つのオラクルベースのサブタスクを定義している。
- 参考スコア(独自算出の注目度): 21.17887601940535
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in LLM-based vulnerability detection have shown promising results, while coding agents further extend this capability from isolated code snippets to complete repositories. This shift requires agents to autonomously explore repositories and locate vulnerability-relevant code, instead of performing detection on preselected functions. However, existing benchmarks primarily focus on vulnerability classification over preselected code snippets, limiting their ability to evaluate coding agents in repository-level vulnerability detection. Moreover, without fine-grained vulnerability trace annotations, the capability limitations underlying the detection process remain difficult to explore. To address these limitations, we present \textbf{VulnGym}, a real-world repository-level benchmark for evaluating vulnerability detection by coding agents. VulnGym aligns reviewed GitHub advisories with their corresponding vulnerable version repositories. It contains 184 advisories and 408 vulnerability entries across 23 repositories, with each entry annotated with line-level entry points, critical operations, and vulnerability traces. Using this fine-grained ground truth, VulnGym defines an end-to-end detection task and three oracle-based subtasks to jointly evaluate vulnerability detection and diagnose limitations in code localization and evidence construction. Our evaluation indicates that current coding agents remain limited in both end-to-end repository-level vulnerability detection and the construction of accurate supporting traces.
- Abstract(参考訳): LLMベースの脆弱性検出の最近の進歩は有望な結果を示している一方で、コーディングエージェントは、この機能を独立したコードスニペットから完全なリポジトリへと拡張している。
このシフトでは、エージェントが事前に選択された関数を検出する代わりに、リポジトリを自律的に探索し、脆弱性に関連するコードを見つける必要がある。
しかし、既存のベンチマークは主に選択済みのコードスニペットよりも脆弱性の分類に重点を置いており、リポジトリレベルの脆弱性検出においてコーディングエージェントを評価する能力を制限している。
さらに、詳細な脆弱性トレースアノテーションがなければ、検出プロセスの根底にある機能制限を探索することは困難である。
これらの制限に対処するため、コードエージェントによる脆弱性検出を評価するために、現実のリポジトリレベルのベンチマークである \textbf{VulnGym} を提示する。
VulnGymは、GitHubのアドバイザリを、対応する脆弱なバージョンリポジトリと整合させる。
その中には、23リポジトリにまたがる184のアドバイザリと408の脆弱性エントリが含まれており、各エントリには、ラインレベルのエントリポイント、クリティカルオペレーション、脆弱性トレースが注釈付けされている。
VulnGymは、この微粒な基底真理を用いて、コードローカライゼーションとエビデンス構築の限界を共同で評価する、エンドツーエンド検出タスクと3つのオラクルベースのサブタスクを定義している。
評価の結果,現在の符号化エージェントは,エンド・ツー・エンドのリポジトリレベルの脆弱性検出と,正確なサポートトレースの構築に限られていることがわかった。
関連論文リスト
- Vulnerability Localization Benchmark: Measuring Agentic Security Analysis at Repository Scale [54.83971397981572]
言語モデルエージェントは、ソフトウェアリポジトリ全体を通してますます運用される。
サイバーセキュリティ評価は、関連するコードを見つけることよりも、脆弱性を検出、再生、または修復できるかどうかを測定する。
脆弱性のローカライゼーションについて検討する。弱点クラスと不慣れなリポジトリが与えられた場合、その弱点に関連する実装ファイルを特定する。
論文 参考訳(メタデータ) (2026-09-14T17:44:51Z) - RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations [51.43574078961796]
本稿では,SWE-Bench Verified上に構築された2段階評価スイートRepoMirageを紹介する。
RepoMirage-Perturbは、リポジトリレベルの摂動を保存する3つのタイプのセマンティクスを適用している。
RepoAnchorは、下流の問題解決からリポジトリの探索を分離する構造第一のプロトタイプワークフローである。
論文 参考訳(メタデータ) (2026-05-25T06:26:43Z) - SecureForge: Finding and Preventing Vulnerabilities in LLM-Generated Code via Prompt Optimization [61.91729298584227]
SecureForgeは、フロンティアモデルのセキュリティリスクを監査し、監査インフォームされたセキュアなシステムプロンプトを生成する自動化パイプラインである。
SecureForgeは、まず静的に検出可能な脆弱性を生成する良性プロンプトを特定し、その後、さまざまなシナリオの大規模な合成プロンプトコーパスに増幅する。
フロンティアモデルでは、SecureForgeは、ユニットテストの成功と出力セキュリティの両方において統計的に有意な改善をもたらし、出力脆弱性は最大48%削減された。
論文 参考訳(メタデータ) (2026-05-08T18:40:47Z) - VulnAgent-X: A Layered Agentic Framework for Repository-Level Vulnerability Detection [9.51089779418208]
VulnAgentXは階層化されたエージェントフレームワークであり、軽量なリスクスクリーニング、コンテキスト拡張、特殊分析エージェント、選択的動的検証、エビデンスを統合パイプラインに融合する。
段階的、エビデンス駆動の監査プロセスは、デ・テクションの品質を改善し、偽陽性を低減し、リポジトリレベルのソフトウェアセキュリティ分析のための解釈可能な再侮辱を生成する。
論文 参考訳(メタデータ) (2026-03-11T04:57:17Z) - RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories [58.32028251925354]
LLM(Large Language Models)は、コード生成において顕著な能力を示しているが、セキュアなコードを生成する能力は依然として重要で、未調査の領域である。
我々はRealSec-benchを紹介します。RealSec-benchは、現実世界の高リスクなJavaリポジトリから慎重に構築されたセキュアなコード生成のための新しいベンチマークです。
論文 参考訳(メタデータ) (2026-01-30T08:29:01Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - Weakly Supervised Vulnerability Localization via Multiple Instance Learning [46.980136742826836]
WeAkly によるマルチプルインスタンス学習による脆弱性ローカライゼーションのための WAVES という新しい手法を提案する。
WAVESは、ある関数が脆弱かどうか(すなわち脆弱性検出)を判定し、脆弱なステートメントをピンポイントする機能を持っている。
提案手法は,文レベルの脆弱性ローカライゼーションにおいて,脆弱性検出と最先端のパフォーマンスにおいて同等のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-09-14T15:11:39Z) - A.S.E: A Repository-Level Benchmark for Evaluating Security in AI-Generated Code [49.009041488527544]
A.S.Eは、AI生成コードのセキュリティを評価するためのリポジトリレベルの評価ベンチマークである。
現在の大規模言語モデル(LLM)は、セキュアなコーディングに苦戦している。
大きな推論予算は、必ずしもより良いコード生成につながるとは限らない。
論文 参考訳(メタデータ) (2025-08-25T15:11:11Z) - CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale [45.97598662617568]
我々は188のソフトウェアプロジェクトにわたる1,507の実際の脆弱性を特徴とする大規模ベンチマークであるCyberGymを紹介した。
我々はCyberGymが35のゼロデイ脆弱性と17の歴史的不完全なパッチを発見できることを示した。
これらの結果は、CyberGymは、サイバーセキュリティにおけるAIの進歩を測定するための堅牢なベンチマークであるだけでなく、直接的な現実世界のセキュリティ効果を生み出すためのプラットフォームでもあることを強調している。
論文 参考訳(メタデータ) (2025-06-03T07:35:14Z) - Benchmarking LLMs and LLM-based Agents in Practical Vulnerability Detection for Code Repositories [8.583591493627276]
JitVulは、各関数をその脆弱性導入とコミットの修正にリンクする脆弱性検出ベンチマークである。
思考・行動・観察と相互言語的文脈を活用するReAct Agentsは,良性のあるコードと区別する上で,LLMよりも優れた性能を示すことを示す。
論文 参考訳(メタデータ) (2025-03-05T15:22:24Z) - VulEval: Towards Repository-Level Evaluation of Software Vulnerability Detection [14.312197590230994]
textbfVulEvalという名前のリポジトリレベルの評価システムは、プロセス間およびプロセス内脆弱性の検出性能を同時に評価することを目的としている。
VulEvalは大規模データセットで構成され、合計で4,196のCVEエントリ、232,239の関数、および対応する4,699のリポジトリレベルのソースコードがC/C++プログラミング言語に含まれる。
論文 参考訳(メタデータ) (2024-04-24T02:16:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。