論文の概要: VEX-Bench: Benchmarking LLM Agents for Assessing Exploitability of Software Supply Chain Vulnerabilities
- arxiv url: http://arxiv.org/abs/2609.08040v1
- Date: Mon, 07 Sep 2026 22:52:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.531802
- Title: VEX-Bench: Benchmarking LLM Agents for Assessing Exploitability of Software Supply Chain Vulnerabilities
- Title(参考訳): VEX-Bench: ソフトウェアサプライチェーン脆弱性の爆発性を評価するためのLLMエージェントのベンチマーク
- Authors: Jiahao Shi, Edward Tsien, Yifeng Di, Hongjiao Zhang, Yuan Tang, Ronit Dey, Ilona Shishov, Gal Netanel, Zvi Grinberg, Vladimir Belousov, Bat-Zion Rotman, Ilan Pinto, Tianyi Zhang,
- Abstract要約: ソフトウェアサプライチェーン脆弱性の悪用性を評価できるLSMエージェントの能力を評価するための最初のベンチマークを紹介する。
VEX-Benchには、GitHubから発掘され、セキュリティの専門家によってラベル付けされた75の現実世界のケースが含まれており、Python、Java、Goをカバーしている。
GPT-5.5とClaude Opus 4.6はバイナリ脆弱性統計分類で約80%のF1に達したが、きめ細かい正当性分類で70%のマクロF1を超えたのはGPT-5.5のみである。
- 参考スコア(独自算出の注目度): 8.261542578922597
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The software supply chain has become an increasingly exposed attack surface because of its reliance on intricate yet fragile dependencies. Existing defenses such as GitHub Dependabot often raise many false alerts because their coarse-grained matching cannot determine whether a vulnerable dependency is actually exploitable. Security analysts typically spend substantial time assessing vulnerability exploitability case by case. Recent LLM agents have emerged as promising candidates for this task given their advanced capabilities in coding and cybersecurity, yet no existing benchmark evaluates them on it. Prior benchmarks target zero-day settings, where agents detect and exploit previously unknown vulnerabilities. In contrast, software supply chain security focuses on how known vulnerabilities in upstream dependencies affect downstream projects. This requires agents to reason across repositories and determine whether an upstream vulnerability is exploitable in the downstream project. To address this gap, we introduce VEX-Bench, the first benchmark for evaluating LLM agents' ability to assess the exploitability of software supply chain vulnerabilities. It contains 75 real-world cases mined from GitHub and labeled by security experts, covering Python, Java, and Go. We evaluate nine models across three agent harnesses. While GPT-5.5 and Claude Opus 4.6 reach approximately 80% F1 on binary vulnerability-status classification, only GPT-5.5 surpasses 70% macro-F1 on fine-grained justification classification. This gap highlights the challenge of moving beyond binary exploitability assessment to identifying fine-grained exploitability reasons. Code and data: https://github.com/steven1518/vex-bench
- Abstract(参考訳): ソフトウェアサプライチェーンは、複雑だが脆弱な依存関係に依存しているため、攻撃面がますます露出している。
GitHub Dependabotのような既存のディフェンスは、脆弱性のある依存関係が実際に悪用されているかどうかを判断できないため、多くの誤った警告を発生させることが多い。
セキュリティアナリストは通常、ケースごとに脆弱性エクスプロイラビリティのケースを評価するためにかなりの時間を費やします。
最近のLSMエージェントは、コーディングとサイバーセキュリティの高度な能力から、このタスクの有望な候補として浮上しているが、その上で評価するベンチマークは存在しない。
以前のベンチマークではゼロデイ設定をターゲットとしており、エージェントは以前未知の脆弱性を検出し、悪用する。
対照的に、ソフトウェアサプライチェーンのセキュリティは、上流依存の既知の脆弱性が下流プロジェクトに与える影響に焦点を当てている。
これにより、エージェントはリポジトリを横断して、上流の脆弱性が下流のプロジェクトで悪用されるかどうかを判断する必要がある。
このギャップに対処するために、ソフトウェアサプライチェーンの脆弱性を悪用するLSMエージェントの能力を評価する最初のベンチマークであるVEX-Benchを紹介する。
GitHubから発掘され、セキュリティの専門家によってラベル付けされた75の現実世界のケースが含まれており、Python、Java、Goをカバーしている。
我々は3つのエージェントハーネスにまたがる9つのモデルを評価する。
GPT-5.5とClaude Opus 4.6はバイナリ脆弱性統計分類で約80%のF1に達したが、きめ細かい正当性分類で70%のマクロF1を超えたのはGPT-5.5のみである。
このギャップは、バイナリエクスプロイラビリティアセスメントを超えて、きめ細かいエクスプロイラビリティーの理由を特定するという課題を浮き彫りにする。
コードとデータ:https://github.com/steven1518/vex-bench
関連論文リスト
- Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens [65.53494487819053]
クローのようなAIエージェント(OpenClawなど)は、認証情報、ファイル、ツール、外部サービスへの永続的なアクセスを伴う、常にオンのプロセスである。
我々はClawのようなエージェントをエージェントコンピュータシステムとして扱い、そのゲートウェイランタイムがOSのような仲介の役割を担っている。
我々は、4つの攻撃面にわたる406の敵タスクのベンチマークであるSafeClawArenaを開発した。
論文 参考訳(メタデータ) (2026-06-29T18:00:45Z) - Code-Augur: Agentic Vulnerability Detection via Specification Inference [8.217845898392293]
自律的なLLMエージェントによる監査が、ソフトウェアの重大な脆弱性を明らかにしている。
本稿では,エージェントの暗黙的な仮定をセキュリティ仕様として明示的に公開する,セキュリティ仕様優先のパラダイムを提案する。
エージェント脆弱性検出のための新しいハーネスであるCode-Augurにおける我々のアプローチを実現する。
論文 参考訳(メタデータ) (2026-06-17T02:32:45Z) - ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks? [92.21756459993695]
低レベルのプログラム推論を必要とするため、爆発は難しい作業です。
その重要性と診断価値にもかかわらず、搾取は未評価のままである。
ExploitGymは、AIエージェントのエクスプロイト能力に関する大規模で多様な、現実的なベンチマークである。
論文 参考訳(メタデータ) (2026-05-11T18:00:14Z) - Credential Leakage in LLM Agent Skills: A Large-Scale Empirical Study [51.717224133855886]
サードパーティのスキルはLLMエージェントを強力な能力で拡張するが、特権のある環境では機密情報を扱うことが多い。
静的解析,サンドボックステスト,手動検査を用いて17,022のスキル(SkillsMPで170,226からサンプリング)を分析した。
我々は,1,708の課題で520の脆弱なスキルを識別し,10の漏洩パターン(事故4件,反対6件)の分類を導出する。
論文 参考訳(メタデータ) (2026-04-03T14:50:16Z) - RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories [58.32028251925354]
LLM(Large Language Models)は、コード生成において顕著な能力を示しているが、セキュアなコードを生成する能力は依然として重要で、未調査の領域である。
我々はRealSec-benchを紹介します。RealSec-benchは、現実世界の高リスクなJavaリポジトリから慎重に構築されたセキュアなコード生成のための新しいベンチマークです。
論文 参考訳(メタデータ) (2026-01-30T08:29:01Z) - What Do They Fix? LLM-Aided Categorization of Security Patches for Critical Memory Bugs [46.325755802511026]
我々は、LLM(Large Language Model)と細調整された小言語モデルに基づく2つのアプローチを統合するデュアルメタルパイプラインであるLMを開発した。
LMは、OOBまたはUAFの脆弱性に対処する最近のLinuxカーネルのパッチ5,140のうち111つを、手作業による検証によって90の正の正が確認された。
論文 参考訳(メタデータ) (2025-09-26T18:06:36Z) - PoCGen: Generating Proof-of-Concept Exploits for Vulnerabilities in Npm Packages [13.877936187495555]
我々は,npmパッケージの脆弱性に対するPoCエクスプロイトを自律的に生成し,検証する新しいアプローチであるPoCGenを提案する。
PoCGenはSecBench$.jsデータセットの脆弱性の77%のエクスプロイトを生成することに成功した。
論文 参考訳(メタデータ) (2025-06-05T12:37:33Z) - CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale [45.97598662617568]
我々は188のソフトウェアプロジェクトにわたる1,507の実際の脆弱性を特徴とする大規模ベンチマークであるCyberGymを紹介した。
我々はCyberGymが35のゼロデイ脆弱性と17の歴史的不完全なパッチを発見できることを示した。
これらの結果は、CyberGymは、サイバーセキュリティにおけるAIの進歩を測定するための堅牢なベンチマークであるだけでなく、直接的な現実世界のセキュリティ効果を生み出すためのプラットフォームでもあることを強調している。
論文 参考訳(メタデータ) (2025-06-03T07:35:14Z) - Eradicating the Unseen: Detecting, Exploiting, and Remediating a Path Traversal Vulnerability across GitHub [1.2124551005857036]
オープンソースソフトウェアの脆弱性は、現代のデジタルエコシステムにカスケード効果をもたらす可能性がある。
1,756の脆弱性のあるオープンソースプロジェクトを特定しました。
当社は、この脆弱性をメンテナに責任を持って開示し、報告された脆弱性の14%が再報告されている。
論文 参考訳(メタデータ) (2025-05-26T16:29:21Z) - Fixing Security Vulnerabilities with AI in OSS-Fuzz [9.730566646484304]
OSS-Fuzzは、オープンソースシステムの継続的な検証のための最も重要で広く使用されているインフラである。
セキュリティ脆弱性を修正するために、よく知られたAutoCodeRoverエージェントをカスタマイズします。
OSS-Fuzz脆弱性データを用いた経験から,LSMエージェントの自律性はセキュリティパッチの成功に有用であることがわかった。
論文 参考訳(メタデータ) (2024-11-03T16:20:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。