論文の概要: PatchBench: Evaluating AI Agents for Vulnerability Patching
- arxiv url: http://arxiv.org/abs/2609.04075v1
- Date: Thu, 03 Sep 2026 16:44:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.15807
- Title: PatchBench: Evaluating AI Agents for Vulnerability Patching
- Title(参考訳): PatchBench: 脆弱性パッチのためのAIエージェントの評価
- Abstract要約: 我々は,現実的な脆弱性パッチタスクにおいてAIエージェントを評価するための新しいベンチマークを提案する。
PatchBenchは、クラッシュスタックの外に根本修正がある脆弱性を選択し、脆弱性移植とコード修正を使用して、過去の脆弱性を新しいリポジトリコンテキストに移行する。
AIxCCエージェントのトップ3を含む11の最先端エージェントを含む、オリジナルのPoCのみの検証は、エージェントのパッチ処理の解決率を平均1.83$times$で検証する。
- 参考スコア(独自算出の注目度): 9.083611812336539
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI agents have recently demonstrated strong performance in automated vulnerability patching. However, existing evaluations often validate a patch only by testing whether the provided Proof-of-Concept (PoC) input still triggers a crash. This leaves two key threats to validity: agents may reproduce memorized historical developer patches, or they may generate surface-level fixes that only suppress the reported crash. We study these concerns for C/C++ vulnerability patching. We introduce a patch similarity metric to detect memorized patches. On average, 25% of the agent patches exhibit substantial similarity to historical developer patches, indicating that patch memorization is a real threat to the validity of vulnerability patching evaluations. Meanwhile, agents also frequently exploit benchmark structures to pass patch validation by patching on the crash stack trace to suppress the crash, rather than localizing and fixing the root cause of the vulnerabilities. To handle these issues, we propose PatchBench, a new benchmark for evaluating AI agents on realistic vulnerability patching tasks. PatchBench selects vulnerabilities whose ground-truth fixes lie outside the crash stack and uses vulnerability transplant and code mutations to migrate historical vulnerabilities into new repository contexts, reducing the risks of surface-level fixes and patch memorization. We develop new patch validation methods that thoroughly evaluate both security and semantic correctness of agent patches. Across 11 state-of-the-art agents, including the top three AIxCC agents, the original PoC-only validation inflates the patching task solve rate of agents by 1.83$\times$ on average. Our results reveal key limitations of current patching agents and point to future research directions for more reliable vulnerability repair.
- Abstract(参考訳): AIエージェントは先頃、自動脆弱性パッチの強力なパフォーマンスを実証した。
しかし、既存の評価では、提供されたProof-of-Concept(PoC)入力が依然としてクラッシュを引き起こすかどうかをテストするだけでパッチを検証することがよくある。
エージェントは記憶された歴史的開発者パッチを再現するか、あるいは報告されたクラッシュを抑えるだけで表面レベルの修正を生成する可能性がある。
C/C++の脆弱性パッチに対するこれらの懸念について検討する。
記憶されたパッチを検出するパッチ類似度指標を導入する。
平均して、エージェントパッチの25%は、歴史的開発者パッチとかなりの類似性を示しており、パッチの暗記は、脆弱性パッチの評価の有効性に対する真の脅威であることを示している。
一方、エージェントは、脆弱性の根本原因のローカライズや修正ではなく、クラッシュスタックトレースにパッチを当ててクラッシュを抑制することで、パッチ検証をパスするベンチマーク構造を頻繁に活用する。
これらの問題に対処するため、現実的な脆弱性パッチタスクにおいてAIエージェントを評価するための新しいベンチマークであるPatchBenchを提案する。
PatchBenchは、クラッシュスタックの外に根本修正がある脆弱性を選択し、脆弱性移植とコード変異を使用して、過去の脆弱性を新しいリポジトリコンテキストに移行し、表面レベルの修正やパッチの暗記のリスクを低減する。
我々は,エージェントパッチのセキュリティと意味的正当性の両方を徹底的に評価する新しいパッチ検証手法を開発した。
AIxCCエージェントのトップ3を含む11の最先端エージェントのうち、オリジナルのPoCのみのバリデーションは、エージェントのパッチ処理解決率を平均1.83$\times$で膨らませている。
以上の結果から,現在のパッチエージェントの限界が明らかとなり,より信頼性の高い脆弱性修復に向けた今後の研究の方向性が示唆された。
関連論文リスト
- Vulnerability Localization Benchmark: Measuring Agentic Security Analysis at Repository Scale [54.83971397981572]
言語モデルエージェントは、ソフトウェアリポジトリ全体を通してますます運用される。
サイバーセキュリティ評価は、関連するコードを見つけることよりも、脆弱性を検出、再生、または修復できるかどうかを測定する。
脆弱性のローカライゼーションについて検討する。弱点クラスと不慣れなリポジトリが与えられた場合、その弱点に関連する実装ファイルを特定する。
論文 参考訳(メタデータ) (2026-09-14T17:44:51Z) - Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework [49.16055123488827]
大規模言語モデルを利用したコーディングエージェントは、バグレポートから直接コードパッチを生成することができる。
報告された問題を真に解決するかどうかを独立に検証するメカニズムは存在しない。
本稿では,RETRACE をトレーニング不要なポストジェネレーション検証フレームワークとして提案する。
論文 参考訳(メタデータ) (2026-08-09T22:59:13Z) - ContraFix: Agentic Vulnerability Repair via Differential Runtime Evidence and Skill Reuse [10.503895811137095]
大規模言語モデル(LLM)エージェントは、自動脆弱性修復にますます利用されている。
最近の実証的な結果は、これらのエージェントがいまだに現実世界の脆弱性と戦っていることを示している。
ContraFixは、再利用可能な修復スキルとランタイムエビデンスを結合するエージェントフレームワークである。
論文 参考訳(メタデータ) (2026-05-17T13:48:25Z) - Patch2Vuln: Agentic Reconstruction of Vulnerabilities from Linux Distribution Binary Patches [3.93181912653522]
本稿では,ローカルバイナリ由来の証拠に制限された言語モデルエージェントが,Linuxディストリビューション更新のセキュリティ意味を再構築できるかどうかを問う。
Patch2Vulnは、古い/新しいELFペアを抽出し、GhidraとGhidriffと拡散し、機能の変更をランク付けし、候補ドシエを構築し、オフラインエージェントに予備監査を生成する、ローカルで再利用可能なパイプラインである。
Patch2Vuln on 25 Ubuntu.deb package pairs: 20のセキュリティアップデートペアと5つの負のコントロール。
論文 参考訳(メタデータ) (2026-05-07T17:22:22Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - Patch Validation in Automated Vulnerability Repair [10.370450546423596]
基本的なテストで正しく検証されたパッチの40%以上は、textPoC+$テストで失敗する。
我々は,ルート原因分析,プログラム仕様の遵守,開発者の意図の把握という3つの重要な領域において,ツールの改善を提案する。
論文 参考訳(メタデータ) (2026-03-06T20:22:36Z) - Abstain and Validate: A Dual-LLM Policy for Reducing Noise in Agentic Program Repair [7.118712516789191]
Agentic Automated Program repair (APR)は、ますます複雑なリポジトリレベルのバグに対処している。
互換性のないパッチを開発者に示すと、かなりのノイズが発生する可能性がある。
このようなノイズを減らすために,バグ回避とパッチ検証という2つの補完的なポリシーを導入する。
論文 参考訳(メタデータ) (2025-10-03T17:53:28Z) - Red Teaming Program Repair Agents: When Correct Patches can Hide Vulnerabilities [22.02073334787359]
本稿では,APRエージェントが機能的正確かつ脆弱なパッチを生成するために,逆問題文を生成するSWExploitを提案する。
評価に基づいて、すべてのテストに合格するパッチが本質的に信頼性と安全性を持つという従来の仮定に初めて挑戦します。
論文 参考訳(メタデータ) (2025-09-30T07:38:57Z) - What Do They Fix? LLM-Aided Categorization of Security Patches for Critical Memory Bugs [46.325755802511026]
我々は、LLM(Large Language Model)と細調整された小言語モデルに基づく2つのアプローチを統合するデュアルメタルパイプラインであるLMを開発した。
LMは、OOBまたはUAFの脆弱性に対処する最近のLinuxカーネルのパッチ5,140のうち111つを、手作業による検証によって90の正の正が確認された。
論文 参考訳(メタデータ) (2025-09-26T18:06:36Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - Segment and Complete: Defending Object Detectors against Adversarial
Patch Attacks with Robust Patch Detection [142.24869736769432]
敵のパッチ攻撃は最先端の物体検出器に深刻な脅威をもたらす。
パッチ攻撃に対して物体検出器を防御するフレームワークであるSegment and Complete Defense (SAC)を提案する。
SACは、物理的パッチ攻撃の標的攻撃成功率を著しく低減できることを示す。
論文 参考訳(メタデータ) (2021-12-08T19:18:48Z) - (De)Randomized Smoothing for Certifiable Defense against Patch Attacks [136.79415677706612]
我々は、所定の画像とパッチ攻撃サイズを保証する、パッチ攻撃に対する認証可能な防御を導入する。
本手法はランダム化スムースなロバスト性スキームの幅広いクラスに関係している。
その結果,CIFAR-10およびImageNetに対するパッチ攻撃に対する認証済みの防御技術が確立した。
論文 参考訳(メタデータ) (2020-02-25T08:39:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。