論文の概要: Metrics Failure in LLM-Based Code Vulnerability Repair: An Empirical Study and a Change-Aware Screen
- arxiv url: http://arxiv.org/abs/2609.26749v1
- Date: Tue, 22 Sep 2026 17:32:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.771099
- Title: Metrics Failure in LLM-Based Code Vulnerability Repair: An Empirical Study and a Change-Aware Screen
- Title(参考訳): LLMによるコード脆弱性修復におけるメトリクス障害 : 実証的研究と変更対応画面
- Abstract要約: コンパイル速度は単一機能脆弱性修復のための科学的に信頼性の低い指標であることを示す。
本研究は, LLMによる脆弱性修復の適応的, 実行的評価について論じる。
- 参考スコア(独自算出の注目度): 1.1666234644810893
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly applied to the automated repair of C/C++ security vulnerabilities, and compile rate is a commonly reported proxy for progress: whether the generated patch compiles. We argue that compile rate is a scientifically unreliable metric for single-function vulnerability repair, and we support this with five controlled experiments over 203 vulnerable functions from Big-Vul, three open-source code LLMs (350M to 6.7B parameters), and three prompting strategies. Compile rate (i) barely responds to an intervention that substantially improves the generated code; (ii) is dominated by evaluation-harness and dataset artifacts rather than model quality, with about 64% of compile failures not attributable to the model, a share that is nearly invariant across models; (iii) shifts by 1.8 to 2.7 times on identical patches under a single compiler-standard flag, with zero regressions; (iv) ranks the three models in the opposite order to reference-similarity metrics; and (v) rewards non-repairs when used as an optimization target, since a compiler-feedback loop raises compile rate while similarity to the human fix falls, with manual inspection finding deletion- and placeholder-style non-repairs among the newly compiling outputs. The natural fallback, whole-function CodeBLEU, also fails: an unchanged copy of the vulnerable input outscores every model. We also examine diff_F1, a change-aware screen that scores only the edited region. It gives exactly zero credit to a no-op and near-zero credit to some, though not all, of the deletion-based gaming patches we observed, while still crediting genuine partial edits, so it may serve as a cheap screen before deeper, execution-based analysis. It is not a repair-quality metric, and we report where it falls short. Our findings argue for change-aware, execution-grounded evaluation of LLM-based vulnerability repair.
- Abstract(参考訳): 大規模言語モデル(LLM)は、C/C++のセキュリティ脆弱性の自動修正にますます適用され、コンパイル率は、一般的に報告される進歩のプロキシである。
コンパイルレートは、単一機能脆弱性修復のための科学的に信頼性の低い指標であり、Big-Vulから203個の脆弱性関数に対して5つの制御された実験、オープンソースの3つのLSM(350Mから6.7Bのパラメータ)、そして3つのプロンプト戦略でこれをサポートする。
補修率
i) 生成されたコードを大幅に改善する介入にほとんど反応しない。
(ii) モデルの品質よりも評価のハーネスとデータセットのアーティファクトに支配されており、コンパイル失敗の約64%はモデルに起因するものではない。
(iii) 1つのコンパイラ標準フラグの下で同じパッチで1.8倍から2.7倍のリグレッションがゼロになる。
(四)3つのモデルを基準類似度指標と反対の順序でランク付けし、
(v) コンパイラフィードバックループがコンパイル率を高め、人間の修正と類似性が低下し、新たにコンパイルされた出力のうち、削除やプレースホルダースタイルの非リペアが手動で検出されるため、最適化対象として使用される場合、非リペアを報奨する。
天然のフォールバックである全関数のCodeBLEUもフェールする。
また、編集領域のみをスコアする変更対応画面であるdiff_F1についても検討する。
完全にゼロのクレジットとほぼゼロのクレジットを、私たちが見た削除ベースのゲームパッチのすべてではないが、真の部分的な編集を信用している者には、完全にゼロのクレジットを与えるので、より深く実行ベースの分析を行う前に、安価なスクリーンとして機能するかもしれない。
修理品質の指標ではないので,不足点を報告します。
本研究は, LLMによる脆弱性修復の適応的, 実行的評価について論じる。
関連論文リスト
- When LLM Decompilers Recompile More and Preserve Less [35.2873296518414]
我々は、ある関数が出荷された全てのテストに合格し、他の正当な入力で分岐することを示します。
De-Divergeは,定型あるいは手作業によるテストに頼らない行動比較オラクルである。
論文 参考訳(メタデータ) (2026-09-04T17:16:18Z) - CODEFUSE-DEBENCH: An Empirical Study on Readability, Recompilability, and Functionality [14.354022325641088]
本稿では, 可読性, 再コンパイル性, 機能性の3次元に沿って, 再コンパイル品質を測定する再利用可能な評価パラダイムを提案する。
我々は,多次元デコンパイル評価のための最初の自動フレームワークであるDEBENCHを提案する。
論文 参考訳(メタデータ) (2026-05-28T07:17:53Z) - ContraFix: Agentic Vulnerability Repair via Differential Runtime Evidence and Skill Reuse [10.503895811137095]
大規模言語モデル(LLM)エージェントは、自動脆弱性修復にますます利用されている。
最近の実証的な結果は、これらのエージェントがいまだに現実世界の脆弱性と戦っていることを示している。
ContraFixは、再利用可能な修復スキルとランタイムエビデンスを結合するエージェントフレームワークである。
論文 参考訳(メタデータ) (2026-05-17T13:48:25Z) - Constraint-Guided Multi-Agent Decompilation for Executable Binary Recovery [47.704311990064554]
脱コンパイルは、セキュリティ分析、マルウェアのリバースエンジニアリング、レガシーソフトウェアメンテナンスに不可欠である。
マルチレベル制約誘導型デコンパイル(MCGD)により,デコンパイルされたコードを再実行可能なソースに変換するマルチエージェントフレームワークを提案する。
本フレームワークは,84~97%の再実行性を実現し,28~89ポイントのベースラインデコンパイラ出力を改善した。
論文 参考訳(メタデータ) (2026-04-27T01:28:11Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Automated Repair of C Programs Using Large Language Models [0.0]
本研究では,Cプログラムの修復を自動化する上で,LLM(Large Language Models)の可能性について検討する。
本稿では,SBFL(Spectrum-based Fault Localization),ランタイムフィードバック,Chain-of-Thought-structured(Chain-of-Thought-structured)を自動修復ループに統合するフレームワークを提案する。
我々の手法は44.93%の修理精度を達成し、最先端のAPRベースラインに対する3.61%の絶対的な改善を示している。
論文 参考訳(メタデータ) (2025-09-02T04:34:11Z) - Repairing vulnerabilities without invisible hands. A differentiated replication study on LLMs [5.10123605644148]
自動脆弱性修復(AVR: Automated Vulnerability repair)は、プログラム修復の急激な分岐である。
近年の研究では、大きな言語モデル(LLM)が従来の手法より優れていることが示されている。
論文 参考訳(メタデータ) (2025-07-28T16:39:16Z) - ReF Decompile: Relabeling and Function Call Enhanced Decompile [50.86228893636785]
逆コンパイルの目標は、コンパイルされた低レベルコード(アセンブリコードなど)を高レベルプログラミング言語に変換することである。
このタスクは、脆弱性識別、マルウェア分析、レガシーソフトウェアマイグレーションなど、さまざまなリバースエンジニアリングアプリケーションをサポートする。
論文 参考訳(メタデータ) (2025-02-17T12:38:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。