論文の概要: VulValidate: Auditing Function-Level Vulnerability Labels with Executable Evidence
- arxiv url: http://arxiv.org/abs/2610.05103v1
- Date: Sun, 04 Oct 2026 10:21:53 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-07 05:12:26.876673
- Title: VulValidate: Auditing Function-Level Vulnerability Labels with Executable Evidence
- Title(参考訳): VulValidate: 実行可能なエビデンスによる関数レベル脆弱性ラベルの監査
- Abstract要約: Vulは、エージェントを使用して動的解析ツールをコーディネートし、脆弱性追跡実験を構築するフレームワークである。
BigVul、PrimeVul、DiverseVulで脆弱性をラベル付けされた35,849のインスタンスを監査します。
20,510人(57.2%)、正解6,819人(19.0%)、攻撃7,981人(22.3%)、未決定539人(正確にはバイト)。
581のサンプル決定の盲目レビューでは、専門家の合意は90.0%--92.0%の確認と92.6%--99.0%のラベル修正を支持している。
- 参考スコア(独自算出の注目度): 3.9114266138745495
- License:
- Abstract: Reliable learning-based vulnerability detection requires high-quality labels, yet datasets built from vulnerability-fixing commits may label functions as vulnerable simply because they were changed by a security patch. We present VulValidate, a framework that uses LLM agents to coordinate dynamic analysis tools and construct vulnerability-triggering experiments from runtime feedback. Given a labeled function and its fixing patch, VulValidate reconstructs vulnerable and fixed revisions, selects suitable tools and execution paths, refines triggering inputs, and compares runtime behavior to assess function-level attribution. We audit all 35,849 instances originally labeled vulnerable in BigVul, PrimeVul, and DiverseVul. We confirm 20,510 (57.2%), correct 6,819 labels (19.0%), leave 7,981 attacked but undecided (22.3%), and cannot successfully measure 539 (1.5%). After conflict resolution and byte-exact deduplication, the corrected release contains 15,890 distinct confirmed vulnerable function bodies. In a blinded review of 581 sampled decisions, expert consensus supports 90.0%--92.0% of confirmations and 92.6%--99.0% of label corrections. With model parameters fixed, corrected evaluation lowers F1 for all five tested detectors on both BigVul and DiverseVul; retraining with corrected labels improves F1 for four of five detectors on each dataset. We also release a reusable VulValidate skill, corrected datasets, and reproducible evidence for future vulnerability-detection research.
- Abstract(参考訳): 信頼性の高い学習ベースの脆弱性検出には高品質なラベルが必要だが、脆弱性修正コミットから構築されたデータセットは、セキュリティパッチによって変更されただけで、関数を脆弱性としてラベル付けする可能性がある。
VulValidate は LLM エージェントを用いて動的解析ツールをコーディネートし,実行時のフィードバックから脆弱性追跡実験を構築するフレームワークである。
ラベル付き関数とその修正パッチが与えられた後、VulValidateは脆弱で固定されたリビジョンを再構築し、適切なツールと実行パスを選択し、入力をトリガーし、実行時の振る舞いを比較して関数レベルの属性を評価する。
BigVul、PrimeVul、DiverseVulで脆弱性をラベル付けされた35,849のインスタンスを監査します。
20,510人(57.2%)、正解6,819人(19.0%)、攻撃7,981人(22.3%)、無判定539人(1.5%)。
コンフリクト分解とバイトエクサクサクサクサクデ複製の後、修正された放出は15,890個の異なる脆弱な機能体を含む。
581のサンプル決定の盲目レビューでは、専門家の合意は90.0%--92.0%の確認と92.6%--99.0%のラベル修正を支持している。
モデルパラメータの固定により、修正された評価は、BigVulとDiverseVulの両方でテストされた5つの検出器のF1を下げる。
また、再利用可能なVulValidateスキル、修正データセット、将来の脆弱性検出研究の再現可能な証拠もリリースしています。
関連論文リスト
- Vulnerability Localization Benchmark: Measuring Agentic Security Analysis at Repository Scale [54.83971397981572]
言語モデルエージェントは、ソフトウェアリポジトリ全体を通してますます運用される。
サイバーセキュリティ評価は、関連するコードを見つけることよりも、脆弱性を検出、再生、または修復できるかどうかを測定する。
脆弱性のローカライゼーションについて検討する。弱点クラスと不慣れなリポジトリが与えられた場合、その弱点に関連する実装ファイルを特定する。
論文 参考訳(メタデータ) (2026-09-14T17:44:51Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - Weakly Supervised Vulnerability Localization via Multiple Instance Learning [46.980136742826836]
WeAkly によるマルチプルインスタンス学習による脆弱性ローカライゼーションのための WAVES という新しい手法を提案する。
WAVESは、ある関数が脆弱かどうか(すなわち脆弱性検出)を判定し、脆弱なステートメントをピンポイントする機能を持っている。
提案手法は,文レベルの脆弱性ローカライゼーションにおいて,脆弱性検出と最先端のパフォーマンスにおいて同等のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-09-14T15:11:39Z) - Uncertainty-aware Long-tailed Weights Model the Utility of Pseudo-labels for Semi-supervised Learning [50.868594148443215]
本研究では,不確かさを意識したアンサンブル構造(UES)を提案する。
UESは軽量でアーキテクチャに依存しないため、分類や回帰を含む様々なコンピュータビジョンタスクに容易に拡張できる。
論文 参考訳(メタデータ) (2025-03-13T02:21:04Z) - CleanVul: Automatic Function-Level Vulnerability Detection in Code Commits Using LLM Heuristics [12.14750501628444]
本稿では,Large Language Model (LLM) を用いて,VFCからの脆弱性修正変更を自動的に識別する手法を提案する。
VulSifterは大規模な調査に適用され、GitHubで127,063のリポジトリをクロールし、5,352,105のコミットを取得しました。
LLM拡張手法を用いて8,198個の関数からなる高品質なデータセットであるCleanVulを開発した。
論文 参考訳(メタデータ) (2024-11-26T09:51:55Z) - Detecting Errors and Estimating Accuracy on Unlabeled Data with
Self-training Ensembles [38.23896575179384]
本稿では,この2つの課題に同時に対処する,原則的かつ実用的な枠組みを提案する。
1つのインスタンス化は、教師なし精度推定における推定誤差を少なくとも70%削減し、エラー検出のためのF1スコアを少なくとも4.7%改善する。
iWildCamでは、教師なし精度推定における推定誤差を少なくとも70%削減し、エラー検出のためのF1スコアを少なくとも4.7%改善する。
論文 参考訳(メタデータ) (2021-06-29T21:32:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。