論文の概要: The Data Problem in Software Vulnerability Analysis: Artifacts, Quality, and Consumption
- arxiv url: http://arxiv.org/abs/2609.01503v1
- Date: Tue, 01 Sep 2026 16:33:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.833708
- Title: The Data Problem in Software Vulnerability Analysis: Artifacts, Quality, and Consumption
- Title(参考訳): ソフトウェア脆弱性分析におけるデータ問題:アーティファクト、品質、消費
- Authors: Yu Nong, Yao Du, Tianxiang Xu, Haipeng Cai,
- Abstract要約: データセット中心の分類法を用いて脆弱性分析の背後にあるデータについて検討する。
2016-2026年に関する1522の論文の体系化されたコーパスと、それ以前の基礎的な作業から、私たちは111のアンカー・ペーパーの結びついたセットをディープコーディングしました。
実行可能アーティファクトは、24のデータセットのうち15が実世界のグレード化され、独立したチェックを受けたラベルを持つ唯一の主要なタイプです。
- 参考スコア(独自算出の注目度): 15.434821716002519
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Learning- and LLM-based software vulnerability analysis is only as trustworthy as the data it is trained and evaluated on, yet that data is rarely examined as a first-class object. We investigate the data behind vulnerability analysis through a dataset-centric taxonomy that separates what an artifact is (code, metadata, patches, tests/PoCs, reasoning, traces), how good it is (realism, label evidence, scale, diversity, leakage, availability), and what it is used for. From a systematically assembled corpus of 1522 papers covering 2016-2026 plus foundational earlier work we deep-code a tiered set of 111 anchor papers, backing every affirmative rubric-graded value with a verbatim span, and we report, per attribute, both how much it has been studied and how well datasets achieve it. The results trace an evidence ladder: executable artifacts are the only major type where 15 of the 24 datasets are both graded real-world and carry labels that received an independent check, while code-sample datasets-the largest category in both the auto-tagged corpus and the anchor set-are the least realistic: 20 of the 41 draw their vulnerabilities from authentic projects or CVEs, but only 3 keep the sample at the unit the code is deployed in, and only 2 do both-though these are coarse component tests, and just one code-sample dataset meets the codebook's stricter full-context real-world grade. Among these, leakage goes unaddressed by 49 of the 90 datasets where it applies, more than a quarter say nothing about availability, reasoning data has arrived only recently and is mostly model-generated, and primary trace corpora remain limited to three datasets, the total after a corpus-wide screen and a full-text check of every candidate it surfaced, with further datasets releasing traces secondarily behind benchmarks and harnesses.
- Abstract(参考訳): 学習型およびLLMベースのソフトウェア脆弱性分析は、トレーニングおよび評価されたデータと同じくらい信頼性が高いが、そのデータが第一級オブジェクトとして検査されることは滅多にない。
脆弱性分析の背後にあるデータは、アーティファクト(コード、メタデータ、パッチ、テスト/PoC、推論、トレース)と、それがどの程度優れているか(リアリズム、ラベルのエビデンス、スケール、多様性、漏洩、可用性)と、それが使用するものとを区別するデータセット中心の分類によって調査する。
2016-2026と基礎的な先行研究を含む1522の論文の体系化されたコーパスから、111のアンカーペーパーの階層をディープコーディングし、肯定的なルーリックグレードのすべての値を冗長スパンでバックアップし、属性毎に、その研究量とデータセットの達成度の両方を報告します。
実行可能アーティファクトは、24のデータセットのうち15が実際のグレードと独立したチェックを受けたラベルを持つ唯一の主要なタイプであり、コードサンプルデータセット(自動タグ付きコーパスとアンカーセットの両方で最大のカテゴリ)は、最も現実的ではない。
このうち、90のデータセットのうち49のリークは修正されず、1/4以上は可用性について何も言わず、推論データが最近到着したばかりで、ほとんどがモデル生成であり、プライマリトレースコーパスは3つのデータセットに制限されている。
関連論文リスト
- Walk Before You Run: The Importance of Data Exploration for Data Analysis Agents [7.140798105546584]
現在のツールやベンチマークでは、このステップは通常暗黙的に残され、ダウンストリームタスクのパフォーマンスとデータセット理解のギャップが生じる。
我々は、より強力なデータ探索サポートによってタスクパフォーマンスが向上するダウンストリーム実験を通して示す。
以上の結果から,強力なLCMとデータ分析エージェントは,たとえスプレッドシートの内容を読み込んだとしても,重要な論理構造を欠いていることが明らかとなった。
論文 参考訳(メタデータ) (2026-08-17T03:19:59Z) - OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value [74.80873109856563]
OpenDataArena(ODA)は、トレーニング後のデータの本質的な価値をベンチマークするために設計された、総合的でオープンなプラットフォームである。
ODAは4つの主要な柱からなる包括的なエコシステムを確立している。 (i) 多様なモデル間で公平でオープンな比較を保証する統一的なトレーニング評価パイプライン、 (ii) 異なる軸数に沿ってデータ品質をプロファイリングする多次元スコアリングフレームワーク、 (iii) データセットの系図を視覚化してコンポーネントソースを識別するインタラクティブなデータ系統探索である。
論文 参考訳(メタデータ) (2025-12-16T03:33:24Z) - LABELING COPILOT: A Deep Research Agent for Automated Data Curation in Computer Vision [13.437102865245285]
本稿では,コンピュータビジョンのための初のデータキュレーションディープリサーチエージェントであるLabeling Copilotを紹介する。
大規模なマルチモーダル言語モデルを利用する中央オーケストレータエージェントは、多段階推論を使用して、3つのコア機能にまたがる特殊なツールを実行する。
論文 参考訳(メタデータ) (2025-09-26T17:55:26Z) - Fact Checking Beyond Training Set [64.88575826304024]
本稿では,レトリバーリーダが,あるドメインのラベル付きデータに基づいてトレーニングし,別のドメインで使用する場合,性能劣化に悩まされることを示す。
本稿では,レトリバー成分を分散シフトに対して頑健にするための逆アルゴリズムを提案する。
次に、これらのデータセットから8つの事実チェックシナリオを構築し、モデルと強力なベースラインモデルのセットを比較します。
論文 参考訳(メタデータ) (2024-03-27T15:15:14Z) - Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data [89.2410799619405]
実世界のデータを用いた統計的および因果推論において,大規模言語モデルの能力を評価するために,データベンチマークを用いた定量的推論を導入する。
このベンチマークは、教科書、オンライン学習教材、学術論文のデータシートを伴う411の質問のデータセットで構成されている。
データとテキストに対するモデルの量的推論能力を比較するために、ベンチマークを290のテキストのみの質問、すなわちQRTextで強化する。
論文 参考訳(メタデータ) (2024-02-27T16:15:03Z) - Automating Dataset Updates Towards Reliable and Timely Evaluation of Large Language Models [81.27391252152199]
大規模言語モデル(LLM)は、さまざまな自然言語ベンチマークで素晴らしいパフォーマンスを実現している。
本稿では、データセットの自動更新と、その有効性に関する体系的な分析を提案する。
1) 類似したサンプルを生成するための戦略を模倣すること,2) 既存のサンプルをさらに拡張する戦略を拡張すること,である。
論文 参考訳(メタデータ) (2024-02-19T07:15:59Z) - Unsupervised Anomaly Detection for Auditing Data and Impact of
Categorical Encodings [20.37092575427039]
自動車クレームのデータセットは、自動車修理の不正な保険請求から成り立っている。
異常検出のためのベンチマークデータセットの欠落という一般的な問題に対処する。
データセットは浅層および深層学習法に基づいて評価される。
論文 参考訳(メタデータ) (2022-10-25T14:33:17Z) - Documenting the English Colossal Clean Crawled Corpus [28.008953329187648]
この作業は、Common Crawlの単一のスナップショットにフィルターのセットを適用することによって作成されたデータセットであるColossal Clean Crawled Corpus(C4; Raffel et al., 2020)の最初のドキュメントを提供します。
まず、テキストがどこから来ていつ書き込まれたかの分布を含む、データのハイレベルな要約から始めます。
次に、最も頻繁なテキストソースを含む、このデータの突出した部分に関するより詳細な分析を行う。
論文 参考訳(メタデータ) (2021-04-18T07:42:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。