論文の概要: JavaVulBench: A Java Vulnerability Benchmark with Realistic Splits, a Unified Multi-Backend Harness, and a Leakage-Aware Evaluation Mode
- arxiv url: http://arxiv.org/abs/2607.02825v1
- Date: Thu, 02 Jul 2026 23:32:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.429975
- Title: JavaVulBench: A Java Vulnerability Benchmark with Realistic Splits, a Unified Multi-Backend Harness, and a Leakage-Aware Evaluation Mode
- Title(参考訳): JavaVulBench: リアリスティックスプリットを備えたJava脆弱性ベンチマーク、統一されたマルチバックエンドのハーネス、漏洩認識評価モード
- Authors: Norbert Sandor Szolnoki, Gabor Antal,
- Abstract要約: textscVulBenchはJavaの脆弱性評価のためのベンチマークと評価ハーネスである。
データセットには1~14,700以上のプロジェクトにまたがる$sim,600のJavaメソッドが含まれており、行と発行日の両方でラベル付けされている。
このハーネスは、バックエンドファミリ間で単一のttexttLlmスキーマを提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We release \textsc{JavaVulBench}, a benchmark dataset and evaluation harness for Java vulnerability detection. The dataset contains $\sim$30{,}600 Java methods spanning 1{,}740 CVEs and 700+ projects, labelled at both method and line granularity, with per-CVE publication dates and five realistic split strategies: random, project-disjoint, temporal, deduplicated, and unseen CWE-family. The harness provides a single \texttt{LlmPrediction} schema across three backend families (encoder classifiers, local generative models served by Ollama, and API-served LLMs routed through OpenRouter) so that twelve reference detectors CodeBERT, GraphCodeBERT, UniXcoder, DeepSeek-Coder-1.3B, and eight API/open-weight LLMs (GPT-4o, GPT-4.1-mini, Claude Sonnet~4, DeepSeek-v3, DeepSeek-Coder-v2, Qwen-2.5-Coder-14B/7B, CodeLlama-13B) are evaluated under identical conditions from a single command. A pre-training contamination audit is shipped alongside every model so users can separate genuinely unseen test CVEs from potentially memorised ones. Data, code, and fine-tuned checkpoints are archived on Zenodo [31] and short demonstration video is available on YouTube (https://www.youtube.com/watch?v=nMTX\_hqkuoM) https://www.youtube.com/watch?v=nMTX_hqkuoM.
- Abstract(参考訳): 私たちは、Javaの脆弱性検出のためのベンチマークデータセットと評価ハーネスである‘textsc{JavaVulBench} をリリースしました。
データセットには、1{,}740のCVEと700以上のプロジェクトにまたがる$\sim$30{,}600のJavaメソッドが含まれており、メソッドと行の粒度にラベル付けされている。
このハーネスは、3つのバックエンドファミリ(エンコーダ分類器、Ollamaによって提供されるローカル生成モデル、OpenRouter経由でルーティングされるAPIサーブされたLLM)に1つの‘texttt{LlmPrediction}スキーマを提供し、12の参照検出器であるCodeBERT、GraphCodeBERT、Unixcoder、DeepSeek-Coder-1.3Bと8つのAPI/オープンウェイトLLM(GPT-4o、GPT-4.1-mini、Claude Sonnet~4、DeepSeek-v3、DeepSeek-Coder-v2、Qwen-2.5-Coder-14B/7B、CodeLlama-13B)を単一のコマンドから評価する。
トレーニング済みの汚染監査は、すべてのモデルと共に配信されるので、真に見えないテストCVEと、潜在的に記憶されているCVEを分離することができる。
データ、コード、微調整されたチェックポイントはZenodo [31]にアーカイブされ、短いデモビデオはYouTube(https://www.youtube.com/watch?
v=nMTX\_hqkuoM) https://www.youtube.com/watch?
v=nMTX_hqkuoM。
関連論文リスト
- Nautilus Compass: Black-box Persona Drift Detection for Production LLM Agents [2.417342411475111]
ナチラス・コンパス(Nautilus Compass)は、ブラックボックスドリフト検出器と、生産用コーディングエージェントのためのエージェントメモリ層である。
このシステムは、Claude Codeプラグイン、CP 20245 A2Aサーバ、CLI、APIを1つのデーモンで提供する。
論文 参考訳(メタデータ) (2026-05-11T01:49:17Z) - An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning [10.815335026032377]
TraceEvalは、コードセマンティック推論のための最初の実行検証されたマルチ言語ベンチマークである。
TraceEvalは、Python、JavaScript、Javaにまたがる1,600以上のオープンソースリポジトリから抽出された10,583の現実世界プログラムで構成されている。
最も強いClaude-Opus-4.6は、3つの言語で平均72.9%のF1に達する。
論文 参考訳(メタデータ) (2026-05-10T07:17:00Z) - LLM-Redactor: An Empirical Evaluation of Eight Techniques for Privacy-Preserving LLM Requests [0.0]
コーディングエージェントとLLMベースのアプリケーションは、通常、潜在的に敏感なコンテンツをクラウドのLLM APIに送信し、ログ化、保持、トレーニングに使用されるか、召喚される可能性がある。
プライバシ保護型LCM要求に対する8つの手法の系統的実証評価を行った。
MCPやOpenAI互換のAPIと互換性のあるオープンソースシムで、全8つ(あるいはデプロイメントがまだ実現不可能な、牽引可能な研究段階のサブセット)を実装しています。
論文 参考訳(メタデータ) (2026-04-13T21:05:42Z) - Bridging Code Property Graphs and Language Models for Program Analysis [1.7158296436650338]
大規模言語モデル(LLM)は、現実世界のセキュリティ脆弱性を分析する上で、重大な課題に直面します。
トークン制限はレポジトリ全体をロードすることを防ぎ、コード埋め込みはプロシージャ間データフローのキャプチャに失敗し、LLMは複雑な静的解析クエリを生成するのに苦労する。
我々は,Joern の Code Property Graph エンジンと LLM を統合した,オープンソースの Model Context Protocol (MCP) サーバである codebadger を紹介する。
論文 参考訳(メタデータ) (2026-03-25T22:08:04Z) - vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models [58.633451339058986]
VLAモデルは一般的に、各モデルリポジトリによって独立して維持されるベンチマークスクリプト毎に評価される。
本稿では、ベンチマーク実行からモデル推論を分離するオープンソースの評価ハーネスであるvla evalを紹介する。
完全な評価では、vla eval serveとvla eval runの2つのコマンドしか必要としない。
論文 参考訳(メタデータ) (2026-03-14T14:38:53Z) - Extracting books from production language models [65.85348210518937]
同様の抽出がLLMの生産に可能であるかどうかについては、未解決のままである。
ジェイルブレイクされたクロード3.7 ソンネットは、全書籍をほぼ全文出力する場合もある。
モデルおよびシステムレベルのセーフガードであっても、(コピーライト内での)トレーニングデータの抽出はLLM生産のリスクである。
論文 参考訳(メタデータ) (2026-01-06T03:01:27Z) - I Know Which LLM Wrote Your Code Last Summer: LLM generated Code Stylometry for Authorship Attribution [0.0580448704422069]
本稿では,Cプログラムの著者帰属に関する最初の体系的研究について述べる。
CodeT5-Authorshipは、オリジナルのCodeT5エンコーダ-デコーダアーキテクチャのエンコーダ層のみを使用する新しいモデルです。
本モデルでは,近縁なモデルによって生成されたCプログラムを97.56%の精度で識別する。
論文 参考訳(メタデータ) (2025-06-18T19:49:41Z) - SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving [90.32201622392137]
We present SwingArena, a competitive evaluation framework for Large Language Models (LLMs)。
従来の静的ベンチマークとは異なり、SwingArenaはLLMをイテレーションとして組み合わせて、テストケースを作成し、継続的インテグレーション(CI)パイプラインを通じてパッチを検証するパッチとレビュアーを生成することで、ソフトウェアのコラボレーションプロセスをモデル化する。
論文 参考訳(メタデータ) (2025-05-29T18:28:02Z) - CLEVER: A Curated Benchmark for Formally Verified Code Generation [53.5486188696892]
$rm Csmall LEVER$は、リーンにおけるエンドツーエンドのコード生成のための161の問題を、高品質でキュレートしたベンチマークである。
それぞれの問題は、(1)堅実な仕様と一致する仕様を生成するタスク、(2)この仕様を確実に満足するリーン実装を生成するタスクで構成されています。
論文 参考訳(メタデータ) (2025-05-20T05:15:47Z) - Private-Library-Oriented Code Generation with Large Language Models [52.73999698194344]
本稿では,大規模言語モデル(LLM)をプライベートライブラリのコード生成に活用することに焦点を当てる。
プログラマがプライベートコードを書く過程をエミュレートする新しいフレームワークを提案する。
TorchDataEval、TorchDataComplexEval、MonkeyEval、BeatNumEvalの4つのプライベートライブラリベンチマークを作成しました。
論文 参考訳(メタデータ) (2023-07-28T07:43:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。