論文の概要: SWE-Test: Benchmarking LLM Vulnerability Discovery via Input Prediction
- arxiv url: http://arxiv.org/abs/2609.06229v1
- Date: Sat, 05 Sep 2026 19:04:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.220468
- Title: SWE-Test: Benchmarking LLM Vulnerability Discovery via Input Prediction
- Title(参考訳): SWE-Test: 入力予測によるLSM脆弱性発見のベンチマーク
- Abstract要約: 脆弱性発見は、大規模言語モデル(LLM)エージェントの重要な機能である。
我々は、その測定を、クローズドな決定論的基底真理を持つ入力予測タスクとして再放送する。
これにより、発見は15ドメインにまたがる22の現実世界のC/C++プログラムで3つのタスクモードに分解される。
- 参考スコア(独自算出の注目度): 13.719725391379276
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vulnerability discovery is becoming an important ability of large language model (LLM) agents: agents that silently miss real defects leave critical software exposed. Rigorously measuring this ability is therefore urgent, but existing benchmarks are gameable through data contamination, score recall against an unknowable vulnerability set, often rely on synthetic bugs, and report a single end-to-end verdict that cannot localize where an agent fails. Vulnerability discovery is a composite ability: an agent must comprehend source code, infer input constraints, construct inputs, execute them, and iteratively correct from feedback. We recast its measurement as an input-prediction task with a closed, deterministic ground truth: using coverage-guided fuzzing, we mine deep target branches in real-world C/C++ programs and ask an agent to predict an input that drives execution to a given branch. This decomposes discovery into three task modes over 22 real-world C/C++ programs spanning 15 domains. Open-loop and Feedback-enabled share 60 fixed-target task instances across 16 of these codebases (13 domains), testing input construction without and with a distance oracle to isolate code comprehension from feedback-driven correction. Online Arena instead removes the predefined target and scores path exploration by coverage gain on a separate, partially overlapping pool of 11 programs; agents collectively confirmed 13 distinct bugs across six programs. Evaluating 15 default-effort model-scaffold configurations, the best reaches only 55.0% pass rate in the Feedback-enabled mode, and the mean across seven paired Claude Code configurations is 36.4% with feedback versus 19.3% without. Decomposing failures, we find constraint inference, not navigation, is the dominant bottleneck. We release SWE-Test with a turnkey evaluation environment.
- Abstract(参考訳): 脆弱性発見は、大規模言語モデル(LLM)エージェントの重要な機能になりつつある。
そのため、この能力を厳格に測定することは急務であるが、既存のベンチマークはデータ汚染を通じてゲーム可能であり、不可知の脆弱性セットに対するリコールをスコアし、しばしば合成バグに依存し、エージェントの障害箇所をローカライズできない単一のエンドツーエンドの判定を報告している。
脆弱性発見は複合的な能力であり、エージェントはソースコードを理解し、入力制約を推論し、入力を構築し、それらを実行し、フィードバックから反復的に修正しなければならない。
我々は,実世界のC/C++プログラムの深いターゲット分岐をマイニングし,エージェントに与えられた分岐に実行を駆動する入力を予測するように依頼する。
これにより、発見は15ドメインにまたがる22の現実世界のC/C++プログラムで3つのタスクモードに分解される。
オープンループとフィードバック対応のタスクインスタンスは、これら16のコードベース(13のドメイン)で60の固定ターゲットタスクインスタンスを共有し、フィードバック駆動の修正からコードの理解を分離するための距離のオラクルなしで入力構成をテストする。
オンラインアリーナは事前に定義された目標を排除し、6つのプログラムで13の異なるバグをまとめて確認し、6つのプログラムで部分的に重複する11のプログラムをカバレッジゲインによってパス探索する。
15のデフォルトのモデルスキャフォールド構成を評価し、ベストはフィードバック対応モードで55.0%のパスレートにしか達せず、7つのペアのClaude Code構成の平均は36.4%であり、フィードバックは19.3%である。
障害を分解すると、ナビゲーションではなく制約推論が主要なボトルネックになる。
我々はターンキー評価環境を備えたSWE-Testをリリースする。
関連論文リスト
- Recognition Without Enforcement: Configuration-Dependent Failures in LLM Agent Instruction Arbitration and External Control [0.0]
LLMエージェントはシステムプロンプト、ユーザ、メモリ、ツールから命令を仲裁するが、この仲裁は信頼境界を強制するものではない。
ソースフォーマット機能はモデルアクティベーションから線形にデオード可能であり、モデルがトリガーされたときの偽の権威を明示的に識別することができる。
モデル自己配置をセキュリティ境界ではなく機能として扱い、認証されたソースルーティングと機能限定ツールの実行を組み合わせた外部参照モニタを実装します。
論文 参考訳(メタデータ) (2026-08-28T16:34:05Z) - Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence [86.61561123749011]
Apodex Discovery(アポデックスディスカバリー)は、重度解法を用いて発見的AIを構築し評価するためのフレームワークである。
まず16のセクターで511の業界を調査し、423の高価値現実問題を集め、最初のリリースで20を選定した。
第二に、共通の環境-タスク-エピソード抽象化は、データ、ツール、制約、フィードバック、軌跡記録、中間成果物と最終提出物の検証を提供する。
論文 参考訳(メタデータ) (2026-08-11T18:48:40Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs [52.50210189669399]
視覚言語モデル(VLM)を駆動するには,操作設計領域(ODD)が定義する様々な条件のシーンを正確に理解する必要がある
SliceScorerは、欠落したスライス推薦のための決定論的スコアリングルールである。
SliceNavは, 従来のスライス発見法よりも, 高リスクカバレッジギャップを効果的に表面化することを示す。
論文 参考訳(メタデータ) (2026-06-01T03:18:01Z) - MOSAIC-Bench: Measuring Compositional Vulnerability Induction in Coding Agents [2.1942030377331245]
コーディングエージェントは、しばしばプロンプト毎の安全性レビューをパスするが、それらのタスクが通常のエンジニアリングチケットに分解されると、悪用可能なコードを出荷する。
199個の3段階攻撃チェーンのベンチマークであるMOSAIC-Benchを紹介する。
9つのプロダクションコーディングエージェントが53~86%の終末ASRで無害なチケットを構成しており、全ステージで2回しか拒否しないことを示す。
論文 参考訳(メタデータ) (2026-05-05T16:38:23Z) - Beyond Code Reasoning: Specification-Anchored Auditing of Multi-Implementation Distributed Protocols [1.5229705287183657]
SPECAは、明示的で分類されたセキュリティプロパティを自然言語仕様から導き出し、実装間で再利用する監査フレームワークである。
RepoAuditのベンチマークでは、SPECAは100%リコール(F1=0.94)で88.9%の精度に達し、著者が検証した12のバグを地上の真実を超えて表面化している。
Sherlock Fusaka Audit Contest(10のターゲット、366の応募)では、SPECAが専門家が強化した15の脆弱性をすべて回復し、4つの修正確認バグが浮上した。
論文 参考訳(メタデータ) (2026-04-29T09:57:07Z) - Verify Before You Fix: Agentic Execution Grounding for Trustworthy Cross-Language Code Analysis [0.0]
ソフトウェア脆弱性分析のための言語横断的な脆弱性ライフサイクルフレームワークを構築します。
89.84-92.02%の言語内検出精度,74.43-80.12%のゼロショット言語F1。
これらの結果は,LLM駆動型エージェントAIのための原理的かつ実用的に展開可能なメカニズムであることを示す。
論文 参考訳(メタデータ) (2026-04-12T20:22:23Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - Understanding NPM Malicious Package Detection: A Benchmark-Driven Empirical Analysis [10.599261033874884]
NPMエコシステムは、ソフトウェアサプライチェーン攻撃の主要なターゲットとなっている。
ベンチマークによるNPMマルウェア検出の実証分析を行う。
我々は、11の行動カテゴリと8の回避テクニックを付加した、6,420の悪意のある7,288の良性パッケージのデータセットを構築した。
論文 参考訳(メタデータ) (2026-03-29T07:04:31Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。