論文の概要: CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers?
- arxiv url: http://arxiv.org/abs/2610.07557v1
- Date: Tue, 06 Oct 2026 00:42:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.725872
- Title: CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers?
- Title(参考訳): CheckerBench: 長期的なエージェントは静的分析チェッカーを合成できるか?
- Abstract要約: 静的解析チェッカー合成では、エージェントが欠陥仕様を解釈し、リポジトリを検査し、アナライザ固有のロジックを実装し、繰り返しコンパイルと解析のフィードバックを通じてチェッカーを洗練する必要がある。
既存のコーディングエージェントベンチマークでは、パッチ生成や脆弱性検出などのタスクに重点を置いており、エージェントがリポジトリ内で開始から終了までの作業チェッカーを開発できるかどうかを評価することは滅多にない。
CheckerBenchは167リポジトリに297のCVE、85のCWE、5つの言語エコシステムから派生した300のタスクの実行可能なベンチマークである。
- 参考スコア(独自算出の注目度): 13.18359471722067
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Static-analysis checker synthesis requires agents to interpret a defect specification, inspect a repository, implement analyzer-specific logic, and refine the checker through repeated compilation and analysis feedback. Existing coding-agent benchmarks focus on tasks such as patch generation or vulnerability detection and rarely assess whether an agent can develop a working checker in a repository from start to finish. We introduce CheckerBench, an executable benchmark of 300 tasks derived from 297 CVEs across 167 repositories, 85 CWEs, and five language ecosystems. Each task includes vulnerable and fixed revisions, a pinned analysis environment, and a checker scaffold. We further introduce CheckerLab, a common evaluation framework that independently rebuilds submitted checkers and measures vulnerable-fixed diagnostic contrast, patch localization, false positives, and tool use. Across 21 model-harness configurations and three independent repeats per configuration, mean Pass@1 is 32.30%, while the best reaches 45.33%. These results show that reliable, reusable checker development remains challenging for current coding agents.
- Abstract(参考訳): 静的解析チェッカー合成では、エージェントが欠陥仕様を解釈し、リポジトリを検査し、アナライザ固有のロジックを実装し、繰り返しコンパイルと解析のフィードバックを通じてチェッカーを洗練する必要がある。
既存のコーディングエージェントベンチマークでは、パッチ生成や脆弱性検出などのタスクに重点を置いており、エージェントがリポジトリ内で開始から終了までの作業チェッカーを開発できるかどうかを評価することは滅多にない。
CheckerBenchは167リポジトリに297のCVE、85のCWE、5つの言語エコシステムから派生した300のタスクの実行可能なベンチマークである。
各タスクには、脆弱で固定されたリビジョン、ピン付き分析環境、チェッカーの足場が含まれる。
提案されたチェッカーを独立して再構築し、脆弱な修正された診断コントラスト、パッチローカライゼーション、偽陽性、ツール使用を測定する共通評価フレームワークであるCheckerLabについても紹介する。
21のモデルハーネス構成と3つの独立したリピート構成で、Pass@1は32.30%、最高は45.33%である。
これらの結果は、現在のコーディングエージェントでは、信頼性が高く再利用可能なチェッカー開発が依然として困難であることを示している。
関連論文リスト
- From Dead Code and Static Requirements to Working Engines: Software Revival with Coding Agents [14.661282304807145]
ReviveBenchは、ネイティブ実行環境に対する隠れ検証によって評価された2つのタスクファミリを持つベンチマークである。
リカバリファミリーは、依存関係の非互換性、削除されたコアモジュール、レガシビルド、GPUベースのファンデーションモデルを含む10のタスクで構成される。
再構成ファミリーは、数値、幾何学、ハードウェア、取引システムにまたがる13のタスクからなる。
論文 参考訳(メタデータ) (2026-09-28T19:30:12Z) - ExecCritic: Learn to Test, Test to Improve for Coding Agents [68.42713285082912]
実行時のフィードバックは、コーディングエージェントを正しいリポジトリの修復に導くことができますが、テストが問題によって要求された振る舞いをキャプチャした場合のみです。
ExecCriticを導入し、テスト-検証-修正足場と、その中のトレーニングエージェントのためのロール固有の強化学習レシピを組み合わせる。
テストエージェントが独立してリポジトリネイティブなテストを生成し、フェイルクローズされたハーネスがそれらを調整して凍結し、リカバリエージェントがテストを変更することなく、ソースコードを実行フィードバックから修正する。
論文 参考訳(メタデータ) (2026-09-08T17:53:37Z) - SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents [63.65682461568621]
ソフトウェアエンジニアリングエージェントのためのリポジトリレベルのベンチマークであるSWE-Gateを導入し、機能的正当性とともにレビュー制約コンプライアンスを明示的に評価する。
SWE-Gateは、実際のプルリクエストレビューコメントからレビュー制約を導き、これらの制約に関するリポジトリレベルの修復インスタンスを合成する。
各インスタンスは、非準拠およびゴールドパッチとともに、機能テストと制約テストの分離を提供し、イシュー解決能力とレビュー制約コンプライアンスの明確な分離を可能にする。
論文 参考訳(メタデータ) (2026-09-03T17:53:34Z) - SHERLOC: Structured Diagnostic Localization for Code Repair Agents [33.35079971033214]
SHERLOCは,コンパクトなリポジトリツールと自己回復機能を備えた推論LDMをペアリングする,トレーニング不要のフレームワークである。
SWE-Bench Liteでは84.33%の精度@1、SWE-Bench Verifiedでは81.27%のリコール@1である。
論文 参考訳(メタデータ) (2026-06-23T17:05:50Z) - Code-Centric Detection of Vulnerability-Fixing Commits: A Unified Benchmark and Empirical Study [4.512751676075442]
本稿では,統合フレームワークによる言語モデルに基づくVFC検出の包括的評価を行う。
コードの変更だけで、モデルが転送可能なセキュリティ関連コードを理解する証拠は見つからない。
グループ階層評価は、ランダムスプリットに比べて約17%のパフォーマンス低下を露呈する。
論文 参考訳(メタデータ) (2026-05-13T08:05:14Z) - Beyond Code Reasoning: Specification-Anchored Auditing of Multi-Implementation Distributed Protocols [1.5229705287183657]
SPECAは、明示的で分類されたセキュリティプロパティを自然言語仕様から導き出し、実装間で再利用する監査フレームワークである。
RepoAuditのベンチマークでは、SPECAは100%リコール(F1=0.94)で88.9%の精度に達し、著者が検証した12のバグを地上の真実を超えて表面化している。
Sherlock Fusaka Audit Contest(10のターゲット、366の応募)では、SPECAが専門家が強化した15の脆弱性をすべて回復し、4つの修正確認バグが浮上した。
論文 参考訳(メタデータ) (2026-04-29T09:57:07Z) - Needle in the Repo: A Benchmark for Maintainability in AI-Generated Repository Edits [3.9532936038777144]
Needle in the Repo (NITR) は、リポジトリの動作的に正しい編集が維持可能な構造を保存するかどうかを評価するためのフレームワークである。
NITRは、ソフトウェアエンジニアリングの知恵を、小さな、現実的なマルチファイルに埋め込まれた制御されたプローブに蒸留する。
GPT、Claude、Gemini、Qwenの各ファミリーの23のコーディング構成を、直接推論とエージェントベースの設定の両方で評価する。
論文 参考訳(メタデータ) (2026-03-29T15:56:05Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding [57.39403818250357]
ここでは,レポジトリベースエージェントコーディングにおける足場認識命令のベンチマークを行うOctoBenchを紹介する。
OctoBenchは34の環境と217のタスクを3つの足場タイプでインスタンス化し、7,098の客観的チェックリストアイテムとペアリングする。
実験により、タスク解決と足場対応の体系的なギャップが明らかになり、トレーニングと評価の必要性が強調される。
論文 参考訳(メタデータ) (2026-01-15T12:36:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。