論文の概要: WitnessGym: Benchmarking Coding Agents on the Construction of Bug Witnesses
- arxiv url: http://arxiv.org/abs/2609.36635v1
- Date: Tue, 29 Sep 2026 03:43:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.160511
- Title: WitnessGym: Benchmarking Coding Agents on the Construction of Bug Witnesses
- Title(参考訳): WitnessGym: バグ・ウィットネス構築のためのベンチマーク・コーディング・エージェント
- Abstract要約: WitnessGymはバグ注入によるバグ検証ベンチマークを構築するためのフレームワークだ。
実際のプロジェクトのテスト済みパスにバグを注入し、各プロジェクトを再構築し、建設時の目撃者が暴露したケースを保持する。
テストスイートを備えた現実世界のJavaプロジェクトに基づいて、WitnessGymは1300のベンチマークケースを自動的に構築する。
- 参考スコア(独自算出の注目度): 52.153965130786794
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Bug validation asks a coding agent to produce an executable witness for a reported bug. The witness combines a concrete input with a testing harness and exposes faulty behavior during execution. Such evidence makes audit findings actionable, yet benchmark evaluation is difficult when cases reuse public historical bugs and witnesses or require manual construction. We present WitnessGym, an automated framework for constructing bug-validation benchmarks through bug injection. It injects bugs into test-reached paths of real projects, rebuilds each project, and retains cases exposed by a construction-time witness. Bug specifications and execution adapters allow extension to additional bug types and languages. Bug-preserving transformations vary the surrounding structure while preserving the witness behavior. Based on real-world Java projects with test suites, WitnessGym automatically constructs 1,300 benchmark cases. The injected patches resemble historical bug patches and are difficult for the two evaluated models to distinguish in blinded comparisons. We evaluate four coding agent frameworks in six framework/model pairings across bug types, execution contexts, and transformation depths. Witness construction remains difficult even when the bug pattern is known. Our framework, benchmark cases, and evaluation scripts are available.
- Abstract(参考訳): バグ検証は、報告されたバグの実行可能な目撃者を生成するために、コーディングエージェントに依頼する。
証人は具体的な入力とテストハーネスを組み合わせることで、実行中の障害行動を公開する。
このような証拠は、監査結果を実際に実行可能にするが、ケースが公共の歴史的バグや目撃者を再利用したり、手作業による構築を必要とする場合、ベンチマーク評価は困難である。
バグ注入によるバグ検証ベンチマークを構築するためのフレームワークWitnessGymを紹介する。
実際のプロジェクトのテスト済みパスにバグを注入し、各プロジェクトを再構築し、建設時の目撃者が暴露したケースを保持する。
バグ仕様と実行アダプタは、追加のバグタイプと言語の拡張を可能にする。
バグ保存変換は、目撃者の振舞いを保ちながら周囲の構造を変える。
テストスイートを備えた現実世界のJavaプロジェクトに基づいて、WitnessGymは1300のベンチマークケースを自動的に構築する。
インジェクトされたパッチは過去のバグパッチに似ており、2つの評価されたモデルがブラインドされた比較を区別することが困難である。
我々は、バグタイプ、実行コンテキスト、変換深さの6つのフレームワーク/モデルペアリングで4つのコーディングエージェントフレームワークを評価した。
バグパターンが分かっている場合でも、ウイットネスの構築は困難である。
フレームワーク、ベンチマークケース、評価スクリプトが利用可能です。
関連論文リスト
- Lie to Me: Finding Bugs in ZK DSL Toolchains with Adversarial Witness Injection [3.6756416620917522]
我々は、ZK DSLプログラムを生成し、敵対的な目撃者注入を通じてバグを公開するテストフレームワークであるLiezzを紹介する。
生成された決定論的プログラムごとに、Liezzは2つの公開入力を異なる出力で実行し、証人をスプリスし、一方の実行の入力と他方の実行の出力を組み合わせる。
制御された分岐と複数の目撃者分離戦略は、不足する制約を明らかにするのに十分な一貫性を維持します。
論文 参考訳(メタデータ) (2026-08-31T11:50:37Z) - SemaDiff: Identifying Semantic-Changing Commits with Generated Code and Tests [5.3138104073306005]
変更点からのセマンティック保存コミットの排除は、ソフトウェアリポジトリのマイニングにおいて、依然としてオープンな課題である。
SemaDiffは、プレコミットとポストコミットバージョンでの同様のテスト実行の比較を通じて、セマンティック保存コミットを特定するための新しいアプローチである。
SemaDiffは、セマンティックな保存と -- 約76%のケースでコミットを変更する -- を正確に区別し、セマンティックなコミット検出の精度は100%である。
論文 参考訳(メタデータ) (2026-07-14T12:23:22Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - CASCADE: Detecting Inconsistencies between Code and Documentation with Automatic Test Generation [0.7611870296994722]
コードとドキュメンテーション間の一貫性を維持することは、ソフトウェア開発において不可欠だが、見落とされがちな側面である。
偽陽性の低減に重点を置いた新しい不整合検出ツールであるCASCADEを紹介する。
我々はCASCADEを、オープンソースJavaプロジェクトから引き出された71の一貫性のない、814の一貫性のあるコード文書ペアからなる新しいデータセットで評価した。
論文 参考訳(メタデータ) (2026-04-21T12:26:54Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification [71.34070740261072]
本稿では,テストケースの生成と完成におけるモデルの能力を評価するためのベンチマークCLOVERを提案する。
ベンチマークはタスク間でのコード実行のためにコンテナ化されています。
論文 参考訳(メタデータ) (2025-02-12T21:42:56Z) - WRTester: Differential Testing of WebAssembly Runtimes via
Semantic-aware Binary Generation [19.78427170624683]
WRTesterは,現実のWasmバイナリを分解・組み立てることで複雑なWasmテストケースを生成可能な,新しい差分テストフレームワークである。
予期せぬ動作の根本原因を更に特定するために,実行時に依存しない根本原因特定手法を設計し,バグを正確に検出する。
人気の高いWasmランタイムで33のユニークなバグを発見しました。
論文 参考訳(メタデータ) (2023-12-16T14:02:42Z) - Automatic Generation of Test Cases based on Bug Reports: a Feasibility
Study with Large Language Models [4.318319522015101]
既存のアプローチは、単純なテスト(例えば単体テスト)や正確な仕様を必要とするテストケースを生成する。
ほとんどのテスト手順は、テストスイートを形成するために人間が書いたテストケースに依存しています。
大規模言語モデル(LLM)を活用し,バグレポートを入力として利用することにより,この生成の実現可能性を検討する。
論文 参考訳(メタデータ) (2023-10-10T05:30:12Z) - Using Developer Discussions to Guide Fixing Bugs in Software [51.00904399653609]
我々は,タスク実行前に利用可能であり,また自然発生しているバグレポートの議論を,開発者による追加情報の必要性を回避して利用することを提案する。
このような議論から派生したさまざまな自然言語コンテキストがバグ修正に役立ち、オラクルのバグ修正コミットに対応するコミットメッセージの使用よりもパフォーマンスの向上につながることを実証する。
論文 参考訳(メタデータ) (2022-11-11T16:37:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。