論文の概要: Beyond Fail-to-Pass: Iterative Hardening of Co-Generated Bug Reproduction Tests and Fixes
- arxiv url: http://arxiv.org/abs/2607.19843v1
- Date: Wed, 22 Jul 2026 07:30:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.013032
- Title: Beyond Fail-to-Pass: Iterative Hardening of Co-Generated Bug Reproduction Tests and Fixes
- Title(参考訳): Fail-to-Passを超えて: 共同生成したバグ再現テストと修正の反復的硬化
- Authors: Yuhao Tan, Zhibang Yang, Fangkai Yang, Yuan Yao, Yu Kang, Lu Wang, Pu Zhao, Xin Zhang, Xiaoxing Ma, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang,
- Abstract要約: 大規模言語モデル(LLM)は、現実のバグに対して、プログラムの自動修正をますます実用的にしている。
バグ再現テスト(BRT)は、バグレポートを実行可能なバグ固有の信号に変換することで、このギャップを埋めるのに役立つ。
本稿では,ループ内収束基準としてLax信号を用いるコジェネレーションフレームワークであるCoHardenを提案する。
- 参考スコア(独自算出の注目度): 55.114939648705395
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) have made automated program repair (APR) increasingly practical for real-world bugs, but repairing directly from bug reports remains underconstrained. Bug reproduction tests (BRTs) help close this gap by turning a bug report into an executable, bug-specific signal that can guide repair and validate candidate patches. Existing work has therefore studied BRT generation as a core subproblem in APR and mainly evaluates a generated BRT using the fail-to-pass (F->P) criterion, which requires the test to fail on the buggy code but pass on the golden fix. We show that F->P alone is insufficient when the goal of a BRT is to improve downstream repair. In particular, some F->P BRTs are lax, reproducing the observed symptom yet still admitting plausible-but-incorrect patches. We formalize this missing quality dimension by separating F->P BRTs into rigorous and lax ones, and show empirically that only the former consistently improve repair success. We further find that co-generation introduces test--fix error coupling, where the in-trajectory fail-to-pass (F->P) check can pass even when both the generated patch and generated test are wrong. Based on these findings, we propose CoHarden, a co-generation framework that uses the Lax signal as an in-loop convergence criterion. CoHarden first generates a test before any fix, then iteratively hardens the test and fix against surviving mutation patches until the generated test no longer admits Lax regressions. Experiments show that CoHarden reaches 69.4% Resolved and 78.9% F->P on SWE-bench Verified, outperforming the strongest fix-only and cogeneration baselines by +9.6 and +7.9 percentage points in Resolved, respectively, with consistent gains across LLM backbones and benchmarks.
- Abstract(参考訳): 大規模言語モデル(LLM)は、現実のバグに対して、APR(Automatic Program repair)をますます実用的にしている。
バグ再現テスト(BRT)は、バグレポートを実行可能なバグ固有の信号に変換し、修正をガイドし、候補パッチを検証することで、このギャップを埋める。
既存の研究は、APRのコアサブプロブレムとしてBRT生成を研究し、主にフェール・ツー・パス(F->P)基準を用いて生成されたBRTを評価する。
BRTの目的が下流補修の改善である場合,F->P単独では不十分であることを示す。
特に,いくつかのF->P BRTはLaxであり,観察された症状を再現するが,もっとも不正確なパッチは認めない。
我々は、F->P BRTを厳格かつラックスに分離することにより、この欠落した品質次元を定式化し、前者のみが一貫して修理成功を改善することを実証的に示す。
さらに、コジェネレーションがテスト修正エラー結合を導入し、生成されたパッチと生成されたテストの両方が間違っている場合でも、軌道内フェール・トゥ・パス(F->P)チェックが通過可能であることを確認した。
これらの知見に基づいて、ループ内収束基準としてLax信号を用いるコジェネレーションフレームワークであるCoHardenを提案する。
CoHardenは、最初に何らかの修正の前にテストを生成し、その後反復的にテストを強化し、生成されたテストがLax回帰を認めなくなるまで、生き残った突然変異のパッチに対して修正する。
実験の結果、CoHardenは69.4%のリゾルトと78.9%のF->PをSWE-bench Verifiedで達成し、LLMバックボーンとベンチマークでそれぞれ+9.6と+7.9の差で最強の修正のみとコージェネレーションベースラインを上回った。
関連論文リスト
- AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents [83.37969790806069]
LLMエージェントのエラーは、エラーが表面化するステップが原因ではないことが多いため、デバッグが難しい。
Agent DebuggerXはオープンソースのフレームワークで、デバッグをDe Detect, Attribute, Recover, Rerunのクローズドループとして整理する。
コアとなるDeep Debuggerは、グローバルな軌跡理解を通じてマルチターン根本原因診断を行う。
論文 参考訳(メタデータ) (2026-07-21T06:21:13Z) - SWE-Doctor: Guiding Software Engineering Agents with Runtime Diagnosis from Multi-Faceted Bug Reproduction Tests [18.192718828200782]
SWE-Doctorは,多面的BRT実行から生じるランタイム診断を用いて,パッチ生成をガイドするソフトウェア問題解決エージェントである。
SWE-Doctorは10のLLM-ベンチマークの組み合わせで既存のエージェントを一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-01T14:27:12Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All [57.23434868678603]
Live-kBenchは、新たに発見されたカーネルバグのエージェントをスクラップし、評価するセルフ進化ベンチマークの評価フレームワークである。
kEnvは、カーネルのコンパイル、実行、フィードバックのためのエージェントに依存しないクラッシュ解決環境である。
kEnvを用いて3つの最先端エージェントをベンチマークし、最初の試行で74%のクラッシュを解決したことを示す。
論文 参考訳(メタデータ) (2026-02-02T19:06:15Z) - Dynamic Cogeneration of Bug Reproduction Test in Agentic Program Repair [4.994693185232122]
バグ再現テスト(BRT)は多くのエージェント自動プログラム修復(APR)システムで使用されている。
実際には、開発者がパッチを提出すると、しばしば修正と一緒にBRTを実装します。
コージェネレーションにより、APRエージェントは専用のBRTエージェントと同じくらい多くのバグに対してBRTを生成することができる。
論文 参考訳(メタデータ) (2026-01-27T01:02:57Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Repair-R1: Better Test Before Repair [2.982543556561469]
APRは、自動的にプログラム欠陥を特定し、パッチを生成し、修復を検証することを目的としている。
現在のAPRメソッドは、推論段階でのみテストケースを使用するのが一般的である。
本稿では,モデルのトレーニングフェーズにテストケースを導入し,修正に先立ってテスト生成をシフトするリファレンス-R1を提案する。
論文 参考訳(メタデータ) (2025-07-30T17:24:05Z) - Agentic Bug Reproduction for Effective Automated Program Repair at Google [9.64193881099048]
本稿では,業界,特にGoogleにおけるBRTの自動生成について検討する。
我々は、最先端のBRT生成技術であるLIBROを適応し、評価し、エージェントベースのアプローチであるBRT Agentを提示する。
以上の結果から,APRシステムにBRTを提供することで,バグが30%増えることが判明した。
論文 参考訳(メタデータ) (2025-02-03T20:57:17Z) - RAP-Gen: Retrieval-Augmented Patch Generation with CodeT5 for Automatic
Program Repair [75.40584530380589]
新たな検索型パッチ生成フレームワーク(RAP-Gen)を提案する。
RAP-Gen 以前のバグ修正ペアのリストから取得した関連する修正パターンを明示的に活用する。
RAP-GenをJavaScriptのTFixベンチマークとJavaのCode RefinementとDefects4Jベンチマークの2つのプログラミング言語で評価する。
論文 参考訳(メタデータ) (2023-09-12T08:52:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。