論文の概要: SWE-Doctor: Guiding Software Engineering Agents with Runtime Diagnosis from Multi-Faceted Bug Reproduction Tests
- arxiv url: http://arxiv.org/abs/2607.00990v1
- Date: Wed, 01 Jul 2026 14:27:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.93469
- Title: SWE-Doctor: Guiding Software Engineering Agents with Runtime Diagnosis from Multi-Faceted Bug Reproduction Tests
- Title(参考訳): SWE-Doctor:多面的バグ再現テストから実行時診断によるソフトウェアエンジニアリングエージェントの誘導
- Authors: Yaoqi Guo, Yang Liu, Jie M. Zhang, Yun Ma, Yiling Lou, Zhenpeng Chen,
- Abstract要約: SWE-Doctorは,多面的BRT実行から生じるランタイム診断を用いて,パッチ生成をガイドするソフトウェア問題解決エージェントである。
SWE-Doctorは10のLLM-ベンチマークの組み合わせで既存のエージェントを一貫して上回っている。
- 参考スコア(独自算出の注目度): 18.192718828200782
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM)-based software engineering agents are increasingly developed to resolve software issues by generating patches from issue reports and code repositories. Bug reproduction tests (BRTs) are an important building block for such agents and have been shown useful for patch validation. However, it remains unclear whether BRTs can also help the more central stage of patch generation. We first conduct a preliminary study and find that directly using advanced BRT generators to guide patch generation is not beneficial: fail-to-fail BRTs can mislead agents, while even fail-to-pass BRTs bring limited or negative gains. Our analysis reveals two reasons: fail-to-pass BRTs may cover only one manifestation of the reported issue, leading to partial patches, whereas fail-to-fail BRTs are unreliable as direct patch-generation targets. Motivated by these insights, we propose SWE-Doctor, a software issue resolution agent that guides patch generation with runtime diagnoses derived from multi-faceted BRT executions. SWE-Doctor first generates multi-faceted BRTs for different behavioral requirements stated in the issue, then executes and debugs these BRTs to construct runtime-grounded diagnosis records, and finally uses the diagnoses together with localization information inferred during BRT generation to guide patch generation and reduce partial patches. We evaluate SWE-Doctor on Python bug-fixing issues from the widely adopted SWE-bench Verified and SWE-bench Pro across five LLM backends. SWE-Doctor consistently outperforms existing agents across all 10 LLM-benchmark combinations, achieving average resolution rates of 75.7% on SWE-bench Verified and 59.4% on SWE-bench Pro. In particular, on the more challenging SWE-bench Pro, SWE-Doctor improves the average resolution rate by 8.0-8.9 percentage points over the baseline agents.
- Abstract(参考訳): 大きな言語モデル(LLM)ベースのソフトウェアエンジニアリングエージェントは、問題レポートやコードリポジトリからパッチを生成することで、ソフトウェア問題を解決するためにますます開発されている。
バグ再現テスト(BRT)はそのようなエージェントにとって重要なビルディングブロックであり、パッチ検証に有用であることが示されている。
しかし、BRTがパッチ生成のより中心的な段階にも役立つかどうかは不明だ。
フェール・トゥ・フェイルBRTはエージェントを誤解させることがあるが、フェール・トゥ・パスBRTでさえ制限あるいは負の利得をもたらす。
フェール・ツー・パスのBRTは、報告された問題の1つだけをカバーし、部分的なパッチにつながるが、フェール・ツー・パスのBRTは、直接的なパッチ生成ターゲットとして信頼できない。
これらの知見に触発されたソフトウェア問題解決エージェントであるSWE-Doctorを提案する。
SWE-Doctorはまず、問題に記載されているさまざまな動作要件に対する多面的BRTを生成し、その後、ランタイム基底診断レコードの構築のためにこれらのBRTを実行およびデバッグし、最終的に、BRT生成時に推測される局所化情報とともに診断を使い、パッチ生成をガイドし、部分パッチを減らす。
5つのLLMバックエンドで広く採用されているSWE-bench VerifiedとSWE-bench Proから,Pythonのバグフィックス問題に対するSWE-Doctorの評価を行った。
SWE-Doctorは、SWE-bench Verifiedで75.7%、SWE-bench Proで59.4%の平均解像度を達成し、既存のエージェントよりも一貫して優れている。
特に、より難しいSWE-bench Proでは、SWE-Doctorはベースラインエージェントよりも平均解像度率を8.0-8.9ポイント改善する。
関連論文リスト
- From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents [56.31499185764872]
教師の長い軌道上の監督された微調整(SFT)は、オープンソフトウェアエンジニアリング(SWE)エージェントに調査と推論を浸透させる主要な方法である。
本稿では,P2T (Patches-to-Trajectories) を提案する。P2T (Patches-to-Trajectories) は,P2T (Patches-to-Trajectories) において,P2T (Patches-to-Trajectories) とP2T (Patches-to-Trajectories) の2つの最適化法である。
論文 参考訳(メタデータ) (2026-05-21T04:54:55Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - Dynamic Cogeneration of Bug Reproduction Test in Agentic Program Repair [4.994693185232122]
バグ再現テスト(BRT)は多くのエージェント自動プログラム修復(APR)システムで使用されている。
実際には、開発者がパッチを提出すると、しばしば修正と一緒にBRTを実装します。
コージェネレーションにより、APRエージェントは専用のBRTエージェントと同じくらい多くのバグに対してBRTを生成することができる。
論文 参考訳(メタデータ) (2026-01-27T01:02:57Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - TDFlow: Agentic Workflows for Test Driven Software Engineering [9.028820294564566]
TDFlowは、テスト解決タスクとして、リポジトリスケールのソフトウェアエンジニアリングをフレーム化します。
SWE-Bench LiteにおけるTDFlowのパスレートは88.8%である。
人間の開発者がテストを書くTDFlowを利用した人間-LLMインタラクティブシステムを提案する。
論文 参考訳(メタデータ) (2025-10-27T18:44:59Z) - Where LLM Agents Fail and How They can Learn From Failures [62.196870049524364]
大規模言語モデル(LLM)エージェントは、複雑なマルチステップタスクの解決において有望であることを示す。
単一ルート原因エラーがその後の決定を通じて伝播する、障害のカスケードに対する脆弱性を増幅する。
現在のシステムは、モジュール的で体系的な方法でエージェントエラーを包括的に理解できるフレームワークを欠いている。
AgentErrorTaxonomyは、メモリ、リフレクション、計画、アクション、システムレベルの操作にまたがる障害モードのモジュール分類である。
論文 参考訳(メタデータ) (2025-09-29T18:20:27Z) - Agentic Bug Reproduction for Effective Automated Program Repair at Google [9.64193881099048]
本稿では,業界,特にGoogleにおけるBRTの自動生成について検討する。
我々は、最先端のBRT生成技術であるLIBROを適応し、評価し、エージェントベースのアプローチであるBRT Agentを提示する。
以上の結果から,APRシステムにBRTを提供することで,バグが30%増えることが判明した。
論文 参考訳(メタデータ) (2025-02-03T20:57:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。