論文の概要: ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports
- arxiv url: http://arxiv.org/abs/2607.09123v1
- Date: Fri, 10 Jul 2026 06:25:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.799149
- Title: ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports
- Title(参考訳): ReProAgent: 課題報告からのバグ再現テストの多段階エージェント生成ツール
- Abstract要約: ReProAgentはイシューレポートから再生テストを生成するフレームワークである。
タスクを、バグローカライゼーション、ルート原因分析、テスト計画、テスト生成の4つのエージェントステージに分解する。
SWT-bench-liteとSWT-bench-verifiedの実験により、ReProAgentは58.43%と70.30%の問題を再現した。
- 参考スコア(独自算出の注目度): 27.433981940933688
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reproduction tests help developers confirm reported issues and provide executable feedback for issue resolution, yet issue reports in open-source projects rarely include such tests. Recent studies have explored generating issue reproduction tests from issue reports with large language models, but existing approaches largely rely on prompt-based pipelines that retrieve textual context and generate tests. This limits their ability to understand how reported issues behave in repository-scale codebases and to flexibly organize the construction of reproduction tests. In this paper, we propose ReProAgent, a multi-stage agent framework for reproduction test generation from issue reports. ReProAgent decomposes the task into four agent stages: bug localization, root cause analysis, test planning, and test generation. To support these stages, ReProAgent integrates task-specific tools for task decomposition and reflection, context retrieval from both textual sources and repository graphs, and runtime interaction with the execution environment. Experiments on SWT-bench-lite and SWT-bench-verified show that ReProAgent successfully reproduces 58.43% and 70.30% of issues, outperforming all baselines, with an average cost of $0.14 per instance. For example, when equipped with GPT-5-mini, ReProAgent exceeds OpenHands with the same backbone by 20.43 and 7.90 percentage points, respectively. ReProAgent also generalizes across multiple backbone LLMs and improves downstream issue resolution performance when integrated with existing repair approaches.
- Abstract(参考訳): 再現テストは、報告された問題を確認し、イシュー解決のための実行可能なフィードバックを提供するのに役立つが、オープンソースプロジェクトのイシューレポートにはそのようなテストが含まれることはめったにない。
最近の研究では、大きな言語モデルを用いた問題レポートから問題再現テストを生成する方法が検討されているが、既存のアプローチは、テキストコンテキストを検索してテストを生成するプロンプトベースのパイプラインに大きく依存している。
これにより、レポートされた問題がリポジトリスケールのコードベースでどのように振る舞うかを理解し、再生テストの構築を柔軟に整理する能力が制限される。
本稿では,課題報告からの再現テスト生成のための多段階エージェントフレームワークReProAgentを提案する。
ReProAgentはタスクを、バグローカライゼーション、ルート原因分析、テスト計画、テスト生成という4つのエージェントステージに分解する。
これらのステージをサポートするためにReProAgentは、タスクの分解とリフレクション、テキストソースとリポジトリグラフの両方からのコンテキスト検索、実行環境とのランタイムインタラクションのためのタスク固有のツールを統合する。
SWT-bench-liteとSWT-bench-verifiedの実験により、ReProAgentは58.43%と70.30%の問題を再現し、全てのベースラインを上回り、インスタンス当たりの平均コストは0.14ドルであった。
例えば、GPT-5-miniを搭載している場合、ReProAgentは、それぞれ同じバックボーンを持つOpenHandsを20.43と7.90のパーセンテージで上回っている。
ReProAgentはまた、複数のバックボーンLLMをまたいで一般化し、既存の修復アプローチに統合された場合、ダウンストリームのイシュー解決性能を改善する。
関連論文リスト
- ExecCritic: Learn to Test, Test to Improve for Coding Agents [68.42713285082912]
実行時のフィードバックは、コーディングエージェントを正しいリポジトリの修復に導くことができますが、テストが問題によって要求された振る舞いをキャプチャした場合のみです。
ExecCriticを導入し、テスト-検証-修正足場と、その中のトレーニングエージェントのためのロール固有の強化学習レシピを組み合わせる。
テストエージェントが独立してリポジトリネイティブなテストを生成し、フェイルクローズされたハーネスがそれらを調整して凍結し、リカバリエージェントがテストを変更することなく、ソースコードを実行フィードバックから修正する。
論文 参考訳(メタデータ) (2026-09-08T17:53:37Z) - RefactorPlatform: An Open-Source Harness for Controlled Evaluation of Repository-Scale Refactoring Agents [0.09320657506524148]
RefactorPlatformは、環境を固定し、各設計軸を変化させるオープンソースの評価ハーネスである。
各実行は、ライブ端末ストリーミング、トークン、差分、およびトランスクリプトのタスクごとのロギング、ASTベースの検証、監査と再生のためのエクスポート可能なテレメトリを備えた、独立したワークスペースで実行される。
論文 参考訳(メタデータ) (2026-09-04T08:58:10Z) - SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents [63.65682461568621]
ソフトウェアエンジニアリングエージェントのためのリポジトリレベルのベンチマークであるSWE-Gateを導入し、機能的正当性とともにレビュー制約コンプライアンスを明示的に評価する。
SWE-Gateは、実際のプルリクエストレビューコメントからレビュー制約を導き、これらの制約に関するリポジトリレベルの修復インスタンスを合成する。
各インスタンスは、非準拠およびゴールドパッチとともに、機能テストと制約テストの分離を提供し、イシュー解決能力とレビュー制約コンプライアンスの明確な分離を可能にする。
論文 参考訳(メタデータ) (2026-09-03T17:53:34Z) - AgentRewind: Recoverable Execution for Long-Horizon LLM Agents [32.44158037765297]
我々は,エージェントコンテキストと制御環境の整列チェックポイントを記録するランタイムリカバリフレームワークであるAgentRewindを紹介する。
また,タスク完了と長期工学的課題の部分的進捗を評価するベンチマークであるMettleBenchを構築した。
論文 参考訳(メタデータ) (2026-08-14T15:20:35Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues [54.98461672730087]
ReproRepoは、人為的なGitHub問題を活用するスケーラブルな評価フレームワークで、現実的な再現ブロッカーを自然に監視する。
ReproRepoは、大規模なカンファレンスから1,149件の機械学習論文をインスタンス化し、4つのフロンティアモデルエージェント構成を評価します。
その結果, LLMエージェントは, コードを実行せずにも, 紙とリポジトリのペアから多くの実世界の問題を識別できることがわかった。
論文 参考訳(メタデータ) (2026-06-16T17:58:05Z) - DeployBench: Benchmarking LLM Agents for Research Artifact Deployment [21.93024846646044]
LLMエージェントは、ソフトウェア工学とML研究のタスクを急速に進歩させてきたが、これらの進歩は、しばしば動作可能な実行可能な環境へのアクセスを前提としている。
既存の環境設定ベンチマークは、研究成果物の配置の全範囲をカバーしていない。
我々は、AI/ML、コンピュータシステム、科学計算にまたがる51の研究成果デプロイメントタスクのベンチマークであるDeployBenchを紹介する。
論文 参考訳(メタデータ) (2026-06-03T04:59:34Z) - RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations [51.43574078961796]
本稿では,SWE-Bench Verified上に構築された2段階評価スイートRepoMirageを紹介する。
RepoMirage-Perturbは、リポジトリレベルの摂動を保存する3つのタイプのセマンティクスを適用している。
RepoAnchorは、下流の問題解決からリポジトリの探索を分離する構造第一のプロトタイプワークフローである。
論文 参考訳(メタデータ) (2026-05-25T06:26:43Z) - HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks [3.958773019872771]
既存のベンチマークは主に、孤立したコンポーネントレベルのタスクでLarge Language Models (LLM)を評価する。
HWE-Benchは,LLMエージェントを現実のハードウェアバグ修正タスクで評価するための,最初の大規模リポジトリレベルのベンチマークである。
論文 参考訳(メタデータ) (2026-04-16T07:19:34Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - TestExplora: Benchmarking LLMs for Proactive Bug Discovery via Repository-Level Test Generation [19.43198506241428]
提案するTestExploraは,大規模言語モデルを積極的なテスタとして評価するためのベンチマークである。
TestExploraには482リポジトリから2,389のタスクが含まれており、すべての欠陥関連信号を隠している。
現状のモデルでは、F2P(Fail-to-Pass)の最大率は16.06%である。
論文 参考訳(メタデータ) (2026-02-11T03:22:51Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Where LLM Agents Fail and How They can Learn From Failures [62.196870049524364]
大規模言語モデル(LLM)エージェントは、複雑なマルチステップタスクの解決において有望であることを示す。
単一ルート原因エラーがその後の決定を通じて伝播する、障害のカスケードに対する脆弱性を増幅する。
現在のシステムは、モジュール的で体系的な方法でエージェントエラーを包括的に理解できるフレームワークを欠いている。
AgentErrorTaxonomyは、メモリ、リフレクション、計画、アクション、システムレベルの操作にまたがる障害モードのモジュール分類である。
論文 参考訳(メタデータ) (2025-09-29T18:20:27Z) - A Unified Debugging Approach via LLM-Based Multi-Agent Synergy [39.11825182386288]
FixAgentはマルチエージェントのシナジーによる統合デバッグのためのエンドツーエンドフレームワークである。
1.25$times$ 2.56$times$レポレベルのベンチマークであるDefects4Jのバグを修正した。
論文 参考訳(メタデータ) (2024-04-26T04:55:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。