論文の概要: Active-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports
- arxiv url: http://arxiv.org/abs/2608.04682v1
- Date: Wed, 05 Aug 2026 10:50:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.829095
- Title: Active-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports
- Title(参考訳): Active-SWE: 問題のないプロアクティブバグ修正のためのベンチマークコーディングエージェント
- Authors: Haobin Li, Ping Deng, Weizhong Qian, Liang Jiang, Zhenyu Huang, Mouxing Yang, Xi Peng,
- Abstract要約: レポートガイダンスを使わずに、複数のバグを積極的に発見・修正する上で、コーディングエージェントを評価するためのベンチマークであるActive-SWEを紹介する。
本稿では,アクティブなバグ修正機能の評価を包括的に行うために,二トラック評価フレームワークを用いたタスク定式化パイプラインを提案する。
- 参考スコア(独自算出の注目度): 19.67153430373391
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Coding agents powered by large language models (LLMs) are increasingly adopted in software engineering (SWE) scenarios, capable of fixing a specific bug in large-scale codebase. However, existing SWE benchmarks typically assume that high-quality issue reports with detailed information are always available, which is easily violated in practice due to the complexity of report acquisition and curation. To address this, we introduce Active-SWE, a benchmark for evaluating coding agents on proactively discovering and fixing multiple bugs without report guidance, covering 1,663 tasks across six bug categories and eight languages. Beyond shifting the focus from existing reactive bug fixing to proactive bug fixing, Active-SWE enables a more in-depth evaluation by expanding the scope from fixing a specific recorded bug to multiple-bug fixing and potential bug discovery scenarios. To construct Active-SWE, we propose a novel difficulty-aware task formulation pipeline with a dual-track evaluation framework, facilitating comprehensive evaluation of proactive bug-fixing capability. Extensive experiments reveal that most state-of-the-art coding agents struggle with proactive bug-fixing tasks, demonstrating limited performance in locating and resolving recorded bugs, handling multiple bug fixing scenarios, and discovering valid potential bugs.
- Abstract(参考訳): 大規模言語モデル(LLM)を利用したコーディングエージェントは、ソフトウェアエンジニアリング(SWE)のシナリオで採用され、大規模なコードベースで特定のバグを修正することができるようになっている。
しかし、既存のSWEベンチマークでは、詳細な情報を持つ高品質なイシューレポートが常に利用可能であり、レポートの取得とキュレーションの複雑さのため、実際は容易に違反していると推定されている。
これを解決するために,6つのバグカテゴリと8つの言語で1,663のタスクをカバーし,複数のバグを積極的に発見し,修正する上で,コーディングエージェントを評価するベンチマークであるActive-SWEを紹介した。
Active-SWEは、既存のリアクティブバグ修正からアクティブバグ修正に焦点を移すだけでなく、特定の記録されたバグの修正から、複数のバグ修正や潜在的なバグ発見シナリオへのスコープを広げることで、より詳細な評価を可能にする。
Active-SWEを構築するために,2トラック評価フレームワークを用いた新しい困難対応タスク定式化パイプラインを提案する。
大規模な実験によると、最先端のコーディングエージェントは、積極的にバグ修正を行うタスクに苦労し、記録されたバグの特定と解決、複数のバグ修正シナリオの処理、潜在的なバグの発見において、限られたパフォーマンスを示す。
関連論文リスト
- Anchored Self-Play for Code Repair [68.0728003844994]
コード修復は言語モデル(LM)の重要な機能である
本稿では,1つのモデルを強化学習で訓練し,バグを生成して修正する__generator--fixer self-play__を提案する。
BugSourceBenchでは、セルフプレイは難しいが非現実的なバグへと向かっている。
本稿では,参照バグの生成と混合のためのコード埋め込み型類似性報酬をフィクスチャトレーニングに付加することにより,小さな参照セットでセルフプレイをアンロックするAnchored Self-Play (ASP)を提案する。
論文 参考訳(メタデータ) (2026-07-03T17:51:52Z) - TIDE: Proactive Multi-Problem Discovery via Template-Guided Iteration [74.97459526627395]
2つの補完機構を備えたテンプレート誘導反復フレームワークであるTIDEを紹介する。
我々は,すでに発見されているものを条件付けながら,ラウンド毎に少数の候補を探索する反復探索を提案する。
単一ショットと並列マルチエージェントのベースラインをタスクカバレッジ,識別,解像度で比較すると,大幅に向上した。
論文 参考訳(メタデータ) (2026-06-03T11:23:08Z) - BeyondSWE: Can Current Code Agent Survive Beyond Single-Repo Bug Fixing? [61.247730037229815]
BeyondSWEは2つの軸 – 解像度スコープと知識スコープ – に沿って既存の評価を拡張する包括的なベンチマークです。
外部知識の役割を解明するために,ディープ検索とコーディング能力を統合するフレームワークであるSearchSWEを開発した。
この作業は、現実的で挑戦的な評価ベンチマークと、より有能なコードエージェントに向けた研究を進めるための柔軟なフレームワークの両方を提供する。
論文 参考訳(メタデータ) (2026-03-03T17:52:01Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - InspectCoder: Dynamic Analysis-Enabled Self Repair through interactive LLM-Debugger Collaboration [71.18377595277018]
大きな言語モデル(LLM)は、診断が難しい複雑なロジックエラーを伴うバグの多いコードを生成することが多い。
対話型デバッガ制御による動的解析を LLM に委ねる初のエージェントプログラム修復システムである InspectCoder を提案する。
論文 参考訳(メタデータ) (2025-10-21T06:26:29Z) - BugScope: Learn to Find Bugs Like Human [9.05553442116139]
BugScopeは、人間の監査人が代表例から新しいバグパターンを学習し、コード監査中にその知識を適用する方法をエミュレートする。
BugScopeが87.04%の精度を達成したことを示す。
Linuxカーネルを含む大規模なオープンソースシステムのさらなるテストにより、これまで不明だった141のバグが明らかになった。
論文 参考訳(メタデータ) (2025-07-21T14:34:01Z) - A Deep Dive into Large Language Models for Automated Bug Localization and Repair [12.756202755547024]
大規模言語モデル(LLM)は、自動プログラム修復(APR)など、様々なソフトウェアエンジニアリングタスクにおいて顕著な効果を示している。
本研究では,LSMを用いた自動バグ修正について深く検討する。
異なるLLMを用いてバグの局所化と修正を分離することにより、多様なコンテキスト情報の効果的な統合が可能になる。
Toggleは、CodeXGLUEコード改善ベンチマークで、新しい最先端(SOTA)パフォーマンスを実現する。
論文 参考訳(メタデータ) (2024-04-17T17:48:18Z) - Auto-labelling of Bug Report using Natural Language Processing [0.0]
ルールとクエリベースのソリューションは、明確なランキングのない、潜在的な類似バグレポートの長いリストを推奨します。
本論文では,NLP手法の組み合わせによる解を提案する。
カスタムデータトランスフォーマー、ディープニューラルネットワーク、および非汎用機械学習メソッドを使用して、既存の同一バグレポートを検索する。
論文 参考訳(メタデータ) (2022-12-13T02:32:42Z) - Using Developer Discussions to Guide Fixing Bugs in Software [51.00904399653609]
我々は,タスク実行前に利用可能であり,また自然発生しているバグレポートの議論を,開発者による追加情報の必要性を回避して利用することを提案する。
このような議論から派生したさまざまな自然言語コンテキストがバグ修正に役立ち、オラクルのバグ修正コミットに対応するコミットメッセージの使用よりもパフォーマンスの向上につながることを実証する。
論文 参考訳(メタデータ) (2022-11-11T16:37:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。