論文の概要: What Makes a Good Bug Report for an AI Agent?
- arxiv url: http://arxiv.org/abs/2607.07593v1
- Date: Wed, 08 Jul 2026 16:13:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.456387
- Title: What Makes a Good Bug Report for an AI Agent?
- Title(参考訳): AIエージェントにとって良いバグレポートは何か?
- Abstract要約: エージェントのための良いバグレポートは、重複するが、人間にとって良い報告ではない。
修正提案、複製スクリプト、リポジトリのソースコード、ローカライゼーション情報は、高い解像度の確率に関連付けられている。
人間の読者にとって長年強調されてきたいくつかの特質、例えば、自然言語のステップで読みやすい記述を再現し、より少ない成功にはほとんど寄与しないか、あるいは相関している。
- 参考スコア(独自算出の注目度): 8.139494830308486
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Automated program repair (APR) agents are transitioning from research benchmarks to developer workflows, yet they still begin with bug reports written for human developers. While decades of research have established what makes a good bug report for humans (e.g., steps to reproduce, stack traces), it remains unclear whether these features transfer to LLM-based agents. We study this question in two analyses. First, we use statistical modeling to examine associations between 27 bug-report features and repair success across 433 SWE-bench Verified issues attempted by 87 repair agents. We find that fix suggestions, reproduction scripts, repository source code, and localization info are associated with higher resolution likelihood, while longer reports are associated with lower odds. Second, we conduct controlled ablations across 2 models and 17 problem-statement mutations on SWE-bench Pro, varying the information available to an agent while holding the underlying task fixed. We remove or isolate selected bug-report content, delete fault-localization cues, and test structural changes that flatten lists or remove section headers. We find that both models depend on localization cues and expected behavior, and that structural changes alone can reduce solve rates, even without removing any content. The two models diverge in how they handle missing information: Qwen searches more widely and can exhaust its turn budget, while Gemma commits to a plausible interpretation early and patches on it. Our findings indicate that a good bug report for an agent overlaps with, but is not identical to, a good report for a human: agents benefit most from concrete, executable, and well-localized information, whereas some qualities long emphasized for human readers, such as natural language steps to reproduce and readable descriptions, contribute little or even correlate with lower success.
- Abstract(参考訳): 自動プログラム修復(APR)エージェントは、研究ベンチマークから開発者ワークフローへ移行している。
何十年にもわたって、人間の優れたバグレポート(例えば、複製する手順、スタックトレース)が確立されてきたが、これらの特徴がLSMベースのエージェントに移行するかどうかは不明だ。
我々はこの問題を2つの分析で研究する。
まず, 統計モデルを用いて, 27個のバグ報告の特徴と433個のSWEベンチにおける修復成功の関係を検証し, 87個の修復エージェントによる検証を行った。
修正提案,複製スクリプト,リポジトリソースコード,ローカライゼーション情報は高い解像度で関連付けられているのに対して,より長いレポートは低い確率で関連していることがわかった。
第2に、SWE-bench Pro上の2つのモデルと17の問題ステートメント変異に対して制御された改善を行い、基礎となるタスクを固定しながらエージェントに利用可能な情報を変化させる。
選択したバグレポートの内容の削除、フォールトローカライゼーションのキューの削除、リストのフラット化やセクションヘッダの削除といった構造的変更のテストを行います。
いずれのモデルも、局所化キューと期待される振る舞いに依存しており、構造的変化だけでは、コンテンツを削除することなく、解決率を低下させることができる。
Qwenはより広く検索し、ターン予算を浪費することができる。
本研究の結果から, エージェントのバグレポートは, 具体的, 実行可能, かつ, かつ, 局所的な情報から得られる, エージェントのバグレポートと重複するが, 同一ではないことが示唆された。
関連論文リスト
- Who is the Agent to Blame? Localizing Faithfulness and Citation Mistakes in Agentic Deep Research [75.8770212601511]
ディープリサーチ(DR)システムは、Webから情報を検索して合成する複数のエージェントを編成することで、長い形式の引用レポートを生成する。
循環はこれらの報告の忠実さを評価するための主要なメカニズムであるが、現在のDRシステムでは引用のリコールが不十分である。
そこで本稿では,エージェントが各エラーをローカルにテストすることで,各エラーをピンポイントで検出する手法を提案する。
論文 参考訳(メタデータ) (2026-08-25T09:34:18Z) - Semantic Drift in Bug Resolution: How Behavioral Signals Propagate from Reports to Tests and Patches [18.727291516223115]
Desc2Fixは、バグレポートのセマンティックアライメント、テストのトリガー、開発者による修正を測定するフレームワークである。
GPT-4o と DeepSeek-Chat を用いて,Defects4J と SWT-Bench の2,857 個のレポート・パッチを解析した。
論文 参考訳(メタデータ) (2026-07-20T22:32:23Z) - Understanding Agent-Reactive Bugs at the Model-Harness Boundary: An Empirical Study of LLM Agent Issue Reports [9.560342483305371]
この研究は、エージェント反応性(AR)バグに焦点を当てた最初の実証的研究である。
以上の結果から,多くのARバグが精査された検針なしでサイレントエラーとして現れることが明らかとなった。
これらの発見は、ユーザーと開発者がARバグの根本原因と解決を理解するのに役立つメカニズムの必要性を示している。
論文 参考訳(メタデータ) (2026-07-17T06:53:31Z) - Writing Bug Reports for Software Repair Agents: What Information Matters Most? [45.10027008889631]
バグレポートのエージェント対応について検討する。
バグレポートを表す441の課題に注目します。
その結果,エージェントファーストレポートは,エージェントの検索・修理スペースを狭める情報から最も恩恵を受けることが示唆された。
論文 参考訳(メタデータ) (2026-07-10T16:00:57Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - TRAJEVAL: Decomposing Code Agent Trajectories for Fine-Grained Diagnosis [23.834704102474927]
コードエージェントはGitHubの問題を解決することができるが、失敗した場合、現在の評価は場所や理由を可視化しない。
本稿では,エージェントトラジェクトリを3つの解釈段階に分解する診断フレームワークTRAJEVALを紹介する。
我々はこれらの診断が予測可能であることを確認し、0.87-2.1% MAEでモデルレベルのPass@1予測を達成する。
論文 参考訳(メタデータ) (2026-03-25T05:27:03Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - BugPilot: Complex Bug Generation for Efficient Learning of SWE Skills [59.003563837981886]
高品質なバグは、次世代の言語モデルベースソフトウェアエンジニアリング(SWE)エージェントをトレーニングする鍵となる。
難易度および多種多様なバグを合成する新しい方法を提案する。
論文 参考訳(メタデータ) (2025-10-22T17:58:56Z) - Where LLM Agents Fail and How They can Learn From Failures [62.196870049524364]
大規模言語モデル(LLM)エージェントは、複雑なマルチステップタスクの解決において有望であることを示す。
単一ルート原因エラーがその後の決定を通じて伝播する、障害のカスケードに対する脆弱性を増幅する。
現在のシステムは、モジュール的で体系的な方法でエージェントエラーを包括的に理解できるフレームワークを欠いている。
AgentErrorTaxonomyは、メモリ、リフレクション、計画、アクション、システムレベルの操作にまたがる障害モードのモジュール分類である。
論文 参考訳(メタデータ) (2025-09-29T18:20:27Z) - Evaluating Agent-based Program Repair at Google [9.62742759337993]
エージェントベースのプログラム修復は、複雑なバグをエンドツーエンドで自動的に解決する。
最近の研究は、人気のあるオープンソースSWE-Benchにおけるエージェントベースの修復アプローチの使用について検討している。
本稿では,企業コンテキストにおけるバグに対処するためのエージェント的アプローチの適用可能性について検討する。
論文 参考訳(メタデータ) (2025-01-13T18:09:25Z) - SEDAC: A CVAE-Based Data Augmentation Method for Security Bug Report
Identification [0.0]
現実の世界では、セキュリティバグ報告の割合は極めて低い。
SEDACは、同様のバグレポートベクターを生成する新しいSBR識別方法である。
g測定の基準線は14.24%から50.10%の改善で上回っている。
論文 参考訳(メタデータ) (2024-01-22T15:53:52Z) - Auto-labelling of Bug Report using Natural Language Processing [0.0]
ルールとクエリベースのソリューションは、明確なランキングのない、潜在的な類似バグレポートの長いリストを推奨します。
本論文では,NLP手法の組み合わせによる解を提案する。
カスタムデータトランスフォーマー、ディープニューラルネットワーク、および非汎用機械学習メソッドを使用して、既存の同一バグレポートを検索する。
論文 参考訳(メタデータ) (2022-12-13T02:32:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。