論文の概要: Coding Agents Don't Know When to Act
- arxiv url: http://arxiv.org/abs/2605.07769v1
- Date: Fri, 08 May 2026 14:10:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 19:43:39.099724
- Title: Coding Agents Don't Know When to Act
- Title(参考訳): コーディングエージェントはいつ行動すべきかわからない
- Abstract要約: コーディングエージェントは、ソフトウェアを自律的にメンテナンスするためにますますデプロイされる。
現実のデプロイメントでは、すでに解決済みの問題に関するバグレポートに遭遇します。
最先端のモデルでさえ失敗し、35ドルから65%のケースで望ましくない変更を提案する。
- 参考スコア(独自算出の注目度): 3.2610504259514754
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Coding agents are increasingly deployed to autonomously maintain software, including to resolve user-reported issues: a bug report comes in and the agent creates a patch to address it. However, in any real-world deployment, they will encounter stale bug reports about issues that have already been resolved. Agents should recognize this and abstain from modifying the code to avoid accumulating technical debt. To systematically evaluate whether current agents do so, we introduce FixedBench, a code benchmark with 200 human-verified coding tasks in which no code changes are required, testing five recent models across four agent harnesses. We find that even state-of-the-art models fail, proposing undesirable changes (excluding tests and documentation) in $35$ to $65\%$ of cases. Explicit instructions to reproduce the issue before patching partially address this issue but introduce a new failure mode: when an issue is partially fixed, they abstain even though a patch would still be needed. More broadly, our results indicate that LLMs fall prey to an action bias: they choose to act even if inaction would be appropriate. To break this pattern, inaction needs to be explicitly framed as a path to success, which highlights an overreliance on human guidance implicit in current training objectives.
- Abstract(参考訳): コーディングエージェントは、ユーザ報告された問題の解決を含む、ソフトウェアを自律的にメンテナンスするために、ますますデプロイされる。
しかし、実際のデプロイでは、すでに解決済みの問題に関する古いバグレポートに遭遇する。
エージェントはこれを認識し、技術的負債の蓄積を避けるためにコードの変更を控えるべきです。
現在のエージェントがそうであるかどうかを体系的に評価するために、FixedBenchを紹介した。
最先端モデルでさえ失敗し、望ましくない変更(テストとドキュメントを除く)を35ドルから65ドル%のケースで提案しています。
パッチが部分的に問題に対処する前に問題を再現する命令を明示するが、新しい障害モードを導入する。
より広範に、我々の結果はLSMが行動バイアスに陥り、不作用が適切であっても行動を選択することを示唆している。
このパターンを破るためには、不アクションを成功への道として明示的にフレーム化する必要がある。
関連論文リスト
- TRIM: Reducing AI-Generated CodeSlop via Agent Trajectory Minimization [57.14479960309637]
コーディングエージェントは、多くの下流タスクでコード生成を加速するためにますます使われています。
その価値にもかかわらず、エージェント生成コードは、対応する人間による実装よりも大きく、冗長である傾向がある。
原因はエージェント自身の検索プロセスにあることを示す。
論文 参考訳(メタデータ) (2026-07-20T17:06:19Z) - Writing Bug Reports for Software Repair Agents: What Information Matters Most? [45.10027008889631]
バグレポートのエージェント対応について検討する。
バグレポートを表す441の課題に注目します。
その結果,エージェントファーストレポートは,エージェントの検索・修理スペースを狭める情報から最も恩恵を受けることが示唆された。
論文 参考訳(メタデータ) (2026-07-10T16:00:57Z) - Is Agent Code Less Maintainable Than Human Code? [17.226150835020146]
保守環境において,エージェントコードがヒューマンコードとどのように比較されるかを検討する。
エージェントは人的コードに比べてエージェントコード構築時のタスクの解決に効果が低いことがわかった。
論文 参考訳(メタデータ) (2026-06-19T23:56:14Z) - Understanding the Rejection of Fixes Generated by Agentic Pull Requests -- Insights from the AIDev Dataset [0.0]
コパイロット、デビン、カーソル、クロードの修正案の46.41%が拒絶されていることが判明した。
本稿の目的は、AIエージェントを効率的なチームメイトとして統合するための重要な理解である、AIエージェントの障害モードを理解することです。
論文 参考訳(メタデータ) (2026-06-11T15:19:36Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - Red Teaming Program Repair Agents: When Correct Patches can Hide Vulnerabilities [22.02073334787359]
本稿では,APRエージェントが機能的正確かつ脆弱なパッチを生成するために,逆問題文を生成するSWExploitを提案する。
評価に基づいて、すべてのテストに合格するパッチが本質的に信頼性と安全性を持つという従来の仮定に初めて挑戦します。
論文 参考訳(メタデータ) (2025-09-30T07:38:57Z) - Can Agents Fix Agent Issues? [15.50260831159089]
LLMベースのエージェントシステムは、新しいソフトウェアパラダイムとして登場し、医学、ロボティクス、プログラミングといった様々な領域で広く採用されている。
これらのシステムを維持するには、バグが必然的に発生し、外部の要求に合うように継続的に進化するため、かなりの努力が必要です。
最近のソフトウェア工学(SE)エージェントは、従来のソフトウェアシステムにおける問題に対処することを約束しているが、エージェントシステムにおける現実の問題がどの程度効果的に解決できるかは不明だ。
論文 参考訳(メタデータ) (2025-05-27T05:45:03Z) - Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent Systems [50.29939179830491]
LLMマルチエージェントシステムにおける障害帰属は、まだ調査が過小評価されており、労働集約的である。
本稿では,3つの自動故障帰属手法の開発と評価を行い,その欠点と欠点を要約する。
最良の方法は、障害に応答するエージェントを特定する際に53.5%の精度を達成するが、故障の特定には14.2%しか役に立たない。
論文 参考訳(メタデータ) (2025-04-30T23:09:44Z) - Evaluating Software Development Agents: Patch Patterns, Code Quality, and Issue Complexity in Real-World GitHub Scenarios [13.949319911378826]
この調査は、500の現実のGitHubイシューで上位10のエージェントから4,892のパッチを評価した。
一人のエージェントが支配的であり、170の問題が未解決であり、改善の余地があった。
ほとんどのエージェントはコードの信頼性とセキュリティを維持し、新しいバグや脆弱性を避けた。
一部のエージェントはコードの複雑さを増し、多くの重複を減らし、コードの臭いを最小限にした。
論文 参考訳(メタデータ) (2024-10-16T11:33:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。