論文の概要: Who Finishes the Job? A Study of Follow-Up Fixes and Commit Authorship on AI Coding Agent Pull Requests
- arxiv url: http://arxiv.org/abs/2609.26847v2
- Date: Thu, 24 Sep 2026 02:15:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.329817
- Title: Who Finishes the Job? A Study of Follow-Up Fixes and Commit Authorship on AI Coding Agent Pull Requests
- Title(参考訳): 誰が仕事を終えるか?AIコーディングエージェントプルリクエストに対するフォローアップ修正とコミットオーソリティの検討
- Abstract要約: 我々は、5つのAIコーディングエージェントで6,774の統合されたエージェントPRをフォローアップ修正します。
統合されたエージェントPRは、同じ期間に同じリポジトリにマージされた人間のPRの確率の1.62倍の精度で、検証された修正を惹きつけることがわかった。
これらの結果は、現在エージェントが自身の仕事をほぼ完了していることを示しているが、マージは人間のマージよりも頻繁に修正する必要があることを示している。
- 参考スコア(独自算出の注目度): 1.1164202369517056
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: AI coding agents now author a large share of pull requests (PRs) merged into popular open-source projects. A merged agent PR is usually considered finished work; yet, prior studies have reported issues in agent code after the merge (e.g., code smells and static-analysis issues). However, little is known about how often a merged agent PR is fixed afterward, and who actually authors the fixing. In this paper, we follow 6,774 merged agent PRs across five AI coding agents (OpenAI Codex, GitHub Copilot, Devin, Cursor, and Claude Code) from the AIDev-pop dataset (open-source repositories with at least 500 stars) into their follow-up fixes, against a baseline of 5,044 contemporaneous human PRs from the same repositories. We link each merge to its candidate fixes, verify every candidate with human annotators and an LLM judge that matches human-level agreement (binary Cohen's Kappa=0.78 against a human-human K=0.77, Direct-fix precision 90%), and attribute the fixing work at the PR and the commit level. Our findings show that (1) merged agent PRs attract verified fixes at 1.62 times the odds of merged human PRs in the same repositories over the same period of time; (2) 69.6% of verified fixes in agent merges come from the same agent; and (3) 76.4% of the verified fix PRs are agent-authored throughout all commits. These results show that agents currently largely finish their own job, but their merges still require fixing more often than human merges.
- Abstract(参考訳): AIコーディングエージェントは、プルリクエスト(PR)の大部分を一般的なオープンソースプロジェクトにマージする。
マージされたエージェントPRは通常、完了作業と見なされるが、以前の研究では、マージ後のエージェントコード(例えば、コードの臭いや静的分析の問題)の問題が報告されている。
しかし、マージされたエージェントPRがその後どのように修正されるかは分かっておらず、誰が実際に修正を作成したのかは分かっていない。
本稿では,AIコーディングエージェント(OpenAI Codex, GitHub Copilot, Devin, Cursor, Claude Code)の5つのAIコーディングエージェント(OpenAI Codex, GitHub Copilot, Devin, Cursor, Claude Code)に対して,AIDev-popデータセット(少なくとも500個の星を持つオープンソースリポジトリ)から6,774個の統合エージェントPRをフォローアップする。
我々は、それぞれのマージをその候補の修正にリンクし、人間のアノテータと人間レベルの合意(バイナリコーエンのKappa=0.78と人間のK=0.77、直接修正精度90%)に一致する全ての候補を検証し、PRの修正作業とコミットレベルを属性とする。
以上の結果から,(1) 統合されたエージェントPRは, 同一リポジトリ内のヒトPRの1.62倍の確率で, (2) エージェントマージの69.6%は同一エージェントから, (3) 76.4%は全コミットを通して, 検証済みのPRを承認していることがわかった。
これらの結果は、現在エージェントが自身の仕事をほぼ完了していることを示しているが、マージは人間のマージよりも頻繁に修正する必要があることを示している。
関連論文リスト
- Not All Agents Are Equal: Code Quality and Post-Merge Maintenance Across Five Autonomous Coding Agents in the Wild [0.0]
本論文は,5つの商用エージェントから37,623件の証明ラベル付きプルリクエスト(PR)について検討する。
AIDevデータセットと58,792のキャッシュされたGitHub APIレスポンスを組み合わせて、追加コードのセキュリティ臭いを測定します。
論文 参考訳(メタデータ) (2026-09-12T19:51:53Z) - TRIM: Reducing AI-Generated CodeSlop via Agent Trajectory Minimization [57.14479960309637]
コーディングエージェントは、多くの下流タスクでコード生成を加速するためにますます使われています。
その価値にもかかわらず、エージェント生成コードは、対応する人間による実装よりも大きく、冗長である傾向がある。
原因はエージェント自身の検索プロセスにあることを示す。
論文 参考訳(メタデータ) (2026-07-20T17:06:19Z) - Writing Bug Reports for Software Repair Agents: What Information Matters Most? [45.10027008889631]
バグレポートのエージェント対応について検討する。
バグレポートを表す441の課題に注目します。
その結果,エージェントファーストレポートは,エージェントの検索・修理スペースを狭める情報から最も恩恵を受けることが示唆された。
論文 参考訳(メタデータ) (2026-07-10T16:00:57Z) - SWE-chat: Coding Agent Interactions From Real Users in the Wild [70.18158706281724]
SWE-chatは、オープンソースの開発者から収集された実際のコーディングエージェントセッションの大規模なデータセットである。
現在、データセットには6000のセッションが含まれており、63,000以上のユーザプロンプトと355,000のエージェントツールコールが含まれている。
論文 参考訳(メタデータ) (2026-04-22T17:08:19Z) - Why Are AI Agent Involved Pull Requests (Fix-Related) Remain Unmerged? An Empirical Study [5.127121704630949]
AIDEV POPデータセットから広く使用されている5つのAIコーディングエージェントによって作成された8,106の修正関連PRを分析した。
以上の結果から,他のPRによるテストケース障害や,同じ問題に対する事前解決が,非統合の最も一般的な原因であることが示唆された。
論文 参考訳(メタデータ) (2026-01-29T22:06:58Z) - Where Do AI Coding Agents Fail? An Empirical Study of Failed Agentic Pull Requests in GitHub [5.808464460707249]
われわれはGitHub全体で5人のコーディングエージェントが作成した33kエージェントのPRを大規模に調査している。
まず,4次元のPRを定量的に特徴付ける。
マージされていないPRは、より大きなコード変更を伴い、より多くのファイルに触れる傾向があり、プロジェクトのCI/CDパイプライン検証に合格しないことが多い。
論文 参考訳(メタデータ) (2026-01-21T17:12:46Z) - Analyzing Message-Code Inconsistency in AI Coding Agent-Authored Pull Requests [5.885226503818935]
AIコーディングエージェントによって生成されたプルリクエスト記述は、人間のレビュアーにコード変更を伝えるための主要なチャネルである。
PRメッセージコード不整合(PR-MCI)を用いた5エージェントにわたるエージェントPR23,247の解析を行った。
高MCIのPRは51.7%減少し、合併までに3.5倍の期間を要した。
論文 参考訳(メタデータ) (2026-01-08T12:31:02Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - AgentPack: A Dataset of Code Changes, Co-Authored by Agents and Humans [46.56091965723774]
コード編集のための微調整された大きな言語モデルは、一般的にコミットのマイニングやプルリクエストに依存しています。
我々は、Claude Code、OpenAI Codex、Cursor Agentが共著した1.3Mコード編集コーパスであるAgentPackを紹介する。
AgentPackで微調整されたモデルは、以前の人間のみのコミットコーパスで訓練されたモデルより優れていることを示す。
論文 参考訳(メタデータ) (2025-09-26T05:28:22Z) - On the Use of Agentic Coding: An Empirical Study of Pull Requests on GitHub [6.7302091035327285]
大規模言語モデル(LLM)は、ソフトウェア開発プロセスに統合されつつある。
自律的なAIエージェントを使用して、コードを生成し、人間の介入を最小限に抑えたプルリクエストを提出する能力は、標準のプラクティスになる可能性がある。
エージェントコーディングツールであるClaude Codeを使って生成した567のGitHubプルリクエスト(PR)を、157のオープンソースプロジェクトで実証研究しました。
論文 参考訳(メタデータ) (2025-09-18T08:48:32Z) - Code with Me or for Me? How Increasing AI Automation Transforms Developer Workflows [60.04362496037186]
本研究は,コーディングエージェントと開発者インタラクションを制御した最初の研究である。
我々は,2つの主要な協調型およびエージェント型符号化アシスタントの評価を行った。
結果から,エージェントはコピロトを超える方法で開発者を支援することができることがわかった。
論文 参考訳(メタデータ) (2025-07-10T20:12:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。