論文の概要: "Go Home Copilot, You're Drunk": Understanding Developer Responses to Agent-Generated Code Review Comments
- arxiv url: http://arxiv.org/abs/2607.21997v2
- Date: Wed, 29 Jul 2026 20:44:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.247141
- Title: "Go Home Copilot, You're Drunk": Understanding Developer Responses to Agent-Generated Code Review Comments
- Title(参考訳): Go Home Copilot, You're Drunk":エージェント生成コードレビューに対する開発者の反応を理解する
- Authors: Shamse Tasnim Cynthia, Ratnadira Widyasari, Banani Roy, Ting Zhang, David Lo,
- Abstract要約: 本稿では,エージェント生成コードレビューコメントの解決に関する大規模な実証的研究について紹介する。
GitHub上の342ドルのPythonリポジトリで、広く使われている5つのコーディングエージェントが生成した54,791のコメントを分析します。
以上の結果から、解決率はエージェントによって大きく異なり、Copilotは解決されたコメントの大多数を占めています。
- 参考スコア(独自算出の注目度): 11.53008696469705
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Code review is a critical quality assurance practice in software engineering development, and AI coding agents are increasingly generating review comments on pull requests. However, little is known about how developers actually respond to such agent-generated feedback. In this paper, we present the first large-scale empirical study on the resolution of agent-generated code review comments. We analyze $54{,}791$ comments generated by five widely used coding agents (i.e., Copilot, Cursor, Codex, Devin, and Claude) across $342$ Python repositories on GitHub. We examine (1) resolution rates across agents and comment types, (2) the role of developer experience, and (3) characteristics that influence comment usefulness. Our results show that resolution rate varies considerably across agents, with Copilot accounting for the majority of resolved comments (72.9\%). Core developers resolve the majority of agent-generated feedback, particularly for \textit{design} and \textit{evolvability}-related comments, while peripheral developers are more involved in resolving \textit{functional defect} comments. Through open card sorting of 470 unresolved comment discussions, we identify \textit{ten} discussion patterns explaining why comments remain unresolved, with \textit{incorrect suggestions} and \textit{intentional design decisions} being the most prevalent. Finally, our analysis reveals that the presence of an inline \textit{code suggestion} is the strongest predictor of comment resolution, while lengthy and complex comments are less likely to be acted upon. Our findings provide insights for improving AI-generated code review feedback and its integration into development workflows.
- Abstract(参考訳): コードレビューはソフトウェア開発において重要な品質保証プラクティスであり、AIコーディングエージェントはプルリクエストに対するレビューコメントをますます生成している。
しかし、そのようなエージェント生成フィードバックに実際にどのように反応するかについては、ほとんど分かっていない。
本稿では,エージェント生成コードレビューコメントの解決に関する大規模な実証的研究を行う。
私たちは,広く使用されている5つのコーディングエージェント(Copilot, Cursor, Codex, Devin, Claude)が生成した5,4{,}791ドルのコメントを,GitHub上の342ドルのPythonリポジトリで分析しました。
本研究では,(1)エージェントとコメントタイプ間の解決率,(2)開発者エクスペリエンスの役割,(3)コメントの有用性に影響を与える特徴について検討する。
以上の結果から、解決率はエージェントによって大きく異なり、Copilotは解決されたコメントの過半数(72.9\%)を占めている。
特に \textit{design} と \textit{evolvability} 関連コメントでは、コア開発者はエージェント生成フィードバックの大部分を解決しているが、周辺開発者は \textit{functional defect} コメントの解決により関与している。
470件の未解決コメントのオープンカードソートを通じて、なぜコメントが未解決のままなのかを説明する、 \textit{incorrect suggestions} と \textit{intentional design decisions} が最も一般的である。
最後に,inline \textit{code suggestion}の存在がコメント解決の最も強力な予測因子であることを明らかにする。
本研究は,AIによるコードレビューフィードバックの改善と開発ワークフローへの統合に関する知見を提供する。
関連論文リスト
- Code Review is a Conversation: Toward Conversational AI Review Assistants [7.335667281862373]
我々は、静的コメントジェネレータではなく、対話的なパートナーとしてコードレビューに参加する会話型AIレビューアシスタントについて議論する。
このようなアシスタントは、会話がいつ必要かを特定し、根拠のある質問をし、開発者説明に答え、未解決の問題を要約し、合理性を捉え、いつ人間レビュアーを棄却するか、エスカレートすべきかを知る必要がある。
論文 参考訳(メタデータ) (2026-07-24T08:44:05Z) - SWE-Review: Closing the Loop on Issue Resolution with Agentic Code Review [47.72392142544407]
コーディングエージェントは、現実世界のソフトウェア問題に対するプルリクエスト(PR)をますます生成します。
PRは、体系的なレビュー、診断、修正なしに提案される。
エージェントコードレビューでこのループを閉じるためのフレームワークである textbfSWE-Review を導入する。
論文 参考訳(メタデータ) (2026-07-07T09:37:45Z) - Is Agentic Code Review Helpful? Mining Developers' Feedback to CodeRabbit Reviews in the Wild [4.433169165028139]
自律的なエージェントがプルリクエストに関するコードレビューコメントを提供するエージェントコードレビューは、開発にますます統合されている。
本稿では,CodeRabbitを事例として,エージェントコードレビューの実証的研究を行う。
論文 参考訳(メタデータ) (2026-07-03T13:35:09Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - What Types of Code Review Comments Do Developers Most Frequently Resolve? [10.277847378685161]
コードレビューコメントを生成するために,LLM(Large Language Model)を使用したコードレビュー自動化ツールが導入されている。
本稿では、人間やLLMが書いたレビューコメントのタイプと、開発者が最も頻繁に解決しているコメントのタイプについて検討する。
論文 参考訳(メタデータ) (2025-10-06T23:32:26Z) - Does AI Code Review Lead to Code Changes? A Case Study of GitHub Actions [21.347559936084807]
AIベースのコードレビューツールは、コード品質を改善するためにプルリクエストを自動的にレビューし、コメントする。
我々は,GitHubで人気の高いAIベースのコードレビューアクション16件について,大規模な実証的研究を行った。
これらのツールがどのように採用され、設定されているか、コメントがコードの変更につながるかどうか、そしてどの要因がそれらの効果に影響を与えるかを調査する。
論文 参考訳(メタデータ) (2025-08-26T07:55:23Z) - Understanding Code Understandability Improvements in Code Reviews [79.16476505761582]
GitHub上のJavaオープンソースプロジェクトからの2,401のコードレビューコメントを分析した。
改善提案の83.9%が承認され、統合され、1%未満が後に復活した。
論文 参考訳(メタデータ) (2024-10-29T12:21:23Z) - Are your comments outdated? Towards automatically detecting code-comment
consistency [3.204922482708544]
古いコメントは危険で有害であり、その後の開発者を誤解させる可能性がある。
コードとコメントの一貫性を検出するための,CoCCと呼ばれる学習手法を提案する。
実験の結果,COCCは90%以上の精度で時代遅れのコメントを効果的に検出できることがわかった。
論文 参考訳(メタデータ) (2024-03-01T03:30:13Z) - Can We Automate Scientific Reviewing? [89.50052670307434]
我々は、最先端自然言語処理(NLP)モデルを用いて、科学論文の第一パスピアレビューを生成する可能性について論じる。
我々は、機械学習領域で論文のデータセットを収集し、各レビューでカバーされているさまざまなコンテンツに注釈を付け、レビューを生成するために論文を取り込み、ターゲットの要約モデルを訓練する。
総合的な実験結果から、システム生成レビューは、人間によるレビューよりも、論文の多くの側面に触れる傾向にあることが示された。
論文 参考訳(メタデータ) (2021-01-30T07:16:53Z) - Deep Just-In-Time Inconsistency Detection Between Comments and Source
Code [51.00904399653609]
本稿では,コード本体の変更によりコメントが矛盾するかどうかを検出することを目的とする。
私たちは、コメントとコードの変更を関連付けるディープラーニングアプローチを開発しています。
より包括的な自動コメント更新システムを構築するために,コメント更新モデルと組み合わせて提案手法の有用性を示す。
論文 参考訳(メタデータ) (2020-10-04T16:49:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。