論文の概要: AI Agent Pull Requests on GitHub: Frequency, Structure, and Merge Conflict Rates
- arxiv url: http://arxiv.org/abs/2607.04697v2
- Date: Tue, 07 Jul 2026 02:40:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:43.276576
- Title: AI Agent Pull Requests on GitHub: Frequency, Structure, and Merge Conflict Rates
- Title(参考訳): AIエージェントがGitHubでリクエストをプルする - 頻度、構造、マージの衝突率
- Authors: George Xu, Arjun Subramanian, Nithilan Karthik,
- Abstract要約: 本稿では, AIDev-pop データセット (33,596 PR, 2,807 リポジトリ) を用いて,エージェントが作成する PR を用いた並列送信の実証的研究を行った。
共活性PRペアの大多数(ほとんどはエージェント内で作成されている)では、どちらのPRも同一のエージェントで作成されている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI coding agents may generate and submit Pull Requests (PRs) to the same repository at the same time. However, research concerning the extent of concurrent submission by AI coding agents to a common repository does not exist. This paper uses the AIDev-pop dataset (33,596 PRs in 2,807 repositories) to provide the first empirical examination of the prevalence of concurrent submission using PRs authored by agents. We report that when considering exact temporal overlap, 40.2% of repositories contain co-active agent-authored PR pairs; further, the co-active pairs account for 79.4% of all PRs generated by an AI agent. When we examine co-activity within a one week collaboration window, the percentages are increased to 53.4% and 95.0%, respectively. For the majority of the co-active PR pairs (underlying the vast majority of which are intra-agent authored), both PRs were authored by the same agent, while only 0.5% of co-active pairs were cross-agent, and occurred in only 122 out of 2807 total repositories examined (or approximately 4.3%). Additionally, we replayed actual three way git merges on 747 unique co-active pairs (one per repository), and computed the percentage of textual conflict encountered during the merge operation to combine the two PRs in each pair. We observed that the percentage of textual conflict encountered was significantly higher for cross-agent pairs compared to intra-agent pairs: 41.7% vs. 19.8%, respectively, with non-overlapping 95% confidence intervals. Lastly, we developed a classification system based on the detection of conflict reported by git, and determined that the majority of conflicts resulted from modifications to source code files (84.4% of conflicted files) and not dependency manifest files; further, nearly 42% of conflicts we observed were structural (i.e., modify/delete or add/add).
- Abstract(参考訳): AIコーディングエージェントは、プルリクエスト(PR)を同時に同じリポジトリに生成し、送信することができる。
しかし、AIコーディングエージェントによる共通リポジトリへの同時提出の程度に関する研究は存在しない。
本稿では, AIDev-pop データセット (33,596 PR, 2,807 リポジトリ) を用いて,エージェントが作成した PR を用いて同時提出の頻度を初めて実証した。
正確な時間的重なりを考慮すると、40.2%のリポジトリには、共活性エージェントによるPRペアが含まれており、さらに、共活性ペアはAIエージェントが生成するすべてのPRの79.4%を占めている。
1週間のコラボレーションウィンドウでコアクティビティを調べると、それぞれ53.4%と95.0%に増加します。
共活性PRペアの大多数(ほとんどはエージェント内で作成されている)については、両方のPRは同一のエージェントによって作成され、一方、共活性PRペアのわずか0.5%はクロスエージェントであり、調査対象となった2807のリポジトリのうち122か所(約4.3%)でのみ発生した。
さらに,747のユニークなコアクティブペア(レポジトリ毎に1つ)上で,実際の3つのgitマージをリプレイし,マージ操作中に発生するテキストコンフリクトの割合を計算して,2つのPRをそれぞれ組み合わせた。
その結果,アジェント・ペア間のテキスト・コンフリクトの割合は,アジェント・ペアの41.7%対19.8%,非オーバーラップ95%の信頼区間で有意に高かった。
最後に、gitが報告したコンフリクトの検出に基づく分類システムを開発し、コンフリクトの大部分がソースコードファイルの変更(84.4%のコンフリクトファイル)によるもので、依存関係のマニフェストファイルではないと判断した。
関連論文リスト
- Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Beyond Simpson's Paradox: A Cascade of Confounders in AI Agent Pull-Request Co-Authorship [7.731517937404174]
エージェントアイデンティティによるAIDevデータセットからの33,596のPRは、結論を覆している。
リポジトリの選択とPR構造の両方が制御されると、明確な共著者効果を維持するエージェントは存在しない。
論文 参考訳(メタデータ) (2026-06-21T23:16:19Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - Comparing AI Coding Agents: A Task-Stratified Analysis of Pull Request Acceptance [4.424336158797069]
この記事では、AIを利用した一般的な5つのコーディングアシスタント(OpenAI Codex、GitHub Copilot、Devin、Cursor、Claude Code)を比較します。
デビンは受容率において唯一一貫した正の傾向を示す(32週間で週0.77%以上)。
分析の結果,PRタスクタイプが受入率に影響を及ぼす主要な要因であることが示唆された。
論文 参考訳(メタデータ) (2026-02-09T17:14:46Z) - Why Are AI Agent Involved Pull Requests (Fix-Related) Remain Unmerged? An Empirical Study [5.127121704630949]
AIDEV POPデータセットから広く使用されている5つのAIコーディングエージェントによって作成された8,106の修正関連PRを分析した。
以上の結果から,他のPRによるテストケース障害や,同じ問題に対する事前解決が,非統合の最も一般的な原因であることが示唆された。
論文 参考訳(メタデータ) (2026-01-29T22:06:58Z) - Code Change Characteristics and Description Alignment: A Comparative Study of Agentic versus Human Pull Requests [0.0]
我々は,33,596個のエージェント生成PRと6,618個の人間PRを分析し,コード変更特性とメッセージ品質を比較した。
エージェントはより強いコミットレベルメッセージを生成するが、PRレベルの要約では人間を遅延させる。
これらの結果は,エージェントのマイクロレベルの精度とマクロレベルのコミュニケーションのギャップを浮き彫りにしている。
論文 参考訳(メタデータ) (2026-01-24T23:33:07Z) - CooperBench: Why Coding Agents Cannot be Your Teammates Yet [44.06715229961526]
CooperBenchは、4つのプログラミング言語で12のライブラリにまたがる600以上の協調コーディングタスクのベンチマークである。
エージェントは、両方のタスクを個別に実行するよりも、一緒に働く場合の平均30%低い成功率を達成する。
分析の結果,(1)コミュニケーションチャネルは不明瞭で不正確なメッセージに悩まされる,(2)効果的なコミュニケーションであっても,エージェントはコミットメントから逸脱する,(3)エージェントが他人の計画やコミュニケーションに対して誤った期待を抱いている,という3つの重要な問題が明らかになった。
論文 参考訳(メタデータ) (2026-01-19T18:48:37Z) - Analyzing Message-Code Inconsistency in AI Coding Agent-Authored Pull Requests [5.885226503818935]
AIコーディングエージェントによって生成されたプルリクエスト記述は、人間のレビュアーにコード変更を伝えるための主要なチャネルである。
PRメッセージコード不整合(PR-MCI)を用いた5エージェントにわたるエージェントPR23,247の解析を行った。
高MCIのPRは51.7%減少し、合併までに3.5倍の期間を要した。
論文 参考訳(メタデータ) (2026-01-08T12:31:02Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。