論文の概要: AI Writes Faster Than Humans Can Review: A Longitudinal Study of an Enterprise 2x Mandate
- arxiv url: http://arxiv.org/abs/2607.01904v1
- Date: Thu, 02 Jul 2026 09:03:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.752494
- Title: AI Writes Faster Than Humans Can Review: A Longitudinal Study of an Enterprise 2x Mandate
- Title(参考訳): AIは人間より速く書く:エンタープライズ2倍の委任状に関する縦断的研究
- Authors: Hao He, Shyam Agarwal, Yegor Denisov-Blanch, Pavel Azaletskiy, Sanmi Koyejo, Bogdan Vasilescu,
- Abstract要約: 中規模のAIフォワード企業は、2025年半ばからエンジニア1人当たりのプルリクエストの倍増を約束している。
802の開発者と196,212のプルリクエストからなるパネルでは、ユーザ当たりのスループットが最終的に倍増し、2026年4月のプレマネージドベースラインの2.09倍に達した。
採用と利用の強度はランダムに割り当てられていないので、私たちはこの証拠が採用と利用のチャンネルに強く関係していると読みました。
- 参考スコア(独自算出の注目度): 27.728366704459265
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Enterprises increasingly mandate AI coding tools and report large productivity gains, yet longitudinal evidence on how such a mandate unfolds is scarce. In this paper, we present a quantitative case study of a documented enterprise "2x" mandate at a mid-sized, AI-forward company that has been committed to doubling merged pull requests per engineer since mid-2025. In a panel of 802 developers and 196,212 pull requests (January 2024-April 2026), per-capita throughput eventually doubled, reaching 2.09x the pre-mandate baseline in April 2026, among the largest gains reported from a field deployment of AI coding tools to our knowledge. A staggered difference-in-differences design links the within-developer share of this gain to AI adoption and to a further gain that grows with accumulated use, with the mandate acting as a catalyst rather than a direct driver. Because adoption and usage intensity were not randomly assigned, we read this evidence as strongly implicating an adoption-and-use channel rather than as exact causal attribution. The gain is broadly shared across seniority yet concentrated in newer code and not separable across model generations. Adoption also restructured code review around automation: per-reviewer load roughly doubled and automated review overtook human review, while merge and revert rates held steady.
- Abstract(参考訳): 企業はますますAIコーディングツールを委任し、生産性の大きな向上を報告している。
本稿では,2025年中頃から技術者1人当たりのプルリクエストの倍増を約束している中規模のAI企業において,文書化された企業 "2x" の委任に関する定量的ケーススタディを示す。
802の開発者と196,212のプルリクエスト(2024年1月-2026年4月)からなるパネルでは、資本当たりのスループットが最終的に倍増し、2026年4月のAIコーディングツールの現場展開から私たちの知る限り、2026年4月のプレマネージドベースラインの2.09倍に達した。
遅延した差分設計は、この利得の開発者内シェアを、AIの採用と、蓄積された使用量で成長するさらなる利得に結び付け、委任が直接のドライバーではなく触媒として機能する。
採用と利用の強度はランダムに割り当てられていないので、この証拠は正確な因果属性ではなく、採用と利用のチャネルに強く関係していると読みました。
利益は、新しいコードに集中している年長者の間で広く共有されており、モデル世代間で分離できない。
レビュー毎の負荷はおよそ2倍になり、自動レビューが人間のレビューを上回り、マージとリバース率は安定している。
関連論文リスト
- Empirical Study on the Characteristics and Evolution of AI-usage in GitHub Repositories: Evidence from Code Comments [7.213400161126317]
私たちは、AIの使用と関連するコードブロックを明示的に参照する、35,361のGitHubコードコメントを分析します。
最初に500のユニークなコメントとコードブロックをオープンにし、AI支援開発活動の分類を導き出しました。
次に、2つのLCMベースの分類器と、Dawid-Skene予測最大化による集約予測を用いて、全データセットに注釈を付ける。
論文 参考訳(メタデータ) (2026-06-05T02:37:44Z) - SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks [55.76734816061826]
我々は20の問題と93のチェックポイントからなる言語に依存しないベンチマークであるSlopCodeBenchを紹介する。
我々は、冗長性、重複コードの割合、構造的侵食という2つの軌道レベルの品質信号を追跡する。
11モデルにまたがるエンドツーエンドの問題を解決するエージェントは存在しない。
論文 参考訳(メタデータ) (2026-03-25T19:26:44Z) - Why Are AI Agent Involved Pull Requests (Fix-Related) Remain Unmerged? An Empirical Study [5.127121704630949]
AIDEV POPデータセットから広く使用されている5つのAIコーディングエージェントによって作成された8,106の修正関連PRを分析した。
以上の結果から,他のPRによるテストケース障害や,同じ問題に対する事前解決が,非統合の最も一般的な原因であることが示唆された。
論文 参考訳(メタデータ) (2026-01-29T22:06:58Z) - Will It Survive? Deciphering the Fate of AI-Generated Code in Open Source [3.6525095710982924]
一般的な仮説では、コードは"使い捨て"であり、すぐにマージされるが、その後すぐに破棄される。
我々は,201件のオープンソースプロジェクトの生存状況を分析し,AIエージェントが作成した20万件のコード修復ユニットを人に対して追跡する。
論文 参考訳(メタデータ) (2026-01-23T15:00:46Z) - On Autopilot? An Empirical Study of Human-AI Teaming and Review Practices in Open Source [11.412808537439973]
プロジェクトレベルのガイドラインとAI支援プルリクエスト(PR)との開発者のインタラクションについて検討した。
AIが共著するPRの67.5%以上が、コードオーナシップのないコントリビュータから生まれています。
非オーナーの開発者が最もフィードバックを受けられるような、人間が作ったPRとは対照的に、非オーナーのAI共著のPRは最小限のフィードバックを受け取っている。
論文 参考訳(メタデータ) (2026-01-20T09:09:53Z) - Early-Stage Prediction of Review Effort in AI-Generated Pull Requests [0.0]
我々は,2,807リポジトリにわたるAIDevデータセットから,エージェントによるPR33,707件を分析した。
本稿では,高解像度PRを生成時に予測するサーキットブレーカートリアージモデルを提案する。
論文 参考訳(メタデータ) (2026-01-02T17:18:01Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - CoCoNUTS: Concentrating on Content while Neglecting Uninformative Textual Styles for AI-Generated Peer Review Detection [60.52240468810558]
我々は、AI生成ピアレビューの詳細なデータセットの上に構築されたコンテンツ指向ベンチマークであるCoCoNUTSを紹介する。
また、マルチタスク学習フレームワークを介してAIレビュー検出を行うCoCoDetを開発し、レビューコンテンツにおけるAIのより正確で堅牢な検出を実現する。
論文 参考訳(メタデータ) (2025-08-28T06:03:11Z) - Code with Me or for Me? How Increasing AI Automation Transforms Developer Workflows [60.04362496037186]
本研究は,コーディングエージェントと開発者インタラクションを制御した最初の研究である。
我々は,2つの主要な協調型およびエージェント型符号化アシスタントの評価を行った。
結果から,エージェントはコピロトを超える方法で開発者を支援することができることがわかった。
論文 参考訳(メタデータ) (2025-07-10T20:12:54Z) - Refine, Discriminate and Align: Stealing Encoders via Sample-Wise Prototypes and Multi-Relational Extraction [57.16121098944589]
RDAは、事前訓練されたエンコーダを盗むために、以前の取り組みで普及した2つの主要な欠陥に対処するために設計された先駆的なアプローチである。
これは、サンプルの様々な視点に対してターゲットエンコーダの表現を統一するサンプルワイドプロトタイプによって達成される。
より強力な有効性を得るために、我々はサロゲートエンコーダを訓練し、ミスマッチした埋め込み-プロトタイプペアを識別するマルチリレーショナル抽出損失を開発する。
論文 参考訳(メタデータ) (2023-12-01T15:03:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。