論文の概要: Do These Violent Delights Have Violent Ends? Measuring the Post-Merge Fate of Agentic Code
- arxiv url: http://arxiv.org/abs/2607.09902v1
- Date: Fri, 10 Jul 2026 18:45:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.242096
- Title: Do These Violent Delights Have Violent Ends? Measuring the Post-Merge Fate of Agentic Code
- Title(参考訳): 悪臭に満ちた喜びは終わりか? エージェントコードのポストマージフェイトを測る
- Authors: Chunqiu Steven Xia, Courtney Miller,
- Abstract要約: エージェントコーディングツールは、現実のプロジェクトに自律的なリポジトリレベルの変更を行うために、ますます使われています。
我々は182リポジトリにわたるエージェントおよび人的貢献の縦断的実証分析を行った。
エージェントの維持負担がリポジトリ特性に関連しているという統計的に有意な証拠が得られている。
- 参考スコア(独自算出の注目度): 8.771752397414094
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agentic coding tools are increasingly used to make autonomous repository-level changes to real-world projects. Prior work has largely evaluated these contributions at the pre-merge stage, through outcomes such as pull request acceptance and review effort. Far less is known about what happens to agentic code post-merge. Yet merge success alone does not reveal whether a contribution will remain stable or require bug fixes and other corrective maintenance downstream. We conduct a longitudinal empirical analysis of agentic and human contributions across 182 repositories, tracking their post-merge fate over time, characterizing the intent of subsequent modifications, and analyzing the defects and vulnerabilities they introduce. While the overall maintenance rates are similar, agentic contributions require significantly higher rates of corrective maintenance and introduce more security weaknesses and dependency vulnerabilities. We also find statistically significant evidence that agentic maintenance burden is associated with repository characteristics. In particular, each 10 percentage-point increase in a project's no-review rate is associated with roughly a 6% increase in agentic maintenance burden on average. As coding agents become pervasive in software development, our findings highlight the need to evaluate and design agentic tools not only to produce mergeable changes, but to produce contributions that remain secure and maintainable.
- Abstract(参考訳): エージェントコーディングツールは、現実のプロジェクトに自律的なリポジトリレベルの変更を行うために、ますます使われています。
これまでの作業は、プルリクエストの受け入れやレビューの取り組みといった成果を通じて、これらのコントリビューションを、マージ前の段階で大きく評価してきた。
エージェントコードがマージ後に何が起こるかは、ほとんど分かっていない。
しかし、マージの成功だけでは、コントリビューションが安定したままなのか、バグ修正やその他の修正メンテナンスが必要なのかは明らかになっていない。
我々は182リポジトリにわたるエージェントと人的貢献の縦断的な分析を行い、それらの統合後の運命を時間とともに追跡し、その後の修正の意図を特徴づけ、導入した欠陥や脆弱性を分析します。
全体的なメンテナンス率は似ているが、エージェント的なコントリビューションは、修正メンテナンスの率を大幅に高め、セキュリティの弱点と依存性の脆弱性を導入する必要がある。
また, エージェントの維持負担がリポジトリ特性と関連していることを示す統計的に有意な証拠も見出した。
特に、プロジェクトのノリビュー率の10ポイントずつの増加は、平均的なエージェント保守負荷の約6%の増加と関連している。
コーディングエージェントがソフトウェア開発で普及するにつれて、当社の発見は、マージ可能な変更を生成するだけでなく、安全でメンテナンス可能なコントリビューションを生成するために、エージェントツールの評価と設計の必要性を強調します。
関連論文リスト
- RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations [51.43574078961796]
本稿では,SWE-Bench Verified上に構築された2段階評価スイートRepoMirageを紹介する。
RepoMirage-Perturbは、リポジトリレベルの摂動を保存する3つのタイプのセマンティクスを適用している。
RepoAnchorは、下流の問題解決からリポジトリの探索を分離する構造第一のプロトタイプワークフローである。
論文 参考訳(メタデータ) (2026-05-25T06:26:43Z) - Quality and Security Signals in AI-Generated Python Refactoring Pull Requests [0.0]
AIDevデータセットからPythonプルリクエスト(PR)を実証研究する。
MLベースのPythonの品質評価ツールであるPyQuを用いてエージェントPRを分析する。
以上の結果から,エージェントのコミットが22.5%の品質特性を改善することが示唆された。
同時に、修正ファイルの24.17%が新しいPylint問題を導入している。
論文 参考訳(メタデータ) (2026-05-20T17:43:36Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - Safer Builders, Risky Maintainers: A Comparative Study of Breaking Changes in Human vs Agentic PRs [0.991629944808926]
我々はPythonリポジトリから,7,191個のエージェント生成PRと1402個の人間によるPRを比較した。
AIエージェントは、コード生成タスクにおいて、人間よりも破壊的な変更が少ない(3.45%対7.40%)。
エージェントは保守作業中に著しく高いリスクを示し、それぞれ6.72%と9.35%の速度で破壊的な変更をもたらす。
論文 参考訳(メタデータ) (2026-03-29T05:15:13Z) - A Benchmark for Evaluating Repository-Level Code Agents with Intermediate Reasoning on Feature Addition Task [11.218318079376365]
RACE-benchは、機能追加タスクでコードエージェントを評価するための推論強化ベンチマークである。
RACE-benchには、12のオープンソースリポジトリから528の現実世界の機能追加インスタンスが含まれている。
RACE-bench上での3つのリポジトリレベルのコードエージェントの評価を行った。
論文 参考訳(メタデータ) (2026-03-27T11:58:47Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Security in the Age of AI Teammates: An Empirical Study of Agentic Pull Requests on GitHub [4.409447722044799]
本研究の目的は,自律型コーディングエージェントが実際にソフトウェアセキュリティにどのように貢献するかを特徴付けることである。
AIDevデータセットを用いてエージェントによるPRの大規模解析を行う。
次に、頻度、受け入れ結果を分析し、自律エージェント、プログラミングエコシステム、コード変更のタイプをレビューします。
論文 参考訳(メタデータ) (2026-01-01T21:14:11Z) - Process-based Indicators of Vulnerability Re-Introducing Code Changes: An Exploratory Case Study [2.204918347869259]
この作業は、脆弱性の再導入の理解と緩和におけるコードの変更とともに、プロセスメトリクスの重要な役割を強調します。
我々のアプローチは、再導入が一つの孤立した行動の結果であることは滅多にないが、累積的な開発活動や社会技術的条件から生じることを強調している。
論文 参考訳(メタデータ) (2025-10-30T16:45:36Z) - Criticality and Safety Margins for Reinforcement Learning [53.10194953873209]
我々は,定量化基盤真理とユーザにとっての明確な意義の両面から,批判的枠組みを定めようとしている。
エージェントがn連続的ランダム動作に対するポリシーから逸脱した場合の報酬の減少として真臨界を導入する。
我々はまた、真の臨界と統計的に単調な関係を持つ低オーバーヘッド計量であるプロキシ臨界の概念も導入する。
論文 参考訳(メタデータ) (2024-09-26T21:00:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。