論文の概要: From Code Review to Code Critique: Intent, Drift, and Spotlight for AI-Generated Diffs at Scale
- arxiv url: http://arxiv.org/abs/2607.29516v1
- Date: Fri, 31 Jul 2026 15:17:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.779027
- Title: From Code Review to Code Critique: Intent, Drift, and Spotlight for AI-Generated Diffs at Scale
- Title(参考訳): コードレビューからコード批評へ:AI生成した大規模ディフのインテント、ドリフト、スポットライト
- Authors: Chandra Maddila, Mashrur Rashik, Euna Mehnaz Khan, Smriti Jha, James Saindon, Nachi Nagappan, Peter C. Rigby,
- Abstract要約: ARCTICはAIを利用したCode Critiqueシステムで、インテント予測、ドリフト検出、コードスポットライトという3つの機能に関するコードレビューを再構築する。
実験的なロールアウトでは、ドリフトスコアは追加で5.76ポイント(p = 0.026)のコードアライメントを減少させ、インテント予測は90.2%の承認を受け、ゼロの欠陥はローンチ以来自己レビューによる差によるものである。
- 参考スコア(独自算出の注目度): 2.8980676513012846
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI coding agents are generating code at volumes that exceed the capacity of traditional peer review. At the same time, existing AI code review tools over-index on low-value suggestions such as style and best practices while under-indexing on the concerns human reviewers prioritize most: correctness, security, and performance. We present ARCTIC, an AI-powered Code Critique system that reframes code review around three capabilities: intent prediction, which infers why a change was made from conversation logs and metadata; drift detection, which measures divergence between the developer's intent and the agent's output via backtranslation; and code spotlight, which ranks the regions of a diff most warranting human scrutiny. We ground these capabilities in a six-theme taxonomy derived from 18,000 code reviews. Offline evaluation shows that intent prediction achieves 0.86 F1, drift detection reaches near-perfect ordinal agreement with human annotators (QWK = 0.907), and spotlight outperforms the baseline AI reviewer by 2.4x on quality estimation at 5x fewer tokens. In the experimental rollout, the drift scores reduces code misalignment by an additional 5.76 points (p = 0.026), intent prediction receives 90.2% approval, and zero defects have been attributed to self-reviewed diffs since launch.
- Abstract(参考訳): AIコーディングエージェントは、従来のピアレビューの能力を超えるボリュームでコードを生成する。
同時に、既存のAIコードレビューツールは、スタイルやベストプラクティスのような価値の低い提案を過剰にインデクシングし、人間のレビュー者が最も優先する関心事(正確性、セキュリティ、パフォーマンス)を過度にインデクシングする。
インテント予測は、会話ログとメタデータから変更が行われた理由を推測するものであり、ドリフト検出は、開発者の意図とエージェントの出力のバックトランスレーションによるばらつきを計測するものであり、コードスポットライトは、人間の精査を最も保証するディグの領域にランク付けする。
これらの能力は、18,000のコードレビューから派生した6つのテーマの分類に根ざしています。
オフライン評価では、意図予測は0.86F1に達し、ドリフト検出は人間のアノテーションとのほぼ完全な順序一致(QWK = 0.907)に達し、スポットライトは5倍のトークンで品質評価でベースラインAIレビュアーを2.4倍上回っている。
実験的なロールアウトでは、ドリフトスコアは追加で5.76ポイント(p = 0.026)のコードアライメントを減少させ、インテント予測は90.2%の承認を受け、ゼロの欠陥はローンチ以来自己レビューによる差によるものである。
関連論文リスト
- Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators [17.44053709945519]
自己改善エージェントはエージェントコーディングベンチマークの最先端(SOTA)であり、最近一般的なドメインに拡張されている。
非定常ユーティリティ下での自己改善のための進化的フレームワークであるRed Queen Godel Machine(RQGM)を紹介する。
RQGMは、補完的なエージェント・アズ・ア・ジャッジ・コード・レビュー信号を追加することにより、以前のSOTAよりもテストパス率を向上させることを示す。
次に、科学論文の執筆とレビュー、オリンピアードレベルの証明の執筆と評価に目を向け、RQGMは以前の自己改善エージェントよりもパフォーマンスを向上させる。
論文 参考訳(メタデータ) (2026-06-24T18:38:26Z) - Automating Low-Risk Code Review at Meta: RADAR, Risk Calibration, and Review Efficiency [10.379265985245537]
Metaでは、人為的な差分あたりのコード行数が前年比105.9%増加した。
開発者毎の差額は51%増加し、エージェントAIが80%以上を占めた。
我々は、キャリブレーションから影響まで、実現可能性から進展する3つの質問を行う。
論文 参考訳(メタデータ) (2026-05-28T16:44:07Z) - Understanding Dominant Themes in Reviewing Agentic AI-authored Code [6.183483850365225]
実世界のGitHubリポジトリから,3,177件のエージェントによるPRにまたがる19,450件のインラインレビューコメントを分析した。
AIエージェントはコード生成を加速できるが、対象とする人間レビューの監視を必要とするギャップは依然として残っている。
論文 参考訳(メタデータ) (2026-01-27T07:21:09Z) - Early-Stage Prediction of Review Effort in AI-Generated Pull Requests [0.0]
我々は,2,807リポジトリにわたるAIDevデータセットから,エージェントによるPR33,707件を分析した。
本稿では,高解像度PRを生成時に予測するサーキットブレーカートリアージモデルを提案する。
論文 参考訳(メタデータ) (2026-01-02T17:18:01Z) - CoCoNUTS: Concentrating on Content while Neglecting Uninformative Textual Styles for AI-Generated Peer Review Detection [60.52240468810558]
我々は、AI生成ピアレビューの詳細なデータセットの上に構築されたコンテンツ指向ベンチマークであるCoCoNUTSを紹介する。
また、マルチタスク学習フレームワークを介してAIレビュー検出を行うCoCoDetを開発し、レビューコンテンツにおけるAIのより正確で堅牢な検出を実現する。
論文 参考訳(メタデータ) (2025-08-28T06:03:11Z) - Rethinking Metrics and Benchmarks of Video Anomaly Detection [58.37571339811799]
ビデオ異常検出(VAD)は、期待から外れた異常を検出することを目的としている。
既存のVADメトリクスは、単一のアノテーションバイアスの影響を受けます。
既存のベンチマークには、完全に/弱い教師付きアルゴリズムのシーンオーバーフィットを評価する能力がない。
論文 参考訳(メタデータ) (2025-05-25T08:09:42Z) - Understanding Code Understandability Improvements in Code Reviews [79.16476505761582]
GitHub上のJavaオープンソースプロジェクトからの2,401のコードレビューコメントを分析した。
改善提案の83.9%が承認され、統合され、1%未満が後に復活した。
論文 参考訳(メタデータ) (2024-10-29T12:21:23Z) - Self-Evaluation Guided Beam Search for Reasoning [61.523627290397556]
我々は,Large Language Model (LLM) の推論プロセスのガイドと校正を行うための段階的自己評価機構を導入する。
本稿では,ビームサーチによる自己評価ガイダンスを統合した復号アルゴリズムを提案する。
我々のアプローチは、GSM8K、AQuA、StrategyQAにおいて、対応するCodexバックボンドベースラインをわずかに精度6.34%、9.56%、および5.46%で上回る。
論文 参考訳(メタデータ) (2023-05-01T02:37:59Z) - ScoreGAN: A Fraud Review Detector based on Multi Task Learning of
Regulated GAN with Data Augmentation [50.779498955162644]
生成・検出プロセスにおけるレビューテキストとレビューレーティングスコアの両方を利用した不正レビュー検出のためのScoreGANを提案する。
その結果,提案フレームワークは,既存の最先端フレームワークであるFakeGANをAPの7%,YelpとTripAdvisorのデータセットで5%上回る性能を示した。
論文 参考訳(メタデータ) (2020-06-11T16:15:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。