論文の概要: OpenCodeReview: Determinism over Non-Determinism for Cost-Effective Agent-Based Code Review
- arxiv url: http://arxiv.org/abs/2608.09290v1
- Date: Mon, 10 Aug 2026 08:43:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.166654
- Title: OpenCodeReview: Determinism over Non-Determinism for Cost-Effective Agent-Based Code Review
- Title(参考訳): OpenCodeReview: コスト効果エージェントベースのコードレビューのための非決定性に関する決定論
- Authors: Zhengfeng Li, Lei Zhang, Xianwei Wu, Zhengqi Zhuang, Yingjie Xu, Boge Wang, Shaofei Zhu, Chuan Wang, Guoping Rong,
- Abstract要約: 我々は不確実なエージェントに対する決定論的エンジニアリングに基づいて構築されたOpenCodeReviewを紹介する。
AACR-Bench(200の現実世界のPR、10の言語、1,505のエキスパート認定されたコメント)では、OpenCodeReviewが主要なコーディングエージェントを上回っている。
- 参考スコア(独自算出の注目度): 8.737703589195544
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based code review agents promise scalable, always-on review, yet current systems suffer from two intertwined weaknesses: (1) non-determinism--unbounded tool use makes review outcomes unstable, and (2) context locality--the reviewer's access remains bounded to the diff, capping discoverable issue depth. Both give rise to three challenges: misaligned context retrieval, a coherence-efficiency trade-off in multi-file pull requests, and hallucinated comments that erode trust. To address these, we introduce OpenCodeReview, built on deterministic engineering for uncertain agents: rather than granting maximal freedom, we inject determinism at three deliberate pipeline points. Rule-Guided Dispatch uses a multi-layer rule system to deterministically select files and review criteria, eliminating variability of agent-driven triage. Grounded File Review replaces free-form exploration with a curated tool set exposed through a ReAct loop, while file-level parallel SubAgents balance context coherence against efficiency and recover cross-file dependencies on demand. Independent Reflection introduces a falsification-first filter under an asymmetric information boundary--the reflector sees only the diff, not the agent's tool-augmented exploration--removing hallucinated comments without self-reinforcing bias, improving precision while preserving recall. On AACR-Bench (200 real-world PRs, 10 languages, 1,505 expert-verified comments), OpenCodeReview outperforms mainstream coding agents (e.g., Claude Code and Codex) across six LLM backends, achieving up to 2.17x higher SEM-F1 (25.10% vs. 11.57%) while consuming 5-15x fewer tokens. We open-source OpenCodeReview at https://github.com/alibaba/open-code-review.
- Abstract(参考訳): LLMベースのコードレビューエージェントは、スケーラブルで常時オンのレビューを約束するが、現在のシステムは2つの中間的な弱点に悩まされている。
どちらも、コンテキスト検索の不一致、複数ファイルのプルリクエストにおける一貫性と効率のトレードオフ、信頼を損なう幻覚的なコメントの3つの課題を生み出します。
これらの問題に対処するために、不確実なエージェントのための決定論的エンジニアリングに基づいて構築されたOpenCodeReviewを紹介します。
Rule-Guided Dispatchは、多層ルールシステムを使用して、エージェント駆動トリアージの可変性を排除し、ファイルとレビュー基準を決定的に選択する。
Grounded File Reviewは、自由形式の探索をReActループを通じて公開されたキュレートされたツールに置き換える一方で、ファイルレベルの並列SubAgentは、効率に対するコンテキストコヒーレンスをバランスさせ、必要に応じてファイル間の依存関係を回復する。
インディペンデント・リフレクション(Independent Reflection)は、非対称情報境界の下でファルシフィケーションファーストフィルタを導入し、リフレクターは、エージェントのツール強化された探索ではなく、差分のみを見る。
AACR-Bench (200の現実世界のPR、10の言語、1,505のエキスパート認定されたコメント)では、OpenCodeReviewは主要なコーディングエージェント(例えばClaude CodeやCodex)を6つのLLMバックエンドで上回り、最大2.17倍のSEM-F1(25.10%対11.57%)を達成し、5~15倍のトークンを消費する。
OpenCodeReviewはhttps://github.com/alibaba/open-code-review.comで公開しています。
関連論文リスト
- Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories [0.0]
永続コンテキストファイル(AGENTS.md, CLAUDE.md)は、AIコーディングエージェントを誘導する標準的な慣行であるが、それらの効果の証拠は矛盾している。
我々は2つのフロンティアエージェント(Claude Code と Codex)間のコンテキスト注入戦略の制御されたアブレーションを示す。
論文 参考訳(メタデータ) (2026-07-28T11:07:53Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - SWE-Review: Closing the Loop on Issue Resolution with Agentic Code Review [47.72392142544407]
コーディングエージェントは、現実世界のソフトウェア問題に対するプルリクエスト(PR)をますます生成します。
PRは、体系的なレビュー、診断、修正なしに提案される。
エージェントコードレビューでこのループを閉じるためのフレームワークである textbfSWE-Review を導入する。
論文 参考訳(メタデータ) (2026-07-07T09:37:45Z) - PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - Affordance Agent Harness: Verification-Gated Skill Orchestration [45.231685718099264]
Affordance groundingは、オープンワールドのシーンでエージェントがどこでどのように対話すべきかを特定する必要がある。
本稿では,エビデンスストアとコストコントロールを備えたクローズドループランタイムであるAffordance Agent Harnessを提案する。
論文 参考訳(メタデータ) (2026-05-01T13:45:16Z) - RAG-Reflect: Agentic Retrieval-Augmented Generation with Reflections for Comment-Driven Code Maintenance on Stack Overflow [0.5607590231264274]
本稿では,エージェントAIの原則がRAG-Reflectを提示することにより,ソフトウェアメンテナンスタスクに革命をもたらすことを示す。
RAG-Reflectは、タスク固有のトレーニングなしで有効なコメント編集予測のための微調整レベルのパフォーマンスを実現するモジュラーフレームワークである。
我々は、公開SOUPベンチマークでRAG-Reflectを評価し、精度が0.81、リコールが0.74、F1が0.78である。
論文 参考訳(メタデータ) (2026-04-24T04:49:58Z) - IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory [73.22944697933603]
既存のパイプラインは不透明でエンドツーエンドの出力を生成し、検査の中間状態は公開しない。
IMPACT-Cycleは,マルチモーダル反復クレームレベルのメンテナンスとして,長時間ビデオ理解を再構築するマルチエージェントシステムである。
論文 参考訳(メタデータ) (2026-04-22T03:03:33Z) - Refute-or-Promote: An Adversarial Stage-Gated Multi-Agent Review Methodology for High-Precision LLM-Assisted Defect Discovery [0.685316573653194]
Refute-or-Promote(Refute-or-Promote)は、候補生成のためのSCH(Stratified Context Hunting)、逆殺命令、コンテキスト、Cross-Model Critic(CMC)を組み合わせた推論時信頼性パターンである。
提案するRefute-or-Promoteは、SCH(Stratified Context Hunting)を併用した推論時信頼性パターンで、候補生成、逆死命令、コンテキスト、およびクロスモデル批判(CMC)を行う。
提案するRefute-or-Promoteは、SCH(Stratified Context Hunting)を併用した推論時信頼性パターンで、候補生成、逆死命令、コンテキスト、およびクロスモデル批判(CMC)を行う。
論文 参考訳(メタデータ) (2026-04-21T03:55:35Z) - Reviewing the Reviewer: Elevating Peer Review Quality through LLM-Guided Feedback [75.31379834079648]
レビューを論証セグメントに分解するLLM駆動型フレームワークを提案する。
遅延思考と特異性をラベル付けした1,309文のデータセットであるLazyReviewPlusもリリースしました。
論文 参考訳(メタデータ) (2026-01-17T20:32:18Z) - Towards Practical Defect-Focused Automated Code Review [8.370750734081088]
オンラインレコメンデーションサービスの中で、業界レベルのC++を分析しながら、完全な自動化パイプラインを調査します。
1)関連コンテキストの取得,2)キーインクルージョンの改善,3)偽アラーム率(FAR)の低減,4)人間のバグスライシングの統合。
提案手法は, 既往の断層記録からの実世界のマージ要求に基づいて検証され, 従来のLLMよりも2倍, 以前のベースラインより10倍向上した。
論文 参考訳(メタデータ) (2025-05-23T14:06:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。