論文の概要: SWE-Review: Closing the Loop on Issue Resolution with Agentic Code Review
- arxiv url: http://arxiv.org/abs/2607.06065v1
- Date: Tue, 07 Jul 2026 09:37:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.471148
- Title: SWE-Review: Closing the Loop on Issue Resolution with Agentic Code Review
- Title(参考訳): SWE-Review: エージェントコードレビューによる問題解決のループのクローズ
- Abstract要約: コーディングエージェントは、現実世界のソフトウェア問題に対するプルリクエスト(PR)をますます生成します。
PRは、体系的なレビュー、診断、修正なしに提案される。
エージェントコードレビューでこのループを閉じるためのフレームワークである textbfSWE-Review を導入する。
- 参考スコア(独自算出の注目度): 47.72392142544407
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Coding agents increasingly generate pull requests (PRs) for real-world software issues, yet one-shot PR generation remains open-loop: the PR is proposed without systematic review, diagnosis, or revision. We introduce \textbf{SWE-Review}, a framework for closing this loop with agentic code review. Given an issue and an AI-generated PR, a reviewer agent explores the repository, decides whether the PR should be accepted, and provides structured feedback for revision. We evaluate this setting with our proposed \textbf{SWE-Review-Bench} to measure both review correctness and downstream revision usefulness. We further curate \textbf{SWE-Review-Traj} dataset to study broader applications of agentic review and fill the data-scarcity gap for open reviewer training. Experiments show that agentic review continuously improves PRs through a generate-review-revise loop, outperforms single-turn fixed-context review in both decision accuracy and resolve rate after revision, transfers beyond review to improve issue-resolution models, and enables effective and efficient test-time scaling. These results position agentic code review as a practical mechanism for moving AI coding agents from one-shot PR generation toward closed-loop issue resolution.
- Abstract(参考訳): コーディングエージェントは、現実世界のソフトウェア問題に対するプルリクエスト(PR)をますます生成しますが、ワンショットのPR生成はオープンループのままです。
我々はエージェントコードレビューでこのループを閉じるためのフレームワークである \textbf{SWE-Review} を紹介した。
問題とAI生成されたPRが与えられた場合、レビュアエージェントがレポジトリを探索し、PRが受け入れられるべきかどうかを決定し、リビジョンのための構造化されたフィードバックを提供する。
この設定を,提案した「textbf{SWE-Review-Bench}」を用いて評価し,レビュー精度と下流修正の有用性を両立させる。
さらに, エージェントレビューの幅広い応用について検討し, オープンレビュアートレーニングにおけるデータ共有ギャップを埋めるために, textbf{SWE-Review-Traj}データセットをキュレートする。
実験の結果、エージェントレビューは、生成レビュー・レビューループを通じてPRを継続的に改善し、意思決定精度とリビジョン後の解決率の両方で単一ターンの固定コンテキストレビューを上回り、レビューを超えてリビジョンを超えてイシューレゾリューションモデルを改善し、効果的かつ効率的なテストタイムスケーリングを可能にした。
これらの結果から、エージェントコードレビューは、AIコーディングエージェントをワンショットPR生成からクローズループ問題解決に移行するための実践的なメカニズムとして位置づけられる。
関連論文リスト
- ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation [54.82704239643649]
本稿では, 紙固有の診断と具体的, 基礎的なリビジョン計画とを結びつける, 反感に満ちたポストトレーニングフレームワークである ActReview を紹介する。
我々の中心的な洞察は、著者の反論は、レビュアーの懸念に対処するための妥当な行動を明らかにし、それゆえ、リビジョン指向のフィードバックに対する潜在的な監督を提供することができるということである。
またActReview-Benchは、診断品質とリビジョンの有用性を評価するために、1,000インスタンスの人為的なベンチマークである。
論文 参考訳(メタデータ) (2026-09-08T17:30:16Z) - CAFE: Self-Improving Search Agents Need Co-Evolving Feedback [64.5257526832476]
アウトカム管理された検索エージェントは、いつ、どのように証拠を回収するかを学習するが、端末の報酬は中間エラーのローカライズも、それらのエラーが複雑になる前に継続する軌道のリダイレクトもしない。
学習した軌道内での介入として修正的フィードバックを扱うことは、エージェントがいつフィードバックを要求し使用するかを決めなければならないのに対し、批評家は、エージェントが改善するにつれて障害パターンが変化する結果構築されたロールアウトから有用な修正を推測しなければならない。
論文 参考訳(メタデータ) (2026-08-25T16:39:00Z) - Reinforced Agent: Inference-Time Feedback for Tool-Calling Agents [6.158612515104146]
エージェントフィードバックとレビュアーフィードバックのトレードオフを測定するために、ヘルプフルネス・ハームフルネスメトリクスを導入します。
我々はBFCLとTau2-Bench(マルチターンステートフルシナリオ)に対するアプローチを評価し、無関係検出では+5.5%、マルチターンタスクでは+7.1%を達成した。
GPT-4oでは,評価モデルo3-miniが3:1の利益率と2.1:1の利益率を達成した。
論文 参考訳(メタデータ) (2026-04-29T22:09:47Z) - ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents [50.27474750319121]
公式ガイドライン、論文の内容、人間によるレビューから派生した、紙固有のルーリックに従ってテキストをレビューする。
本稿では、公式ガイドライン、論文の内容、人手によるレビューに基づいて、レビューテキストを評価するベンチマークであるREVIEWBENCHを紹介する。
本稿では,レビューを起草段階と接地段階に分解するルーリック誘導ツール統合マルチエージェントフレームワークであるREVIEWGROUNDERを提案する。
論文 参考訳(メタデータ) (2026-04-15T16:33:04Z) - CR-Bench: Evaluating the Real-World Utility of AI Code Review Agents [0.7496422063843831]
我々は、ベンチマークデータセットであるCR-Benchと、コードレビューエージェントのためのきめ細かい評価パイプラインであるCR-Evaluatorを紹介する。
コードレビューエージェントは、隠されたすべての問題を特定するために設計された場合、低信号対雑音比を示すことができる。
本分析では,課題解決と突発的な発見との間に隠されたトレードオフを明らかにし,効果的なエージェント設計を制約するフロンティアを明らかにした。
論文 参考訳(メタデータ) (2026-03-10T21:29:42Z) - Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization [58.390885294401066]
Retrieval-augmented Generation (RAG) は知識基底型大規模言語モデル(LLM)を実現するためのパラダイムとして広く採用されている。
RAGパイプラインは、モデル推論が得られた証拠と整合性を維持するのに失敗することが多く、事実上の矛盾や否定的な結論につながる。
批判駆動アライメント(CDA)に基づく新しい反復的枠組みであるAlignRAGを提案する。
AlignRAG-autoは、動的に洗練を終了し、批判的な反復回数を事前に指定する必要がなくなる自律的な変種である。
論文 参考訳(メタデータ) (2025-04-21T04:56:47Z) - On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows [71.92083784393418]
エージェントAI(自律的な計画と行動を行うシステム)は広く普及しているが、複雑なタスクにおけるタスクの成功率は低いままである。
推論時のアライメントは、サンプリング、評価、フィードバックの3つのコンポーネントに依存します。
本稿では,様々な形態の批判から抽出されたフィードバックを繰り返し挿入するIterative Agent Decoding(IAD)を紹介する。
論文 参考訳(メタデータ) (2025-04-02T17:40:47Z) - On Unified Prompt Tuning for Request Quality Assurance in Public Code Review [19.427661961488404]
We propose a unified framework called UniPCR to complete developer-based request quality assurance (e., predicting request need and recommending tags subtask) under a Masked Language Model (MLM)。
2011-2022年までのPublic Code Reviewデータセットの実験結果は、我々のUniPCRフレームワークが2つのサブタスクに適応し、要求品質保証のための最先端の手法で同等の精度に基づく結果より優れていることを示している。
論文 参考訳(メタデータ) (2024-04-11T17:41:28Z) - Code Reviewer Recommendation Based on a Hypergraph with Multiplex
Relationships [30.74556500021384]
多重関係を持つハイパーグラフを利用する新しいコードレビュアレコメンデーション手法であるMIRRecを提案する。
MIRRecは、プルリクエストと開発者の間で、学位なしのハイパーエッジを使用して、従来のペアワイズ接続を超える高次相関をエンコードする。
MIRRecの有効性を検証するために、GitHubにホストされている10の人気のあるオープンソースプロジェクトからの48,374のプルリクエストからなるデータセットを用いて実験を行った。
論文 参考訳(メタデータ) (2024-01-19T15:25:14Z) - Convex Aggregation for Opinion Summarization [18.753472191533515]
エンコーダデコーダモデルは、単一レビューを再構築するために訓練され、潜在レビューエンコーディング空間を学習する。
要約時には、潜在レビューベクトルの未重み付き平均を要約に復号する。
本稿では,意見要約のためのconvexベクトル集約フレームワークであるcoopを提案する。
論文 参考訳(メタデータ) (2021-04-03T10:52:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。