論文の概要: Agentic Code Review in the Terminal: A Trajectory-Level Analysis of Behavior, Cost, and Human-Alignment
- arxiv url: http://arxiv.org/abs/2607.16740v1
- Date: Sat, 18 Jul 2026 10:03:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.250425
- Title: Agentic Code Review in the Terminal: A Trajectory-Level Analysis of Behavior, Cost, and Human-Alignment
- Title(参考訳): ターミナルにおけるエージェントコードレビュー:行動・コスト・アライメントの軌道レベル分析
- Authors: Wachiraphan Charoenwet, Kla Tantithamthavorn, Patanamon Thongtanunam, Hong Yi Lin, Minwoo Jeong, Ming Wu,
- Abstract要約: 端末ベースの環境におけるエージェントコードレビューは、プルリクエスト作成前のローカル開発における早期フィードバックを可能にする。
既存の評価はパフォーマンス中心であり、リポジトリ基底のエージェントレビュアーの動的な振る舞いを捉えられない。
以上の結果から,エージェントレビューの精度は向上するが,十分な調査と検証のオーバーヘッドが生じる一方で,レビューの成功はより強力な計画と下流検証に結びついていることが示唆された。
- 参考スコア(独自算出の注目度): 8.909533914802669
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Agentic code review in terminal-based environments enables early feedback during local development before pull request creation. However, existing evaluations remain performance-centric and fail to capture the dynamic behaviors of repository-grounded agentic reviewers. Understanding these behaviors is critical for identifying how agentic reviewers succeed, fail, and incur hidden operational costs in practice. Then, we analyze the reviewers' behavior based on their trajectories. Our results show that agentic reviewers achieve higher review precision but incur substantial exploration and validation overhead, while successful reviews are associated with stronger planning and less downstream validation. These findings highlight the potential benefits of trajectory-aware and cost-sensitive evaluation of future agentic code review systems.
- Abstract(参考訳): 端末ベースの環境におけるエージェントコードレビューは、プルリクエスト作成前のローカル開発における早期フィードバックを可能にする。
しかし、既存の評価はパフォーマンス中心であり、リポジトリ基底のエージェントレビュアーの動的な振る舞いを捉えられない。
これらの振る舞いを理解することは、エージェントレビュアーがどのように成功し、失敗し、実際に隠れた運用コストを発生させるかを特定するために重要である。
そして,その軌跡に基づいてレビュアーの行動を分析する。
以上の結果から,エージェントレビューの精度は向上するが,十分な調査と検証のオーバーヘッドが生じる一方で,レビューの成功はより強力な計画と下流検証に結びついていることが示唆された。
これらの結果は,将来のエージェントコードレビューシステムのトラジェクトリ認識とコスト感受性評価の潜在的なメリットを浮き彫りにしている。
関連論文リスト
- From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape [79.30826980815927]
ルーブリックは、複雑な品質判断を構造化され、実行可能な標準に変換する明示的な基準セットです。
我々は,既存のルーリックデザインを体系的に整理し,その構築と最適化を検証し,評価と訓練をまたいだ役割を解析する。
論文 参考訳(メタデータ) (2026-06-07T13:34:55Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - Log analysis is necessary for credible evaluation of AI agents [31.236953223202875]
エージェントベンチマークは通常、パスまたはフェールという最終結果のみを報告します。
これは3つの点で評価の信頼性を脅かす。
これらの妥当性の脅威を克服するにはログ分析が必要であると我々は主張する。
論文 参考訳(メタデータ) (2026-05-08T23:10:32Z) - A Benchmark for Evaluating Repository-Level Code Agents with Intermediate Reasoning on Feature Addition Task [11.218318079376365]
RACE-benchは、機能追加タスクでコードエージェントを評価するための推論強化ベンチマークである。
RACE-benchには、12のオープンソースリポジトリから528の現実世界の機能追加インスタンスが含まれている。
RACE-bench上での3つのリポジトリレベルのコードエージェントの評価を行った。
論文 参考訳(メタデータ) (2026-03-27T11:58:47Z) - CR-Bench: Evaluating the Real-World Utility of AI Code Review Agents [0.7496422063843831]
我々は、ベンチマークデータセットであるCR-Benchと、コードレビューエージェントのためのきめ細かい評価パイプラインであるCR-Evaluatorを紹介する。
コードレビューエージェントは、隠されたすべての問題を特定するために設計された場合、低信号対雑音比を示すことができる。
本分析では,課題解決と突発的な発見との間に隠されたトレードオフを明らかにし,効果的なエージェント設計を制約するフロンティアを明らかにした。
論文 参考訳(メタデータ) (2026-03-10T21:29:42Z) - Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents [22.781523439717223]
エージェントのパフォーマンスを適切に評価するには、最終回答を超え、問題解決の軌跡も評価する必要がある。
ツール拡張LDMエージェント性能の多次元評価のためのフレームワークであるTRACEを紹介する。
TRACEはこれらの複雑な挙動を,スケーラブルで費用対効果の高い方法で正確に評価する。
論文 参考訳(メタデータ) (2025-10-03T09:19:15Z) - Identifying Aspects in Peer Reviews [59.02879434536289]
我々は、ピアレビューのコーパスからアスペクトを抽出するデータ駆動スキーマを開発した。
我々は、アスペクトを付加したピアレビューのデータセットを導入し、コミュニティレベルのレビュー分析にどのように使用できるかを示す。
論文 参考訳(メタデータ) (2025-04-09T14:14:42Z) - Unbiased Evaluation of Large Language Models from a Causal Perspective [19.897724867351315]
評価バイアスを理論的に定式化し、バイアスのない評価プロトコルの設計に関する貴重な洞察を提供する。
我々は,LLMのより包括的で,偏りのない,解釈可能な評価プロトコルであるUnbiased Evaluatorを提案する。
論文 参考訳(メタデータ) (2025-02-10T16:45:18Z) - Catch Me if I Can: Detecting Strategic Behaviour in Peer Assessment [61.24399136715106]
我々は、試験やホームワークの査定や採用・昇進の査定など、様々な査定課題における戦略的行動の課題について考察する。
我々はこのような操作を検出する方法の設計に重点を置いている。
具体的には、エージェントがピアのサブセットを評価し、後に集約されたランキングを最終的な順序付けとして出力する設定について検討する。
論文 参考訳(メタデータ) (2020-10-08T15:08:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。