論文の概要: ProdCodeBench: A Production-Derived Benchmark for Evaluating AI Coding Agents
- arxiv url: http://arxiv.org/abs/2604.01527v2
- Date: Fri, 03 Apr 2026 07:18:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 12:42:34.272044
- Title: ProdCodeBench: A Production-Derived Benchmark for Evaluating AI Coding Agents
- Title(参考訳): ProdCodeBench:AIコーディングエージェントを評価するための生産指向ベンチマーク
- Authors: Smriti Jha, Matteo Paltenghi, Chandra Maddila, Vijayaraghavan Murali, Shubham Ugare, Satish Chandra,
- Abstract要約: 本稿では,ProdCodeBenchを用いて実運用用ベンチマークの計算手法を提案する。
それぞれのキュレートされたサンプルは、7つのプログラミング言語にまたがる冗長なプロンプト、コミットされたコード変更、フェイル・ツー・パステストで構成されている。
4つの基礎モデルの体系的な分析は、53.2%から72.2%の範囲で解決する。
- 参考スコア(独自算出の注目度): 10.578603956693696
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Benchmarks that reflect production workloads are better for evaluating AI coding agents in industrial settings, yet existing benchmarks differ from real usage in programming language distribution, prompt style and codebase structure. This paper presents a methodology for curating production-derived benchmarks, illustrated through ProdCodeBench, a benchmark sourced from real developer-agent sessions. We detail our data collection and curation practices including LLM-based task classification, test relevance validation, and multi-run stability checks which address challenges in constructing reliable evaluation signals from monorepo environments. Each curated sample consists of a verbatim prompt, a committed code change and fail-to-pass tests spanning seven programming languages. Our systematic analysis of four foundation models yields solve rates ranging from 53.2% to 72.2%. We demonstrate how these offline evaluation signals drive practical decisions around model selection and harness design, while noting that offline benchmarks provide directional signal that we complement with online A/B testing for production deployment decisions. We share our methodology and lessons learned to enable other organizations to construct similar production-derived benchmarks.
- Abstract(参考訳): プロダクションワークロードを反映したベンチマークは、産業環境でAIコーディングエージェントを評価するのに適しているが、既存のベンチマークは、実際のプログラミング言語の配布、プロンプトスタイル、コードベース構造とは異なる。
本稿では,実際の開発者エージェントセッションをベースとしたベンチマークであるProdCodeBenchを用いて,生産ベースベンチマークの計算手法を提案する。
LLMに基づくタスク分類、テスト関連性検証、モノレポ環境からの信頼性評価信号構築における課題に対処するマルチラン安定性チェックなど、データ収集とキュレーションの実践について詳述する。
それぞれのキュレートされたサンプルは、7つのプログラミング言語にまたがる冗長なプロンプト、コミットされたコード変更、フェイル・ツー・パステストで構成される。
4つの基礎モデルの体系的な分析は、53.2%から72.2%の範囲で解決する。
これらのオフライン評価信号が、モデル選択と設計の実践的な決定を駆動し、オフラインベンチマークは、運用デプロイメントの決定のためにオンラインA/Bテストと補完する指向的なシグナルを提供する、と指摘する。
私たちは、他の組織が同様のプロダクションベースのベンチマークを構築するために学んだ方法論と教訓を共有します。
関連論文リスト
- WybeCoder: Verified Imperative Code Generation [22.401681809856896]
WybeCoderはエージェントコード検証フレームワークである。
コード、不変性、そして証明が共進化する所で、証明・アズ・ユー・ジェネレーション開発を可能にする。
論文 参考訳(メタデータ) (2026-03-31T00:06:44Z) - SiliconMind-V1: Multi-Agent Distillation and Debug-Reasoning Workflows for Verilog Code Generation [1.8797634116550468]
大規模言語モデル(LLM)は、最近、Verilogコード生成を自動化するための有望なアプローチとして登場した。
本研究では,統合テストベンチ駆動検証を用いた推論指向トレーニングデータ生成のための統合マルチエージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-10T06:43:20Z) - PACIFIC: a framework for generating benchmarks to check Precise Automatically Checked Instruction Following In Code [1.1164117387254457]
大言語モデル(LLM)ベースのコードアシスタントは、生成AIの強力な応用として登場した。
これらのシステムの主な要件は、ユーザの指示を正確に従う能力である。
PACIFICは,逐次命令追従機能とコードドライラン機能とを厳格に評価するベンチマークを自動的に生成する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-12-11T14:49:56Z) - Automated Validation of LLM-based Evaluators for Software Engineering Artifacts [0.7548538278943616]
REFINE(Ranking Evaluators for FIne grained Nuanced Evaluation)は、大規模言語モデル(LLM)をベンチマークする自動化フレームワークである。
REFINEは、徐々に品質が低下したアーティファクトを自動的に合成するために、新しい生成技術を適用している。
それぞれの候補評価器の構成を、そのランクが期待された順序にどの程度近いかを測定することで定量化する。
論文 参考訳(メタデータ) (2025-08-04T18:52:01Z) - Training Language Models to Generate Quality Code with Program Analysis Feedback [66.0854002147103]
大規模言語モデル(LLM)によるコード生成は、ますます本番環境で採用されているが、コード品質の保証には失敗している。
実運用品質のコードを生成するためにLLMにインセンティブを与える強化学習フレームワークであるREALを提案する。
論文 参考訳(メタデータ) (2025-05-28T17:57:47Z) - IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis [60.32962597618861]
IDA-Benchは、多ラウンドの対話シナリオで大規模言語モデルを評価する新しいベンチマークである。
エージェント性能は、最終的な数値出力と人間由来のベースラインを比較して判断する。
最先端のコーディングエージェント(Claude-3.7-thinkingなど)でさえ50%のタスクを成功させ、シングルターンテストでは明らかでない制限を強調している。
論文 参考訳(メタデータ) (2025-05-23T09:37:52Z) - Scoring Verifiers: Evaluating Synthetic Verification for Code and Reasoning [59.25951947621526]
本稿では,既存の符号化ベンチマークをスコアとランキングデータセットに変換して,合成検証の有効性を評価する手法を提案する。
我々は4つの新しいベンチマーク(HE-R, HE-R+, MBPP-R, MBPP-R+)を公表し, 標準, 推論, 報酬に基づくLCMを用いて合成検証手法を解析した。
実験の結果, 推論はテストケースの生成を著しく改善し, テストケースのスケーリングによって検証精度が向上することがわかった。
論文 参考訳(メタデータ) (2025-02-19T15:32:11Z) - Automated Refactoring of Non-Idiomatic Python Code: A Differentiated Replication with LLMs [54.309127753635366]
本研究は, GPT-4の有効性について検討し, 慣用行動の推奨と示唆について検討した。
この結果から,従来は複雑なコード解析に基づくレコメンデータの実装が求められていた,LCMの課題達成の可能性が浮き彫りになった。
論文 参考訳(メタデータ) (2025-01-28T15:41:54Z) - RepoMasterEval: Evaluating Code Completion via Real-World Repositories [14.744942194298673]
RepoMasterEvalは、現実世界のリポジトリから構築されたコード補完モデルを評価するための新しいベンチマークである。
各ベンチマークは、1つのソースコードファイルから既存のテストスイートでコードスニペットをマスキングすることで生成される。
論文 参考訳(メタデータ) (2024-08-07T03:06:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。