論文の概要: CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation
- arxiv url: http://arxiv.org/abs/2608.03535v1
- Date: Tue, 04 Aug 2026 12:15:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 07:04:20.718678
- Title: CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation
- Title(参考訳): CodeAssay: LLMコード生成のためのオーディテッドグラウンドトゥルースを用いたマルチメトリックベンチマーク
- Authors: Shahbaz Siddeeq, Muhammad Waseem, Umar Subhan Malhi, Pekka Abrahamsson,
- Abstract要約: CodeAssayは10のソフトウェアエンジニアリングカテゴリにまたがる185のPythonタスクの分類学第一のベンチマークである。
監査済みの真実、生成と修復のための公開テスト、グレーディングのための隠されたテスト、突然変異ベースのテストスーツ検証、選択されたコードプロパティ対策を組み合わせる。
- 参考スコア(独自算出の注目度): 1.8589311604031529
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models are increasingly evaluated for code generation using test-based benchmarks. The validity of such evaluations depends on the reliability of their references and tests, while test-based correctness captures only part of the observable properties of generated code. We present CodeAssay, a taxonomy-first benchmark of 185 Python tasks across ten software-engineering categories. It combines audited ground truth, public tests for generation and repair, hidden tests for grading, mutation-based test-suite validation, and selected code-property measures. Regrading fixed model outputs after the audit changed 170 of 1,890 correctness labels (9.0%) and increased the measured best-to-worst model spread from 11.9 to 23.7 percentage points, although aggregate correctness remained nearly unchanged. The complete and hidden test suites achieved mutation scores of 82.6% and 74.8%, respectively. Across seven proprietary LLMs, standard-prompt correctness ranged from 77.3% to 98.9%, with significant differences in 12 of 21 model pairs. On the 120 tasks solved by all 14 model-prompt configurations, no model performed best across all selected code properties. A security-focused prompt produced no significant change in correctness or consistent reduction in the selected static-analysis findings, while increasing program length and cyclomatic complexity across all models. These findings show that reliable evaluation of LLM-generated code requires validated ground truth, protected tests, and multiple explicitly interpreted measures. CodeAssay provides a reproducible basis for evidence-based model evaluation in AI-augmented software development.
- Abstract(参考訳): 大規模な言語モデルは、テストベースのベンチマークを使用してコード生成のためにますます評価されている。
このような評価の妥当性は、参照とテストの信頼性に依存するが、テストベースの正確性は、生成されたコードの可観測性の一部をキャプチャする。
CodeAssayは10のソフトウェアエンジニアリングカテゴリにまたがる185のPythonタスクの分類学第一のベンチマークである。
監査済みの真実、生成と修復のための公開テスト、グレーディングのための隠されたテスト、突然変異ベースのテストスーツ検証、選択されたコードプロパティ対策を組み合わせる。
監査後の固定モデルの出力は1,890個の正当性ラベル(9.0%)を170個変更し、測定されたベスト・ツー・ワースト・モデルが1.9ポイントから23.7ポイントまで拡大したが、総合的正当性はほぼ変わらなかった。
完全なテストスイートと隠れテストスイートは、それぞれ82.6%と74.8%の突然変異スコアを得た。
7つのプロプライエタリなLLMで、標準プロンプトの正確さは77.3%から98.9%まで変化し、21組のモデルペアのうち12組で大きな違いがあった。
14のモデルプロンプト構成で解決された120のタスクでは、選択されたすべてのコードプロパティで最善を尽くしたモデルはない。
セキュリティを重視したプロンプトは、選択された静的分析結果の正当性や一貫した減少に有意な変化は生じなかったが、プログラム長と全モデルにわたるサイクロマティックな複雑さは増大した。
これらの結果から, LLM生成コードの信頼性評価には, 検証済みの真理, 保護された試験, および複数の明示的に解釈された措置が必要であることが示唆された。
CodeAssayは、AI強化ソフトウェア開発におけるエビデンスベースのモデル評価の再現可能な基盤を提供する。
関連論文リスト
- Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - Unit Test Update through LLM-Driven Context Collection and Error-Type-Aware Refinement [5.8748750353007635]
テストのメンテナンス方法は、主に壊れたテストの修復に焦点を当て、新しい機能を検証するために既存のテストを強化するシナリオを無視します。
実運用コードの変更に応じて、ジャスト・イン・タイムの自動テスト更新を可能にする新しいアプローチであるTESTUPDATERを提案する。
TestUPDATERは94.4%のコンパイルパス率と86.7%のテストパス率を達成し、それぞれ最先端のSYTERを15.9%と20.0%で上回っている。
論文 参考訳(メタデータ) (2025-09-29T08:08:22Z) - Learning to Solve and Verify: A Self-Play Framework for Code and Test Generation [69.62857948698436]
大規模言語モデル(LLM)の最近の進歩は、コーディングベンチマークのパフォーマンスを改善している。
しかし、手軽に利用できる高品質なデータの枯渇により、改善は停滞している。
本稿では,単一モデルのコードとテスト生成能力を共同で改善するセルフプレイ・ソルバ検証フレームワークであるSol-Verを提案する。
論文 参考訳(メタデータ) (2025-02-20T18:32:19Z) - TestGenEval: A Real World Unit Test Generation and Test Completion Benchmark [24.14654309612826]
TestGenEvalは、1,210のコードから68,647のテストと、11の保守されたPythonリポジトリにまたがるテストファイルペアで構成されている。
初期テストのオーサリング、テストスイートの補完、コードカバレッジの改善をカバーしている。
パラメータは7Bから405Bまで様々である。
論文 参考訳(メタデータ) (2024-10-01T14:47:05Z) - Measuring the Influence of Incorrect Code on Test Generation [22.168699378889148]
間違ったコードエクスペリエンスのために生成されたテストは、バグ検出率を47%上回っている。
+18%の精度、+4%のカバレッジ、+34%のバグ検出の改善は、自然言語によるコード記述を提供することで達成できる。
論文 参考訳(メタデータ) (2024-09-14T15:17:34Z) - Self-Evaluation Improves Selective Generation in Large Language Models [54.003992911447696]
オープンエンド生成タスクをトークンレベルの予測タスクに再構成する。
我々はLSMに答えを自己評価するように指示する。
自己評価に基づくスコアリング手法をベンチマークする。
論文 参考訳(メタデータ) (2023-12-14T19:09:22Z) - LLMs as Factual Reasoners: Insights from Existing Benchmarks and Beyond [135.8013388183257]
そこで我々は,SummEditsと呼ばれる10ドメインのベンチマークで不整合検出ベンチマークを作成し,実装する新しいプロトコルを提案する。
ほとんどのLLMはSummEditsで苦労しており、パフォーマンスはランダムに近い。
最も優れたモデルであるGPT-4は、推定された人間のパフォーマンスよりも8%低い。
論文 参考訳(メタデータ) (2023-05-23T21:50:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。