論文の概要: Evaluating the effectiveness of class-level LLM-generated test suites in Python
- arxiv url: http://arxiv.org/abs/2609.24341v1
- Date: Mon, 21 Sep 2026 09:37:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 15:37:52.435442
- Title: Evaluating the effectiveness of class-level LLM-generated test suites in Python
- Title(参考訳): PythonにおけるクラスレベルのLCM生成テストスイートの有効性の評価
- Abstract要約: 大規模言語モデル(LLM)は迅速に単体テストを生成することができるが、高い構造的カバレッジは、これらのテストが確実に実行され、障害を検出することを保証するものではない。
既存のエビデンスはしばしばカバレッジを主要な結果として扱い、クラスレベルでの突然変異テストを通じて、迅速な戦略とモデルを比較することは滅多にない。
本研究では, LLM 生成 Python テストスイートの実行可能性, 構造的カバレッジ, 欠陥検出の有効性, 構造的品質について検討した。
- 参考スコア(独自算出の注目度): 0.39998518782208786
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Context: Large language models (LLMs) can generate unit tests quickly, but high structural coverage does not establish that those tests execute reliably or detect faults. Existing evidence often treats coverage as the principal outcome and rarely compares prompt strategies and models through mutation testing at class level. Objective: This study examines how prompt strategy and model choice shape the executability, structural coverage, fault-detection effectiveness, and structural quality of LLM-generated Python test suites relative to human-written suites. Method: We evaluate multiple prompt strategies across a diverse set of current LLM configurations on the ClassEval benchmark. The evaluation combines execution outcomes, line and branch coverage, Cosmic Ray mutation scores, and structural quality indicators. Primary analyses treat successful execution as a prerequisite; paired comparisons use only classes shared by the relevant executable subsets. Results: Structural coverage is consistently near its ceiling and offers little discrimination among configurations. Executability varies substantially. The proposed prompt performs strongly for mutation score, but no prompt dominates across models. Model choice explains more variation than prompt choice, and their interaction shows that prompt effectiveness depends on the selected model. Human and LLM suites are evaluated on unequal executable subsets, so their relative mutation scores do not establish superiority. Conclusion: Reliable assessment of LLM-generated tests should treat executability as a gate and combine coverage with mutation testing and structural quality indicators. In practice, model selection should precede prompt tuning.
- Abstract(参考訳): コンテキスト: 大規模言語モデル(LLM)はユニットテストを迅速に生成できるが、高い構造的カバレッジは、これらのテストが確実に実行されるか、障害を検出することを保証しない。
既存のエビデンスはしばしばカバレッジを主要な結果として扱い、クラスレベルでの突然変異テストを通じて、迅速な戦略とモデルを比較することは滅多にない。
目的: 本研究は, LLM 生成 Python テストスイートの実行可能性, 構造カバレッジ, 欠陥検出の有効性, 構造品質を, 人手によるテストスイートと比較していかに迅速に形成するかを検討する。
方法: クラスEvalベンチマークにおいて, 現在のLLM構成の多種多様なセットに対して, 複数のプロンプト戦略を評価する。
評価には、実行結果、行と枝のカバレッジ、宇宙線突然変異スコア、構造的品質指標が組み合わされている。
一次解析は実行を前提条件として扱い、ペア比較は関連する実行可能なサブセットで共有されるクラスのみを使用する。
結果: 構造的カバレッジは、常に天井付近にあり、構成間ではほとんど区別されません。
実行可能性は大きく異なる。
提案したプロンプトは突然変異スコアに対して強く作用するが、モデル間ではプロンプトが支配的ではない。
モデル選択は、迅速な選択よりも多くのバリエーションを説明し、それらの相互作用は、迅速な効果が選択されたモデルに依存することを示す。
人間とLLMスイートは不平等な実行可能サブセットで評価されるため、それらの相対突然変異スコアは優越性を確立しない。
結論: LLM生成試験の信頼性評価は、実行可能性をゲートとして扱い、変異検査や構造品質指標と組み合わせるべきである。
実際には、モデル選択はプロンプトチューニングに先んじるべきである。
関連論文リスト
- Do Coverage and Mutation Scores of LLM-Generated Test Suites Correlate with Their Effectiveness? (Replicability Study) [6.228248513679207]
研究によると、テストスイートのサイズが制御されると、カバレッジ、突然変異、および実際のバグ検出の相関がほとんどなくなる。
対象と変異の有用性は,文脈依存的であることが示唆された。
また、テストスイートのサイズがカバレッジ、突然変異、実際のバグ検出の相関関係において、主要な共同創設者であるという証拠もほとんどありません。
論文 参考訳(メタデータ) (2026-07-24T19:46:30Z) - Mutation-Guided Unit Test Generation with a Large Language Model [7.3946430511009735]
MUTGENは変異誘導型LLMベースのテスト生成アプローチである。
これはEvoSuiteとバニラプロンプトベースの戦略の両方で突然変異スコアにおいて著しく優れています。
論文 参考訳(メタデータ) (2025-06-03T14:47:22Z) - Mutation Testing via Iterative Large Language Model-Driven Scientific Debugging [10.334617290353192]
我々は,Large Language Models (LLM) が変異体に対するテストを生成する上で,科学的計算が有効かどうかを評価する。
LLMは、より良い障害検出とカバレッジを持つテストを生成する上で、Pynguinを一貫して上回っている。
重要なことは、テストケースの反復的な改善が高品質なテストスイートを実現する上で重要であるということだ。
論文 参考訳(メタデータ) (2025-03-11T08:47:13Z) - StructTest: Benchmarking LLMs' Reasoning through Compositional Structured Outputs [78.84060166851805]
StructTestは、大規模な言語モデル(LLM)を合成命令に従って構造化出力を生成する能力に基づいて評価する、新しいベンチマークである。
評価はルールベースの評価器を用いて決定的に行われ、新しいタスクやデータセットに容易に拡張できる。
StructTestは、Deepseek-V3/R1やGPT-4oといったトップパフォーマンスモデルでも、依然として難しいままです。
論文 参考訳(メタデータ) (2024-12-23T22:08:40Z) - AIME: AI System Optimization via Multiple LLM Evaluators [79.03422337674664]
AIME は複数の LLM を利用した評価プロトコルであり、それぞれが独立した基準で評価を生成し、結合を通してそれらを結合する。
コード生成タスクにおける AIME のベースラインメソッドのパフォーマンスは,LeetCodeHard と HumanEval データセットの単一 LLM 評価プロトコルよりも最大 62% 高いエラー検出率,最大 16% 高い成功率で向上している。
論文 参考訳(メタデータ) (2024-10-04T04:03:24Z) - Self-Evaluation Improves Selective Generation in Large Language Models [54.003992911447696]
オープンエンド生成タスクをトークンレベルの予測タスクに再構成する。
我々はLSMに答えを自己評価するように指示する。
自己評価に基づくスコアリング手法をベンチマークする。
論文 参考訳(メタデータ) (2023-12-14T19:09:22Z) - LLMs as Factual Reasoners: Insights from Existing Benchmarks and Beyond [135.8013388183257]
そこで我々は,SummEditsと呼ばれる10ドメインのベンチマークで不整合検出ベンチマークを作成し,実装する新しいプロトコルを提案する。
ほとんどのLLMはSummEditsで苦労しており、パフォーマンスはランダムに近い。
最も優れたモデルであるGPT-4は、推定された人間のパフォーマンスよりも8%低い。
論文 参考訳(メタデータ) (2023-05-23T21:50:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。