論文の概要: How effective are traditional test criteria at detecting bugs in large language models generated code?
- arxiv url: http://arxiv.org/abs/2609.09315v1
- Date: Tue, 08 Sep 2026 18:04:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.777413
- Title: How effective are traditional test criteria at detecting bugs in large language models generated code?
- Title(参考訳): 大規模言語モデル生成コードのバグ検出における従来のテスト基準はどの程度有効か?
- Abstract要約: 大規模言語モデルによって導入されたほとんどの障害は、比較的簡単にキャッチできる。
断層検出率は極端に低く、多くの場合ゼロに近い。
急進的なオラクルは断層検出を改善することができるが、全体的な効果は限られている。
- 参考スコア(独自算出の注目度): 5.2762490553598065
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Test adequacy criteria are widely used to evaluate and guide software testing. Although prior research has extensively examined these criteria using human-written programs, faults, and tests, the increasing adoption of Large Language Models (LLMs) for code generation raises important questions about their effectiveness in detecting LLM-induced faults. To investigate this, we conduct an empirical study involving 5 LLMs and 4 benchmarks, simulating end-to-end workflows in which both code and tests are automatically generated. We collect 6,000+ faulty program instances and evaluate the effectiveness and efficiency of 3 widely used adequacy criteria: statement coverage, branch coverage, and mutation testing. Our findings reveal several key insights. First, most faults introduced by LLMs are relatively trivial to catch. Second, the challenging faults are difficult to trigger using either traditional coverage-based or mutation-based criteria. Third, actual fault detection rates remain extremely low, often near zero, because test oracles fail to capture faulty behavior triggered by the generated test prefixes, exposing a critical limitation of automated test generation. Fourth, prompt-aware oracles can improve fault detection, but their overall effectiveness remains limited, highlighting the need for users to manually reason about test assertions. We further observe that mutation testing only marginally outperforms traditional coverage criteria in both triggering and detecting faults, raising questions about whether its significantly higher application cost is justified in this context.
- Abstract(参考訳): テストの妥当性基準は、ソフトウェアテストの評価とガイドに広く使用されている。
コード生成におけるLLM(Large Language Models)の導入の増加は,LLMによる欠陥の検出において,その有効性に関する重要な疑問を提起している。
そこで本研究では,コードとテストの両方が自動生成されるエンドツーエンドのワークフローをシミュレートした,5つのLLMと4つのベンチマークに関する実証的研究を行った。
6000以上の障害プログラムを収集し, 文カバレッジ, 分岐カバレッジ, 突然変異検査という, 広く使用されている3つの基準の有効性と効率を評価する。
我々の発見はいくつかの重要な洞察を浮き彫りにした。
まず、LLMによって導入されたほとんどの障害は、比較的簡単にキャッチできる。
第二に、従来のカバレッジベースまたは突然変異ベースの基準を使用することで、困難な障害をトリガーすることは困難である。
第3に、テストオーラクルは生成されたテストプレフィックスによって引き起こされる欠陥の振る舞いを捉えず、自動テスト生成の限界を露呈するため、実際の障害検出率は極端に低く、多くの場合ゼロに近いままである。
第4に、プロンプト対応のオラクルは障害検出を改善することができるが、全体的な効果は限定的であり、テストアサーションを手動で推論する必要性を強調している。
さらに、突然変異検査は、障害の誘発と検出の両方において従来のカバレッジ基準をわずかに上回り、この文脈でアプリケーションコストが著しく高いことが正当化されるかどうかという疑問を提起する。
関連論文リスト
- Do Coverage and Mutation Scores of LLM-Generated Test Suites Correlate with Their Effectiveness? (Replicability Study) [6.228248513679207]
研究によると、テストスイートのサイズが制御されると、カバレッジ、突然変異、および実際のバグ検出の相関がほとんどなくなる。
対象と変異の有用性は,文脈依存的であることが示唆された。
また、テストスイートのサイズがカバレッジ、突然変異、実際のバグ検出の相関関係において、主要な共同創設者であるという証拠もほとんどありません。
論文 参考訳(メタデータ) (2026-07-24T19:46:30Z) - Fail-Aware and Explainable Test Oracle Prediction [4.6927139685668315]
新たなコードLLMに基づく識別オラクル予測器であるFOCALを提案する。
テスト中のテストプレフィックスとメソッドのラベル付きペアから学習し、トレーニング中に失敗するケースを強調する損失を採用し、ステートメントレベルの行動証拠にその予測を根拠とする。
ベースライン手法SEERと比較すると,未確認プロジェクトのフェールケースの性能は著しく向上する。
論文 参考訳(メタデータ) (2026-07-13T10:04:36Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - VIBEPASS: Can Vibe Coders Really Pass the Vibe Check? [46.85901599242161]
emphFault-Triggering Test Generation(FT-Test)とemphFault-targeted Program repair(FPR)の2つの組み合わせタスクを評価した。
故障対象推論は一般的な符号化能力ではスケールしないことがわかった。
自己生成テストが障害の発見に成功すると、結果として得られた修復結果が外部から提供されたテストによってガイドされた修復と一致したり、性能が低下する。
論文 参考訳(メタデータ) (2026-03-16T21:14:28Z) - Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning [54.95476453942411]
コード生成のための強化学習は、単体テストのパスレートから検証可能な報酬に依存する。
最近のセルフプレイ手法は、1つのモデルでコードとテスト生成を統合する。
Code-A1は、人間のアノテーションによるテストでトレーニングされたコード生成のパフォーマンスマッチングまたはモデルを超えることを実現する。
論文 参考訳(メタデータ) (2026-03-16T17:58:13Z) - ProbeLLM: Automating Principled Diagnosis of LLM Failures [89.44131968886184]
ProbeLLMはベンチマークに依存しない自動探索フレームワークで、個々の障害から構造的障害モードへの脆弱性発見を増大させる。
ProbeLLMは、検証可能なテストケースにプローブを制限し、ツールの拡張された生成と検証を活用することで、信頼性のある証拠として障害発見を根拠とする。
論文 参考訳(メタデータ) (2026-02-13T14:33:13Z) - Can We Classify Flaky Tests Using Only Test Code? An LLM-Based Empirical Study [40.93176986225226]
不安定なテストは、同じコード修正で繰り返し実行されるとき、一貫性のない結果をもたらす。
以前の研究は、テストコードの識別子に基づいて不安定なテストを分類するために、機械学習モデルを訓練するアプローチを評価した。
論文 参考訳(メタデータ) (2026-02-05T09:15:09Z) - Studying the Impact of Early Test Termination Due to Assertion Failure on Code Coverage and Spectrum-based Fault Localization [48.22524837906857]
本研究は,アサーション障害による早期検査終了に関する最初の実証的研究である。
6つのオープンソースプロジェクトの207バージョンを調査した。
以上の結果から,早期検査終了は,コードカバレッジとスペクトルに基づく障害局所化の有効性の両方を損なうことが示唆された。
論文 参考訳(メタデータ) (2025-04-06T17:14:09Z) - Large-scale, Independent and Comprehensive study of the power of LLMs for test case generation [11.517293765116307]
ユニットテストはソフトウェアの信頼性に不可欠だが、手動のテスト作成には時間がかかり、しばしば無視される。
本研究は,LLM生成単体テストの大規模評価をクラスレベルで行った最初の大規模評価である。
論文 参考訳(メタデータ) (2024-06-28T20:38:41Z) - Test Oracle Automation in the era of LLMs [52.69509240442899]
大規模言語モデル(LLM)は、多様なソフトウェアテストタスクに取り組むのに顕著な能力を示した。
本研究の目的は, 各種のオラクル生成時に生じる課題とともに, LLMs によるオラクルの自動化の可能性について検討することである。
論文 参考訳(メタデータ) (2024-05-21T13:19:10Z) - Effective Test Generation Using Pre-trained Large Language Models and
Mutation Testing [13.743062498008555]
大規模言語モデル(LLM)が生成するテストケースの有効性を,バグの発見の観点から改善するための MuTAP を導入する。
MuTAPは、プログラム・アンダー・テスト(PUT)の自然言語記述がない場合に有効なテストケースを生成することができる
提案手法は, 最大28%の人書きコードスニペットを検出できることを示す。
論文 参考訳(メタデータ) (2023-08-31T08:48:31Z) - Position: AI Evaluation Should Learn from How We Test Humans [65.36614996495983]
人間の評価のための20世紀起源の理論である心理測定は、今日のAI評価における課題に対する強力な解決策になり得る、と我々は主張する。
論文 参考訳(メタデータ) (2023-06-18T09:54:33Z) - LLMs as Factual Reasoners: Insights from Existing Benchmarks and Beyond [135.8013388183257]
そこで我々は,SummEditsと呼ばれる10ドメインのベンチマークで不整合検出ベンチマークを作成し,実装する新しいプロトコルを提案する。
ほとんどのLLMはSummEditsで苦労しており、パフォーマンスはランダムに近い。
最も優れたモデルであるGPT-4は、推定された人間のパフォーマンスよりも8%低い。
論文 参考訳(メタデータ) (2023-05-23T21:50:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。