論文の概要: Evaluating and Mitigating the Misguidance Effect of Buggy Code in LLM-Generated Unit Tests
- arxiv url: http://arxiv.org/abs/2607.22883v1
- Date: Fri, 24 Jul 2026 19:47:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.919453
- Title: Evaluating and Mitigating the Misguidance Effect of Buggy Code in LLM-Generated Unit Tests
- Title(参考訳): LLM生成単体テストにおけるバギー符号の誤用効果の評価と緩和
- Abstract要約: 本稿では,その誤動作を検証するテストを生成するために,バギーコードによるLSMを誘導する現象である「誤用効果」を測定するための新しい指標を提案する。
我々は,テスト中のコードをLCM生成した仕様文書に置き換える仕様ベースの単体テスト生成パラダイムを導入し,検証する。
本研究の結果から,このパラダイムは誤操作を効果的に低減し,有効なテストを大幅に増加させ,複数ラウンドのフィードバック駆動型テスト生成パイプラインを改善し,バグやバグのないコードにも適用可能であることが示唆された。
- 参考スコア(独自算出の注目度): 6.228248513679207
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While Large Language Models (LLMs) show great promise for automating unit test generation, recent studies suggest that the quality of generated tests can be negatively impacted when models are prompted with buggy code. This paper presents a new metric to quantitatively measure the "misguidance effect," a phenomenon where buggy code steers LLMs toward generating tests that validate its erroneous behavior rather than expose it. Our analysis reveals that prompting LLMs with buggy code has a severe, twofold impact: it significantly increases "misguided tests" that assert incorrect behavior while simultaneously suppressing the generation of effective, bug-finding tests. We further corroborate this effect from a model-internal perspective, showing that buggy code skews LLMs' preference toward tests that assert the same erroneous behavior. To counter this, we introduce and validate a specification-based unit test generation paradigm that replaces the code under test in the prompt with an LLM-generated specification docstring. Our results show that this paradigm effectively reduces misguided tests while substantially increasing effective tests, improves multi-round, feedback-driven test generation pipelines, and remains applicable to both buggy and bug-free code. Overall, these results suggest that specification-based prompting is a promising strategy for mitigating misguidance from buggy code in LLM-generated unit tests.
- Abstract(参考訳): 大規模言語モデル(LLMs)は単体テスト生成の自動化に非常に有望であるが、最近の研究では、モデルにバグのあるコードを追加すると、生成したテストの品質に悪影響を及ぼす可能性があることを示唆している。
本報告では, バグコードによるLCMを, 誤動作の検証に向ける現象である「誤認識効果」を定量的に測定する手法を提案する。
我々の分析によると、バグのあるコードでLLMを誘導することは、重大な2倍のインパクトを持つ。これは、効果的でバグをフィニッシュするテストの生成を同時に抑制しながら、誤った振る舞いを主張する"誤字テスト"を大幅に増加させる。
さらに、モデル内部の観点からこの効果を相関させ、バギーコードは、同じ誤った振る舞いを主張するテストに対するLLMの好みを歪めていることを示す。
これに対応するために、我々は、テスト中のコードをLCM生成仕様文書に置き換える仕様ベースの単体テスト生成パラダイムを導入し、検証する。
本研究の結果から,このパラダイムは誤操作を効果的に低減し,有効なテストを大幅に増加させ,複数ラウンドのフィードバック駆動型テスト生成パイプラインを改善し,バグやバグのないコードにも適用可能であることが示唆された。
これらの結果から,LLM生成単体テストにおいて,仕様ベースのプロンプトがバグジィコードからのミスガイダンスを緩和するための有望な戦略であることが示唆された。
関連論文リスト
- Do Coverage and Mutation Scores of LLM-Generated Test Suites Correlate with Their Effectiveness? (Replicability Study) [6.228248513679207]
研究によると、テストスイートのサイズが制御されると、カバレッジ、突然変異、および実際のバグ検出の相関がほとんどなくなる。
対象と変異の有用性は,文脈依存的であることが示唆された。
また、テストスイートのサイズがカバレッジ、突然変異、実際のバグ検出の相関関係において、主要な共同創設者であるという証拠もほとんどありません。
論文 参考訳(メタデータ) (2026-07-24T19:46:30Z) - Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning [54.95476453942411]
コード生成のための強化学習は、単体テストのパスレートから検証可能な報酬に依存する。
最近のセルフプレイ手法は、1つのモデルでコードとテスト生成を統合する。
Code-A1は、人間のアノテーションによるテストでトレーニングされたコード生成のパフォーマンスマッチングまたはモデルを超えることを実現する。
論文 参考訳(メタデータ) (2026-03-16T17:58:13Z) - ATGen: Adversarial Reinforcement Learning for Test Case Generation [78.48498301767079]
大きな言語モデル(LLM)はコード生成に優れていますが、その出力には微妙なバグが伴います。
既存のテスト生成方法は静的データセットに依存している。
我々は,対戦型強化学習を通じてテストケースジェネレータを訓練するフレームワークであるATGenを紹介する。
論文 参考訳(メタデータ) (2025-10-16T12:49:25Z) - Towards Automated Error Discovery: A Study in Conversational AI [48.735443116662026]
本稿では,会話型AIにおけるエラーの検出と定義のためのフレームワークであるAutomated Error Discoveryを紹介する。
また,その実装に対するエンコーダに基づくアプローチとして,SEEED(Soft Clustering Extended-Based Error Detection)を提案する。
論文 参考訳(メタデータ) (2025-09-13T14:53:22Z) - Teaching Your Models to Understand Code via Focal Preference Alignment [70.71693365502212]
既存の手法では、テストケースの成功率に基づいてn個の候補解が評価される。
このアプローチは、特定のエラーを特定するのではなく、失敗するコードブロック全体を整列するので、意味のあるエラーと訂正の関係を捉えるのに必要な粒度が欠けている。
我々は、人間の反復デバッグを模倣してコードLLMを洗練させる新しい優先順位調整フレームワークであるTarget-DPOを提案する。
論文 参考訳(メタデータ) (2025-03-04T16:56:34Z) - Learning to Solve and Verify: A Self-Play Framework for Code and Test Generation [69.62857948698436]
大規模言語モデル(LLM)の最近の進歩は、コーディングベンチマークのパフォーマンスを改善している。
しかし、手軽に利用できる高品質なデータの枯渇により、改善は停滞している。
本稿では,単一モデルのコードとテスト生成能力を共同で改善するセルフプレイ・ソルバ検証フレームワークであるSol-Verを提案する。
論文 参考訳(メタデータ) (2025-02-20T18:32:19Z) - Design choices made by LLM-based test generators prevent them from finding bugs [0.850206009406913]
本稿は,最近のLCMベースのテスト生成ツールであるCodium CoverAgentやCoverUpが,効果的にバグを見つけたり,意図せずに欠陥コードを検証することができるかどうかを,批判的に検証する。
実際の人手によるバグ検出コードを入力として使用すると、これらのツールを評価し、LCM生成テストがバグの検出に失敗する可能性を示し、さらに警告として、生成されたテストスイートのバグを検証することで、その設計が状況を悪化させる可能性があることを示します。
論文 参考訳(メタデータ) (2024-12-18T18:33:26Z) - Toward Automated Validation of Language Model Synthesized Test Cases using Semantic Entropy [0.5057850174013127]
現代の大規模言語モデル(LLM)ベースのプログラミングエージェントは、しばしば、生成されたコードを洗練するためにテスト実行フィードバックに依存する。
本稿では,LLMが生成したテストケースの自動検証にセマンティックエントロピーを利用する新しいフレームワークVALTESTを紹介する。
VALTESTはテストの妥当性を最大29%向上し、パス@1スコアの大幅な増加によって証明されたコード生成のパフォーマンスが向上することを示している。
論文 参考訳(メタデータ) (2024-11-13T00:07:32Z) - Large Language Models as Test Case Generators: Performance Evaluation and Enhancement [3.5398126682962587]
大規模言語モデルが高品質なテストケースをいかに生み出すかを検討する。
本稿では,テストインプットとテストアウトプットの生成を分離するemphTestChainというマルチエージェントフレームワークを提案する。
以上の結果から,TestChainはベースラインのマージンを大きく上回っていることが示唆された。
論文 参考訳(メタデータ) (2024-04-20T10:27:01Z) - GPT-HateCheck: Can LLMs Write Better Functional Tests for Hate Speech Detection? [50.53312866647302]
HateCheckは、合成データに対してきめ細かいモデル機能をテストするスイートである。
GPT-HateCheckは,スクラッチからより多彩で現実的な機能テストを生成するフレームワークである。
クラウドソースのアノテーションは、生成されたテストケースが高品質であることを示しています。
論文 参考訳(メタデータ) (2024-02-23T10:02:01Z) - Effective Test Generation Using Pre-trained Large Language Models and
Mutation Testing [13.743062498008555]
大規模言語モデル(LLM)が生成するテストケースの有効性を,バグの発見の観点から改善するための MuTAP を導入する。
MuTAPは、プログラム・アンダー・テスト(PUT)の自然言語記述がない場合に有効なテストケースを生成することができる
提案手法は, 最大28%の人書きコードスニペットを検出できることを示す。
論文 参考訳(メタデータ) (2023-08-31T08:48:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。