論文の概要: Knowledge-Guided Synthetic Bug Feedback for LLM-Based Unit Test Generation
- arxiv url: http://arxiv.org/abs/2607.11573v1
- Date: Mon, 13 Jul 2026 13:53:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.495896
- Title: Knowledge-Guided Synthetic Bug Feedback for LLM-Based Unit Test Generation
- Title(参考訳): LLMに基づく単体テスト生成のための知識誘導型合成バグフィードバック
- Authors: Ziheng Wang, Maike Li, Chen Zhi,
- Abstract要約: 大規模言語モデル(LLM)は単体テスト生成の新しい機会を開いた。
本稿では,過去のリアルタイムバグ機構を,実行可能なフィードバックターゲットに変換する方法について検討する。
- 参考スコア(独自算出の注目度): 4.633934330524198
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) have opened new opportunities for unit test generation, but executable tests do not necessarily reveal real defects. This paper studies how historical real-bug mechanisms can be transformed into executable feedback targets for LLM-based unit test generation. The proposed framework constructs structural and semantic representations of real-bug records, retrieves mechanisms applicable to a focal method, and instantiates them as synthetic bugs that guide iterative test enhancement. We evaluate the approach on method-level real-bug detection tasks from Defects4J and show that mechanism-guided synthetic-bug feedback improves real-bug detection over execution-, coverage-, mutation-, knowledge-, and search-based baselines. The results suggest that organizing real-bug mechanisms as retrievable and executable feedback targets is an effective way to guide generated tests toward bug-triggering inputs and behavioral oracles.
- Abstract(参考訳): 大規模言語モデル(LLM)は単体テスト生成の新しい機会を開いたが、実行可能なテストは必ずしも本当の欠陥を明らかにするとは限らない。
本稿では,LLMに基づく単体テスト生成において,過去の実バグ機構を実行可能なフィードバックターゲットに変換する方法について検討する。
提案するフレームワークは,実バグレコードの構造的および意味的表現を構築し,局所的手法に適用可能な機構を検索し,反復的テスト拡張を誘導する合成バグとしてインスタンス化する。
そこで本研究では,Defects4Jからのメソッドレベルの実バグ検出タスクに対するアプローチを評価し,機構誘導型合成バグフィードバックが,実行時,カバレッジ時,突然変異時,知識時,検索ベースラインよりもリアルバグ検出を改善することを示す。
その結果,実際のバグメカニズムを検索可能かつ実行可能なフィードバックターゲットとして整理することは,バグトリガ入力や行動オラクルに対して生成したテストをガイドする効果的な方法であることが示唆された。
関連論文リスト
- ProbeLLM: Automating Principled Diagnosis of LLM Failures [89.44131968886184]
ProbeLLMはベンチマークに依存しない自動探索フレームワークで、個々の障害から構造的障害モードへの脆弱性発見を増大させる。
ProbeLLMは、検証可能なテストケースにプローブを制限し、ツールの拡張された生成と検証を活用することで、信頼性のある証拠として障害発見を根拠とする。
論文 参考訳(メタデータ) (2026-02-13T14:33:13Z) - InspectCoder: Dynamic Analysis-Enabled Self Repair through interactive LLM-Debugger Collaboration [71.18377595277018]
大きな言語モデル(LLM)は、診断が難しい複雑なロジックエラーを伴うバグの多いコードを生成することが多い。
対話型デバッガ制御による動的解析を LLM に委ねる初のエージェントプログラム修復システムである InspectCoder を提案する。
論文 参考訳(メタデータ) (2025-10-21T06:26:29Z) - Test Case Generation from Bug Reports via Large Language Models: A Cognitive Layered Evaluation Framework [10.919459368597295]
テストケース生成におけるLarge Language Models(LLM)推論の体系的評価について述べる。
言語的・意味的課題を導入した欠陥4J, GHRB, 変異変種についてStarCoderとGPT-4oを評価した。
論文 参考訳(メタデータ) (2025-10-06T20:47:12Z) - Towards Automated Error Discovery: A Study in Conversational AI [48.735443116662026]
本稿では,会話型AIにおけるエラーの検出と定義のためのフレームワークであるAutomated Error Discoveryを紹介する。
また,その実装に対するエンコーダに基づくアプローチとして,SEEED(Soft Clustering Extended-Based Error Detection)を提案する。
論文 参考訳(メタデータ) (2025-09-13T14:53:22Z) - LLMShot: Reducing snapshot testing maintenance via LLMs [0.5218155982819203]
スナップショットテストは、現代のソフトウェア開発におけるUIバリデーションの重要なテクニックとして登場した。
本稿では、VLM(Vision-Language Models)を利用して、スナップショットテストの失敗を自動的に解析する新しいフレームワークであるLLMShotを紹介する。
論文 参考訳(メタデータ) (2025-07-14T08:47:19Z) - Learning to Solve and Verify: A Self-Play Framework for Code and Test Generation [69.62857948698436]
大規模言語モデル(LLM)の最近の進歩は、コーディングベンチマークのパフォーマンスを改善している。
しかし、手軽に利用できる高品質なデータの枯渇により、改善は停滞している。
本稿では,単一モデルのコードとテスト生成能力を共同で改善するセルフプレイ・ソルバ検証フレームワークであるSol-Verを提案する。
論文 参考訳(メタデータ) (2025-02-20T18:32:19Z) - Automated Refactoring of Non-Idiomatic Python Code: A Differentiated Replication with LLMs [54.309127753635366]
本研究は, GPT-4の有効性について検討し, 慣用行動の推奨と示唆について検討した。
この結果から,従来は複雑なコード解析に基づくレコメンデータの実装が求められていた,LCMの課題達成の可能性が浮き彫りになった。
論文 参考訳(メタデータ) (2025-01-28T15:41:54Z) - Effective Test Generation Using Pre-trained Large Language Models and
Mutation Testing [13.743062498008555]
大規模言語モデル(LLM)が生成するテストケースの有効性を,バグの発見の観点から改善するための MuTAP を導入する。
MuTAPは、プログラム・アンダー・テスト(PUT)の自然言語記述がない場合に有効なテストケースを生成することができる
提案手法は, 最大28%の人書きコードスニペットを検出できることを示す。
論文 参考訳(メタデータ) (2023-08-31T08:48:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。