論文の概要: Context Matters: Improving the Practical Reliability of LLM-Based Unit Test Generation
- arxiv url: http://arxiv.org/abs/2607.19682v1
- Date: Wed, 22 Jul 2026 02:31:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.95085
- Title: Context Matters: Improving the Practical Reliability of LLM-Based Unit Test Generation
- Title(参考訳): コンテキスト: LLMベースの単体テスト生成の実用的信頼性の向上
- Authors: Junjie Chen, Ziqi Wang, Lin Yang, Chen Yang, Xiao Chu, Jianyi Zhou, Guangtai Liang, Qianxiang Wang, Dong Wang,
- Abstract要約: 本稿では、コンテキスト対応の単体テスト生成ワークフローであるCATGenの設計、デプロイ、評価の経験について報告する。
不完全なプロジェクトコンテキストを推測するためにLLMに頼るのではなく、コンパイルの堅牢性は、プロジェクトレベルの依存関係を明確にすることに依存している、ということに気付きました。
我々は,CATGenを,プロプライエタリな産業プロジェクトとDefects4Jベンチマークで評価し,一般化性を評価する。
- 参考スコア(独自算出の注目度): 19.272036022286844
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automated unit test generation has recently benefited from advances in large language models (LLMs), yet our industrial deployments reveal a persistent gap between promising research results and practical usability. In real-world projects with complex frameworks and cross-file dependencies, LLM-generated tests frequently fail to compile, require costly manual repair, or provide unstable coverage improvements. This paper reports our experience in designing, deploying, and evaluating CATGen, a context-aware workflow for LLM-based unit test generation, informed by repeated industrial failures and refinements. Rather than relying on LLMs to infer incomplete project context, we found that compilation robustness critically depends on making project-level dependencies explicit, stabilizing test class scaffolding, and replacing iterative LLM-based repair with lightweight static analysis. These experience-driven insights shaped CATGen's multi-stage design, which combines structured context retrieval, deterministic test skeleton construction, and program analysis-based post-processing. We evaluate CATGen on real-world complex focal methods from proprietary industrial projects and additionally on the Defects4J benchmark to assess generalizability. Across both settings, CATGen substantially improves compilation success and structural coverage while significantly reducing generation time and token consumption compared to existing LLM-based approaches. Our results demonstrate that reliable LLM-based unit test generation in practice depends less on prompt engineering alone and more on systematic engineering support grounded in real-world development constraints.
- Abstract(参考訳): 近年,大規模言語モデル (LLMs) の進歩により自動単体テスト生成が恩恵を受けているが,我々の産業展開は,有望な研究結果と実用的ユーザビリティとの間に持続的なギャップがあることを明らかにする。
複雑なフレームワークとファイル間の依存関係を持つ現実のプロジェクトでは、LCMの生成したテストはコンパイルに失敗することが多く、手作業による修正が必要で、不安定なカバレッジ改善を提供する。
本稿では,LLMベースの単体テスト生成のためのコンテキスト認識ワークフローであるCATGenの設計,デプロイ,評価の経験について報告する。
不完全なプロジェクトコンテキストを推測するためにLLMに頼るのではなく、コンパイルの堅牢性は、プロジェクトレベルの依存関係を明確にし、テストクラスのスキャフォールディングを安定化し、反復的なLLMベースの修復を軽量な静的解析に置き換えることに大きく依存することがわかった。
これらの経験駆動の洞察は、構造化されたコンテキスト検索、決定論的テストスケルトン構築、プログラム分析に基づく後処理を組み合わせたCATGenの多段階設計を形作った。
我々は,CATGenを,プロプライエタリな産業プロジェクトとDefects4Jベンチマークで評価し,一般化性を評価する。
両方の設定で、CATGenはコンパイル成功と構造的カバレッジを大幅に改善し、既存のLCMベースのアプローチと比べて生成時間とトークン消費を大幅に削減する。
この結果から,LLMによる信頼性の高い単体テスト生成は,プロンプトエンジニアリングのみに依存せず,実世界の開発制約に根ざしたシステム工学的支援に依存していることがわかった。
関連論文リスト
- Failure Modes in LLM Systems: A System-Level Taxonomy for Reliable AI Applications [0.0]
大規模言語モデル(LLM)は、意思決定支援ツール、自動化、AI対応ソフトウェアシステムに急速に統合されている。
本稿では,現実のLLMアプリケーションで発生する15の隠れ障害モードのシステムレベルでの分類について述べる。
論文 参考訳(メタデータ) (2025-11-25T05:19:23Z) - Training Language Models to Generate Quality Code with Program Analysis Feedback [66.0854002147103]
大規模言語モデル(LLM)によるコード生成は、ますます本番環境で採用されているが、コード品質の保証には失敗している。
実運用品質のコードを生成するためにLLMにインセンティブを与える強化学習フレームワークであるREALを提案する。
論文 参考訳(メタデータ) (2025-05-28T17:57:47Z) - MLE-Dojo: Interactive Environments for Empowering LLM Agents in Machine Learning Engineering [57.156093929365255]
自律型大規模言語モデル(LLM)エージェントを体系的に強化し、評価し、改善するためのガイムスタイルのフレームワーク。
MLE-Dojoは、現実的なエンジニアリングシナリオを反映した、多様でオープンなMLEタスクを慎重にキュレートする。
完全に実行可能な環境は、教師付き微調整と強化学習の両方を通して包括的なエージェントトレーニングをサポートする。
論文 参考訳(メタデータ) (2025-05-12T17:35:43Z) - Evaluating Large Language Models for Real-World Engineering Tasks [75.97299249823972]
本稿では,実運用指向のエンジニアリングシナリオから得られた100以上の質問をキュレートしたデータベースを提案する。
このデータセットを用いて、4つの最先端の大規模言語モデル(LLM)を評価する。
以上の結果から,LLMは時間的および構造的推論において強みを示すが,抽象的推論や形式的モデリング,文脈に敏感な工学的論理にはかなり苦労することがわかった。
論文 参考訳(メタデータ) (2025-05-12T14:05:23Z) - APE-Bench I: Towards File-level Automated Proof Engineering of Formal Math Libraries [5.227446378450704]
APE-Bench Iは、Mathlib4の実際のコミット履歴から構築された最初の現実的なベンチマークである。
Eleansticはスケーラブルな並列検証インフラストラクチャで、Mathlibの複数バージョンにわたる検証に最適化されている。
論文 参考訳(メタデータ) (2025-04-27T05:04:02Z) - A Systematic Approach for Assessing Large Language Models' Test Case Generation Capability [0.8287206589886879]
大規模言語モデル (LLM) を評価するために,制御フロー構造と可変利用構成 (GBCV) から生成したベンチマークを提案する。
基本的な制御フロー構造と変数使用量を活用することで、GBCVは、単純なプログラムから複雑なプログラムの範囲を作成する柔軟なフレームワークを提供する。
以上の結果から,GPT-4oは複雑なプログラム構造において優れた性能を示し,全てのモデルが単純な条件下で境界値を効果的に検出するが,算術計算では問題に直面することが示唆された。
論文 参考訳(メタデータ) (2025-02-05T03:51:44Z) - What's Wrong with Your Code Generated by Large Language Models? An Extensive Study [92.62952504133926]
本研究は,3つの一般的なベンチマーク上で,3つの主要なクローズドソースLLMと6つの人気のあるオープンソースLLMの性能評価を行った。
間違ったコードに対するバグの分類を開発し、一般的なバグタイプに対する根本原因を分析した。
本稿では,自己批判を導入し,LLMが生成したコードに対する批判と修正を可能にする,新たな学習自由反復手法を提案する。
論文 参考訳(メタデータ) (2024-07-08T17:27:17Z) - Advancing Code Coverage: Incorporating Program Analysis with Large Language Models [8.31978033489419]
難解な分岐に到達可能なテストを生成する新しい技術である TELPA を提案する。
27のオープンソースPythonプロジェクトに対する実験結果から,TELPAは最先端のSBSTやLLMベースの技術よりも優れていたことが判明した。
論文 参考訳(メタデータ) (2024-04-07T14:08:28Z) - Characterization of Large Language Model Development in the Datacenter [55.9909258342639]
大きな言語モデル(LLM)は、いくつかの変換タスクにまたがって素晴らしいパフォーマンスを示している。
しかし,大規模クラスタ資源を効率よく利用してLCMを開発することは容易ではない。
我々は,GPUデータセンタAcmeから収集した6ヶ月のLDM開発ワークロードの詳細な評価を行った。
論文 参考訳(メタデータ) (2024-03-12T13:31:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。