論文の概要: An empirical study of LoRA-based fine-tuning of large language models for automated test case generation
- arxiv url: http://arxiv.org/abs/2604.06946v1
- Date: Wed, 08 Apr 2026 11:09:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-09 17:30:51.490432
- Title: An empirical study of LoRA-based fine-tuning of large language models for automated test case generation
- Title(参考訳): 自動テストケース生成のためのLoRAを用いた大規模言語モデルの微調整に関する実証的研究
- Authors: Milad Moradi, Ke Yan, David Colwell, Rhona Asgari,
- Abstract要約: 本稿では,パラメータ効率の高いファインチューニング,特にLoRAを用いた要件ベースのテストケース生成に関する総合的研究について述べる。
オープンソースおよびプロプライエタリモデルを含む複数のLLMファミリーを統一実験パイプラインで評価する。
実験により,LoRAをベースとしたファインチューニングにより,すべてのオープンソースモデルの性能が大幅に向上することが示された。
- 参考スコア(独自算出の注目度): 5.182076496564637
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automated test case generation from natural language requirements remains a challenging problem in software engineering due to the ambiguity of requirements and the need to produce structured, executable test artifacts. Recent advances in LLMs have shown promise in addressing this task; however, their effectiveness depends on task-specific adaptation and efficient fine-tuning strategies. In this paper, we present a comprehensive empirical study on the use of parameter-efficient fine-tuning, specifically LoRA, for requirement-based test case generation. We evaluate multiple LLM families, including open-source and proprietary models, under a unified experimental pipeline. The study systematically explores the impact of key LoRA hyperparameters, including rank, scaling factor, and dropout, on downstream performance. We propose an automated evaluation framework based on GPT-4o, which assesses generated test cases across nine quality dimensions. Experimental results demonstrate that LoRA-based fine-tuning significantly improves the performance of all open-source models, with Ministral-8B achieving the best results among them. Furthermore, we show that a fine-tuned 8B open-source model can achieve performance comparable to pre-fine-tuned GPT-4.1 models, highlighting the effectiveness of parameter-efficient adaptation. While GPT-4.1 models achieve the highest overall performance, the performance gap between proprietary and open-source models is substantially reduced after fine-tuning. These findings provide important insights into model selection, fine-tuning strategies, and evaluation methods for automated test generation. In particular, they demonstrate that cost-efficient, locally deployable open-source models can serve as viable alternatives to proprietary systems when combined with well-designed fine-tuning approaches.
- Abstract(参考訳): 自然言語要求からの自動テストケース生成は、要件の曖昧さと構造化された実行可能なテストアーティファクトを生成する必要性のため、ソフトウェアエンジニアリングにおいて依然として難しい問題である。
LLMの最近の進歩は、この課題に対処する上で有望であることを示しているが、その効果はタスク固有の適応と効率的な微調整戦略に依存している。
本稿では,パラメータ効率のよい微調整,特にLoRAを用いた要件ベースのテストケース生成に関する総合的研究について述べる。
オープンソースおよびプロプライエタリモデルを含む複数のLLMファミリーを統一実験パイプラインで評価する。
この研究は、ランク、スケーリング係数、ドロップアウトを含む重要なLoRAハイパーパラメータが下流のパフォーマンスに与える影響を体系的に調査する。
GPT-4oに基づく自動評価フレームワークを提案する。
実験結果から,LoRAをベースとしたファインチューニングにより,すべてのオープンソースモデルの性能が大幅に向上し,Ministral-8Bが最も優れた結果が得られた。
さらに,粒度調整した8Bオープンソースモデルでは,事前調整したGPT-4.1モデルに匹敵する性能が得られ,パラメータ効率が向上することを示す。
GPT-4.1モデルは全体的な性能が最も高いが、プロプライエタリモデルとオープンソースモデルのパフォーマンスギャップは微調整後に大幅に減少する。
これらの結果は、モデル選択、微調整戦略、自動テスト生成のための評価方法に関する重要な知見を提供する。
特に、コスト効率が高く、ローカルにデプロイ可能なオープンソースモデルは、よく設計された微調整のアプローチと組み合わせることで、プロプライエタリなシステムに代わる実行可能な選択肢として機能することを示した。
関連論文リスト
- One Model to Critique Them All: Rewarding Agentic Tool-Use via Efficient Reasoning [54.580646706013965]
リワードモデル(RM)は、大きな言語モデルと人間の嗜好の整合において重要な役割を果たす。
一般的なツール使用シナリオに適した軽量な生成型RMのファミリーであるToolRMを紹介する。
これらのモデルを構築するために,ルールベースのスコアリングと多次元サンプリングを用いたペアワイズ選好データを構築するパイプラインを提案する。
論文 参考訳(メタデータ) (2025-10-30T06:08:27Z) - Large Language Models for Fault Localization: An Empirical Study [3.2111987440830974]
本稿では,大規模言語モデル (LLM) に関する体系的な実証的研究を,文レベルコード故障の局所化タスクにおいて提案する。
我々は,オープンソースモデル (Qwen2.5-coder-32b-instruct, DeepSeek-V3) とクローズドソースモデル (GPT-4.1 mini, Gemini-2.5-flash) を評価し,その故障局所化機能を評価する。
論文 参考訳(メタデータ) (2025-10-23T13:04:22Z) - Self-Improving LLM Agents at Test-Time [49.9396634315896]
言語モデル(LM)の1つのパラダイムは、大規模なトレーニングデータセットの作成に依存している。
実際には、大量のデータを集めることは非効率であり、それらのトレーニングは違法に高価である。
テスト時間自己改善(TT-SI)とテスト時間蒸留(TT-D)の2つのバリエーションについて検討する。
論文 参考訳(メタデータ) (2025-10-09T06:37:35Z) - TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making [75.29820290660065]
本稿では,効果的な具体的意思決定のための思考中心推論最適化(TCPO)を提案する。
モデルの中間的推論プロセスの整合性を強調し、モデル劣化の問題を緩和する。
ALFWorld環境での実験では、平均成功率は26.67%であり、RL4VLMよりも6%向上している。
論文 参考訳(メタデータ) (2025-09-10T11:16:21Z) - Language Models are Few-Shot Graders [0.12289361708127876]
我々は最先端のLCMを利用したASAGパイプラインを提案する。
GPT-4、GPT-4o、o1-previewの3つのOpenAIモデルのグレーディング性能を比較した。
以上の結果より,RAGによる選択はランダム選択よりも優れており,グレードドドサンプルを提供することでグレーディング精度が向上することが示唆された。
論文 参考訳(メタデータ) (2025-02-18T23:38:21Z) - SELF: Surrogate-light Feature Selection with Large Language Models in Deep Recommender Systems [51.09233156090496]
ディープレコメンデータシステムのためのSurrogatE-Light特徴選択法
SELFは、大規模言語モデルからのセマンティック推論と、代理モデルからのタスク固有の学習を統合する。
実世界のレコメンデータプラットフォームからの3つの公開データセットに関する総合的な実験は、SELFの有効性を検証する。
論文 参考訳(メタデータ) (2024-12-11T16:28:18Z) - Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark [62.58869921806019]
GPT-4oに基づくタスク分解評価フレームワークを提案し、新しいトレーニングデータセットを自動構築する。
我々は、GPT-4oの評価能力を7BオープンソースMLLM、MiniCPM-V-2.6に効果的に蒸留するための革新的なトレーニング戦略を設計する。
実験結果から,我々の蒸留したオープンソースMLLMは,現在のGPT-4oベースラインよりも有意に優れていた。
論文 参考訳(メタデータ) (2024-11-23T08:06:06Z) - AI based Multiagent Approach for Requirements Elicitation and Analysis [3.9422957660677476]
本研究では,大規模言語モデル(LLM)を用いた要求分析タスクの自動化の有効性を実証的に検討する。
我々は,GPT-3.5,GPT-4 Omni,LLaMA3-70,Mixtral-8Bの4つのモデルをデプロイし,実世界の4つのプロジェクトにおける要件を分析する実験を行った。
予備的な結果は,各モデルにおけるタスク完了の顕著な変化を示している。
論文 参考訳(メタデータ) (2024-08-18T07:23:12Z) - Scaling Down to Scale Up: A Cost-Benefit Analysis of Replacing OpenAI's LLM with Open Source SLMs in Production [3.41402911469979]
多くの企業は、OpenAIのGPT-4のようなサービスとして提供される大きな言語モデル(LLM)を使用して、AI対応製品エクスペリエンスを作成している。
同時に、オープンソースのスモールランゲージモデル(SLM)が市販されている。
本稿では,現代のオープンソースSLMの体系的評価手法と特徴について述べる。
論文 参考訳(メタデータ) (2023-12-20T19:27:59Z) - CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation [87.44350003888646]
Eval-Instructは、疑似参照でポイントワイズした批評を取得し、マルチパスプロンプトを通じてこれらの批評を修正できる。
CritiqueLLMは、ChatGPTとすべてのオープンソースベースラインを上回るように実証的に示されています。
論文 参考訳(メタデータ) (2023-11-30T16:52:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。