論文の概要: Industrial Practice of LLM-Based Test Case Carving and Assertion Generation (Experience Paper)
- arxiv url: http://arxiv.org/abs/2607.24000v2
- Date: Sat, 01 Aug 2026 04:42:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 21:56:46.331212
- Title: Industrial Practice of LLM-Based Test Case Carving and Assertion Generation (Experience Paper)
- Title(参考訳): LLMによる試験ケースの製作・製作(実験論文)
- Abstract要約: 本稿では、自然言語シナリオから実行可能なAPI回帰テストを生成するエンドツーエンドのアプローチとツールであるNL2Testを提案する。
NL2Testはテストケースの彫刻とアサーション生成という2つの結合タスクに対処する。
大手消費者向けインターネット企業から抽出した51の産業レグレッションシナリオについてNL2Testを評価した。
- 参考スコア(独自算出の注目度): 14.766370287473519
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Enterprise regression testing for microservice systems is often constrained by incomplete or outdated documentation. In practice, QA engineers frequently rely on real execution traffic to reconstruct business scenarios; however, turning raw traffic into replayable regression tests with stable validation logic remains labor-intensive and error-prone. This paper presents NL2Test, an end-to-end approach and tool that generates executable API regression tests from (i) a natural-language scenario description and (ii) a traffic capture recorded while executing the scenario. NL2Test addresses two coupled tasks: test case carving, which extracts a minimal replayable request sequence and reconstructs data dependencies so that dynamic values are bound from their responses rather than hard-coded; and assertion generation, which produces assertions aligned with business intent while avoiding non-deterministic fields and hallucinated paths. To improve reliability, NL2Test uses LLMs for semantic interpretation and constrained code synthesis, and uses deterministic algorithms for request filtering, dependency confirmation via value consistency, and assertion-path validation. We evaluate NL2Test on 51 industrial regression scenarios extracted from a large consumer-facing Internet company. NL2Test achieves an exact-match rate of 82.4% (42/51), and produces a functionally usable draft in 98.0% (50/51) of scenarios when allowing minor post-edits. In a 9-month production deployment starting in March 2025, NL2Test generated 3,196 test cases with an overall code adoption rate of 85.4%. These results indicate that traffic-grounded generation with deterministic guardrails can substantially reduce manual effort while improving regression automation in complex microservice environments.
- Abstract(参考訳): マイクロサービスシステムのエンタープライズ回帰テストは、不完全あるいは時代遅れのドキュメントによって制約されることが多い。
実際には、QAエンジニアはビジネスシナリオを再構築するために実際の実行トラフィックに依存することが多いが、実際のトラフィックを安定したバリデーションロジックで再生可能な回帰テストに変換することは、労働集約的かつエラーを起こしやすい。
本稿では,API回帰テストを生成するエンドツーエンドのアプローチとツールであるNL2Testについて述べる。
(i)自然言語のシナリオ記述及び説明
(ii)シナリオの実行中に記録されたトラフィックキャプチャ。
NL2Testは、最小限の再生可能なリクエストシーケンスを抽出し、動的値がハードコードではなくレスポンスからバインドされるようにデータ依存を再構築するテストケースカービングと、非決定論的フィールドや幻覚パスを避けながら、ビジネス意図に沿ったアサーションを生成するアサーション生成という2つの結合タスクに対処する。
信頼性を向上させるため、NL2Testは意味論的解釈と制約付きコード合成にLLMを使用し、リクエストフィルタリング、値整合性による依存性確認、アサーションパス検証に決定論的アルゴリズムを使用している。
大手消費者向けインターネット企業から抽出した51の産業レグレッションシナリオについてNL2Testを評価した。
NL2Testは82.4%(42/51)の正確なマッチ率を実現し、小さなポスト編集を許可する際、98.0%(50/51)のシナリオで機能的に使用可能なドラフトを生成する。
2025年3月から9ヶ月の運用デプロイメントで、NL2Testは3,196のテストケースを生成し、コードの採用率は85.4%だった。
これらの結果は、決定論的ガードレールによるトラフィックグラウンド生成は、複雑なマイクロサービス環境での回帰自動化を改善しながら、手作業を大幅に削減できることを示している。
関連論文リスト
- Should I Use This Synthetic Dataset for Training? How to Test with Minimal Real Data [73.19814469893088]
デジタルツインと学習された世界モデルは、エンジニアリングシステムにおける人工知能(AI)モデルのトレーニングに利用可能な、少ない実際のデータセットを増大させる合成データを生成するために、ますます使われています。
本稿では,拡張データセットのトレーニングが真の,人口レベルのパフォーマンスを向上する一方で,実際のテストデータポイントを可能な限り少なく消費するかどうかを論じる。
合成データ分類タスク、DT支援無線パケットスケジューリングタスク、および無線マップ予測タスクにおいて、aeSFTは平均ベースのシーケンシャルテストよりもはるかに少ない実検サンプルを用いて有用な合成データを識別することを示す。
論文 参考訳(メタデータ) (2026-08-28T07:05:38Z) - RESTOR: Automated Test Oracle Generation for RESTful APIs via Reinforcement Learning [21.927343858709122]
Restorは、ブラックボックスの設定で単一のリクエスト-レスポンスペアから実行可能なテストアサーションを生成するフレームワークである。
実世界の246のサービスにまたがる2,300以上のAPIトレースからなる産業データセット上でRestorを評価する。
論文 参考訳(メタデータ) (2026-07-27T03:20:28Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis [68.28714988482703]
プロセス・リワード・モデル(PRM)は、LLM(Large Language Models)の推論能力を増強することに成功した。
本稿では,一般ドメインのPRMがデータ分析エージェントの監督に苦慮していることを示す。
本稿では,新しい環境対応生成プロセス報酬モデルであるDataPRMを紹介する。
論文 参考訳(メタデータ) (2026-04-27T09:00:30Z) - Synthesizing File-Level Data for Unit Test Generation with Chain-of-Thoughts via Self-Debugging [40.29934051200609]
本稿では,高品質なUTトレーニングを実現するための新しいデータ蒸留手法を提案する。
このパイプラインをオープンソースプロジェクトの大規模なコーパスに適用します。
実験により, 微調整モデルにより, UT生成効率が高いことを示す。
論文 参考訳(メタデータ) (2026-02-03T06:52:54Z) - LLMCFG-TGen: Using LLM-Generated Control Flow Graphs to Automatically Create Test Cases from Use Cases [11.173694789846435]
適切なテストケース生成は、ソフトウェアテストにおいて重要である。
ユースケース記述は、機能的振る舞いと相互作用フローを構造化形式でキャプチャする一般的な方法である。
NLのユースケース記述からテストケースを自動的に生成する手法を提案する。
論文 参考訳(メタデータ) (2025-12-06T11:19:37Z) - TestWeaver: Execution-aware, Feedback-driven Regression Testing Generation with Large Language Models [5.871736617580623]
回帰テストは、コードの変更が意図せずに既存の機能を壊さないようにする。
大規模言語モデル(LLM)の最近の進歩は、回帰テストのためのテスト生成を自動化することを約束している。
テスト生成をより効率的にガイドするために、軽量なプログラム分析を統合する新しいアプローチであるTestWeaverを提案する。
論文 参考訳(メタデータ) (2025-08-02T08:13:02Z) - Unearthing Gems from Stones: Policy Optimization with Negative Sample Augmentation for LLM Reasoning [41.83677588934301]
負のサンプル拡張(BCPG-NSA)による行動制約付きポリシーのグラディエントを提案する。
BCPG-NSA は,1) サンプルセグメンテーション,2) LLM と PRM を併用した合意に基づくステップ正当性評価,3) 正のステップを負のサンプル内で効果的にマイニングするNSA とのポリシー最適化の3段階を含む,詳細なオフラインフレームワークである。
実験の結果、BCPG-NSAは、同じトレーニングデータセットを使用して、いくつかの挑戦的な数学/コーディング推論ベンチマークのベースラインよりも優れていた。
論文 参考訳(メタデータ) (2025-05-20T14:16:49Z) - AutoPT: How Far Are We from the End2End Automated Web Penetration Testing? [54.65079443902714]
LLMによって駆動されるPSMの原理に基づく自動浸透試験エージェントであるAutoPTを紹介する。
以上の結果から, AutoPT は GPT-4o ミニモデル上でのベースラインフレームワーク ReAct よりも優れていた。
論文 参考訳(メタデータ) (2024-11-02T13:24:30Z) - ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks [91.55895047448249]
本稿では,LLMベースのフレームワークであるReEvalについて述べる。
本稿では、ChatGPTを用いてReEvalを実装し、2つの人気のあるオープンドメインQAデータセットのバリエーションを評価する。
我々の生成したデータは人間可読であり、大きな言語モデルで幻覚を引き起こすのに役立ちます。
論文 参考訳(メタデータ) (2023-10-19T06:37:32Z) - Neural Embeddings for Web Testing [49.66745368789056]
既存のクローラは、状態等価性を評価するために、アプリ固有のしきい値ベースのアルゴリズムに依存している。
ニューラルネットワークの埋め込みとしきい値のない分類器に基づく新しい抽象関数WEBEMBEDを提案する。
WEBEMBEDは,9つのWebアプリケーションに対する評価の結果,近距離検出により最先端技術よりも精度が高いことがわかった。
論文 参考訳(メタデータ) (2023-06-12T19:59:36Z) - An Empirical Evaluation of Using Large Language Models for Automated
Unit Test Generation [3.9762912548964864]
本稿では,自動単体テスト生成における大規模言語モデルの有効性について,大規模な実証評価を行った。
これはJavaScript用のテスト生成ツールで、npmパッケージ内のすべてのAPI関数のユニットテストを自動的に生成します。
TestPilotの生成されたテストの92.8%は、既存のテストと50%以上の類似性を持っていない。
論文 参考訳(メタデータ) (2023-02-13T17:13:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。