論文の概要: NEUROTESTGEN: Neuro-Symbolic Guided Test Generation with Large Language Models
- arxiv url: http://arxiv.org/abs/2609.30178v1
- Date: Thu, 24 Sep 2026 17:27:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:10.165738
- Title: NEUROTESTGEN: Neuro-Symbolic Guided Test Generation with Large Language Models
- Title(参考訳): ニューロテトステゲン:大規模言語モデルを用いた神経細胞性誘導試験生成
- Abstract要約: 大規模言語モデル(LLM)は、最近、人間のようなテストケースを生成する強力な能力を実証した。
シンボリックな実行とLLM駆動テスト合成を統合するハイブリッドアプローチであるNEUROTESTGENを紹介する。
- 参考スコア(独自算出の注目度): 12.678353799885064
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Ensuring high structural coverage remains a fundamental challenge in automated test generation, particularly for complex software systems where reaching specific lines or branches requires satisfying intricate control- and data-flow constraints. Large Language Models (LLMs) have recently demonstrated strong capabilities in producing human-like test cases; however, they often struggle to generate inputs that satisfy precise path conditions. Conversely, symbolic execution can systematically derive such constraints, but it often fails to construct realistic, executable test cases and is constrained by scalability limitations. In this paper, we introduce NEUROTESTGEN, a hybrid approach that integrates symbolic execution with LLM-driven test synthesis to generate test cases targeting on-demand code coverage. Given a set of target statements within a method, NEUROTESTGEN first employs a symbolic analysis engine (i.e., the Z3 SMT solver) to extract path-specific constraints and construct a symbolic guidance specification for the desired coverage goal. This specification is then used to guide an LLM in synthesizing concrete test cases that are both structurally valid and semantically meaningful. For paths involving complex object-related constraints that are difficult for SMT solvers to handle, NEUROTESTGEN leverages LLMs to infer plausible constraints. Furthermore, NEUROTESTGEN incorporates an iterative feedback loop that validates LLM-generated tests and provides corrective guidance until the target line or branch is covered or a limit is reached. Our empirical evaluation on a widely used benchmark demonstrates that NEUROTESTGEN significantly outperforms the state-of-the-art approach across multiple LLMs, including Llama 3.3 70B1, GPT-4o Mini, Claude 3.5 Haiku3, and Claude Sonnet 4.6.
- Abstract(参考訳): 高い構造的カバレッジを確保することは、特に複雑なソフトウェアシステムにおいて、複雑な制御とデータフローの制約を満たす必要がある場合において、自動テスト生成の基本的な課題である。
大規模言語モデル(LLM)は最近、人間のようなテストケースを生成する強力な能力を示しているが、正確な経路条件を満たすインプットを生成するのに苦労することが多い。
逆に、シンボリック実行はそのような制約を体系的に導き出すことができるが、現実的な実行可能なテストケースの構築に失敗し、スケーラビリティの制限によって制約されることが多い。
本稿では,LLM駆動テスト合成とシンボリック実行を統合し,オンデマンドコードカバレッジをターゲットとしたテストケースを生成するハイブリッド手法NEUROTESTGENを紹介する。
NEUROTESTGENは、まず、経路固有の制約を抽出し、所望のカバレッジゴールのためのシンボルガイダンス仕様を構築するために、シンボル分析エンジン(Z3 SMTソルバ)を使用する。
この仕様は、構造的に有効かつ意味論的に意味のある具体的なテストケースの合成においてLLMを導くのに使用される。
SMTソルバが扱うのが難しい複雑なオブジェクト関連の制約を含むパスに対して、NEUROTESTGENはLLMを活用して妥当な制約を推測する。
さらに、NEUROTESTGENは、LSM生成テストを検証する反復フィードバックループを組み込んでおり、ターゲットラインまたはブランチがカバーされるか制限に達するまで修正ガイダンスを提供する。
Llama 3.3 70B1, GPT-4o Mini, Claude 3.5 Haiku3, Claude Sonnet 4.6 など, NEUROTESTGEN が複数の LLM にまたがる最先端のアプローチを著しく上回っていることを示す。
関連論文リスト
- Prompt Coverage Adequacy [10.326615143688482]
大規模言語モデル(LLM)と自律エージェントは、ソフトウェア開発における抽象化のレベルを高めます。
このパラダイムシフトは、コードではなくプロンプトが主要な開発アーティファクトになるときに、テストをどのようにガイドすべきかという、新たな課題を導入します。
本稿では,タスク記述から生成されたコードのテストを支援する新しいカバレッジ基準であるPrompt Coverage Adequacyを提案する。
論文 参考訳(メタデータ) (2026-07-02T11:35:39Z) - ClarifyCodeBench: Evaluating LLMs on Clarifying Ambiguous Requirements for Code Generation [54.788849448970154]
我々はClarifyCodeBenchを紹介した。ClarifyCodeBenchは、要求のあいまいさを解決するためのLarge Language Modelsの機能を評価するための、インタラクティブなベンチマークだ。
ClarifyCodeBenchを用いて、6つの最先端LCMの体系的評価を行う。
1) 能力の疎結合: 強いコード生成性能は本質的には効果的な要求の明確化に変換されない; 2) 推論パラドックス: 計算思考の増大はコードの正確性を高めるが、あいまいさの識別において限界的な利益をもたらす。
論文 参考訳(メタデータ) (2026-07-01T09:58:59Z) - From I/O to Code with Discovery Agent [103.88427301265669]
IO2Codeの発見エージェントであるDIO-Agentを提案する。
本手法は,プログラム空間上の進化的探索としてIO2Codeをフレーム化する。
大規模な実験により、DIO-Agentは従来のプログラムバイサンプル法とSOTA進化エージェントベースラインの両方を一貫して上回っていることが示された。
論文 参考訳(メタデータ) (2026-05-14T18:57:32Z) - LLMCFG-TGen: Using LLM-Generated Control Flow Graphs to Automatically Create Test Cases from Use Cases [11.173694789846435]
適切なテストケース生成は、ソフトウェアテストにおいて重要である。
ユースケース記述は、機能的振る舞いと相互作用フローを構造化形式でキャプチャする一般的な方法である。
NLのユースケース記述からテストケースを自動的に生成する手法を提案する。
論文 参考訳(メタデータ) (2025-12-06T11:19:37Z) - Combining TSL and LLM to Automate REST API Testing: A Comparative Study [3.8615905456206256]
RestTSLLMは、テスト仕様言語(TSL)とLarge Language Models(LLM)を併用して、REST APIのテストケースの自動生成を行うアプローチである。
提案したソリューションは,プロンプトエンジニアリング技術と自動パイプラインを統合して,OpenAPI仕様からテストを生成する能力に基づいて,さまざまなLSMを評価する。
その結果、最高のパフォーマンスのLSMは、一貫して堅牢でコンテキスト的に一貫性のあるREST APIテストを生成しました。
論文 参考訳(メタデータ) (2025-09-05T23:32:35Z) - Worst-Case Symbolic Constraints Analysis and Generalisation with Large Language Models [7.658134651527103]
最悪のケースのシンボリック制約分析では、最悪のケースのプログラムの実行を特徴付けるシンボリック制約を推論する必要がある。
我々は,現在最先端の大規模言語モデル (LLM) でさえ,このタスクに直接適用した場合に苦労することを示す。
我々は,より小さな具体的入力サイズに対する最悪の制約を計算する,革新的ニューロシンボリックアプローチであるWARPを提案する。
論文 参考訳(メタデータ) (2025-06-09T19:33:30Z) - Self-Steering Language Models [113.96916935955842]
DisCIPL は "self-steering" 言語モデル (LM) の手法である。
DisCIPLは、Followerモデルの集団によって実行されるタスク固有の推論プログラムを生成する。
我々の研究は、高度に並列化されたモンテカルロ推論戦略の設計空間を開く。
論文 参考訳(メタデータ) (2025-04-09T17:54:22Z) - Large-scale, Independent and Comprehensive study of the power of LLMs for test case generation [11.517293765116307]
ユニットテストはソフトウェアの信頼性に不可欠だが、手動のテスト作成には時間がかかり、しばしば無視される。
本研究は,LLM生成単体テストの大規模評価をクラスレベルで行った最初の大規模評価である。
論文 参考訳(メタデータ) (2024-06-28T20:38:41Z) - MuSR: Testing the Limits of Chain-of-thought with Multistep Soft Reasoning [63.80739044622555]
自然言語ナラティブで指定されたソフト推論タスクの言語モデルを評価するデータセットである MuSR を紹介する。
このデータセットには2つの重要な特徴がある。まず、ニューロシンボリック合成-自然生成アルゴリズムによって生成される。
第二に、私たちのデータセットインスタンスは、実世界の推論の領域に対応する無料のテキスト物語です。
論文 参考訳(メタデータ) (2023-10-24T17:59:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。