論文の概要: Sakura: An Approach for Generating Complex Tests from Natural Language Test Descriptions
- arxiv url: http://arxiv.org/abs/2606.00530v1
- Date: Sat, 30 May 2026 04:49:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 18:34:18.580162
- Title: Sakura: An Approach for Generating Complex Tests from Natural Language Test Descriptions
- Title(参考訳): サクラ: 自然言語テスト記述から複雑なテストを生成するためのアプローチ
- Abstract要約: Sagaは、自然言語(NL)による開発者意図の記述からテストを生成するためのフレームワークである。
サクラはNL記述を構造化ブロックに分解し、マルチエージェントシステムを用いて処理する。
Sagaは、Gemini CLIのような真剣なエージェントツールよりも大幅に優れています。
- 参考スコア(独自算出の注目度): 46.562528718959506
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Testing is a core activity in software development workflows, and research on its automation has spanned several decades. Most existing approaches generate unit tests for individual methods, validate isolated API endpoints, or target user interface (UI) layers, with non-API and non-UI automated test generators typically exercising only a single focal method. Recent empirical evidence shows a substantial gap between such generated tests and developer-written ones, which often span multiple focal methods, involve complex call sequences, and contain elaborate assertions that current automated approaches fail to capture. To address this gap, we propose generating tests from natural language (NL) descriptions of developer intent. We present Sakura, the first agent-based framework for generating structurally complex test cases from NL descriptions. Sakura decomposes NL descriptions into structured blocks and processes them using a multi-agent system consisting of a localization agent that grounds test steps in concrete application code via static analysis, a composition agent that synthesizes compilable test code and iteratively refines it using execution feedback, and a supervisor agent that coordinates agent interactions. To evaluate Sakura, we curate a novel dataset of NL test descriptions at three levels of abstraction, systematically generated from developer-written tests mined from Apache Commons projects. Across 20 applications and 1,464 test scenarios, Sakura significantly outperforms off-the-shelf agentic tools such as Gemini CLI. Specifically, Sakura achieves 50-78% higher test compilability and 38-66% higher coverage overlap with ground-truth tests compared to baselines using the same models. Moreover, Sakura paired with small open-source models such as Devstral Small 2 and Qwen3-Coder outperforms Gemini CLI using large proprietary models, while also being more cost-effective.
- Abstract(参考訳): テストはソフトウェア開発のワークフローの中核的な活動であり、その自動化に関する研究は数十年にわたって続いている。
既存のほとんどのアプローチは、個別のメソッドの単体テスト、分離されたAPIエンドポイントの検証、ターゲットユーザーインターフェース(UI)層を生成する。
最近の実証的な証拠は、このような生成されたテストと、複数の焦点のメソッドにまたがり、複雑な呼び出しシーケンスを伴い、現在の自動化アプローチがキャプチャーできないという精巧な主張を含む開発者によって書かれたテストの間に、かなりのギャップがあることを示しています。
このギャップに対処するため,開発意図の自然言語(NL)記述からテストを生成することを提案する。
我々はNL記述から構造的に複雑なテストケースを生成する最初のエージェントベースのフレームワークである佐倉について紹介する。
サクラはNL記述を構造化ブロックに分解して処理し、静的解析を通じて具体的なアプリケーションコードのテストステップを基盤とするローカライゼーションエージェントと、コンパイル可能なテストコードを合成し、実行フィードバックを使用してそれを反復的に洗練するコンポジションエージェントと、エージェントインタラクションをコーディネートするスーパーバイザエージェントからなるマルチエージェントシステムで処理する。
サクラを評価するため,Apache Commonsプロジェクトから抽出した開発者によるテストから体系的に生成された,3段階の抽象化でNLテスト記述の新たなデータセットをキュレートした。
20のアプリケーションと1,464のテストシナリオで、Saraは、Gemini CLIのような市販のエージェントツールよりも大幅に優れています。
具体的には、サクラは、同じモデルを使用したベースラインと比較して、50~78%高いテストコンパイル性、38~66%高いカバレッジオーバーラップを実現している。
さらに、SaraはDevstral Small 2やQwen3-Coderのような小さなオープンソースモデルと組み合わせて、大きなプロプライエタリモデルを使用してGemini CLIを性能良くし、コスト効率も向上した。
関連論文リスト
- Multi-Agent LLM Collaboration for Unit Test Generation via Human-Testing-Inspired Workflows [18.32804849870551]
大規模言語モデル(LLM)は、自動単体テスト生成の研究を急加速させた。
マルチエージェント協調機構を用いて,人間のテストプラクティスをエミュレートするLLMベースのテスト生成手法であるTestAgentを提案する。
TestAgentは97.46%の実行率、92.34%のラインカバレッジ、90.24%のブランチカバレッジ、6つのJavaプロジェクトで83.69%の突然変異スコアを達成した。
論文 参考訳(メタデータ) (2026-07-10T05:16:54Z) - Testing with AI Agents: An Empirical Study of Test Generation Frequency, Quality, and Coverage [1.6782288954198918]
本研究では,AIDevデータセットを用いたエージェントベースコーディングツールによるテスト生成の実験的検討を行った。
テスト関連変更を含む2,232件のコミットを抽出し,テスト追加頻度,生成したテストの構造特性,コードカバレッジへの影響の3つの側面を検討した。
その結果,(i)AIは,実世界のリポジトリにテストを追加するコミットの16.4%を作成した。(ii)AI生成テストメソッドは,より長いコードと高いアサーション密度を特徴とする構造パターンを示し,(iii)AI生成テストは,人手によるテストに匹敵するコードカバレッジに寄与していることがわかった。
論文 参考訳(メタデータ) (2026-03-14T03:01:44Z) - SAINT: Service-level Integration Test Generation with Program Analysis and LLM-based Agents [43.3273990835497]
SAINTは、エンタープライズJavaアプリケーションのサービスレベルのテストのための、新しいホワイトボックステストアプローチである。
SAINTは静的解析、大規模言語モデル(LLM)、LLMベースのエージェントを組み合わせて、エンドポイントとシナリオベースのテストを自動的に生成する。
論文 参考訳(メタデータ) (2025-11-17T12:29:42Z) - Rethinking Testing for LLM Applications: Characteristics, Challenges, and a Lightweight Interaction Protocol [83.83217247686402]
大言語モデル(LLM)は、単純なテキストジェネレータから、検索強化、ツール呼び出し、マルチターンインタラクションを統合する複雑なソフトウェアシステムへと進化してきた。
その固有の非決定主義、ダイナミズム、文脈依存は品質保証に根本的な課題をもたらす。
本稿では,LLMアプリケーションを3層アーキテクチャに分解する: textbftextitSystem Shell Layer, textbftextitPrompt Orchestration Layer, textbftextitLLM Inference Core。
論文 参考訳(メタデータ) (2025-08-28T13:00:28Z) - Alignment with Fill-In-the-Middle for Enhancing Code Generation [56.791415642365415]
コードスニペットを小さな粒度のブロックに分割し,同じテストケースからより多様なDPOペアを生成する手法を提案する。
提案手法は,HumanEval (+), MBPP (+), APPS, LiveCodeBench, BigCodeBenchといったベンチマークデータセットの実験によって検証された,コード生成タスクの大幅な改善を示す。
論文 参考訳(メタデータ) (2025-08-27T03:15:53Z) - LlamaRestTest: Effective REST API Testing with Small Language Models [50.058600784556816]
LlamaRestTestは、2つのLLM(Large Language Models)を使って現実的なテストインプットを生成する新しいアプローチである。
私たちは、GPTを使った仕様強化ツールであるRESTGPTなど、最先端のREST APIテストツールに対して、これを評価しています。
私たちの研究は、REST APIテストにおいて、小さな言語モデルは、大きな言語モデルと同様に、あるいは、より良く機能することができることを示しています。
論文 参考訳(メタデータ) (2025-01-15T05:51:20Z) - Commit0: Library Generation from Scratch [77.38414688148006]
Commit0は、AIエージェントにスクラッチからライブラリを書くよう促すベンチマークである。
エージェントには、ライブラリのAPIを概説する仕様文書と、インタラクティブなユニットテストスイートが提供されている。
Commit0はまた、モデルが生成したコードに対して静的解析と実行フィードバックを受け取る、インタラクティブな環境も提供する。
論文 参考訳(メタデータ) (2024-12-02T18:11:30Z) - ASTER: Natural and Multi-language Unit Test Generation with LLMs [6.259245181881262]
静的解析を組み込んだジェネリックパイプラインを記述し,コンパイル可能な高カバレッジテストケースの生成においてLCMをガイドする。
コードカバレッジとテスト自然性の観点から,生成したテストの品質を評価するための実証的研究を行った。
論文 参考訳(メタデータ) (2024-09-04T21:46:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。