論文の概要: Multi-Agent LLM Collaboration for Unit Test Generation via Human-Testing-Inspired Workflows
- arxiv url: http://arxiv.org/abs/2607.09101v1
- Date: Fri, 10 Jul 2026 05:16:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.784173
- Title: Multi-Agent LLM Collaboration for Unit Test Generation via Human-Testing-Inspired Workflows
- Title(参考訳): ヒューマンテストインスパイアされたワークフローによる単体テスト生成のためのマルチエージェントLLMコラボレーション
- Abstract要約: 大規模言語モデル(LLM)は、自動単体テスト生成の研究を急加速させた。
マルチエージェント協調機構を用いて,人間のテストプラクティスをエミュレートするLLMベースのテスト生成手法であるTestAgentを提案する。
TestAgentは97.46%の実行率、92.34%のラインカバレッジ、90.24%のブランチカバレッジ、6つのJavaプロジェクトで83.69%の突然変異スコアを達成した。
- 参考スコア(独自算出の注目度): 18.32804849870551
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recently, the emergence of Large Language Models (LLMs) has spurred a surge of research into automated unit test generation, yielding impressive performance and reducing manual effort. However, existing LLM-based approaches still suffer from two major limitations: (1) they follow rigid, procedural workflows that underutilize the autonomous reasoning potential of LLMs, making it difficult to dynamically adapt testing strategies based on real-time feedback; and (2) they rely on rule-based context extraction that is not tailored to test generation, failing to capture fine-grained code dependencies and test-specific knowledge required for deriving test requirements. In this paper, we propose TestAgent, an LLM-based test generation approach that addresses the above limitations by emulating human testing practices via a multi-agent collaboration mechanism. Particularly, TestAgent designs three specialized agents, namely a requirement planner, a test generator, and a test reviewer, to simulate how developers understand, construct, and validate unit tests. To unleash the autonomous capabilities of LLMs, we equip TestAgent with a set of tool APIs that can be invoked dynamically in an on-demand and adaptive manner. To further support repository-level reasoning, TestAgent constructs a test-specialized knowledge graph via static analysis, which captures code entities and their dependencies across the project and persistently stores testing artifacts (e.g., test reports and failure analyses) produced during generation. Experimental results show that TestAgent achieves 97.46% execution rate, 92.34% line coverage, 90.24% branch coverage, and 83.69% mutation score on six Java projects, outperforming LLM-based baselines across all metrics and achieving substantially higher mutation scores than search-based tools.
- Abstract(参考訳): 最近、LLM(Large Language Models)が出現し、自動ユニットテスト生成の研究が急増し、目覚ましいパフォーマンスと手作業の削減につながった。
しかし、既存のLLMベースのアプローチは、(1)LLMの自律的推論能力を弱め、リアルタイムフィードバックに基づいてテスト戦略を動的に適応させることが困難になる厳格で手続き的なワークフローに従うこと、(2)テスト生成に適さないルールベースのコンテキスト抽出に依存し、きめ細かいコード依存関係とテスト要件の導出に必要なテスト固有の知識を捕捉できないこと、の2つの大きな制限に悩まされている。
本論文では,LLMを用いたテスト生成手法であるTestAgentを提案する。
特にTestAgentは、開発者がユニットテストを理解し、構築し、検証する方法をシミュレートするために、要件プランナ、テストジェネレータ、テストレビュアの3つの特殊なエージェントを設計している。
LLMの自律的能力を解き放つために、TestAgentにオンデマンドかつ適応的な方法で動的に呼び出せる一連のツールAPIを装備します。
TestAgentは、リポジトリレベルの推論をさらにサポートするために、静的解析を通じてテスト特化知識グラフを構築し、プロジェクト全体にわたるコードエンティティと依存関係をキャプチャし、生成時に生成されたテストアーティファクト(テストレポート、障害解析など)を永続的に保存する。
実験の結果、TestAgentは97.46%の実行率、92.34%のラインカバレッジ、90.24%のブランチカバレッジ、83.69%の突然変異スコアを6つのJavaプロジェクトで達成し、全てのメトリクスでLSMベースのベースラインを上回り、検索ベースのツールよりも大幅に高い突然変異スコアを達成した。
関連論文リスト
- Tangent: An Empirical Study of Testing Practices for LLM-Based Agent Applications [41.648736542377016]
エージェントアプリケーションのテストレベル、目的、データパターン、テストの複雑さ、バリデーション戦略は未検討のままです。
エージェントアプリケーション,ツール,テストの大規模データセットを構築し,240モジュールから2,572のテストメソッドを手作業でラベル付けする。
テストフィクスチャ、データ、目的、アサーションにまたがる23のテストパターンの分類を導き、レベル(ユニット、モジュール、統合)によるテストの特徴付けを行います。
論文 参考訳(メタデータ) (2026-08-09T02:08:34Z) - Automated Test Suite Enhancement Using Large Language Models with Few-shot Prompting [0.0]
単体テストは、コードモジュールの機能的正当性を検証するのに不可欠である。
検索ベースのソフトウェアテスト(SBST)、可読性、自然性、実用的なユーザビリティの欠如など、従来のアプローチを採用したツールによって生成されたユニットテスト。
ソフトウェアリポジトリには、人間によるテスト、LLMで生成されたテスト、SBSTのような従来のアプローチを使ったツールが混在している。
論文 参考訳(メタデータ) (2026-02-12T18:42:49Z) - Automated structural testing of LLM-based agents: methods, framework, and case studies [0.05254956925594667]
LLMベースのエージェントは、様々な領域で急速に採用されている。
現在のテストアプローチは、ユーザの視点からの受け入れレベルの評価に重点を置いている。
LLMをベースとしたエージェントの構造試験を可能にする手法を提案する。
論文 参考訳(メタデータ) (2026-01-25T11:52:30Z) - SelfAI: Building a Self-Training AI System with LLM Agents [79.10991818561907]
SelfAIは、高レベルの研究目的を標準化された実験構成に変換するためのUser Agentを組み合わせた、一般的なマルチエージェントプラットフォームである。
実験マネージャは、連続的なフィードバックのための構造化知識ベースを維持しながら、異種ハードウェアをまたいだ並列かつフォールトトレラントなトレーニングを編成する。
回帰、コンピュータビジョン、科学計算、医用画像、薬物発見ベンチマークなどを通じて、SelfAIは一貫して高いパフォーマンスを達成し、冗長な試行を減らしている。
論文 参考訳(メタデータ) (2025-11-29T09:18:39Z) - Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation [47.85891728056131]
PRDBenchは、20のドメインにわたる50の現実のPythonプロジェクトからなる、新しいベンチマークである。それぞれに構造化された製品要求文書(PRD)要件、包括的な評価基準、リファレンス実装がある。
我々はエージェント・アズ・ア・ジャッジ(Agen-as-a-Judge)パラダイムを用いてエージェントの出力を評価する。
論文 参考訳(メタデータ) (2025-10-28T12:26:45Z) - Rethinking Testing for LLM Applications: Characteristics, Challenges, and a Lightweight Interaction Protocol [83.83217247686402]
大言語モデル(LLM)は、単純なテキストジェネレータから、検索強化、ツール呼び出し、マルチターンインタラクションを統合する複雑なソフトウェアシステムへと進化してきた。
その固有の非決定主義、ダイナミズム、文脈依存は品質保証に根本的な課題をもたらす。
本稿では,LLMアプリケーションを3層アーキテクチャに分解する: textbftextitSystem Shell Layer, textbftextitPrompt Orchestration Layer, textbftextitLLM Inference Core。
論文 参考訳(メタデータ) (2025-08-28T13:00:28Z) - PALM: Synergizing Program Analysis and LLMs to Enhance Rust Unit Test Coverage [14.702182387149547]
本稿では,大規模言語モデル(LLM)を活用して高カバレッジ単体テストを生成する手法であるPALMを提案する。
PALMはプログラム解析を行い、関数内の分岐条件を特定し、それを経路制約に結合する。
このアプローチを実装し、それを15のオープンソースのRustクラッドで評価します。
論文 参考訳(メタデータ) (2025-06-10T17:21:21Z) - IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis [60.32962597618861]
IDA-Benchは、多ラウンドの対話シナリオで大規模言語モデルを評価する新しいベンチマークである。
エージェント性能は、最終的な数値出力と人間由来のベースラインを比較して判断する。
最先端のコーディングエージェント(Claude-3.7-thinkingなど)でさえ50%のタスクを成功させ、シングルターンテストでは明らかでない制限を強調している。
論文 参考訳(メタデータ) (2025-05-23T09:37:52Z) - Commit0: Library Generation from Scratch [77.38414688148006]
Commit0は、AIエージェントにスクラッチからライブラリを書くよう促すベンチマークである。
エージェントには、ライブラリのAPIを概説する仕様文書と、インタラクティブなユニットテストスイートが提供されている。
Commit0はまた、モデルが生成したコードに対して静的解析と実行フィードバックを受け取る、インタラクティブな環境も提供する。
論文 参考訳(メタデータ) (2024-12-02T18:11:30Z) - AutoPT: How Far Are We from the End2End Automated Web Penetration Testing? [54.65079443902714]
LLMによって駆動されるPSMの原理に基づく自動浸透試験エージェントであるAutoPTを紹介する。
以上の結果から, AutoPT は GPT-4o ミニモデル上でのベースラインフレームワーク ReAct よりも優れていた。
論文 参考訳(メタデータ) (2024-11-02T13:24:30Z) - ASTER: Natural and Multi-language Unit Test Generation with LLMs [6.259245181881262]
静的解析を組み込んだジェネリックパイプラインを記述し,コンパイル可能な高カバレッジテストケースの生成においてLCMをガイドする。
コードカバレッジとテスト自然性の観点から,生成したテストの品質を評価するための実証的研究を行った。
論文 参考訳(メタデータ) (2024-09-04T21:46:18Z) - Benchmarking Uncertainty Quantification Methods for Large Language Models with LM-Polygraph [83.90988015005934]
不確実性定量化は機械学習アプリケーションにおいて重要な要素である。
最新のUQベースラインの集合を実装した新しいベンチマークを導入する。
我々は、11タスクにわたるUQと正規化技術に関する大規模な実証的研究を行い、最も効果的なアプローチを特定した。
論文 参考訳(メタデータ) (2024-06-21T20:06:31Z) - MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation [96.71370747681078]
我々は,CIFAR-10におけるモデル性能の改善から,BabyLMのような最近の研究課題まで,13のタスクからなるMLAgentBenchを紹介した。
各タスクに対して、エージェントはファイルの読み書き、コードの実行、出力の検査などのアクションを実行することができる。
我々は、Claude v1.0、Claude v2.1、Claude v3 Opus、GPT-4、GPT-4-turbo、Gemini-Pro、Mixtralに基づいてベンチマークエージェントをベンチマークし、Claude v3 Opusエージェントが成功率の点で最高であることを示す。
論文 参考訳(メタデータ) (2023-10-05T04:06:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。