論文の概要: Tangent: An Empirical Study of Testing Practices for LLM-Based Agent Applications
- arxiv url: http://arxiv.org/abs/2608.08413v1
- Date: Sun, 09 Aug 2026 02:08:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.811873
- Title: Tangent: An Empirical Study of Testing Practices for LLM-Based Agent Applications
- Title(参考訳): Tangent: LLMベースのエージェントアプリケーションのテスト実践に関する実証的研究
- Abstract要約: エージェントアプリケーションのテストレベル、目的、データパターン、テストの複雑さ、バリデーション戦略は未検討のままです。
エージェントアプリケーション,ツール,テストの大規模データセットを構築し,240モジュールから2,572のテストメソッドを手作業でラベル付けする。
テストフィクスチャ、データ、目的、アサーションにまたがる23のテストパターンの分類を導き、レベル(ユニット、モジュール、統合)によるテストの特徴付けを行います。
- 参考スコア(独自算出の注目度): 41.648736542377016
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Agents built on large language models (LLMs) are increasingly used to build applications that perform complex, multi-step tasks involving reasoning, tool use, and interaction with external environments. Despite rapid progress in benchmarking LLM-based agents, very few studies have attempted to understand how such systems are tested in practice. In particular, testing levels, objectives, data patterns, test complexity, and validation strategies for agent applications remain underexplored. In this paper, we present an empirical study of testing practices in LLM-based agent applications using a large corpus of mined open-source projects. We construct a large-scale dataset of agent applications, tools, and tests, and manually label 2,572 test methods from 240 modules. From this analysis, we derive a taxonomy of 23 testing patterns across test fixtures, data, objectives, and assertions, and characterize tests by level (unit, module, integration). We complement this with structured interviews of 10 senior industry practitioners building agentic systems. Our results show that testing of LLM-based agent applications is dominated by narrowly scoped unit tests, with limited coverage of complex interactions, realistic scenarios, and non-functional requirements. Tests frequently rely on simplistic inputs, heavy mocking, and shallow validation, and agent-related tests exhibit low structural complexity. While industry practice places greater emphasis on non-functional testing than open-source projects, both reveal common gaps, including the lack of formal testing foundations, unclear test objectives, and challenges in generating high-quality test data. Based on these findings, we outline research directions toward more systematic and rigorous testing of agent applications, including foundations for agent testability, formalized test objectives, and fault-based testing techniques.
- Abstract(参考訳): 大規模言語モデル(LLM)上に構築されたエージェントは、推論、ツールの使用、外部環境とのインタラクションを含む複雑なマルチステップタスクを実行するアプリケーションの構築にますます利用されている。
LLMをベースとしたエージェントのベンチマークが急速に進んでいるにもかかわらず、そのようなシステムが実際にどのようにテストされているかを理解するための研究はほとんどない。
特に、テストレベル、目的、データパターン、テストの複雑さ、エージェントアプリケーションのバリデーション戦略は未定のままです。
本稿では,LLMをベースとしたエージェントアプリケーションにおける大規模なオープンソースプロジェクトコーパスを用いたテスト実践の実証的研究について述べる。
エージェントアプリケーション,ツール,テストの大規模データセットを構築し,240モジュールから2,572のテストメソッドを手作業でラベル付けする。
この分析から、テストフィクスチャ、データ、目的、アサーションにまたがる23のテストパターンの分類を導き、レベル(ユニット、モジュール、統合)によるテストの特徴付けを行う。
エージェントシステムを構築する10人のシニア産業実践者の構造的なインタビューでこれを補完する。
以上の結果から, LLMをベースとしたエージェントアプリケーションのテストは, 複雑なインタラクション, 現実シナリオ, 非機能要件を限定した, 狭い範囲の単体テストに支配されていることがわかった。
テストは単純な入力、重いモック、浅い検証に頻繁に依存し、エージェント関連のテストは構造的な複雑さが低い。
業界プラクティスは、オープンソースプロジェクトよりも非機能テストに重点を置いているが、どちらも、公式なテスト基盤の欠如、テストの目的が不明であること、高品質なテストデータを生成する上での課題など、共通のギャップを明らかにしている。
これらの知見に基づき,エージェントアプリケーションのより体系的で厳密なテストに向けた研究の方向性を概説する。
関連論文リスト
- Multi-Agent LLM Collaboration for Unit Test Generation via Human-Testing-Inspired Workflows [18.32804849870551]
大規模言語モデル(LLM)は、自動単体テスト生成の研究を急加速させた。
マルチエージェント協調機構を用いて,人間のテストプラクティスをエミュレートするLLMベースのテスト生成手法であるTestAgentを提案する。
TestAgentは97.46%の実行率、92.34%のラインカバレッジ、90.24%のブランチカバレッジ、6つのJavaプロジェクトで83.69%の突然変異スコアを達成した。
論文 参考訳(メタデータ) (2026-07-10T05:16:54Z) - Automated structural testing of LLM-based agents: methods, framework, and case studies [0.05254956925594667]
LLMベースのエージェントは、様々な領域で急速に採用されている。
現在のテストアプローチは、ユーザの視点からの受け入れレベルの評価に重点を置いている。
LLMをベースとしたエージェントの構造試験を可能にする手法を提案する。
論文 参考訳(メタデータ) (2026-01-25T11:52:30Z) - SelfAI: Building a Self-Training AI System with LLM Agents [79.10991818561907]
SelfAIは、高レベルの研究目的を標準化された実験構成に変換するためのUser Agentを組み合わせた、一般的なマルチエージェントプラットフォームである。
実験マネージャは、連続的なフィードバックのための構造化知識ベースを維持しながら、異種ハードウェアをまたいだ並列かつフォールトトレラントなトレーニングを編成する。
回帰、コンピュータビジョン、科学計算、医用画像、薬物発見ベンチマークなどを通じて、SelfAIは一貫して高いパフォーマンスを達成し、冗長な試行を減らしている。
論文 参考訳(メタデータ) (2025-11-29T09:18:39Z) - Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation [47.85891728056131]
PRDBenchは、20のドメインにわたる50の現実のPythonプロジェクトからなる、新しいベンチマークである。それぞれに構造化された製品要求文書(PRD)要件、包括的な評価基準、リファレンス実装がある。
我々はエージェント・アズ・ア・ジャッジ(Agen-as-a-Judge)パラダイムを用いてエージェントの出力を評価する。
論文 参考訳(メタデータ) (2025-10-28T12:26:45Z) - Software Testing with Large Language Models: An Interview Study with Practitioners [2.198430261120653]
ソフトウェアテストにおける大きな言語モデルの使用は、多くのタスクをサポートするにつれて急速に増加しています。
しかし、彼らの採用は構造的なガイダンスよりも非公式な実験に依存していることが多い。
本研究は,ソフトウェアテスト専門家が LLM を用いて,予備的,実践的インフォームドガイドラインを提案する方法について考察する。
論文 参考訳(メタデータ) (2025-10-20T05:06:56Z) - An Empirical Study of Testing Practices in Open Source AI Agent Frameworks and Agentic Applications [12.166151903597445]
ファンデーションモデル(FM)ベースのAIエージェントは、さまざまなドメインで急速に採用されている。
その固有の非決定主義と非再現性は、テストと品質保証の課題を引き起こす。
AIエージェントエコシステムにおけるテストプラクティスの大規模な実証的研究を初めて実施する。
論文 参考訳(メタデータ) (2025-09-23T16:02:09Z) - Rethinking Testing for LLM Applications: Characteristics, Challenges, and a Lightweight Interaction Protocol [83.83217247686402]
大言語モデル(LLM)は、単純なテキストジェネレータから、検索強化、ツール呼び出し、マルチターンインタラクションを統合する複雑なソフトウェアシステムへと進化してきた。
その固有の非決定主義、ダイナミズム、文脈依存は品質保証に根本的な課題をもたらす。
本稿では,LLMアプリケーションを3層アーキテクチャに分解する: textbftextitSystem Shell Layer, textbftextitPrompt Orchestration Layer, textbftextitLLM Inference Core。
論文 参考訳(メタデータ) (2025-08-28T13:00:28Z) - AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios [51.46347732659174]
LLM(Large Language Models)は、現実世界のエージェントアプリケーションにおいて高度な機能を示す。
AgentIFは、エージェントシナリオでLLM命令に従う能力を体系的に評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2025-05-22T17:31:10Z) - ASTER: Natural and Multi-language Unit Test Generation with LLMs [6.259245181881262]
静的解析を組み込んだジェネリックパイプラインを記述し,コンパイル可能な高カバレッジテストケースの生成においてLCMをガイドする。
コードカバレッジとテスト自然性の観点から,生成したテストの品質を評価するための実証的研究を行った。
論文 参考訳(メタデータ) (2024-09-04T21:46:18Z) - Automatic benchmarking of large multimodal models via iterative experiment programming [71.78089106671581]
本稿では,LMMの自動ベンチマークのための最初のフレームワークであるAPExを紹介する。
自然言語で表現された研究の質問に対して、APExは大きな言語モデル(LLM)と事前定義されたツールのライブラリを活用して、手元にあるモデルの一連の実験を生成する。
調査の現在の状況に基づいて、APExはどの実験を行うか、結果が結論を引き出すのに十分かどうかを選択する。
論文 参考訳(メタデータ) (2024-06-18T06:43:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。