論文の概要: Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation
- arxiv url: http://arxiv.org/abs/2608.17177v2
- Date: Fri, 21 Aug 2026 19:41:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 18:24:36.88865
- Title: Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation
- Title(参考訳): 契約における接地AIエージェント: 仕様駆動テスト生成の実証評価
- Abstract要約: 仕様駆動テスト生成(Spec-Driven Test Generation)は、エージェントに対して、コード事前条件、事後条件、未定義の振る舞いについて-および明示的に文書化するように指示する。
この中間半形式仕様は、その後のテスト生成を導くための認知的足場として機能する。
- 参考スコア(独自算出の注目度): 4.061618191574875
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based agents are increasingly used for coding tasks, where they have outperformed many classical approaches and scaled to repository-level tasks, such as test generation. However, when directly prompted to generate tests, these agents can fail to reason about the code and its underlying contracts, thereby missing edge cases and behavioral boundaries that affect test quality. To address this limitation, we propose Spec-Driven Test Generation, where we instruct an agent to first reason about -- and explicitly document -- code pre-conditions, post-conditions, and undefined behaviors. This intermediate semi-formal specification acts as a cognitive scaffold to guide subsequent test generation. Our evaluation on production bugs from Google shows that the spec-driven agent can deliver a 9.8 percentage points ($p = 0.0352$) improvement in bug detection rate and a 2.5 percentage point ($p = 0.0034$) improvement in branch coverage, compared to a traditional test generation agent baseline. Using LLM-as-a-Judge, we further show that test suites generated by the spec-driven agent are superior to the baseline and human-authored tests in 77.8% and 56.7% of the cases, respectively, and demonstrated improvements on following best practices, readability, and edge-case coverage.
- Abstract(参考訳): LLMベースのエージェントは、多くの古典的なアプローチより優れており、テスト生成のようなリポジトリレベルのタスクにスケールしている。
しかしながら、直接テストを生成するように指示されると、これらのエージェントはコードとその基盤となるコントラクトを判断できないため、テスト品質に影響を与えるエッジケースや振る舞い境界が欠落する可能性がある。
この制限に対処するために、私たちは仕様駆動テスト生成(Spec-Driven Test Generation)を提案します。
この中間半形式仕様は、その後のテスト生成を導くための認知的足場として機能する。
Googleによるプロダクションバグの評価によると、この仕様駆動エージェントは、従来のテスト生成エージェントのベースラインと比較して、バグ検出率が9.8ポイント(p = 0.0352$)改善され、ブランチカバレッジが2.5ポイント(p = 0.0034$)改善できる。
さらに, LLM-as-a-Judgeを用いて, 仕様駆動エージェントが生成したテストスイートが, 77.8%, 56.7%のケースにおいて, ベースラインと人為的なテストよりも優れていることを示し, 以下のベストプラクティス, 可読性, エッジケースカバレッジの改善を実証した。
関連論文リスト
- TDD-Agent: Test-Driven Reasoning for Code Generation [12.09256800328452]
既存のアプローチでは、生成されたテストを静的なポストホックバリデータとして使用しています。
コード生成のためのテスト駆動開発パラダイムを運用するTDD-Agentを紹介します。
論文 参考訳(メタデータ) (2026-08-17T15:52:04Z) - Beyond Test Presence: Assessing the Quality and Robustness of Agent-Generated Tests in Open-Source Projects [2.9713899640333348]
AIによるコーディングエージェントを継続的インテグレーション/継続的デリバリパイプラインに統合することは、ソフトウェア検証の実施方法を根本的に変えた。
これらのエージェントは、テスト生成の自動化に成功したが、現在の評価ベンチマークは、生成されたテストの本質的な品質よりも、パスレートに重点を置いている。
AIDevデータセットから得られた24,941の人間が作成したファイルと179,732のエージェント生成ファイルからなる204,673個のテストアーティファクトを比較した。
論文 参考訳(メタデータ) (2026-07-13T18:40:24Z) - Multi-Agent LLM Collaboration for Unit Test Generation via Human-Testing-Inspired Workflows [18.32804849870551]
大規模言語モデル(LLM)は、自動単体テスト生成の研究を急加速させた。
マルチエージェント協調機構を用いて,人間のテストプラクティスをエミュレートするLLMベースのテスト生成手法であるTestAgentを提案する。
TestAgentは97.46%の実行率、92.34%のラインカバレッジ、90.24%のブランチカバレッジ、6つのJavaプロジェクトで83.69%の突然変異スコアを達成した。
論文 参考訳(メタデータ) (2026-07-10T05:16:54Z) - What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs [52.50210189669399]
視覚言語モデル(VLM)を駆動するには,操作設計領域(ODD)が定義する様々な条件のシーンを正確に理解する必要がある
SliceScorerは、欠落したスライス推薦のための決定論的スコアリングルールである。
SliceNavは, 従来のスライス発見法よりも, 高リスクカバレッジギャップを効果的に表面化することを示す。
論文 参考訳(メタデータ) (2026-06-01T03:18:01Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - Test-Driven AI Agent Definition (TDAD): Compiling Tool-Using Agents from Behavioral Specifications [0.0]
テスト駆動型AIエージェント定義(TDAD)は、エージェントプロンプトをコンパイルされたアーティファクトとして扱う方法論である。
SpecSuite-CoreのTDADは、ポリシーコンプライアンス、グラウンドド・アナリティクス、ランブックの遵守、決定論的強制にまたがる4つのエージェントのベンチマークである。
論文 参考訳(メタデータ) (2026-03-09T18:04:54Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - SWT-Bench: Testing and Validating Real-World Bug-Fixes with Code Agents [10.730852617039451]
ユーザ問題をテストケースに形式化するLLMベースのコードエージェントについて検討する。
我々は人気のあるGitHubリポジトリに基づいた新しいベンチマークを提案し、現実世界の問題、地味なバグフィックス、ゴールデンテストを含む。
コード修復用に設計されたコードエージェントは,テスト生成用に設計されたシステムの性能を上回っている。
論文 参考訳(メタデータ) (2024-06-18T14:54:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。