論文の概要: Integrating High-Level Requirements to Low-Level Tests with Machine-Readable V&V Specifications
- arxiv url: http://arxiv.org/abs/2607.17686v1
- Date: Mon, 20 Jul 2026 08:36:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.551
- Title: Integrating High-Level Requirements to Low-Level Tests with Machine-Readable V&V Specifications
- Title(参考訳): マシン可読V&V仕様による低レベルテストへの高レベル要求の統合
- Abstract要約: 実際には、マシンが実際に実行する高レベルな要件と低レベルのテストとのリンクは、もしもそうでなければ手作業で維持される。
VNVSpecは、V&V仕様を機械可読化し実行可能にするオープンソースフレームワークである。
フレームワークを自己アプリケーションで評価し、449のテストで検証された36の要件の仕様に対してCIで継続的に評価する。
- 参考スコア(独自算出の注目度): 0.7874708385247353
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern software teams have mature tools for low-level testing, such as pytest, JUnit, and Jest, which make it inexpensive to write unit tests and run them on every commit. Systems engineering, in parallel, has developed rigorous principles for design verification and validation (V&V), which has worked very well across engineering discipline to align user expecations and requirements with developers' deliverables. In practice, however, the two rarely connect, and the link between users' high-level requirements and the low-level tests that machines actually run is maintained by hand, if at all. This gap is increasingly costly for AI-enabled and cyber-physical systems, for which regulators now ask for traceable evidence that high-level requirements are met, while raw test results provide little of the structure such evidence requires. We introduce VNVSpec, an open-source framework that makes V&V specifications machine-readable and executable. With this framework, users state high-level requirements directly or import them from catalogs derived from published standards. Then, the framework checks requirement quality, supports decomposition into module-level requirements with explicit metrics and acceptance criteria, links these requirements to test results through a traceability graph, and compiles the collected evidence into verdicts and audit-ready reports. We evaluate the framework by self-application, in which it is continuously assessed in CI against its own specification of 36 requirements verified by 449 tests, completed within limited time which scales linearly and thus can handle up to 10,000 requirements. We also discuss how the framework extends to testing black-box AI models and AI coding agents. The framework, its full test suite, the catalogs, and the benchmark scripts are available at https://github.com/ai-vnv/vnvspec.
- Abstract(参考訳): 現代のソフトウェアチームは、pytest、JUnit、Jestといった低レベルのテストのための成熟したツールを持っている。
システムエンジニアリングは、設計検証と検証(V&V)のための厳格な原則を開発しており、これは、ユーザの排除と要求を開発者の納品物と整合させるために、エンジニアリングの分野で非常にうまく機能している。
しかし、実際には2つが接続されることはほとんどなく、ユーザの高レベルの要求とマシンが実際に実行する低レベルのテストとのリンクは、たとえ何であれ、手作業で維持される。
このギャップは、AI対応とサイバー物理システムにとってますますコストがかかり、規制当局は、高レベルの要求が満たされているという追跡可能な証拠を要求している。
VNVSpecは、V&V仕様を機械可読化し実行可能にするオープンソースフレームワークである。
このフレームワークでは、ユーザは高レベルの要件を直接記述するか、公開標準から派生したカタログからインポートする。
次に、フレームワークは要求品質をチェックし、明示的なメトリクスと受け入れ基準でモジュールレベルの要件への分解をサポートし、これらの要件をトレーサビリティグラフを通じてテスト結果にリンクし、収集したエビデンスを検証および監査可能なレポートにコンパイルする。
フレームワークを自己アプリケーションで評価し、449のテストで検証された36の要件の仕様に対してCIで継続的に評価し、線形にスケールする限られた時間内に完了し、最大10,000の要件を処理することができる。
また、このフレームワークがブラックボックスAIモデルとAIコーディングエージェントのテストにどのように拡張されるかについても論じる。
フレームワーク、完全なテストスイート、カタログ、ベンチマークスクリプトはhttps://github.com/ai-vnv/vnvspec.comから入手できる。
関連論文リスト
- WebTestBench: Evaluating Computer-Use Agents towards End-to-End Automated Web Testing [57.7131457251794]
エンドツーエンドの自動Webテストを評価するベンチマークであるWebTestBenchを紹介します。
テストプロセスを2つのカスケードサブタスク、チェックリストの生成と欠陥検出に分解し、WebTesterを提案する。
以上の結果から,現在のコンピュータ利用エージェント能力と産業レベルの展開要求との間に大きなギャップがあることが判明した。
論文 参考訳(メタデータ) (2026-03-26T09:27:29Z) - ARC: Compiling Hundreds of Requirement Scenarios into A Runnable Web System [10.49539144799249]
Agentic Requirement Compilation (ARC)は、単純なコード生成から要件コンパイルへ移行するテクニックである。
ARCはソースコードだけでなく、UI、API、データベース層のためのモジュラーデザインも生成する。
21人の参加者によるユーザスタディでは、初心者のユーザが複雑なシステムのためにDSL文書を書けることが示されている。
論文 参考訳(メタデータ) (2026-02-14T11:07:58Z) - RAL-Bench: Benchmarking for Application-Level Functional Correctness and Non-Functional Quality Attributes [12.202503919149118]
RAL-Benchはアプリケーションレベルのコード生成のためのベンチマークおよび評価フレームワークである。
各タスクに対して,高品質な参照プロジェクトから簡潔な自然言語要求を抽出する。
Black-boxシステムテストは機能的および非機能的属性をカバーし、参照リポジトリに渡すテストのみを保持する。
論文 参考訳(メタデータ) (2026-02-03T12:35:09Z) - Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation [47.85891728056131]
PRDBenchは、20のドメインにわたる50の現実のPythonプロジェクトからなる、新しいベンチマークである。それぞれに構造化された製品要求文書(PRD)要件、包括的な評価基準、リファレンス実装がある。
我々はエージェント・アズ・ア・ジャッジ(Agen-as-a-Judge)パラダイムを用いてエージェントの出力を評価する。
論文 参考訳(メタデータ) (2025-10-28T12:26:45Z) - Rethinking Testing for LLM Applications: Characteristics, Challenges, and a Lightweight Interaction Protocol [83.83217247686402]
大言語モデル(LLM)は、単純なテキストジェネレータから、検索強化、ツール呼び出し、マルチターンインタラクションを統合する複雑なソフトウェアシステムへと進化してきた。
その固有の非決定主義、ダイナミズム、文脈依存は品質保証に根本的な課題をもたらす。
本稿では,LLMアプリケーションを3層アーキテクチャに分解する: textbftextitSystem Shell Layer, textbftextitPrompt Orchestration Layer, textbftextitLLM Inference Core。
論文 参考訳(メタデータ) (2025-08-28T13:00:28Z) - VERINA: Benchmarking Verifiable Code Generation [46.582574591358735]
大規模言語モデル(LLM)は、ソフトウェア開発にますます統合されている。
LLM生成コードの正確性を保証することは依然として困難である。
検証可能なコード生成は、この制限に対処するための有望なパスを提供する。
論文 参考訳(メタデータ) (2025-05-29T06:12:52Z) - Requirements-Driven Automated Software Testing: A Systematic Review [12.953746641112518]
この体系的な文献は、要求入力フォーマット、変換技術、生成されたテストアーティファクト、評価方法、一般的な制限の現状を批判的に検証する。
本研究は,機能要件,モデルベース仕様,自然言語フォーマットの優位性に注目した。
テストケース、構造化されたテキスト形式、要求カバレッジは一般的だが、完全な自動化は依然として稀である。
論文 参考訳(メタデータ) (2025-02-25T23:13:09Z) - CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification [71.34070740261072]
本稿では,テストケースの生成と完成におけるモデルの能力を評価するためのベンチマークCLOVERを提案する。
ベンチマークはタスク間でのコード実行のためにコンテナ化されています。
論文 参考訳(メタデータ) (2025-02-12T21:42:56Z) - Commit0: Library Generation from Scratch [77.38414688148006]
Commit0は、AIエージェントにスクラッチからライブラリを書くよう促すベンチマークである。
エージェントには、ライブラリのAPIを概説する仕様文書と、インタラクティブなユニットテストスイートが提供されている。
Commit0はまた、モデルが生成したコードに対して静的解析と実行フィードバックを受け取る、インタラクティブな環境も提供する。
論文 参考訳(メタデータ) (2024-12-02T18:11:30Z) - Harnessing the Power of LLMs: Automating Unit Test Generation for High-Performance Computing [7.3166218350585135]
ユニットテストは、品質を保証するために、ソフトウェア工学において不可欠です。
並列処理や高性能計算ソフトウェア、特に科学応用では広く使われていない。
本稿では,このようなソフトウェアを対象としたユニットテストの自動生成手法を提案する。
論文 参考訳(メタデータ) (2024-07-06T22:45:55Z) - A General Framework for Verification and Control of Dynamical Models via Certificate Synthesis [54.959571890098786]
システム仕様を符号化し、対応する証明書を定義するためのフレームワークを提供する。
コントローラと証明書を形式的に合成する自動化手法を提案する。
我々のアプローチは、ニューラルネットワークの柔軟性を利用して、制御のための安全な学習の幅広い分野に寄与する。
論文 参考訳(メタデータ) (2023-09-12T09:37:26Z) - Complete Agent-driven Model-based System Testing for Autonomous Systems [0.0]
複雑な自律輸送システムをテストするための新しいアプローチについて述べる。
検証と検証に関して最も重大な問題のいくつかを軽減することを目的としている。
論文 参考訳(メタデータ) (2021-10-25T01:55:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。