論文の概要: Fault Injection in OpenAPI Specifications for Evaluating Black-Box Testing Effectiveness
- arxiv url: http://arxiv.org/abs/2607.12101v1
- Date: Mon, 13 Jul 2026 19:19:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:29.955345
- Title: Fault Injection in OpenAPI Specifications for Evaluating Black-Box Testing Effectiveness
- Title(参考訳): ブラックボックステストの有効性評価のためのOpenAPI仕様のフォールトインジェクション
- Abstract要約: 文献に基づく6つのOpenAPI仕様欠陥クラスの分類について紹介する。
コードカバレッジ、仕様カバレッジ、要求/レスポンスの品質、振る舞いの多様性を使って、これらの障害の影響を測定します。
これらの結果は、仕様品質がブラックボックスAPIテストの効率を直接的に形成していることを示している。
- 参考スコア(独自算出の注目度): 18.523862168004207
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: OpenAPI specifications are the primary input for black-box testing tools in microservice systems (MSS), yet prior work shows these specifications are often incomplete, inconsistent, or incorrect. Despite this, most studies on OpenAPI-based black-box testing assume correct specifications and evaluate tool performance. We address this gap by introducing a literature-grounded taxonomy of six OpenAPI specification fault classes. We inject faults at five severity levels, and evaluate the resulting mutated specifications on two microservice benchmarks, TrainTicket and SocialNetwork, using three testing tools: EvoMaster, RESTler, and Schemathesis. We measure the impact of these faults using code coverage, specification coverage, request/response quality, and behavioral diversity. Our results show that specification faults cause strong and heterogeneous degradation patterns across testing tools and systems. Faults in method semantics cause broad degradation across all metrics, while others, such as modifications to response codes, remain weak. Relaxations of schema constraints cause hidden degradation, with no impact on code and specification coverage but a large impact on request/response quality. These findings demonstrate that specification quality directly shapes black-box API testing effectiveness. Also, code and specification coverage-only evaluations can understate the impact of specification faults on black-box testing in MSS and should be complemented by request/response quality and behavioral diversity.
- Abstract(参考訳): OpenAPI仕様は、マイクロサービスシステム(MSS)におけるブラックボックステストツールの主要な入力である。
それにもかかわらず、OpenAPIベースのブラックボックステストに関するほとんどの研究は、正しい仕様を仮定し、ツールのパフォーマンスを評価する。
6つのOpenAPI仕様欠陥クラスの文献的分類を導入することで、このギャップに対処する。
また、EvoMaster、RESTler、Schemathesisの3つのテストツールを使用して、TrainTicketとSocialNetworkの2つのベンチマークで得られた変更仕様を評価します。
コードカバレッジ、仕様カバレッジ、要求/レスポンスの品質、振る舞いの多様性を使って、これらの障害の影響を測定します。
この結果から,テストツールやシステム間で仕様欠陥が強く異質な劣化パターンを引き起こすことが明らかとなった。
メソッドセマンティクスのフォールトは、すべてのメトリクスで広範囲の劣化を引き起こします。
スキーマ制約の緩和は、コードや仕様のカバレッジに影響を与えることなく、リクエスト/レスポンスの品質に大きな影響を与える、隠れた劣化を引き起こす。
これらの結果は、仕様品質がブラックボックスAPIテストの効率を直接的に形成していることを示している。
また、コードと仕様のカバレッジのみの評価は、仕様の欠陥がMSSのブラックボックステストに与える影響を裏付けるものであり、要求/レスポンスの品質と振る舞いの多様性によって補完されるべきである。
関連論文リスト
- How effective are traditional test criteria at detecting bugs in large language models generated code? [5.2762490553598065]
大規模言語モデルによって導入されたほとんどの障害は、比較的簡単にキャッチできる。
断層検出率は極端に低く、多くの場合ゼロに近い。
急進的なオラクルは断層検出を改善することができるが、全体的な効果は限られている。
論文 参考訳(メタデータ) (2026-09-08T18:04:21Z) - CauSec: Unboxing the Causal Drivers of Static Vulnerability Analysis Performance [51.50254897627053]
静的アプリケーションセキュリティテスト(SAST)ツールは、業界と学術の両方で広く利用されている。
これらのツールは、高いパフォーマンスを達成するために検出を犠牲にする設計上の選択をしばしば行います。
本稿では,これらのツールによる仮定は概して因果性である,というキーとなる考察を頼りに,この問題に対処することを目的とする。
論文 参考訳(メタデータ) (2026-08-19T12:56:00Z) - MassSpecGym in the Wild: Uncovering and Correcting Evaluation Pitfalls in AI-Driven Molecule Discovery [31.680941154745245]
我々は、最近のMS/MS機械学習文献において、モデル評価問題について徹底的にレビューする。
我々は、MassSpecGymベンチマークの結果を報告した26の論文のうち、少なくとも17の論文で評価問題を発見した。
我々はこれらの問題の影響を定量化し、MassSpecGymが実施するために設計された評価基準をいかに悪用したかを示す。
論文 参考訳(メタデータ) (2026-06-17T22:05:38Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Flaky Tests in a Large Industrial Database Management System: An Empirical Study of Fixed Issue Reports for SAP HANA [45.467566253448666]
不安定なテストは、同じバージョンのソースコードに対して複数回実行されると、異なる結果をもたらす。
様々な要因がテストのフレキネスを引き起こすことがある。
不安定なテストを修正するアプローチは、通常、特定の原因に対処するために調整される。
論文 参考訳(メタデータ) (2026-02-03T14:03:59Z) - MASTEST: A LLM-Based Multi-Agent System For RESTful API Tests [2.4690347153946237]
クラウドネイティブアプリケーションの品質保証において、APIのテストはますます重要になっている。
機械学習の最近の進歩は、様々なテスト活動が妥当な精度で大規模言語モデル(LLM)によって自動的に実行されることを示した。
本稿では, LLM とプログラムエージェントを組み合わせたマルチエージェントシステム MASTEST を開発した。
論文 参考訳(メタデータ) (2025-11-22T12:33:13Z) - Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs [71.7892165868749]
LLM(Commercial Large Language Model) APIは基本的な信頼の問題を生み出します。
ユーザーは特定のモデルに課金するが、プロバイダが忠実に提供できることを保証することはない。
我々は,このモデル置換問題を定式化し,現実的な逆条件下での検出方法を評価する。
我々は,信頼された実行環境(TEE)を実用的で堅牢なソリューションとして使用し,評価する。
論文 参考訳(メタデータ) (2025-04-07T03:57:41Z) - Utilizing API Response for Test Refinement [2.8002188463519944]
本稿では,応答メッセージを利用した動的テスト改善手法を提案する。
インテリジェントエージェントを使用すると、テストシナリオを生成するためにさらに使用されるAPI仕様に制約が追加される。
提案されたアプローチは、4xxレスポンスの数を減少させ、より現実的なテストケースを生成するための一歩を踏み出した。
論文 参考訳(メタデータ) (2025-01-30T05:26:32Z) - LlamaRestTest: Effective REST API Testing with Small Language Models [50.058600784556816]
LlamaRestTestは、2つのLLM(Large Language Models)を使って現実的なテストインプットを生成する新しいアプローチである。
私たちは、GPTを使った仕様強化ツールであるRESTGPTなど、最先端のREST APIテストツールに対して、これを評価しています。
私たちの研究は、REST APIテストにおいて、小さな言語モデルは、大きな言語モデルと同様に、あるいは、より良く機能することができることを示しています。
論文 参考訳(メタデータ) (2025-01-15T05:51:20Z) - CAP: Data Contamination Detection via Consistency Amplification [20.135264289668463]
大規模言語モデル(LLM)は広く使われているが、データの汚染に関する懸念は信頼性に疑問を呈している。
本稿では,データセットの漏洩量を測定するためのPCR(Performance Consistency Ratio)を導入した新しいフレームワークである Consistency Amplification-based Data Contamination Detection (CAP)を提案する。
CAPは様々なベンチマークに適用でき、ホワイトボックスモデルとブラックボックスモデルの両方で動作する。
論文 参考訳(メタデータ) (2024-10-19T06:33:33Z) - FuzzTheREST: An Intelligent Automated Black-box RESTful API Fuzzer [0.0]
この作業では、脆弱性検出にReinforcement Learning(RL)を使用しているファジィテストツールのブラックボックスAPIを導入している。
このツールは6つのユニークな脆弱性を発見し、55%のコードカバレッジを達成した。
論文 参考訳(メタデータ) (2024-07-19T14:43:35Z) - A Comprehensive Library for Benchmarking Multi-class Visual Anomaly Detection [89.92916473403108]
本稿では,新しい手法のモジュラーフレームワークであるADerの総合的な視覚異常検出ベンチマークを提案する。
このベンチマークには、産業ドメインと医療ドメインからの複数のデータセットが含まれており、15の最先端メソッドと9つの包括的なメトリクスを実装している。
我々は,異なる手法の長所と短所を客観的に明らかにし,多クラス視覚異常検出の課題と今後の方向性について考察する。
論文 参考訳(メタデータ) (2024-06-05T13:40:07Z) - Leveraging Large Language Models to Improve REST API Testing [51.284096009803406]
RESTGPTはAPI仕様を入力として、機械解釈可能なルールを抽出し、仕様内の自然言語記述からサンプルパラメータ値を生成する。
評価の結果、RESTGPTはルール抽出と値生成の両方において既存の技術よりも優れています。
論文 参考訳(メタデータ) (2023-12-01T19:53:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。