論文の概要: MASTOR: A Multi-Agent Approach to Semantic Test Oracle Generation for RESTful APIs
- arxiv url: http://arxiv.org/abs/2606.10465v1
- Date: Tue, 09 Jun 2026 06:35:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-11 16:42:37.994288
- Title: MASTOR: A Multi-Agent Approach to Semantic Test Oracle Generation for RESTful APIs
- Title(参考訳): MASTOR: RESTful APIのためのセマンティックテストOracle生成のためのマルチエージェントアプローチ
- Authors: Sida Deng, Rubing Huang, Zhenzhen Yang, Man Zhang, Xuan Xie, Rongcun Wang,
- Abstract要約: 既存の自動APIテストアプローチは、単純なチェックに依存している。
実装ソースコードに基づくAPIのためのセマンティックテストオラクルを生成するためのマルチエージェントアプローチであるMASTORを提案する。
- 参考スコア(独自算出の注目度): 8.248920932579876
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing automated RESTful API testing approaches commonly rely on simple checks (e.g., HTTP status codes, schema conformance), which are insufficient for detecting semantic faults, business logic violations, and state-dependent inconsistencies. To address this, we propose MASTOR, a Multi-Agent approach for generating Semantic Test Oracles for RESTful APIs based on implementation source code. MASTOR consists of two phases: source analysis and oracle generation. The former employs a source extraction agent to construct a source context for each endpoint operation by analyzing a transitive import closure of relevant source files. The latter employs two parallel oracle-generation paths over the collected contexts: a single-operation path producing status and field oracles per operation, and a multi-operation path generating behavioral consistency oracles for operation sequences by leveraging cross-operation semantic associations. Both paths apply a challenger-agent review, where a dedicated reviewer identifies weaknesses and issues improvement hints to guide targeted regeneration, followed by oracle normalization to filter out structurally invalid oracles. We evaluated MASTOR on a benchmark of 13 open-source RESTful API projects (296 operations, 251,303 lines of code) from the WFD and PRAB datasets. MASTOR achieved an average mutation score of 75.4%, generating 10,022 oracles. These oracles were translated into executable assertions via ToJUnit and ToPostmanAssertify, and into human-readable descriptions via ToReadable. In a baseline comparison on 50 selected operations, MASTOR outperformed Direct Prompting by 30.1 percentage points (69.9% vs. 39.8%) and SATORI by 49.4 percentage points (69.9% vs. 20.5%).
- Abstract(参考訳): 既存のRESTful APIの自動テストアプローチは、一般的に単純なチェック(HTTPステータスコード、スキーマ適合性など)に依存しており、セマンティック障害、ビジネスロジック違反、状態依存の不整合を検出するには不十分です。
この問題を解決するために,実装ソースコードに基づいたRESTful API用のセマンティックテストオラクルを生成するためのマルチエージェントアプローチであるMASTORを提案する。
MASTORはソース解析とオラクル生成という2つのフェーズから構成される。
前者は、ソース抽出エージェントを使用して、関連するソースファイルの推移的なインポートクロージャを分析することにより、エンドポイント操作毎にソースコンテキストを構築する。
後者は、収集されたコンテキストに対して、2つの並列なオラクル生成パスを使用する: 単一のオペレーションパスは、状態とフィールドのオークルを1回ごとに生成し、マルチオペレーションパスは、クロスオペレーションセマンティックアソシエーションを活用して、操作シーケンスの動作整合性オラクルを生成する。
どちらのパスもチャレンジャー・エージェント・レビューを適用しており、専用のレビュアーが弱点を特定し、ターゲットの再生を誘導するための改善ヒントを提示し、続いてオラクルの正規化によって構造的に無効なオラクルをフィルタリングする。
我々は、WFDおよびPRABデータセットから13のオープンソースのRESTful APIプロジェクト(296のオペレーション、21,303行のコード)のベンチマークでMASTORを評価した。
MASTORの平均突然変異率は75.4%に達し、10,022オラクルを発生させた。
これらのオラクルはToJUnitとToPostmanAssertifyを介して実行可能なアサーションに変換され、ToReadableを介して人間が読める記述に変換された。
選抜50回のベースライン比較では、MASTORは30.1ポイント(69.9%対39.8%)、SATORIは49.4ポイント(69.9%対20.5%)で、ダイレクト・プロンプティングを上回った。
関連論文リスト
- BADGER: Bridging Agentic and Deterministic Evaluation for Generative Enterprise Reasoning [0.8681424810073922]
BADGERはテキスト・ツー・アセスメントとエージェント動作評価を統合した統合フレームワークである。
BADGERは、クライアントが管理するデータ環境内で完全に動作します。
クライアント固有の判断とメトリクスの迅速なプロトタイピングをサポートする。
論文 参考訳(メタデータ) (2026-06-01T11:42:37Z) - iCoRe: An Iterative Correlation-Aware Retriever for Bug Reproduction Test Generation [10.824024745675281]
iCoReは反復的相関型コンテキスト検索手法である。
本手法はFail-to-Passレートをそれぞれ42.0%,52.8%とする。
論文 参考訳(メタデータ) (2026-04-21T08:26:30Z) - APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay [7.370176470430802]
LLMベースの自律エージェントは、永続的な手続き記憶を欠いている。
我々は,構造化手続き計画の蓄積,検索,再利用を行う非パラメトリックオンライン学習フレームワークであるAPEX-EMを提案する。
論文 参考訳(メタデータ) (2026-03-31T00:24:56Z) - CaveAgent: Transforming LLMs into Stateful Runtime Operators [31.548422546991915]
CaveAgentは"LLM-as-Text-Generator"から"LLM-as-as-Runtime"にパラダイムを変換するフレームワークです。
CaveAgentは小売業のタスクで10.5%の成功率の向上を実現し、マルチターンシナリオではトークン総消費を28.4%削減している。
論文 参考訳(メタデータ) (2026-01-04T15:32:47Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Benchmarking Deep Search over Heterogeneous Enterprise Data [73.55304268238474]
検索強化生成(RAG)の形式を評価するための新しいベンチマークを提案する。
RAGは、多種多様な、しかし関連するソースに対して、ソースを意識したマルチホップ推論を必要とする。
製品計画、開発、サポートステージをまたいだビジネスをシミュレートする合成データパイプラインを使用して構築します。
論文 参考訳(メタデータ) (2025-06-29T08:34:59Z) - Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent Systems [50.29939179830491]
LLMマルチエージェントシステムにおける障害帰属は、まだ調査が過小評価されており、労働集約的である。
本稿では,3つの自動故障帰属手法の開発と評価を行い,その欠点と欠点を要約する。
最良の方法は、障害に応答するエージェントを特定する際に53.5%の精度を達成するが、故障の特定には14.2%しか役に立たない。
論文 参考訳(メタデータ) (2025-04-30T23:09:44Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。