論文の概要: LLM-Based Robustness Testing of Microservice Applications: An Empirical Study
- arxiv url: http://arxiv.org/abs/2605.14202v1
- Date: Wed, 13 May 2026 23:36:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.542607
- Title: LLM-Based Robustness Testing of Microservice Applications: An Empirical Study
- Title(参考訳): LLMに基づくマイクロサービスアプリケーションのロバストネステスト:実証的研究
- Authors: Hrushitha Goud Tigulla, Marco Vieira,
- Abstract要約: マイクロサービスAPIの不正な、欠落、あるいはバウンダリバリューな入力は、依存サービスにまたがってカスケードし、信頼性を脅かす可能性がある。
大規模な言語モデルはAPI仕様からこのようなテストを生成することができるが、多種多様な効果的なテストを生成することは依然として困難である。
アーキテクチャ的に異なる2つのマイクロサービスシステムを対象とした,オープンソースの3つのLLMに対して,7つのプロンプト戦略を適用した制御実験を報告する。
- 参考スコア(独自算出の注目度): 1.0026496861838445
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Malformed, missing, or boundary-value inputs in microservice APIs can cascade across dependent services, threatening reliability. Robustness testing systematically exercises such inputs to expose server-side failures, but generating diverse, effective tests remains challenging. Large Language Models can generate such tests from API specifications; however, it is unknown whether different models and prompt strategies produce diverse failure sets or converge on the same failures. We report a controlled experiment applying 7 prompt strategies to 3 open-source LLMs (14B-70B parameters) targeting 2 architecturally distinct microservice systems: one Java monolingual (6 services, 9 failure modes) and one polyglot (27 services, 14 failure modes), yielding 38 valid runs and 663 generated tests. We find that prompt strategy explains more variation in diversity than model size: a Structured prompt collapses diversity entirely, while a single model varied across three prompt strategies achieves complete failure-mode coverage on one system, outperforming any multi-model ensemble under a fixed prompt. We introduce two strategies, Guided and GuidedFewShot, that embed a mutation taxonomy from prior robustness testing research as domain context. GuidedFewShot achieves the highest single-run coverage on both systems (5 of 9 and 8 of 14 failure modes) while maintaining low cross-model similarity. A key lesson is that taxonomy rules alone are insufficient: LLMs cannot distinguish key-absent from value-empty mutations without concrete examples. Findings replicate across both systems.
- Abstract(参考訳): マイクロサービスAPIの不正な、欠落、あるいはバウンダリバリューな入力は、依存サービスにまたがってカスケードし、信頼性を脅かす可能性がある。
ロバストネステストは、サーバー側の障害を公開するためにこのようなインプットを体系的に実行しますが、多種多様な効果的なテストを生成することは依然として困難です。
大規模な言語モデルは、API仕様からこのようなテストを生成することができるが、異なるモデルとプロンプト戦略が多様な障害セットを生成するか、同じ障害に収束するかは不明である。
1つのJavaモノリンガル(6つのサービス、9つの障害モード)と1つのポリグロット(27のサービス、14の障害モード)という、2つのアーキテクチャ的に異なるマイクロサービスシステムをターゲットにした7つのオープンソースLSM(14B-70Bパラメータ)に7つのプロンプト戦略を適用した制御実験を報告する。
構造的プロンプトは、多様性を完全に崩壊させ、一方、3つのプロンプト戦略にまたがる1つのモデルは、1つのシステムにおける完全な失敗モードカバレッジを達成し、固定されたプロンプトの下でのマルチモデルアンサンブルよりも優れている。
Guidedと GuidedFewShotという2つの戦略を導入し、ドメインコンテキストとしてのロバストネステスト研究から突然変異分類学を組み込む。
GuidedFewShotは、低いクロスモデル類似性を保ちながら、両方のシステム(14の障害モードのうち5と8の障害モード)で最高の単一実行カバレッジを達成する。
重要な教訓は、分類規則だけでは不十分である: LLMは、具体的な例なしでは、キー・アプサントと値空突然変異を区別できない。
両方のシステムにまたがって複製する。
関連論文リスト
- A Systematic Comparison of Prompting and Multi-Agent Methods for LLM-based Stance Detection [11.458166456268103]
スタンス検出は、テキスト作者の所定のターゲットに対する姿勢を特定する。
最近の研究は、ゼロショットからマルチエージェントの議論まで、この課題に対する様々なLCMベースの戦略を探求している。
我々は,プロンプトベースの推論(Direct Prompting, Auto-CoT, StSQA)とエージェントベースの議論(COLA, MPRF)という,2つのカテゴリにわたる5つの手法を評価する体系的な比較を行う。
まず、最も優れたプロンプトベースのメソッドは、最高のエージェントベースのメソッドよりも優れており、エージェントメソッドは、各API呼び出しの7倍から12倍のAPIコールを必要とする。
論文 参考訳(メタデータ) (2026-04-29T06:02:32Z) - Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems [52.83669998269706]
テキストのみの設定で研究されてきたが、まだマルチモーダルに探索されていない。
現在のベンチマークでは、未解決性を無視するか、現実的な障害モードを見逃す粗末なメソッドに依存している。
MM-AQAは、2つの軸に沿った変換によって解答不能なインスタンスを解答可能なインスタンスから構築するベンチマークである。
論文 参考訳(メタデータ) (2026-04-16T09:23:22Z) - The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning [54.67958855362658]
複雑な構造化クエリを用いたアンラーニングテストを強調する動的フレームワークを提案する。
提案手法はまず,対象モデル(事前学習)から知識を抽出し,単純なクエリからマルチホップチェーンまで,対象プローブを構築する。
本フレームワークは,テストセットを手作業で構築することなく,非学習手法の実用的でスケーラブルな評価を可能にする。
論文 参考訳(メタデータ) (2026-03-11T19:51:33Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Challenges in Testing Large Language Model Based Software: A Faceted Taxonomy [8.927002750209295]
LLM(Large Language Models)とMulti-Agent LLM(MALLMs)は、従来の機械学習ソフトウェアとは異なり、非決定性を導入している。
本稿では,LLMテストケース設計のための分類法について述べる。
論文 参考訳(メタデータ) (2025-03-01T13:15:56Z) - Bridging the Gap for Test-Time Multimodal Sentiment Analysis [7.871669754963032]
マルチモーダル感情分析(マルチモーダル感情分析、Multimodal sentiment analysis、MSA)は、複数のモーダルを通して人間の感情や感情を理解し、認識することを目的とした、新たな研究トピックである。
本稿では,コントラスト適応(Contrastive Adaptation)と安定擬似ラベル生成(Stable Pseudo-label generation, CASP)の2つの手法を提案する。
論文 参考訳(メタデータ) (2024-12-10T02:26:33Z) - On the Worst Prompt Performance of Large Language Models [93.13542053835542]
大規模言語モデル(LLM)の性能は,プロンプトの表現に非常に敏感である。
セマンティックに等価なケースレベルのクエリで構成される新しいベンチマークであるRobustAlpacaEvalを紹介する。
RobustAlpacaEvalとChatGPT、およびLlama、Mistral、Gemmaファミリーの6つのオープンソースLLMによる実験により、モデル性能のかなりのばらつきが明らかになった。
論文 参考訳(メタデータ) (2024-06-08T13:40:38Z) - Rationale-Guided Few-Shot Classification to Detect Abusive Language [5.977278650516324]
乱用言語検出のためのRGFS(Rationale-Guided Few-Shot Classification)を提案する。
2つの理性統合BERTアーキテクチャ(RGFSモデル)を導入し、5つの異なる乱用言語データセット上でシステムを評価する。
論文 参考訳(メタデータ) (2022-11-30T14:47:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。