論文の概要: Large Language Models for Fuzz Testing in Microservices: A Systematic Literature Review
- arxiv url: http://arxiv.org/abs/2609.04219v1
- Date: Thu, 02 Jul 2026 16:12:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.464292
- Title: Large Language Models for Fuzz Testing in Microservices: A Systematic Literature Review
- Title(参考訳): マイクロサービスにおけるファズテストのための大規模言語モデル: 体系的な文献レビュー
- Abstract要約: 大きな言語モデル (LLM) は、仕様、入力、フィードバックに対する意味論的推論によるファジングを強化するために導入された。
本稿では, LLMを用いたファジテストの体系的レビュー(SLR)を行い, LLMの応用, 評価, 今後の課題について述べる。
- 参考スコア(独自算出の注目度): 21.810526621173747
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Microservice systems (MSS) increasingly rely on heterogeneous APIs whose combinatorial input space and stateful dependencies challenge traditional fuzz testing. Meanwhile, Large Language Models (LLMs) have recently been introduced to enhance fuzzing with semantic reasoning over specifications, inputs, and runtime feedback. This paper presents a systematic literature review (SLR) of LLM-assisted fuzz testing for microservices to synthesise how LLMs are applied, evaluated, and what challenges remain. Following established SLR guidelines, we analyze 20 primary studies published between 2024 and 2026. Results show LLMs are mainly used as semantic input generators in black-box fuzzing, with a growing shift towards agent-based and retrieval-augmented architectures, improving valid input generation and modestly increasing coverage and vulnerability detection. However, evaluation remains heterogeneous, with limited benchmark standardization, scarce cost reporting, and a bias toward single-service experiments, highlighting a gap with real-world multi-service systems. This review provides a taxonomy of LLM roles and integrations, a consolidated view of evaluation practices, and a mapping of open challenges to research directions, supporting the design and deployment of LLM-driven fuzzing in microservices.
- Abstract(参考訳): マイクロサービスシステム(MSS)は、結合的な入力スペースとステートフルな依存関係が従来のファズテストに挑戦する異種APIにますます依存しています。
一方、Large Language Models (LLM) は、仕様、入力、ランタイムフィードバックに対する意味論的推論によるファジングを強化するために最近導入された。
本稿では,LLMを用いたマイクロサービスファジテストの体系的文献レビュー(SLR)を行い,LLMの適用方法,評価方法,課題について述べる。
確立されたSLRガイドラインに従って,2024年から2026年の間に発行された20の初等研究を分析した。
その結果、LSMは主にブラックボックスファジィにおけるセマンティック入力ジェネレータとして使用され、エージェントベースおよび検索拡張アーキテクチャへのシフトが増加し、有効な入力生成が改善され、カバレッジと脆弱性検出が適度に増加した。
しかしながら、ベンチマークの標準化、コスト報告の不足、シングルサービス実験への偏見など、評価は相変わらず不均一であり、現実のマルチサービスシステムとのギャップを浮き彫りにしている。
このレビューでは、LLMの役割と統合の分類、評価プラクティスの統合ビュー、研究方向へのオープンな課題のマッピング、マイクロサービスにおけるLLM駆動ファジィの設計とデプロイメントのサポートなどについて紹介する。
関連論文リスト
- LLM-Assisted Empirical Software Engineering: Systematic Literature Review and Research Agenda [11.530621491409015]
経験的ソフトウェアエンジニアリング(ESE)は、データスケール、方法論的複雑さ、関心事による課題の増加に直面します。
大きな言語モデル(LLM)は経験的をサポートするための有望なツールとして登場したが、それでもその使用は断片化されている。
本研究では,ESEにおけるLCMの使用状況,サポート対象タスクの検証,リポジトリへの統合,報告されたメリットと制限,報告範囲について分析する。
論文 参考訳(メタデータ) (2026-04-29T00:34:39Z) - How Do LLM-Generated Texts Impact Term-Based Retrieval Models? [76.92519309816008]
本稿では,大規模言語モデル(LLM)が項ベース検索モデルに与える影響について検討する。
言語学的解析により,LLM生成テキストはよりスムーズで低周波なZipf勾配を示すことが明らかとなった。
本研究は,項分布がクエリと密接に一致した文書を優先して,項ベース検索モデルがソースバイアスを示すかどうかを考察する。
論文 参考訳(メタデータ) (2025-08-25T06:43:27Z) - Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs [78.09559830840595]
本稿では拡散に基づく言語モデルの定量化に関する最初の体系的研究について述べる。
異常に大きなアクティベーション値によって特徴付けられるアクティベーションアウトリーチの存在を同定する。
我々は最先端のPTQ手法を実装し、包括的な評価を行う。
論文 参考訳(メタデータ) (2025-08-20T17:59:51Z) - Discrete Tokenization for Multimodal LLMs: A Comprehensive Survey [69.45421620616486]
本研究は、大規模言語モデル(LLM)用に設計された離散トークン化手法の最初の構造的分類と解析である。
古典的および近代的なパラダイムにまたがる8つの代表的なVQ変種を分類し、アルゴリズムの原理を分析し、力学を訓練し、LLMパイプラインとの統合に挑戦する。
コードブックの崩壊、不安定な勾配推定、モダリティ固有の符号化制約など、重要な課題を特定する。
論文 参考訳(メタデータ) (2025-07-21T10:52:14Z) - Forget What You Know about LLMs Evaluations -- LLMs are Like a Chameleon [12.13060272830352]
大規模言語モデル(LLM)は、しばしば公開ベンチマークで優れているように見える。
これらの高いスコアは、真の言語理解よりもデータセット固有のサーフェスキューへの過度な依存を隠蔽する可能性がある。
本稿では,ベンチマークプロンプトを歪ませるメタ評価フレームワークであるChameleon Benchmark Overfit Detector (C-BOD)を紹介する。
論文 参考訳(メタデータ) (2025-02-11T10:43:36Z) - Exploring Automatic Cryptographic API Misuse Detection in the Era of LLMs [60.32717556756674]
本稿では,暗号誤用の検出において,大規模言語モデルを評価するための体系的評価フレームワークを提案する。
11,940個のLCM生成レポートを詳細に分析したところ、LSMに固有の不安定性は、報告の半数以上が偽陽性になる可能性があることがわかった。
最適化されたアプローチは、従来の手法を超え、確立されたベンチマークでこれまで知られていなかった誤用を明らかにすることで、90%近い顕著な検出率を達成する。
論文 参考訳(メタデータ) (2024-07-23T15:31:26Z) - LM-Polygraph: Uncertainty Estimation for Language Models [71.21409522341482]
不確実性推定(UE)手法は、大規模言語モデル(LLM)の安全性、責任性、効果的な利用のための1つの経路である。
テキスト生成タスクにおけるLLMの最先端UEメソッドのバッテリを実装したフレームワークであるLM-PolygraphをPythonで統一したプログラムインタフェースで導入する。
研究者によるUEテクニックの一貫した評価のための拡張可能なベンチマークと、信頼スコア付き標準チャットダイアログを強化するデモWebアプリケーションを導入している。
論文 参考訳(メタデータ) (2023-11-13T15:08:59Z) - Assessing Hidden Risks of LLMs: An Empirical Study on Robustness,
Consistency, and Credibility [37.682136465784254]
我々は、ChatGPT、LLaMA、OPTを含む、主流の大規模言語モデル(LLM)に100万以上のクエリを実行します。
入力が極端に汚染された場合でも、ChatGPTは正しい答えを得ることができる。
そこで本研究では,LCMによる評価において,そのようなデータの有効性を大まかに決定する新たな指標を提案する。
論文 参考訳(メタデータ) (2023-05-15T15:44:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。