論文の概要: MIRAGE: Online LLM Simulation for Microservice Dependency Testing
- arxiv url: http://arxiv.org/abs/2604.04806v3
- Date: Sun, 12 Apr 2026 05:46:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 14:47:45.510246
- Title: MIRAGE: Online LLM Simulation for Microservice Dependency Testing
- Title(参考訳): MIRAGE: マイクロサービス依存テストのためのオンラインLLMシミュレーション
- Abstract要約: 既存のマイクロサービス依存性シミュレーションアプローチでは、テスト実行前に静的アーティファクトを生成する。
オンラインLLMシミュレーションは,LLMが各依存要求に応答するランタイムアプローチである。
このアプローチをMIRAGEでインスタンス化し、3つのマイクロサービスシステムにわたる110のテストシナリオで評価します。
- 参考スコア(独自算出の注目度): 5.94231111588812
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing approaches to microservice dependency simulation--record-replay, pattern-mining, and specification-driven stubs--generate static artifacts before test execution. These artifacts can only reproduce behaviors encoded at generation time; on error-handling and code-reasoning scenarios, which are underrepresented in typical trace corpora, record-replay achieves 0% and 12% fidelity in our evaluation. We propose online LLM simulation, a runtime approach where the LLM answers each dependency request as it arrives, maintaining cross-request state throughout a test scenario. The model reads the dependency's source code, caller code, and production traces, then simulates behavior on demand--trading latency (~3 s per request) and cost ($0.16-$0.82 per dependency) for coverage on scenarios that static artifacts miss. We instantiate this approach in MIRAGE and evaluate it on 110 test scenarios across three microservice systems (Google's Online Boutique, Weaveworks' Sock Shop, and a custom system). In white-box mode, MIRAGE achieves 99% status-code and 99% response-shape fidelity, compared to 62% / 16% for record-replay. A signal ablation shows dependency source code is often sufficient (100% alone); without it, the model retains error-code accuracy (94%) but loses response-structure fidelity (75%). Results are stable across three LLM families (within 3%) and deterministic across repeated runs. Caller integration tests produce the same pass/fail outcomes with MIRAGE as with real dependencies (8/8 scenarios).
- Abstract(参考訳): 既存のマイクロサービス依存性シミュレーションアプローチ — レコード再生、パターンマイニング、仕様駆動スタブ — は、テスト実行前に静的アーティファクトを生成する。
これらのアーティファクトは生成時に符号化された振る舞いのみを再現することができ、典型的なトレースコーパスで表現されていないエラー処理やコード推論のシナリオでは、評価においてレコード再生は0%と12%の忠実性を達成する。
オンラインLCMシミュレーションは、LCMが到着するたびに各依存要求に応答し、テストシナリオ全体を通して相互要求状態を維持する実行時アプローチである。
モデルは、依存関係のソースコード、呼び出し元コード、プロダクショントレースを読み出し、静的アーティファクトが見逃すシナリオをカバーするために、オンデマンドのトレーディング遅延(要求あたり約3秒)とコスト(依存性あたり0.16~$0.82)の振る舞いをシミュレートする。
このアプローチをMIRAGEでインスタンス化し、3つのマイクロサービスシステム(GoogleのOnline Boutique、WeaveworksのSock Shop、カスタムシステム)にわたる110のテストシナリオで評価します。
ホワイトボックスモードでは、MIRAGEは99%のステータスコードと99%のレスポンスシェイプフィデリティを達成したが、レコード再生では62%/16%であった。
信号アブレーションは、依存関係のソースコードが十分である(100%単独で)ことを示し、それなしでは、エラーコードの精度(94%)を維持するが、応答構造の不確かさ(75%)を失う。
結果は3つのLLMファミリー(3%)で安定し、反復実行で決定論的である。
呼び出し統合テストは、MIRAGEと実際の依存関係(8/8シナリオ)で同じパス/フェイル結果を生成する。
関連論文リスト
- From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix [55.08143827481755]
200以上の内部アプリケーションから1つのモデルにトラフィックを集約します。
我々は、各軸ごとに別々のGRPOエキスパートを訓練し、2段階のSLERPを介してそれらをマージする。
このモデルは、プラットフォームトラフィックの50%、月1億6600万リクエストをサービスコストのごく一部で吸収する。
論文 参考訳(メタデータ) (2026-09-01T17:39:26Z) - LMSM: LLM Security Framework Inspired by Linux Security Modules [56.93644694627783]
大規模言語モデル(LLM)は階層化されたディフェンスでデプロイされることが多いが、悪意のあるプロンプトはそれらをバイパスすることができる。
我々は,Language Model Security Modules (LMSM) という,Linux Security Modules (LSM) の背後にある分離を LLM サービスに適応させるセキュリティフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-26T12:13:05Z) - LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production and AGV Scheduling [10.289256706393084]
シミュレーションベースの最適化(SBO)は、動的に実行可能なポリシーを評価する。
ほとんどのメソッドは、シミュレータをブラックボックスとして扱う。なぜ失敗したのか、どのポリシーロジックを変更するべきかを明らかにすることなく、ランキング候補を集計する。
LLM誘導設計フレームワークについて,繰り返しシミュレーションによる選択と事象レベルのトレースを用いて診断を行う。
論文 参考訳(メタデータ) (2026-08-10T09:20:56Z) - A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination [51.06539604709775]
本稿では、制御ユニットを表現編集からロール条件のエビデンスビューへシフトさせる自己進化型エージェントフレームワークであるA-SRを提案する。
A-SRは、コーディネートプロトコル、オンライン評価器・リワードロールポリシー、および状態制御プロセスメモリ間のルーティングによる公式発見をコーディネートする。
論文 参考訳(メタデータ) (2026-08-05T14:01:10Z) - TraceCompiler: Skill-Guided Mining and Compilation of LLM Agent Traces into Mostly Deterministic Workflows [2.435006380732194]
ノイズの多いトレースをトラジェクトリにコンパイルする,スキルガイドシステムであるTraceCompilerを提案する。
あらゆるハードエッジは監査可能な証拠を持ち、あいまいな関係が疑われる。
コールの削減を計測するが、オフラインのコンパイルコストはかからない。
論文 参考訳(メタデータ) (2026-08-03T01:05:06Z) - Industrial Practice of LLM-Based Test Case Carving and Assertion Generation (Experience Paper) [14.766370287473519]
本稿では、自然言語シナリオから実行可能なAPI回帰テストを生成するエンドツーエンドのアプローチとツールであるNL2Testを提案する。
NL2Testはテストケースの彫刻とアサーション生成という2つの結合タスクに対処する。
大手消費者向けインターネット企業から抽出した51の産業レグレッションシナリオについてNL2Testを評価した。
論文 参考訳(メタデータ) (2026-07-27T04:52:51Z) - MEME: Multi-entity & Evolving Memory Evaluation [76.57263966646404]
MEMEは、マルチエンタリティと進化する軸によって定義される全空間にまたがる6つのタスクを定義している。
3つの記憶パラダイムにまたがる6つの記憶システムの評価。
デフォルト設定の下では、すべてのシステムが依存性の推論で崩壊しているのが分かります。
論文 参考訳(メタデータ) (2026-05-12T17:55:10Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards [76.49428173793386]
LLMは、中間出力を伝搬しながら、正しい順序で複数の依存APIを呼び出す必要がある。
既存の環境は、シミュレーションデータを使った単純なターン毎の関数呼び出しとバイナリ報酬に重点を置いている。
まず、実APIレスポンスの大規模キャッシュを背景とした強化学習環境を構築し、有効なマルチステップオーケストレーショントレースをサンプリングするデータ合成パイプラインを実現する。
第二に、正当性を原子の妥当性とオーケストレーションに分解する、段階的な報酬設計を提案する。
論文 参考訳(メタデータ) (2026-03-25T18:31:39Z) - dVoting: Fast Voting for dLLMs [71.572316901001]
拡散大言語モデル(dLLMs)は自己回帰モデリングを超えた新しいパラダイムである。
dLLMは任意の位置で任意のトークンを並列に生成できるため、並列テストタイムスケーリングには大きな可能性がある。
トレーニングなしで推論能力を高める高速投票手法であるdVotingを導入する。
論文 参考訳(メタデータ) (2026-02-12T16:35:05Z) - Evaluating Asynchronous Semantics in Trace-Discovered Resilience Models: A Case Study on the OpenTelemetry Demo [0.0]
トレースからサービス依存グラフを導出する、トレースが発見された接続モデルを再検討する。
フェールストップサービス障害時にエンドポイントの可用性を推定するために、Monte Carloシミュレーションを使用します。
論文 参考訳(メタデータ) (2025-12-13T13:08:05Z) - PALM: Synergizing Program Analysis and LLMs to Enhance Rust Unit Test Coverage [14.702182387149547]
本稿では,大規模言語モデル(LLM)を活用して高カバレッジ単体テストを生成する手法であるPALMを提案する。
PALMはプログラム解析を行い、関数内の分岐条件を特定し、それを経路制約に結合する。
このアプローチを実装し、それを15のオープンソースのRustクラッドで評価します。
論文 参考訳(メタデータ) (2025-06-10T17:21:21Z) - Sample, Don't Search: Rethinking Test-Time Alignment for Language Models [55.2480439325792]
新しいテストタイムアライメントアプローチであるQAlignを紹介します。
テスト時間計算をスケールする際、QAlignは各プロンプトの最適配向分布からのサンプリングに収束する。
マルコフ連鎖モンテカルロのテキスト生成における最近の進歩を取り入れることで、基礎となるモデルを変更したり、ロジットアクセスを必要とせずに、より良い整合出力を可能にする。
論文 参考訳(メタデータ) (2025-04-04T00:41:40Z) - Reinforcement Learning for Long-Horizon Interactive LLM Agents [56.9860859585028]
インタラクティブデジタルエージェント(IDA)は、ステートフルなデジタル環境のAPIを利用して、ユーザの要求に応じてタスクを実行する。
対象環境で直接IDAを訓練する強化学習(RL)手法を提案する。
我々は、近似ポリシー最適化のデータおよびメモリ効率の亜種である LOOP を導出する。
論文 参考訳(メタデータ) (2025-02-03T18:35:42Z) - An Empirical Evaluation of Using Large Language Models for Automated
Unit Test Generation [3.9762912548964864]
本稿では,自動単体テスト生成における大規模言語モデルの有効性について,大規模な実証評価を行った。
これはJavaScript用のテスト生成ツールで、npmパッケージ内のすべてのAPI関数のユニットテストを自動的に生成します。
TestPilotの生成されたテストの92.8%は、既存のテストと50%以上の類似性を持っていない。
論文 参考訳(メタデータ) (2023-02-13T17:13:41Z) - Mimicking Production Behavior with Generated Mocks [11.367562045401554]
実運用環境でのアプリケーションを監視して,モックによる現実的な実行シナリオを模倣するテストを生成することを提案する。
このアプローチは自動化され、RICKと呼ばれるオープンソースのツールで実装されている。
生成されたテストケースはすべて実行可能であり、52.4%は本番環境で観測されたターゲットメソッドの完全な実行コンテキストをうまく模倣している。
論文 参考訳(メタデータ) (2022-08-02T09:08:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。