論文の概要: KRCA: An Efficient Root Cause Analysis System in Hyper-Scale Microservice Systems via Agentic AI
- arxiv url: http://arxiv.org/abs/2607.01788v1
- Date: Thu, 02 Jul 2026 07:01:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.714011
- Title: KRCA: An Efficient Root Cause Analysis System in Hyper-Scale Microservice Systems via Agentic AI
- Title(参考訳): KRCA:エージェントAIによる超大規模マイクロサービスシステムにおける効率的な根因解析システム
- Abstract要約: ハイパースケールのマイクロサービスシステムは、大規模なインターネット企業の標準的なインフラストラクチャになっています。
既存のルート原因分析(RCA)手法は、しばしばこれらのシステムの極端なダイナミズムと大規模なスケールに適応するのに苦労する。
我々は、超大規模マイクロサービスシステム用に設計されたエンドツーエンドのRCAシステムであるKRCAを紹介する。
- 参考スコア(独自算出の注目度): 14.531960390639343
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hyper-scale microservice systems have become the standard infrastructure for large-scale Internet companies. These systems consist of numerous loosely coupled microservices that evolve independently through continuous development and deployment. Such complexity makes failures unavoidable, necessitating efficient Root Cause Analysis (RCA) to help Site Reliability Engineers (SREs) quickly localize root cause services and classify failure types. However, existing RCA methods often struggle to adapt to the extreme dynamism and massive scale of these systems. In this paper, we present KRCA, an end-to-end RCA system designed for hyper-scale microservice systems. To manage the vast search space, KRCA employs a multi-stage pipeline that begins with an API-level drilldown to isolate suspicious services. It then instantiates a skeleton-based causal graph from anomalous metrics to serve as a high-recall structural prior, before utilizing a memory-augmented multi-agent framework to verify causality and generate the final failure report. By combining structured causal constraints with multi-agent reasoning, KRCA employs balances diagnostic accuracy with the efficiency requirements of real-time production use. Experimental results show that KRCA achieves AC@1 scores of 0.88 and 0.79 for root cause service localization and failure type classification, outperforming the strongest baseline by at lease 31% in absolute gains. KRCA has been deployed in Kuaishou's production environment for over six months, reducing the average diagnosis time by 77.3%.
- Abstract(参考訳): ハイパースケールのマイクロサービスシステムは、大規模なインターネット企業の標準的なインフラストラクチャになっています。
これらのシステムは、継続的開発とデプロイメントを通じて独立して進化する、多数の疎結合マイクロサービスで構成されています。
このような複雑さは、障害を回避し、効率的なルート原因分析(RCA)を必要とし、Site Reliability Engineers(SRE)がルート原因サービスの迅速なローカライズと障害タイプ分類を支援する。
しかしながら、既存のRCA手法は、しばしばこれらのシステムの極端なダイナミズムと大規模なスケールに適応するのに苦労する。
本稿では,超大規模マイクロサービスシステム用に設計されたエンドツーエンドRCAシステムであるKRCAを提案する。
巨大な検索スペースを管理するため、KRCAでは、不審なサービスを分離するために、APIレベルのドリルダウンから始まるマルチステージパイプラインを採用している。
次に、異常なメトリクスからスケルトンベースの因果グラフをインスタンス化し、メモリ拡張マルチエージェントフレームワークを使用して因果性を検証し、最終的な障害レポートを生成する。
構造的因果制約とマルチエージェント推論を組み合わせることで、KRCAはリアルタイム生産における効率要件と診断精度のバランスを取る。
実験の結果,KRCAは根本原因サービスのローカライゼーションと障害タイプ分類においてAC@1スコア0.88,0.79を達成し,絶対ゲインの31%のリースで最強のベースラインを上回った。
KRCAはクアイショーの生産環境に6ヶ月以上展開され、平均診断時間を77.3%削減した。
関連論文リスト
- Root Cause Analysis with Latent Confounders using Partial Ancestral Graphs [0.8602553195689513]
障害の原因を見つけることは、異常の根本原因を特定し、複雑なシステムの信頼性を維持するために不可欠である。
因果理論は、データ駆動のルート因果解析を進歩させてきたが、既存のフレームワークは因果補充を前提としており、現実の環境でよく見られる観測されていない潜伏変数を説明できない。
このフレームワークは、潜伏変数の存在下でRCAを実行するために、部分アンセストラルグラフ(PAG)に対するパラメトリック介入としてシステム障害をモデル化する。
論文 参考訳(メタデータ) (2026-06-18T20:08:34Z) - Anomaly Detection and Root Cause Analysis for Microservice Systems [0.0]
マイクロサービスシステムは、クラウドアプリケーションを構築するために広く使われていますが、その複雑さにより、障害は避けられません。
この論文は、マイクロサービスの障害に対する自動異常検出と根本原因分析を前進させる。
論文 参考訳(メタデータ) (2026-06-08T00:50:43Z) - Towards a Virtual Neuroscientist: Autonomous Neuroimaging Analysis via Multi-Agent Collaboration [53.772014300855375]
我々は,自律型エンドツーエンド神経画像解析のためのマルチエージェントシステムであるNIAgentを紹介する。
従来のフラットなツール呼び出しエージェントとは異なり、NIAgentはコード中心の実行パラダイムを採用している。
本稿では,コホートレベルの検定とエージェント視覚検査を組み合わせた,自律的品質管理のための階層的検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-10T06:30:19Z) - Multi-Agent Systems for Root Cause Analysis in Microservices [58.95503998127531]
LATS-RCAはMSSの根本原因分析のためのマルチエージェントフレームワークである。
リフレクションスコアは、最も可能性が高い根本原因への探索を導くために使用される。
我々は,オープンソースの産業MSSであるLight-OAuth2上でLATS-RCAを評価する。
論文 参考訳(メタデータ) (2026-05-05T08:39:42Z) - MetaRCA: A Generalizable Root Cause Analysis Framework for Cloud-Native Systems Powered by Meta Causal Knowledge [3.8594782754324535]
クラウドネイティブシステムのダイナミクスと複雑性は、ルート原因分析(RCA)に重大な課題をもたらす
本稿では,クラウドネイティブシステムのための汎用RCAフレームワークであるMetaRCAを紹介する。
論文 参考訳(メタデータ) (2026-03-02T16:16:22Z) - Cloud-OpsBench: A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems [51.2882705779387]
Cloud-OpsBenchは、State Snapshot Paradigmを使用して、クラウドの決定論的デジタルツインを構築する大規模なベンチマークである。
フルスタックにまたがる40の根本原因タイプに452の障害ケースがある。
論文 参考訳(メタデータ) (2026-02-28T05:04:42Z) - Graph-Free Root Cause Analysis [0.0]
根本原因分析のためのシンプルで効率的なフレームワークであるPRISMを提案する。
9つの実世界のデータセットにわたる735の障害に対して、PRISMは68%のTop-1精度を達成し、最高のベースラインよりも258%改善した。
論文 参考訳(メタデータ) (2026-01-29T07:38:20Z) - LLM-Augmented Knowledge Base Construction For Root Cause Analysis [0.6439596199812365]
本研究では,支援チケットからルート原因分析(RCA)知識ベースを構築するための3つの大規模言語モデル(LLM)手法を評価する。
語彙と意味の類似度を総合的に比較する。
実産業データセットを用いた実験により, 生成した知識ベースがRCAタスクの高速化に優れた出発点となることが示された。
論文 参考訳(メタデータ) (2026-01-09T16:41:30Z) - Multi-modal Causal Structure Learning and Root Cause Analysis [67.67578590390907]
根本原因局所化のためのマルチモーダル因果構造学習手法であるMulanを提案する。
ログ選択言語モデルを利用してログ表現学習を行い、ログシーケンスを時系列データに変換する。
また、モダリティの信頼性を評価し、最終因果グラフを共同学習するための新しいキーパフォーマンスインジケータ対応アテンション機構も導入する。
論文 参考訳(メタデータ) (2024-02-04T05:50:38Z) - TraceDiag: Adaptive, Interpretable, and Efficient Root Cause Analysis on
Large-Scale Microservice Systems [44.53009495726297]
マイクロサービスシステムの信頼性を確保するために、ルート原因分析(RCA)がますます重要になっている。
本稿では,大規模マイクロサービスシステムの課題に対処するエンドツーエンドのRCAフレームワークであるTraceDiagを提案する。
論文 参考訳(メタデータ) (2023-10-28T15:49:00Z) - Disentangled Causal Graph Learning for Online Unsupervised Root Cause
Analysis [49.910053255238566]
ルート原因分析(RCA)は、システム監視データを分析することにより、システム障害/障害の根本原因を特定することができる。
従来の研究は主にオフラインのRCAアルゴリズムの開発に重点を置いており、しばしば手動でRCAプロセスを開始する必要がある。
我々は、RCAプロセスを自動的に起動し、RCAモデルを漸進的に更新できる新しいオンラインRCAフレームワークであるCORALを提案する。
論文 参考訳(メタデータ) (2023-05-18T01:27:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。