論文の概要: Towards In-Depth Root Cause Localization for Microservices with Multi-Agent Recursion-of-Thought
- arxiv url: http://arxiv.org/abs/2605.14866v1
- Date: Thu, 14 May 2026 14:13:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.865277
- Title: Towards In-Depth Root Cause Localization for Microservices with Multi-Agent Recursion-of-Thought
- Title(参考訳): マルチエージェント・オブ・サートによるマイクロサービスの深部根のローカライゼーション
- Authors: Lingzhe Zhang, Tong Jia, Kangjin Wang, Chiming Duan, Minghua He, Rongqian Wang, Xi Peng, Meiling Wang, Gong Zhang, Renhai Chen, Ying Li,
- Abstract要約: マイクロサービスシステムのための詳細な根本原因ローカライゼーションフレームワークであるRCLAgentを紹介します。
RCLAgentは、各スパンを専用エージェントに割り当てることで、トレースグラフに沿って診断プロセスを分解する。
ローカライズ精度と推論効率の両方において、最先端の手法を一貫して上回る。
- 参考スコア(独自算出の注目度): 22.98209081540165
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As modern microservice systems grow increasingly complex due to dynamic interactions and evolving runtime environments, they experience failures with rising frequency. Ensuring system reliability therefore critically depends on accurate root cause localization (RCL). While numerous traditional machine learning and deep learning approaches have been explored for this task, they often suffer from limited interpretability and poor transferability across deployments. More recently, large language model (LLM)-based methods have been proposed to address these issues. However, existing LLM-based approaches still face two fundamental limitations: context explosion, which dilutes critical evidence and degrades localization accuracy, and serial reasoning structures, which hinder deep causal exploration and impair inference efficiency. In this paper, we conduct a comprehensive study of both how human SREs perform root cause localization in practice and why existing LLM-based methods fall short. Motivated by these findings, we introduce RCLAgent, an in-depth root cause localization framework for microservice systems that realizes multi-agent recursion-of-thought with parallel reasoning. RCLAgent decomposes the diagnostic process along the trace graph by assigning each span to a Dedicated Agent and organizing agents recursively and in parallel according to the graph topology, with the final diagnosis obtained by synthesizing the Root-Level Diagnosis Report and the Global Evidence Graph. Extensive experiments on multiple public benchmarks demonstrate that RCLAgent consistently outperforms state-of-the-art methods in both localization accuracy and inference efficiency.
- Abstract(参考訳): 動的インタラクションとランタイム環境の進化により、現代のマイクロサービスシステムがますます複雑化するにつれて、彼らは頻度の上昇による障害を経験する。
したがって、システムの信頼性を確保することは、正確な根本原因ローカライゼーション(RCL)に依存する。
このタスクのために、多くの伝統的な機械学習とディープラーニングのアプローチが検討されているが、それらはしばしば、デプロイメント間の限定的な解釈可能性と低い転送可能性に悩まされている。
近年,これらの問題に対処する大規模言語モデル (LLM) ベースの手法が提案されている。
しかし、既存のLLMベースのアプローチは、重要な証拠を希釈し、局所化の精度を低下させるコンテキスト爆発と、深い因果探索と推論効率の障害を引き起こすシリアル推論構造という、2つの基本的な制限に直面している。
本稿では,人間のSREが根本原因の局在化を行う方法と,既存のLCM法が不足している理由について,包括的に検討する。
これらの知見に触発されて、並列推論によるマルチエージェント再帰を実現するマイクロサービスシステムのための、詳細な根本原因のローカライズフレームワークであるRCLAgentを紹介した。
RCLAgentは、ルートレベル診断レポートとグローバルエビデンスグラフを合成し、各スパンを専用エージェントに割り当ててトレースグラフに沿って診断プロセスを分解し、グラフトポロジに従って再帰的かつ並列にエージェントを組織化する。
複数の公開ベンチマークにおいて、RCLAgentはローカライズ精度と推論効率の両方において、最先端の手法を一貫して上回ることを示した。
関連論文リスト
- METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models [61.33372454250959]
コンテキスト因果推論は、大規模言語モデルにとって重要なが難しい能力である。
既存のベンチマークでは、コンテキスト整合性を保証するか、完全な因果階層をカバーすることができない。
私たちはMETERの先駆者であり、因果はしごの3つのレベルすべてにわたってLSMを体系的にベンチマークしました。
論文 参考訳(メタデータ) (2026-04-13T14:07:11Z) - Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration [49.9937230730202]
本稿では,新たなアクター・リファイナ・コラボレーション・フレームワークであるSearch-R2を提案する。
提案手法は,生成過程をアクターに分解し,最初の推論軌道を生成する。
本稿では,検索-R2がモデルスケール全体にわたって強力なRAGとRLベースのベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-03T15:32:09Z) - Hypothesize-Then-Verify: Speculative Root Cause Analysis for Microservices with Pathwise Parallelism [19.31110304702373]
SpecRCAは、thithypothesize-then-verifyパラダイムを採用した投機的根本原因分析フレームワークである。
AIOps 2022に関する予備的な実験では、既存のアプローチよりも精度と効率が優れていることが示されている。
論文 参考訳(メタデータ) (2026-01-06T05:58:25Z) - Agentic Memory Enhanced Recursive Reasoning for Root Cause Localization in Microservices [19.187189391947815]
Site Reliability Engineers (SRE) 障害の根本原因をローカライズする。
従来のグラフベースのディープラーニングアプローチは、事前に定義されたスキーマに大きく依存することが多い。
本稿では,ルート原因ローカライゼーションのためのエージェントメモリ拡張フレームワークAMER-RCLを紹介する。
論文 参考訳(メタデータ) (2026-01-06T05:50:14Z) - SelfAI: Building a Self-Training AI System with LLM Agents [79.10991818561907]
SelfAIは、高レベルの研究目的を標準化された実験構成に変換するためのUser Agentを組み合わせた、一般的なマルチエージェントプラットフォームである。
実験マネージャは、連続的なフィードバックのための構造化知識ベースを維持しながら、異種ハードウェアをまたいだ並列かつフォールトトレラントなトレーニングを編成する。
回帰、コンピュータビジョン、科学計算、医用画像、薬物発見ベンチマークなどを通じて、SelfAIは一貫して高いパフォーマンスを達成し、冗長な試行を減らしている。
論文 参考訳(メタデータ) (2025-11-29T09:18:39Z) - Root Cause Analysis for Microservice Systems via Cascaded Conditional Learning with Hypergraphs [6.06702225930801]
マイクロサービスシステムにおけるルート原因分析では、ルート原因ローカライゼーション(RCL)と障害タイプ識別(FTI)という、2つのコアタスクが一般的である。
これらの手法は主に、共有情報を利用してトレーニング時間を短縮するために、RCLとFTIのジョイントラーニングパラダイムを採用する。
CCLHは,ケースド・コンディショナル・ラーニングに基づく診断タスクを編成する新しい根本原因分析フレームワークである。
論文 参考訳(メタデータ) (2025-11-14T03:20:02Z) - Adaptive Root Cause Localization for Microservice Systems with Multi-Agent Recursion-of-Thought [11.307072056343662]
本稿では,マイクロサービスシステムに対する適応的根本原因ローカライゼーション手法であるRCLAgentを紹介する。
RCLAgentは,1つの要求出力状態のみを用いて根本原因を局所化し,優れた性能を発揮することを示す。
論文 参考訳(メタデータ) (2025-08-28T02:34:19Z) - Online Multi-modal Root Cause Analysis [61.94987309148539]
ルート原因分析(RCA)は、マイクロサービスシステムにおける障害の根本原因の特定に不可欠である。
既存のオンラインRCAメソッドは、マルチモーダルシステムにおける複雑な相互作用を見渡す単一モーダルデータのみを処理する。
OCEANは、根本原因の局在化のための新しいオンラインマルチモーダル因果構造学習手法である。
論文 参考訳(メタデータ) (2024-10-13T21:47:36Z) - Multi-modal Causal Structure Learning and Root Cause Analysis [67.67578590390907]
根本原因局所化のためのマルチモーダル因果構造学習手法であるMulanを提案する。
ログ選択言語モデルを利用してログ表現学習を行い、ログシーケンスを時系列データに変換する。
また、モダリティの信頼性を評価し、最終因果グラフを共同学習するための新しいキーパフォーマンスインジケータ対応アテンション機構も導入する。
論文 参考訳(メタデータ) (2024-02-04T05:50:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。