論文の概要: Where Root Cause Analysis Fails: A Retrieval-Reranking Decomposition
- arxiv url: http://arxiv.org/abs/2609.36686v1
- Date: Tue, 29 Sep 2026 04:28:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.182929
- Title: Where Root Cause Analysis Fails: A Retrieval-Reranking Decomposition
- Title(参考訳): 根本原因分析が失敗する場所--検索リグレードの分解
- Abstract要約: 我々は,この盲点を公開するために,検索基準の分解と4つのよく知られたベンチマークを監査する。
実験により、複雑な故障のあるベンチマークでは、統計ベースラインが真の79-100%の原因を誤っていることが示されている。
断層が起源で顕著に現れる単純なベンチマークでは、検索はほぼ解決される(98-100%)。
- 参考スコア(独自算出の注目度): 12.794015270607291
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Identifying the root cause of an anomaly among hundreds of sensors is critical for preventing safety incidents and costly downtime in complex monitored systems. Existing studies evaluate root cause analysis (RCA) methods using top@k accuracy. We show that this metric has a fundamental blind spot: it conflates two failure modes, retrieval failure, where the true cause is never considered, and reranking failure, where it is considered but ranked too low. In this work, we introduce a retrieval-reranking decomposition and audit four well-known benchmarks to expose this blind spot. Our experiments show that, on benchmarks with complex faults, statistical baselines mis-rank the true cause 79-100% of the time, and graph-based methods never clearly beat the best statistical baseline, whether their causal graphs are learned on short fault windows, on retrieved candidate pools guaranteed to contain the cause, or on multi-day normal-operation data. Meanwhile, on simple benchmarks where faults manifest significantly at their origin, retrieval is nearly solved (98-100%). Guided by the decomposition, we build a two-stage pipeline combining a multi-signal retriever with an LLM reranker that, as one fixed configuration, matches or exceeds the best baseline's top@1 accuracy on all six benchmark suites (by up to +12 points), with no causal graph or labeled data required. When all methods rank the same retrieved candidates with the true cause guaranteed present, adding a short system-description document lets the reranker lead the best baseline by +7 to +18 points on every benchmark. Code is available at https://github.com/cruiseresearchgroup/DecompRCA.
- Abstract(参考訳): 数百のセンサーで異常の原因を特定することは、複雑な監視システムにおける安全事故やコストダウンを防ぐために重要である。
既存の研究では、top@kの精度を用いて根本原因分析(RCA)手法が評価されている。
この指標は、2つの障害モードを混同し、真の原因が考慮されないような検索障害を発生させ、障害を再評価し、考慮されるが、ランクが低すぎるという、基本的な盲点を持つことを示す。
本研究では,この失明点を明らかにするために,検索基準の分解と4つのよく知られたベンチマークの監査を行う。
実験の結果, 複雑な故障のあるベンチマークでは, 統計ベースラインが79~100%の真の原因を誤っていることが示され, グラフベースの手法は, 因果グラフがショートフォールトウインドウで学習されているか, 原因を含むことが保証された候補プールか, あるいは複数日間の正常操作データで学習されているかに関わらず, 最高の統計ベースラインを確実に上回りません。
一方、障害が起源で顕著に現れる単純なベンチマークでは、検索はほぼ解決される(98-100%)。
この分解によって導かれた2段階のパイプラインは、マルチシグナルレトリバーとLLMリランカを組み合わせたもので、1つの固定構成として、6つのベンチマークスイート(最大+12ポイント)で最高のベースラインのトップ@1の精度を一致または超過し、因果グラフやラベル付きデータを必要としない。
すべてのメソッドが、真の原因が保証されている同じ候補をランク付けすると、短いシステム記述のドキュメントが加わり、リランカはベンチマーク毎に+7から+18ポイントの最高のベースラインをリードする。
コードはhttps://github.com/cruiseresearchgroup/DecompRCA.comで入手できる。
関連論文リスト
- READ-Bench: Benchmarking Historical Instance Retrieval for Time-Series Diagnosis [5.8680789975287775]
12の診断データセットにわたる履歴ケース検索のベンチマークであるREAD-Benchを紹介する。
我々は,古典的,象徴的なレトリバー,自己監督型,基礎モデル埋め込み器およびそれらの融合を評価した。
我々は,通常の残像埋め込み器を相反するランクの融合によって動的に時間ゆがみのある脚で融合し,その後,ガウス過程のリランカで再帰する。
論文 参考訳(メタデータ) (2026-09-26T00:53:42Z) - Not All Relations Are Equal: Relation-Balanced and Calibrated Graph Learning for Provenance-Based Intrusion Detection [69.06648810271712]
本稿では,関係バランスの取れたグラフ学習を用いた教師なしフレームワークRECALについて述べる。
3つのDARPA E3データセットにおいて、RECALはF1スコアの99.99%、99.93%、99.99%を達成し、各データセットでそれぞれ0.88、0.82、0.42で最高のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-09-15T00:31:01Z) - How Far Can Root Cause Analysis Go on Real-World Telemetry Data? [0.8594140167290097]
従来の因果探索法や既存のLLMベースのマルチエージェントシステムでは根本原因を確実に特定できないことを示す。
本稿では,既存のLLMベースおよび古典的ベースラインを著しく上回る構造的マルチエージェントRCAパイプラインを提案する。
論文 参考訳(メタデータ) (2026-07-15T07:54:46Z) - Auditable Graph-Guided Root Cause Analysis for Kubernetes Incidents [1.116726665785374]
LLM推論と特殊なツールを組み合わせたグラフ誘導RCAエージェントであるグラフトラバースエージェントを提案する。
我々は、読み取り専用エビデンス収集、伝搬認識診断、有界実行、独立に検証された検証を含む運用上の制約をマップする。
ある固定されたqwenオーバージャッジによってスコアされたITBenchスナップショットでは、監査されたシステムは、同じシステムの初期のイテレーションに対してルート因果F1を上昇させる。
論文 参考訳(メタデータ) (2026-06-07T12:05:09Z) - Reasoning Graphs: Self-Improving, Deterministic RAG through Evidence-Centric Feedback [0.0]
言語モデルエージェントは、クエリ毎にスクラッチから推論し、各実行後に思考の連鎖を破棄する。
このグラフ構造は,エビデンス・チェーンを,評価項目に関連付けられた構造化されたエッジとみなす。
逐次クラスタプロトコル,高再利用デプロイメントシミュレーション,決定論的実験を用いて,MuSiQueとHotpotQAの評価を行った。
論文 参考訳(メタデータ) (2026-04-08T20:57:21Z) - CausalReasoningBenchmark: A Real-World Benchmark for Disentangled Evaluation of Causal Identification and Estimation [18.187891198793455]
CausalReasoningBenchmarkは、128の現実世界のデータセットにわたる173のクエリのベンチマークである。
因果推論における失敗と数値実行における誤りを区別する。
論文 参考訳(メタデータ) (2026-02-24T05:44:25Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - PULL: Reactive Log Anomaly Detection Based On Iterative PU Learning [58.85063149619348]
本稿では,推定故障時間ウィンドウに基づくリアクティブ異常検出のための反復ログ解析手法PULLを提案する。
我々の評価では、PULLは3つの異なるデータセットで10のベンチマークベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2023-01-25T16:34:43Z) - TadGAN: Time Series Anomaly Detection Using Generative Adversarial
Networks [73.01104041298031]
TadGANは、GAN(Generative Adversarial Networks)上に構築された教師なしの異常検出手法である。
時系列の時間相関を捉えるために,ジェネレータと批評家のベースモデルとしてLSTMリカレントニューラルネットワークを用いる。
提案手法の性能と一般化性を示すため,いくつかの異常スコアリング手法を検証し,最も適した手法を報告する。
論文 参考訳(メタデータ) (2020-09-16T15:52:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。