論文の概要: OpenRCA 2.0: From Outcome Labels to Causal Process Supervision
- arxiv url: http://arxiv.org/abs/2606.27154v1
- Date: Thu, 25 Jun 2026 15:24:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.333233
- Title: OpenRCA 2.0: From Outcome Labels to Causal Process Supervision
- Title(参考訳): OpenRCA 2.0: アウトカムラベルから因果プロセススーパービジョンへ
- Abstract要約: 本稿では,因果伝播経路の再構築に既知の介入を活用する段階的ラベリングプロトコルPAVEを紹介する。
PAVEを適用することでOpenRCA 2.0(500インスタンス)が得られる。
- 参考スコア(独自算出の注目度): 15.525905024836701
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Root cause analysis (RCA) poses a holistic test of LLM agentic capabilities, such as long-context understanding, multi-step reasoning, and tool use. However, existing datasets suffer from a fundamental gap: they label only the root cause, not the propagation path connecting it to the observed symptom, which largely simplifies the task to naive pattern matching. To support rigorous evaluation, we introduce PAVE, a step-wise labeling protocol that leverages known interventions from fault injection to reconstruct causal propagation paths. The mechanism is forward verification: reasoning from cause to effect rather than inferring backward from symptoms. Applying PAVE yields OpenRCA 2.0 (500 instances), the first cross-system RCA benchmark with step-wise causal annotations for LLM agents. Across 11 frontier LLMs, recovering the exact root-cause set succeeds in only 20.7% of cases on average. To locate where this difficulty lies, we relax the criterion and find what we call the ungrounded diagnosis: agents identify at least one correct root-cause service in 76.0% of cases, but ground that service in a verified causal propagation path to the observed symptom in only 61.5%. Outcome-only evaluation hides this failure mode; step-wise causal ground truth is the missing piece for trustworthy LLM-based RCA agents.
- Abstract(参考訳): ルート原因分析(RCA)は、長期コンテキスト理解、多段階推論、ツール使用などのLLMエージェント機能の総合的なテストを行う。
しかし、既存のデータセットは根本原因のみをラベル付けし、それを観察された症状に接続する伝播経路ではなく、パターンマッチングをナビゲートするタスクを単純化する、基本的なギャップに悩まされている。
厳密な評価を支援するために,障害注入からの既知の介入を利用して因果伝播経路を再構築する段階的ラベル付けプロトコルPAVEを導入する。
このメカニズムは、症状から後方に推論するのではなく、原因から効果への推論である、前方検証である。
PAVEを適用することでOpenRCA 2.0(500インスタンス)が得られる。
11のフロンティアLSMを越え、正確な根源セットを回復することは、平均して20.7%のケースでしか成功しない。
エージェントは76.0%の症例で少なくとも1つの正しい根起因菌を同定するが、その作用は61.5%の症状で確認された因果伝播経路にある。
アウトカムのみの評価はこの障害モードを隠蔽する; ステップワイズ因果的真実は、信頼できるLCMベースのRCAエージェントの欠落点である。
関連論文リスト
- FALAT: Tracing Failures in LLM Agent Trajectories via Dependency-Guided Search [11.638321375070047]
LLMエージェントトラジェクトリにおける障害帰属の診断フレームワークであるFALATを提案する。
我々は、アルゴリズム生成と手作りのマルチエージェント障害軌跡を含むWho&WhenベンチマークでFALATを評価する。
論文 参考訳(メタデータ) (2026-05-30T15:11:35Z) - HunterAgent: Neuro-Symbolic Attack Trace Reconstruction under Anti-Forensics [4.5096964986324]
脅威狩りは、不均一な丸太を越えて因果攻撃鎖を再構築する必要がある。
我々は,コストバウンドグラフ検索としてトレース再構成を再構成するニューロシンボリックなフレームワークであるHunterAgentを提案する。
HunterAgentは86.1%の平均F1を達成し、トップエージェントベースラインを26.7F1、KAIROSを17.1F1で上回っている。
論文 参考訳(メタデータ) (2026-05-28T02:38:12Z) - Multi-Agent Systems for Root Cause Analysis in Microservices [58.95503998127531]
LATS-RCAはMSSの根本原因分析のためのマルチエージェントフレームワークである。
リフレクションスコアは、最も可能性が高い根本原因への探索を導くために使用される。
我々は,オープンソースの産業MSSであるLight-OAuth2上でLATS-RCAを評価する。
論文 参考訳(メタデータ) (2026-05-05T08:39:42Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - Interpretable Failure Analysis in Multi-Agent Reinforcement Learning Systems [8.723131512052703]
MARL(Multi-Agent Reinforcement Learning)は、安全上重要な領域にますます導入されている。
本稿では,3つの臨界故障解析タスクの解釈可能な診断を行うための2段階の勾配に基づくフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-08T19:55:26Z) - Stalled, Biased, and Confused: Uncovering Reasoning Failures in LLMs for Cloud-Based Root Cause Analysis [5.532586951580959]
LLMの推論動作を分離する実験的な評価手法を提案する。
我々は16の共通RCA推論失敗の分類をラベル付きで作成し、アノテーションにLLM-as-a-Judgeを使用する。
論文 参考訳(メタデータ) (2026-01-29T18:23:26Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - LLMs Can Get "Brain Rot"! [68.08198331505695]
ジャンクウェブテキストへの連続曝露は、大規模言語モデル(LLM)の持続的認知低下を誘導する
実Twitter/Xコーパスで制御された実験を行い、ジャンクと逆制御されたデータセットを構築します。
その結果、データ品質がLLM能力の崩壊の原因であることを示す重要な多視点的証拠が得られた。
論文 参考訳(メタデータ) (2025-10-15T13:28:49Z) - GALA: Can Graph-Augmented Large Language Model Agentic Workflows Elevate Root Cause Analysis? [9.394057684388027]
本稿では,マイクロサービスシステムにおける根本原因分析の新しいフレームワークであるGALAを紹介する。
GALAはオープンソースのベンチマークで評価され、最先端のメソッドよりも大幅に改善されている。
GALAは自動故障診断と実用的なインシデント解決のギャップを埋めることを示す。
論文 参考訳(メタデータ) (2025-08-17T19:12:05Z) - Towards Causality-Aware Inferring: A Sequential Discriminative Approach
for Medical Diagnosis [142.90770786804507]
医学診断アシスタント(MDA)は、疾患を識別するための症状を逐次調査する対話型診断エージェントを構築することを目的としている。
この研究は、因果図を利用して、MDAにおけるこれらの重要な問題に対処しようとする。
本稿では,他の記録から知識を引き出すことにより,非記録的調査に効果的に答える確率に基づく患者シミュレータを提案する。
論文 参考訳(メタデータ) (2020-03-14T02:05:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。