論文の概要: ORCA-bench: How Ready Are Language Model Agents for Oncall?
- arxiv url: http://arxiv.org/abs/2607.28545v2
- Date: Wed, 05 Aug 2026 12:21:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:42.93654
- Title: ORCA-bench: How Ready Are Language Model Agents for Oncall?
- Title(参考訳): ORCA-bench: オンコールのための言語モデルエージェントはどの程度準備が整っているか?
- Authors: Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi,
- Abstract要約: ORCA-benchは、汎用的なコーディングエージェントを実運用環境のオンコール設定に配置するベンチマークである。
最高のRCA精度は、中級微分タスクにおける25.3%である。
最も弱いモデルは、インシデントレポートの40%において、信じられないほど根本原因を幻覚させる。
- 参考スコア(独自算出の注目度): 14.379965421387586
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models can write, patch, and search code, but oncall root cause analysis (RCA) demands something different: reasoning over noisy metrics, logs, traces, and source code, starting from ambiguous user-facing reports, often hours after the incident began. We introduce ORCA-bench, a benchmark that puts general-purpose coding agents in a production-fidelity oncall setting. ORCA-bench pairs a live OpenTelemetry-instrumented microservice system--exposing six days of metrics, logs, and traces through real telemetry interfaces (Prometheus, Jaeger, and OpenSearch via Grafana) and full source-code access--with 1,079 RCA tasks that systematically vary report specificity, time-to-detection, and co-occurring fault scenarios. Ground-truth symptoms are curated and signed off by expert SREs, and our LLM-as-judge is independently re-scored by humans (Cohen's $κ_w=0.90$). Across five frontier agents, the best RCA Accuracy is 25.3% on Medium-difficulty tasks (the realistic-input setting) and 10.0% on Hard--a gap that remains even with Claude Fable 5. The weakest model hallucinates an implausible root cause in 40% of incident reports, and removing source-code access degrades every metric. Crucially, these are performances on a curated 50 GB / six-day testbed with tasks investigated in isolation on a system whose code and instrumentation are public. Since real production systems are order of magnitudes larger, more dynamic, and more idiosyncratic, the gap we report is a lower bound on the engineering investment required before frontier coding agents can be safely entrusted with production reliability. We release the public set at https://hub.harborframework.com/datasets/orca-bench/orca-bench.
- Abstract(参考訳): 大規模な言語モデルでは、コードの記述、パッチ、検索が可能だが、oncall root cause analysis (RCA) では、ノイズの多いメトリクス、ログ、トレース、ソースコードの推論が要求される。
ORCA-benchは、汎用的なコーディングエージェントを実運用環境のオンコール設定に配置するベンチマークである。
ORCA-benchは、実際のテレメトリインターフェース(Prometheus、Jaeger、Grafana経由のOpenSearch)を通じて6日間のメトリクス、ログ、トレースを抽出した、ライブのOpenTelemetry-instrumentedマイクロサービスシステムと、レポートの特異性、時間対検出、共起障害シナリオを体系的に変更した1,079のRCAタスクと、完全なソースコードアクセスをペアリングする。
LLM-as-judgeは人間によって独立に再構成される(Cohenの$κ_w=0.90$)。
5つのフロンティアエージェントの中で、最高のRCA精度は、中間微分タスク(リアルなインプット設定)で25.3%、ハードで10.0%である。
最も弱いモデルは、インシデントレポートの40%において、予測できない根本原因を幻覚させ、ソースコードアクセスを削除することは、すべてのメトリクスを劣化させる。
重要なことに、これらは50GB/6日間のキュレートされたテストベッド上のパフォーマンスであり、コードとインスツルメンテーションが公開されているシステム上で、個別に調査されたタスクである。
実生産システムは桁違いに大きく、よりダイナミックで、より慣用的であるため、フロンティアコーディングエージェントが生産信頼性を安全に信頼される前に必要とされるエンジニアリング投資の限界は低くなります。
公開セットはhttps://hub.harborframework.com/datasets/orca-bench/orca-bench.comで公開しています。
関連論文リスト
- Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - The Prover Is the Judge: Verified Security Software from AI Coding Agents in Ada/SPARK [0.0]
検証者主導のループにおいて、AIエージェントは古典的および後量子暗号、TLS 1.3、IKEv2、X.509、マトリックスクライアントにまたがるAda/SPARKのベアメタルセキュリティソフトウェアを書いて検証した。
GNATproveは49,280の証明義務を解除し、選択されたプリミティブに対して機能的正当性を確立し、残りのプリミティブに対して実行時のエラーがないことを証明した。
それぞれのレイヤが障害をキャッチし,中心的な教訓を引き出す方法を報告します。エージェントが確立するために信頼できるものは,そのフィードバックの強さに縛られているのです。
論文 参考訳(メタデータ) (2026-07-15T20:09:05Z) - Log-Insight: Automating Microservice Incident Diagnosis via Neuro-Symbolic Log Analysis [4.172239714799967]
我々はHuaweiで運用されている自動インシデント診断システムであるLog-Insightを紹介する。
私たちの6段階パイプラインは、統計的に重要な障害信号を保存しながら、数百万の生イベントを1,000~7000倍削減します。
Log-Insight は MRR = 0.790 を達成し、最大3つの仮説の正しい根本原因を1分以内の動作の90%以上で返す。
論文 参考訳(メタデータ) (2026-07-09T14:25:31Z) - Multi-Agent Systems for Root Cause Analysis in Microservices [58.95503998127531]
LATS-RCAはMSSの根本原因分析のためのマルチエージェントフレームワークである。
リフレクションスコアは、最も可能性が高い根本原因への探索を導くために使用される。
我々は,オープンソースの産業MSSであるLight-OAuth2上でLATS-RCAを評価する。
論文 参考訳(メタデータ) (2026-05-05T08:39:42Z) - Synthesizing Multi-Agent Harnesses for Vulnerability Discovery [8.518689779459974]
LLMエージェントは、人間の監査官や自動ファジッターが何十年も見逃していた、真のセキュリティ脆弱性を見つけ始めている。
実際には、作業は複数のエージェントに分割され、ハーネスによってワイヤリングされる。どの役割が存在するかを修正するプログラム、どのように情報を渡すか、どのツールを呼び出すか、リトライがどのように調整されるかである。
AgentFlowは、エージェントの役割、プロンプト、ツール、通信トポロジ、調整プロトコルを共同でカバーする型付きグラフDSLで、両方の制限に対処する。
論文 参考訳(メタデータ) (2026-04-22T17:27:40Z) - SWE-chat: Coding Agent Interactions From Real Users in the Wild [70.18158706281724]
SWE-chatは、オープンソースの開発者から収集された実際のコーディングエージェントセッションの大規模なデータセットである。
現在、データセットには6000のセッションが含まれており、63,000以上のユーザプロンプトと355,000のエージェントツールコールが含まれている。
論文 参考訳(メタデータ) (2026-04-22T17:08:19Z) - Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All [57.23434868678603]
Live-kBenchは、新たに発見されたカーネルバグのエージェントをスクラップし、評価するセルフ進化ベンチマークの評価フレームワークである。
kEnvは、カーネルのコンパイル、実行、フィードバックのためのエージェントに依存しないクラッシュ解決環境である。
kEnvを用いて3つの最先端エージェントをベンチマークし、最初の試行で74%のクラッシュを解決したことを示す。
論文 参考訳(メタデータ) (2026-02-02T19:06:15Z) - MALCDF: A Distributed Multi-Agent LLM Framework for Real-Time Cyber [0.0]
4つの大規模言語モデル(LLM)エージェント-検出、インテリジェンス、応答、分析をリアルタイムで協調する。
エージェントはセキュア通信層(SCL)上で暗号化されたオントロジー対応のメッセージと通信し、監査に優しい出力を生成する。
MALCDFは検出精度が90.0%、F1スコア85.7%、偽陽性率9.1%に達し、1時間あたり平均6.8秒の遅延がある。
論文 参考訳(メタデータ) (2025-12-16T19:08:12Z) - COCA: Generative Root Cause Analysis for Distributed Systems with Code Knowledge [33.88776152946711]
問題報告のためのコード知識強化根本原因分析手法であるCOCAを提案する。
問題レポート内のデータに基づいて、COCAは関連するコードスニペットをインテリジェントに抽出し、実行パスを再構築する。
実世界の5つの分散システムのデータセットに対する評価は,COCAが既存手法を著しく上回っていることを示す。
論文 参考訳(メタデータ) (2025-03-29T11:56:48Z) - Automatic Root Cause Analysis via Large Language Models for Cloud
Incidents [51.94361026233668]
クラウドインシデントの根本原因分析を自動化するために,大規模言語モデルによって強化されたオンコールシステムであるRCACopilotを紹介する。
RCACopilotは、入ってくるインシデントと、そのアラートタイプに基づいて対応するインシデントハンドラとをマッチングし、クリティカルランタイム診断情報を集約し、インシデントの根本原因カテゴリを予測し、説明的な物語を提供する。
Microsoftから1年分のインシデントからなる実世界のデータセットを使用してRCACopilotを評価する。
論文 参考訳(メタデータ) (2023-05-25T06:44:50Z) - WNARS: WFST based Non-autoregressive Streaming End-to-End Speech
Recognition [59.975078145303605]
本稿では,ハイブリッドCTC-attention AEDモデルと重み付き有限状態トランスデューサを用いた新しいフレームワークWNARSを提案する。
AISHELL-1タスクでは、640msの遅延で5.22%の文字エラー率を達成し、オンラインASRの最先端のパフォーマンスである私たちの知識を最大限に活用します。
論文 参考訳(メタデータ) (2021-04-08T07:56:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。