論文の概要: Incident-Arena: Getting agents to the last nine of reliability
- arxiv url: http://arxiv.org/abs/2610.00648v1
- Date: Wed, 30 Sep 2026 19:50:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.735467
- Title: Incident-Arena: Getting agents to the last nine of reliability
- Title(参考訳): インシデント・アレーナ:最後の9つの信頼性にエージェントを配置する
- Abstract要約: Incident-Arena(インシデント・アリーナ)は、現実世界にデプロイされたオープンソースソフトウェアに根ざした、慎重に選択されたタスク20の人為的なベンチマークである。
各タスクはプロダクションアプリケーションを一時的なクラスタにデプロイし、基盤となるイメージと持続的なロードプロファイルを通じて構成層から障害を注入する。
また,静的チェックから機能検証まで,システムレベルのメトリクスを安定に保持する新たな検証手法を提案する。
- 参考スコア(独自算出の注目度): 2.807220621992172
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI coding agents are ubiquitous in engineering workflows amongst industry and academia. Yet, despite their use in app coding, relatively less attention has been paid to their ability to execute on production incident response. This emerging field, termed agentic site-reliability-engineering (SRE) contains benchmarks limited by (1) unrealistic environments, typically toy repositories (2) non-standard framework implementations and (3) simple static verifiers. We introduce Incident-Arena, a human-built benchmark of 20 carefully selected tasks grounded in real-world deployed open source software. Each task deploys a production application to an ephemeral Kubernetes cluster, injecting a fault from the config layer through underlying images, and a sustained load profile given the task requirements. We also present a novel verification method, going beyond static checks to functional verifiers, holding systems level metrics stable, while ensuring repairs are done safely. Agent trials run an average of 2.81M tokens and 41 turns, going beyond existing benchmarks, demonstrating agentic long horizon reasoning. Across 20 tasks and 3 application substrates, frontier models score below 64.3%, with failures extending from diagnosis/localization errors, through incomplete repairs and unsafe regressions.
- Abstract(参考訳): AIコーディングエージェントは、業界や学界のエンジニアリングワークフローにおいてユビキタスです。
しかし、アプリコーディングに使用しているにもかかわらず、本番インシデント対応の実行能力に対して、比較的注意が払われていない。
エージェントサイト信頼性エンジニアリング(SRE)と呼ばれるこの新興分野は、(1)非現実的な環境、通常、おもちゃのリポジトリ、(2)非標準フレームワークの実装、(3)単純な静的検証によって制限されたベンチマークを含んでいる。
Induction-Arenaは、実世界のオープンソースソフトウェアに根ざした、慎重に選択されたタスク20の人為的なベンチマークである。
各タスクは、運用アプリケーションを一時的なKubernetesクラスタにデプロイし、基盤となるイメージを通じて設定層から障害を注入し、タスク要求に応じて持続的なロードプロファイルを発行する。
また,静的チェックを超えて機能検証を行い,システムレベルのメトリクスを安定に保ちながら,修復を安全に行う新しい検証手法を提案する。
エージェントトライアルは、平均2.81万のトークンと41のターンを実行し、既存のベンチマークを越え、エージェント的な長い地平線推論を実証している。
20のタスクと3つのアプリケーション基板で、フロンティアモデルは64.3%以下であり、診断/ローカライゼーションエラーから不完全な修復と安全でない回帰まで拡張された。
関連論文リスト
- From Dead Code and Static Requirements to Working Engines: Software Revival with Coding Agents [14.661282304807145]
ReviveBenchは、ネイティブ実行環境に対する隠れ検証によって評価された2つのタスクファミリを持つベンチマークである。
リカバリファミリーは、依存関係の非互換性、削除されたコアモジュール、レガシビルド、GPUベースのファンデーションモデルを含む10のタスクで構成される。
再構成ファミリーは、数値、幾何学、ハードウェア、取引システムにまたがる13のタスクからなる。
論文 参考訳(メタデータ) (2026-09-28T19:30:12Z) - LogicHunter: Testing LLM Agent Frameworks with an Agentic Oracle [6.653693552089508]
LangChain、LlamaIndex、CrewAIといった大規模言語モデル(LLM)エージェントフレームワークは、実運用AIシステムを支える重要なインフラストラクチャになっています。
これらの純粋なPythonフレームワークの欠陥は、通常の例外やサイレントなセマンティックな失敗として現れ、深いオラクルの曖昧さを生み出します。
我々は、アクティブな仕様認識テストを通じて世代とオラクルの課題に対処するファジングフレームワークであるLogicHunterを紹介する。
論文 参考訳(メタデータ) (2026-07-07T12:21:42Z) - OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - Shell or Nothing: Real-World Benchmarks and Memory-Activated Agents for Automated Penetration Testing [23.554239007767276]
本稿では,世界初の実世界のエージェント指向ペンテストベンチマークTermiBenchを紹介する。
本稿では,多エージェント浸透試験フレームワークTermiAgentを提案する。
評価において,本研究は最先端のエージェントより優れ,より強力な浸透試験能力を示す。
論文 参考訳(メタデータ) (2025-09-11T07:30:44Z) - OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety [58.201189860217724]
OpenAgentSafetyは,8つの危機リスクカテゴリにまたがるエージェントの動作を評価する包括的なフレームワークである。
従来の作業とは異なり、我々のフレームワークは、Webブラウザ、コード実行環境、ファイルシステム、bashシェル、メッセージングプラットフォームなど、実際のツールと対話するエージェントを評価します。
ルールベースの分析とLSM-as-judgeアセスメントを組み合わせることで、過度な行動と微妙な不安全行動の両方を検出する。
論文 参考訳(メタデータ) (2025-07-08T16:18:54Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。