論文の概要: ResonAct: Streaming Metrics for Runtime Diagnosis and Self-Healing in Multi-Agent Systems
- arxiv url: http://arxiv.org/abs/2609.34701v1
- Date: Mon, 28 Sep 2026 09:18:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 03:39:42.394778
- Title: ResonAct: Streaming Metrics for Runtime Diagnosis and Self-Healing in Multi-Agent Systems
- Title(参考訳): ResonAct:マルチエージェントシステムにおける実行時診断と自己修復のためのストリーミングメトリック
- Abstract要約: 本稿では,マルチエージェントシステムの継続的監視,診断,修復を可能にするランタイム自己修復フレームワークであるResonActを紹介する。
ResonActは、実行トレース、エージェントインタラクション、ツール呼び出しをストリーミング分析層に取り込みます。
フレームワークは外部コントロールプレーンとして動作し、アプリケーションエージェントやオーケストレーションロジックを変更することなく介入を可能にする。
- 参考スコア(独自算出の注目度): 7.777663013568655
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-agent systems (MAS) are increasingly used to automate enterprise workflows involving multiple specialized agents, external tools, and long-running task execution. Failures may arise from tool degradation, context propagation errors, coordination breakdowns, or repeated agent interactions that prevent task completion. While existing observability frameworks provide traces and logs, diagnosis and remediation are largely performed after execution completes, limiting opportunities for recovery during runtime. We present ResonAct, a runtime self-healing framework that enables continuous monitoring, diagnosis, and remediation of multi-agent systems through streaming operational metrics. ResonAct ingests execution traces, agent interactions, and tool invocations into a streaming analytics layer that continuously derives task progress, context health, and tool reliability metrics. These metrics serve as runtime control signals for detecting anomalous execution patterns and localizing root causes using a structured failure model. Based on the diagnosed failure, ResonAct dynamically selects remediation policies and performs actions. The framework operates as an external control plane, enabling intervention without modifying application agents or orchestration logic. We evaluate ResonAct across enterprise workflow scenarios and AppWorld benchmarks. The results show that the streaming metric-based analysis identifies execution degradations and localizes faults. Furthermore, policy-driven remediation improves task completion rates by up to 10.00 percentage points, with detection precision ranging from 70.59% to 82.91%, recall from 63.09% to 100%, recovery rates from 10.48% to 46.67%, and runtime overhead ranging from $-0.25%$ to 14.12% across the evaluated configurations.
- Abstract(参考訳): マルチエージェントシステム(MAS)は、複数の専門エージェント、外部ツール、長時間実行されるタスク実行を含むエンタープライズワークフローを自動化するために、ますます使われている。
失敗は、ツールの劣化、コンテキストの伝搬エラー、コーディネーションのブレークダウン、あるいはタスクの完了を防ぐための繰り返しエージェントのインタラクションから生じます。
既存のオブザーバビリティフレームワークはトレースとログを提供するが、診断と修復は実行が完了した後に行われ、実行中のリカバリの機会が制限される。
本稿では、ストリーミング運用メトリクスを通じてマルチエージェントシステムの継続的監視、診断、修復を可能にするランタイム自己修復フレームワークであるResonActを紹介する。
ResonActは、実行トレース、エージェントインタラクション、ツール呼び出しをストリーミング分析層に取り込み、タスクの進捗、コンテキストの健全性、ツール信頼性のメトリクスを継続的に導き出す。
これらのメトリクスは、構造化障害モデルを使用して異常な実行パターンを検出し、根本原因をローカライズするための実行時制御信号として機能する。
診断された障害に基づいて、ResonActは動的に修復ポリシーを選択し、アクションを実行する。
フレームワークは外部コントロールプレーンとして動作し、アプリケーションエージェントやオーケストレーションロジックを変更することなく介入を可能にする。
企業ワークフローのシナリオとAppWorldベンチマークでResonActを評価します。
その結果,ストリーミングメトリックに基づく解析では,実行の劣化を識別し,障害を局所化することがわかった。
さらに、政策主導の修復はタスク完了率を最大10.00ポイント改善し、検出精度は70.59%から82.91%、リコール率63.09%から100%、リカバリ率10.48%から46.67%、ランタイムオーバーヘッドは評価された構成で$-0.25%から14.12%となっている。
関連論文リスト
- TraceDance: An Automated System for Building Agent Behavior Benchmarks from Real-World Agent Deployment Traces [49.561879967469714]
TraceDanceは、ユーザが指定した望ましくない振る舞いのデプロイメントトレースからターゲットベンチマークを構築するエージェントシステムである。
効率的な構築のために、Anchor-and-Confirmはプログラム可能な検索と、Flash大言語モデルによる候補レベルの確認を組み合わせる。
コーディングと一般的なツールの実験では、252,557のセッションで描画され、ビルドターゲット要求の95.3%を満たす4,125のインスタンスで107のベンチマークを生成する。
論文 参考訳(メタデータ) (2026-09-27T06:58:39Z) - ParaRecover: A Process-Level Benchmark for Error Localization and Recovery in Parallel Tool-Use Agents [9.426759720914623]
ParaRecoverは、マルチターン並列ツール使用エージェントのエラーローカライゼーションとリカバリを評価するための、プロセスレベルのベンチマークである。
計画依存関係、ツールの選択、引数マッチングを含む14のエラータイプの詳細な分類に基づいて、ベンチマークは2つの困難レベルにまたがる10,626のインスタンスで構成されている。
実験によると、最先端のモデルでさえも、マルチターンエラーの伝播、ツール使用障害の簡易化、正確な再計画に苦戦している。
論文 参考訳(メタデータ) (2026-09-11T02:09:33Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Self-Healing Agentic Orchestrators for Reliable Tool-Augmented Large Language Model Systems [0.10210859604701106]
セルフヒーリングエージェントオーケストレータは、信頼性をランタイム境界制御問題として扱う。
セルフヒーリングは98.8%のタスク成功を達成し、リトライオンリーでは94.5%、フルリプランでは93.8%を達成している。
論文 参考訳(メタデータ) (2026-05-31T19:27:22Z) - ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation [0.0]
本稿では,プランナー指向実行,特殊なツール使用,テレメトリ駆動評価を中心に構築されたツール拡張型自律推論フレームワークを提案する。
クリーンな評価制約の下でGAIA 2023 Level-1バリデーションタスクのクロマフローを解析する。
論文 参考訳(メタデータ) (2026-05-13T20:40:37Z) - From Reaction to Anticipation: Proactive Failure Recovery through Agentic Task Graph for Robotic Manipulation [45.37258918150899]
本稿では,操作タスクを有向タスクグラフとしてモデル化するエージェントシステムであるAgentChordを紹介する。
実行前に、このグラフには、コンテキスト対応の修正動作を指定する予測リカバリブランチが組み込まれている。
多様な長距離双方向操作タスクに関する実証研究は、AgentChordが成功率と実行効率を大幅に改善することを示した。
論文 参考訳(メタデータ) (2026-05-12T11:00:45Z) - AgentTrace: Causal Graph Tracing for Root Cause Analysis in Deployed Multi-Agent Systems [0.0]
本稿では,デプロイされたマルチエージェントAIシステムにおけるポストホック障害診断のための軽量因果トレースフレームワークであるAgentTraceを紹介する。
AgentTraceは、実行ログから因果グラフを再構築し、エラー発生から後方にトレースし、解釈可能な構造信号と位置信号を使って候補根本原因をランク付けする。
この結果から,因果トレースはエージェントシステムの信頼性と信頼性を向上させるための実践的な基盤となることが示唆された。
論文 参考訳(メタデータ) (2026-03-16T00:46:44Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - InspectCoder: Dynamic Analysis-Enabled Self Repair through interactive LLM-Debugger Collaboration [71.18377595277018]
大きな言語モデル(LLM)は、診断が難しい複雑なロジックエラーを伴うバグの多いコードを生成することが多い。
対話型デバッガ制御による動的解析を LLM に委ねる初のエージェントプログラム修復システムである InspectCoder を提案する。
論文 参考訳(メタデータ) (2025-10-21T06:26:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。