論文の概要: Who Broke the System? Failure Localization in LLM-Based Multi-Agent Systems
- arxiv url: http://arxiv.org/abs/2607.07989v1
- Date: Wed, 08 Jul 2026 23:33:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.365941
- Title: Who Broke the System? Failure Localization in LLM-Based Multi-Agent Systems
- Title(参考訳): LLMに基づくマルチエージェントシステムにおける障害局在化
- Authors: Yufei Xia, Anjun Gao, Yueyang Quan, Zhuqing Liu, Minghong Fang,
- Abstract要約: LLMに基づくマルチエージェントシステムにおける障害局所化の問題について検討する。
我々は、特定のエージェントと最初期の決定的なステップの両方に障害を属性付けるフレームワークであるAgentを提案する。
実験の結果、Agentは既存の障害ローカライゼーションメソッドを一貫して上回っていることがわかった。
- 参考スコア(独自算出の注目度): 9.458292549037155
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) based multi-agent systems enable complex problem solving through coordinated reasoning and action, but their distributed structure also introduces new challenges in diagnosing system-level failures. When an execution fails, identifying which agent is responsible and at what point the trajectory first becomes irreversibly misdirected is difficult due to long-horizon interactions and tightly coupled agent behaviors. In this paper, we study the problem of failure localization in LLM-based multi-agent systems and present AgentLocate, a framework that attributes failures to both a specific agent and the earliest decisive step. AgentLocate combines an LLM-based judging mechanism with multi-perspective verification by independent evaluators, whose assessments are aggregated using a confidence-aware strategy. The resulting feedback is further used to adapt the judge through lightweight fine-tuning, improving attribution quality. We evaluate AgentLocate on two complementary benchmarks covering diverse tasks, agent configurations, and trajectory lengths. Experimental results show that AgentLocate consistently outperforms existing failure localization methods in identifying both responsible agents and failure steps, while remaining efficient in terms of token usage and running time.
- Abstract(参考訳): 大規模言語モデル(LLM)に基づくマルチエージェントシステムにより,協調推論と動作による複雑な問題解決が可能になるが,その分散構造はシステムレベルの障害の診断に新たな課題をもたらす。
実行が失敗すると、どのエージェントが責任を負い、どの時点では、長い水平相互作用と密結合されたエージェントの挙動のために、軌道がまず不可逆的に誤った方向となるかを特定することは困難である。
本稿では,LLMに基づくマルチエージェントシステムにおける障害局所化の問題と,特定のエージェントと最初期の決定ステップの両方に障害を関連付けるフレームワークであるAgentLocateを提案する。
AgentLocate は LLM に基づく判定機構と独立評価器によるマルチパースペクティブ検証を組み合わせる。
得られたフィードバックは、軽量な微調整によって判断に適応し、属性の品質を向上させるためにさらに使用される。
我々は,多種多様なタスク,エージェント構成,軌道長を含む2つの相補的ベンチマーク上で,AgenLocateを評価した。
実験の結果、AgentLocateは、トークンの使用と実行時間の点で効率的でありながら、責任のあるエージェントと障害ステップの両方を識別する既存の障害ローカライゼーションメソッドを一貫して上回っている。
関連論文リスト
- POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems [0.07783271875179179]
システム独自のエージェントを診断層として再利用するプロトコルであるPOIROTを提案する。
評価された設定全体で、POIROTは単一LLMベースライン評価器より優れている。
我々は,安全クリティカルなマルチエージェントシステムにおけるフォールト属性のベンチマークであるBLAMEとともに,オープンソースのライブラリとしてPOIROTをリリースした。
論文 参考訳(メタデータ) (2026-06-01T14:05:35Z) - FALAT: Tracing Failures in LLM Agent Trajectories via Dependency-Guided Search [11.638321375070047]
LLMエージェントトラジェクトリにおける障害帰属の診断フレームワークであるFALATを提案する。
我々は、アルゴリズム生成と手作りのマルチエージェント障害軌跡を含むWho&WhenベンチマークでFALATを評価する。
論文 参考訳(メタデータ) (2026-05-30T15:11:35Z) - Meta-Agent: From Task Descriptions to Verified Multi-Agent Systems [36.485119937780524]
本稿では,マルチエージェントシステムの自動構築と実行を行う2相フレームワークMeta-Agentを提案する。
本稿では,局所的,上流的,構造的障害を区別する3段階の誤り帰属機構を提案する。
強力なマルチエージェントベースラインとアブレーションスタディに対する実験では、タスク成功率、エラー回復、ワークフロー安定性が一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-05-24T19:38:54Z) - VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems [79.51005192758262]
大規模言語モデル駆動型マルチエージェントシステムは複雑なタスクで優れている。
しかし、信頼性の低いエージェントは、システムレベルの信頼性にとって重要なボトルネックである。
本稿では,エージェント故障の帰属に関する仮説検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T14:09:35Z) - FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments [60.3427704389541]
大規模言語モデルは、自律エージェントの意思決定コアとして、ますます多くデプロイされている。
しかし、会話のベンチマークでは、誤った意思決定のカスケード効果のために、これらのエージェントは頻繁に失敗する。
これらの課題に対処するために、Failure-Aware Meta-Agenticフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-28T02:21:53Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - An Adversary-Resistant Multi-Agent LLM System via Credibility Scoring [8.779871128906787]
信頼性スコアリングに基づく汎用・対向抵抗型マルチエージェントLCMフレームワークを提案する。
私たちのシステムは、チームのアウトプットを集約するときに使用される信頼性スコアを関連付けています。
論文 参考訳(メタデータ) (2025-05-30T05:57:37Z) - Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent Systems [50.29939179830491]
LLMマルチエージェントシステムにおける障害帰属は、まだ調査が過小評価されており、労働集約的である。
本稿では,3つの自動故障帰属手法の開発と評価を行い,その欠点と欠点を要約する。
最良の方法は、障害に応答するエージェントを特定する際に53.5%の精度を達成するが、故障の特定には14.2%しか役に立たない。
論文 参考訳(メタデータ) (2025-04-30T23:09:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。