論文の概要: EDGE: Error Dependency Graph-Guided Multi-Error Attribution in Multi-Agent LLM Systems
- arxiv url: http://arxiv.org/abs/2609.01360v1
- Date: Tue, 01 Sep 2026 15:00:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.788553
- Title: EDGE: Error Dependency Graph-Guided Multi-Error Attribution in Multi-Agent LLM Systems
- Title(参考訳): EDGE:マルチエージェントLLMシステムにおけるエラー依存グラフ誘導マルチエラー属性
- Authors: Jun Hou, Priya Pitre, Yi Fang, Xuan Wang,
- Abstract要約: EDGE(Error Dependency Graph-Guided multi-Error Attribution framework)を紹介する。
EDGEは、最も評価されたモデルや設定に対して、カテゴリレベルのマルチエラー属性を改善していることを示す。
- 参考スコア(独自算出の注目度): 16.87029422280475
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agent failures often contain multiple related errors rather than a single mistake. Existing attribution methods usually identify a responsible agent, step, or root cause, but do not explicitly model dependency between errors. We introduce EDGE, an Error Dependency Graph-guided multi-Error attribution framework. EDGE constructs an error dependency graph from observed error events and validates a reliable causal subset through counterfactual rollout. The inference graph guides a two-stage LLM-as-judge detector for error attribution, and the intervention-validated subgraph provides a more reliable basis for explanation and repair analysis. Experiments on TRAIL and MAST show that EDGE improves category-level multi-error attribution across most evaluated models and settings. Experiments with adapted Who&When-style prompts show that the graph helps across prompting strategies. These results suggest that dependency structure is a useful diagnostic prior for agent failures beyond isolated root-cause prediction.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントのエラーは、単一のミスではなく、複数の関連するエラーを含むことが多い。
既存の属性メソッドは通常、責任あるエージェント、ステップ、ルート原因を特定するが、エラー間の依存性を明示的にモデル化しない。
EDGE(Error Dependency Graph-Guided multi-Error Attribution framework)を紹介する。
EDGEは、観測されたエラーイベントからエラー依存性グラフを構築し、反ファクト的なロールアウトを通じて信頼性の高い因果部分集合を検証する。
推論グラフは2段階のLCM-as-judge検出器を導出し、干渉検証されたサブグラフは、より信頼性の高い説明と修復解析の基盤を提供する。
TRAILとMASTの実験では、EDGEは最も評価されたモデルと設定でカテゴリレベルのマルチエラー属性を改善している。
適応されたWho&Whenスタイルのプロンプトによる実験は、グラフが戦略のプロンプトを横断するのに役立つことを示している。
これらの結果から, 依存構造は孤立根起因予測を超えたエージェント故障の診断に有用であることが示唆された。
関連論文リスト
- Adaptive Influence Graphs for Failure Attribution in Multi-Agent Systems [16.78530745432555]
本稿では,2段階のエージェントフレームワークであるAdaptive Influence Graphs(AIGs)を紹介する。
複数のモデルにまたがって、よりリッチなトレース表現がフェール属性を継続的に改善することを示す。
この仮説は、帰属は診断モデルだけでなく、どのようにトレースが表現され、探索されるかにも依存する、という我々の仮説を裏付けるものである。
論文 参考訳(メタデータ) (2026-08-25T10:18:19Z) - TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories [48.638067300108276]
臨界エラー検出は、最終失敗の原因となる軌道上の最初期のエラーステップを見つけることを目的としている。
長い軌道は、ステップを判断する証拠は遠方の指示、観察、事前の文脈に散らばっているため、個々のエラーを特定するのを困難にしている。
長距離エラー検出に対処するエラーライフサイクルトレースフレームワークであるTraj Debugを提案する。
論文 参考訳(メタデータ) (2026-08-06T17:51:20Z) - Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems [47.66236392009794]
LLM(Large Language Model)ベースのエージェントは、様々な複雑な対話的タスクにおいて、例外的なパフォーマンスを示す。
textitTrajectory Graph Copilot は LLM エージェントの副操縦士' として機能する新しいフレームワークで,実行前に潜在的な動作エラーを診断する。
論文 参考訳(メタデータ) (2026-07-29T20:14:43Z) - Experience Memory Graph: One-Shot Error Correction for Agents [9.23684438376937]
大規模言語モデル(LLM)エージェントは、エラーを複雑にし、障害から回復するのに苦労する。
既存の自己補正機構は本質的に不安定なプロンプトベースの反射に依存している。
本稿では,エージェント障害回復をグラフマッチング問題として再構成するフレームワークであるExperience Memory Graph (EMG)を提案する。
論文 参考訳(メタデータ) (2026-07-15T14:33:15Z) - VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems [79.51005192758262]
大規模言語モデル駆動型マルチエージェントシステムは複雑なタスクで優れている。
しかし、信頼性の低いエージェントは、システムレベルの信頼性にとって重要なボトルネックである。
本稿では,エージェント故障の帰属に関する仮説検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T14:09:35Z) - Conformal Agent Error Attribution [12.400746451700945]
本稿では,共形予測(CP)に基づく誤り帰属の枠組みを提案する。
エージェントトラジェクトリなどのシーケンシャルデータ用に設計されたフィルタベースCPの新しいアルゴリズムを提案する。
我々の全体的なアプローチはモデルに依存しないものであり、MASエラーの帰属に対する原則的不確実性層を提供する。
論文 参考訳(メタデータ) (2026-05-07T18:00:07Z) - Towards Self-Improving Error Diagnosis in Multi-Agent Systems [31.04613892300063]
セマンティック障害帰属のための自己改善フレームワークであるErrorProbeを紹介する。
ErrorProbeは、責任あるエージェントと発生したエラーステップを特定する。
検証されたエピソードメモリを維持しており、実行可能証拠によってエラーパターンが確認された場合にのみ更新される。
論文 参考訳(メタデータ) (2026-04-19T23:13:05Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction [58.51530390018909]
大規模言語モデルに基づくマルチエージェントシステムは、協調的な問題解決において優れているが、エラーのカスケードには脆弱である。
我々は,MASにリアルタイム,教師なし,ステップレベルの誤り検出と自己補正を付与するメタ認知フレームワークMASCを提案する。
論文 参考訳(メタデータ) (2025-10-16T05:35:37Z) - Where LLM Agents Fail and How They can Learn From Failures [62.196870049524364]
大規模言語モデル(LLM)エージェントは、複雑なマルチステップタスクの解決において有望であることを示す。
単一ルート原因エラーがその後の決定を通じて伝播する、障害のカスケードに対する脆弱性を増幅する。
現在のシステムは、モジュール的で体系的な方法でエージェントエラーを包括的に理解できるフレームワークを欠いている。
AgentErrorTaxonomyは、メモリ、リフレクション、計画、アクション、システムレベルの操作にまたがる障害モードのモジュール分類である。
論文 参考訳(メタデータ) (2025-09-29T18:20:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。