論文の概要: DeFA: Dependency-Guided Failure Attribution for LLM Agents
- arxiv url: http://arxiv.org/abs/2610.01256v1
- Date: Thu, 01 Oct 2026 07:50:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.975574
- Title: DeFA: Dependency-Guided Failure Attribution for LLM Agents
- Title(参考訳): DeFA: LLMエージェントの依存性誘導型障害属性
- Abstract要約: エージェント障害帰属のための依存性ガイダンスフレームワークであるDeFAを紹介する。
DeFAはまず、プロトコルの関係とセマンティック依存関係をトラジェクトリにまたがるイベント依存グラフに結合する。
次に、タスク要求に違反する可能性のあるイベントを特定し、ソースとその後の影響をトレースして、障害伝播グラフを構築する。
- 参考スコア(独自算出の注目度): 23.995633236163695
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Errors in LLM agent executions and their visible consequences can be separated by many steps, making decisive-error localization a matter of understanding both step content and step dependencies. We introduce DeFA, a dependency-guided framework for agent failure attribution. DeFA first combines protocol relations and semantic dependencies into an event dependency graph spanning the trajectory. It then identifies events that may violate task requirements and traces their sources and subsequent effects to construct a failure propagation graph. Finally, DeFA uses step evidence and the steps' roles in failure propagation to identify the decisive error, responsible agent, and error category. To support long trajectories, DeFA partitions executions into segments and combines the current segment's detailed content with summaries of the other segments, giving local diagnosis access to global execution context. Across Who and When and the Who and When Pro text subset, DeFA achieves the highest responsible-agent and exact step accuracy with all evaluated backbones, and the highest failure-mode accuracy among taxonomy-aligned methods on Pro. Further experiments on image and video trajectories demonstrate its applicability to multimodal failure attribution. Ablations support the contributions of segmentation, the event dependency graph, and the failure propagation graph. Using DeFA's diagnostic feedback for skill evolution in Trace2Skill improves downstream task accuracy by 6-15 percentage points over the native pipeline, showing that the diagnoses can also support agent improvement on subsequent tasks.
- Abstract(参考訳): LLMエージェントの実行中のエラーとその目に見える結果が、多くのステップで分離できるため、ステップ内容とステップ依存性の両方を理解する上で、決定的エラーのローカライゼーションが問題になる。
エージェント障害帰属のための依存性ガイダンスフレームワークであるDeFAを紹介する。
DeFAはまず、プロトコルの関係とセマンティック依存関係をトラジェクトリにまたがるイベント依存グラフに結合する。
次に、タスク要求に違反する可能性のあるイベントを特定し、ソースとその後の影響をトレースして、障害伝播グラフを構築する。
最後に、DeFAでは、ステップエビデンスと失敗伝播におけるステップの役割を使用して、決定的なエラー、責任のあるエージェント、エラーカテゴリを特定します。
長いトラジェクトリをサポートするために、DeFAは実行をセグメントに分割し、現在のセグメントの詳細な内容と他のセグメントの要約を組み合わせることで、グローバルな実行コンテキストへのローカルな診断アクセスを提供する。
Who and the When and the Who and When Proのテキストサブセット全体にわたって、DeFAは、評価されたすべてのバックボーンにおいて、最高責任エージェントと正確なステップ精度を達成し、Proの分類基準に準拠したメソッドの中で、最高失敗モードの精度を達成します。
画像とビデオのトラジェクトリに関するさらなる実験は、マルチモーダルな障害属性に適用可能であることを示した。
アブレーションはセグメンテーション、イベント依存グラフ、障害伝播グラフのコントリビューションをサポートする。
Trace2Skillのスキル進化のためのDeFAの診断フィードバックを使用することで、ネイティブパイプライン上でのダウンストリームタスクの精度が6~15ポイント向上する。
関連論文リスト
- DCFA: Dual-view Causal-inspired Attribution for Failure Reasoning in LLM-based Multi-agent Systems [61.11435469308521]
大規模言語モデルシステムにおける障害帰属のためのトレーニング不要フレームワークDCFAを提案する。
DCFAは、システムトレースから構造化因果インスパイアされた依存性グラフを構築するグローバルモジュールを統合する。
実験の結果、DCFAは最先端のベースラインよりもステップレベルの精度を最大8.27%向上することが示された。
論文 参考訳(メタデータ) (2026-09-04T05:29:31Z) - From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents [75.69180947909148]
大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
論文 参考訳(メタデータ) (2026-08-17T01:40:14Z) - StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents [67.03593791535786]
強化学習(Reinforcement Learning, RL)は、長期のデジタル環境においてGUIエージェントを改善するための有望なアプローチである。
この問題を軽減するため、最近の研究はプロセス・リワード・モデル(PRM)を導入している。
PRMは、グローバルマイルストーン検証やローカルステップレベルの評価を通じて、よりきめ細かいトレーニングフィードバックを提供する。
本稿では,GUIエージェントのためのエンティティ・スタンフロープロセス報酬モデルであるStainFlowを提案する。
論文 参考訳(メタデータ) (2026-06-05T08:17:28Z) - FALAT: Tracing Failures in LLM Agent Trajectories via Dependency-Guided Search [11.638321375070047]
LLMエージェントトラジェクトリにおける障害帰属の診断フレームワークであるFALATを提案する。
我々は、アルゴリズム生成と手作りのマルチエージェント障害軌跡を含むWho&WhenベンチマークでFALATを評価する。
論文 参考訳(メタデータ) (2026-05-30T15:11:35Z) - AgentTrace: Causal Graph Tracing for Root Cause Analysis in Deployed Multi-Agent Systems [0.0]
本稿では,デプロイされたマルチエージェントAIシステムにおけるポストホック障害診断のための軽量因果トレースフレームワークであるAgentTraceを紹介する。
AgentTraceは、実行ログから因果グラフを再構築し、エラー発生から後方にトレースし、解釈可能な構造信号と位置信号を使って候補根本原因をランク付けする。
この結果から,因果トレースはエージェントシステムの信頼性と信頼性を向上させるための実践的な基盤となることが示唆された。
論文 参考訳(メタデータ) (2026-03-16T00:46:44Z) - AgentRx: Diagnosing AI Agent Failures from Execution Trajectories [9.61742219198197]
構造化されたAPI、インシデント管理、オープンなWeb/ファイルタスクにまたがる115の障害トラジェクトリのベンチマークをリリースする。
各トラジェクトリには、臨界障害ステップと、基底理論から派生したクロスドメイン障害分類のカテゴリが注釈付けされている。
本稿では,ドメインに依存しない自動診断フレームワークであるAgentRXについて述べる。
論文 参考訳(メタデータ) (2026-02-02T18:54:07Z) - Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection [59.04089915447622]
ForenAgentはインタラクティブなIFDフレームワークで、MLLMが検出対象に関するPythonベースの低レベルツールを自律的に生成、実行、洗練することができる。
人間の推論にインスパイアされた我々は、グローバルな認識、局所的な焦点、反復的探索、そして全体論的偏見を含む動的推論ループを設計する。
実験の結果,ForenAgent は IFD 課題に対する創発的なツール利用能力と反射的推論を示すことがわかった。
論文 参考訳(メタデータ) (2025-12-18T08:38:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。