論文の概要: Beyond LLM-Based Reasoning: Lightweight GNNs for Agent Failure Attribution
- arxiv url: http://arxiv.org/abs/2608.18575v1
- Date: Wed, 19 Aug 2026 06:16:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.30177
- Title: Beyond LLM-Based Reasoning: Lightweight GNNs for Agent Failure Attribution
- Title(参考訳): LLMに基づく推論を超えて: エージェント障害の帰属のための軽量GNN
- Abstract要約: 大規模言語モデル(LLM)ベースのマルチエージェントシステムは、しばしば複雑な障害モードを示す。
AFANetは、ステップレベルの意味信号とエージェントレベルの関係を通して相互作用軌跡をモデル化する軽量なグラフベースのフレームワークである。
以上の結果から, エージェント障害の効果的な帰属は大きな推論を必要とせず, 軽量で構造化されたアプローチで高い性能を達成できることが示唆された。
- 参考スコア(独自算出の注目度): 47.70578021328887
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM)-based multi-agent systems (MAS) often exhibit complex failure modes, which frequently cause agents to produce incorrect outcomes. This motivates the task of Agent Failure Attribution: given a failed multi-agent trajectory, identify the faulty agents and their corresponding error types. Existing approaches predominantly rely on LLMs to perform failure attribution, either through direct prompting, fine-tuning on synthetic data or complex agentic pipelines. While effective, these methods incur substantial computational overhead due to long-context processing, expensive post-training and handcrafted workflows. Moreover, empirical evidence shows that even state-of-the-art models achieve limited accuracy on existing benchmarks, suggesting that scaling model size alone is insufficient. In this work, we revisit this task and question the necessity of such expensive generative solutions. We introduce AFANet, a lightweight graph-based framework that models interaction trajectories through step-level semantic signals and agent-level relationships. We show that with significantly fewer parameters and near-zero inference cost, AFANet (i) matches or outperforms LLM-based baselines, including fine-tuned models on in-domain benchmarks, (ii) maintains robust performance across different GNN architectures and (iii) can be further improved with inexpensive test-time adaptation on the OOD benchmark. Our results suggest that effective agent failure attribution does not require heavy LLM reasoning and a lightweight, structured approach can achieve strong performance.
- Abstract(参考訳): 大規模言語モデル(LLM)ベースのマルチエージェントシステム(MAS)は、しばしば複雑な障害モードを示し、エージェントが誤った結果をもたらす。
これはAgens Failure Attributionのタスクを動機付けている: 失敗したマルチエージェントの軌道が与えられた場合、障害エージェントとその対応するエラータイプを識別する。
既存のアプローチは、直接的なプロンプト、合成データへの微調整、複雑なエージェントパイプラインを通じて、失敗の帰属をLCMに頼っている。
効果はあるものの、これらの手法は長いコンテキスト処理、高価な後処理、手作りのワークフローによってかなりの計算オーバーヘッドを発生させる。
さらに、実証的な証拠は、最先端モデルでさえ既存のベンチマークで限られた精度で達成できることを示し、スケールモデルのサイズだけでは不十分であることを示唆している。
本稿では,この課題を再考し,このような高価な生成ソリューションの必要性に疑問を呈する。
AFANetは、ステップレベルの意味信号とエージェントレベルの関係を通して相互作用軌跡をモデル化する軽量なグラフベースのフレームワークである。
パラメータが大幅に少なく、ほぼゼロの推論コストで、AFANetは、
i) LLMベースのベースライン(ドメイン内のベンチマークで微調整されたモデルを含む)にマッチまたはパフォーマンスが向上する。
(ii)異なるGNNアーキテクチャで堅牢なパフォーマンスを維持します。
(iii)OODベンチマークの安価なテスト時間適応によりさらに改善することができる。
提案手法は, LLM推論を必要とせず, 軽量かつ構造化された手法により高い性能が得られることを示唆する。
関連論文リスト
- Detect Before You Attribute: Cascade Failure Attribution for Multi-Agent Systems [27.57915091923977]
DUOTRACEはLLMベースの障害属性に対するプラグアンドプレイ検出フィルタである。
最初は異常な実行を検出し、下流の帰属法に焦点を絞った軌道証拠を提供する。
実験によると、DUOTRACEはエージェントレベルとステップレベルの属性の精度をそれぞれ8.7%と7.0%改善している。
論文 参考訳(メタデータ) (2026-08-30T08:17:42Z) - From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents [75.69180947909148]
大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
論文 参考訳(メタデータ) (2026-08-17T01:40:14Z) - VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems [79.51005192758262]
大規模言語モデル駆動型マルチエージェントシステムは複雑なタスクで優れている。
しかし、信頼性の低いエージェントは、システムレベルの信頼性にとって重要なボトルネックである。
本稿では,エージェント故障の帰属に関する仮説検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T14:09:35Z) - FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments [60.3427704389541]
大規模言語モデルは、自律エージェントの意思決定コアとして、ますます多くデプロイされている。
しかし、会話のベンチマークでは、誤った意思決定のカスケード効果のために、これらのエージェントは頻繁に失敗する。
これらの課題に対処するために、Failure-Aware Meta-Agenticフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-28T02:21:53Z) - AgentCollab: A Self-Evaluation-Driven Collaboration Paradigm for Efficient LLM Agents [37.232397795331444]
我々は,エージェント実行中に異なる推論能力を持つモデルを動的にコーディネートする,自己駆動型協調推論フレームワークであるAgenCollabを提案する。
外部ルーティングモジュールに頼る代わりに、このフレームワークはエージェント自身の自己反射信号を使用して、現在の推論軌道が有意義な進歩を遂げているかどうかを判断する。
論文 参考訳(メタデータ) (2026-03-27T03:07:34Z) - Confidence-Guided Stepwise Model Routing for Cost-Efficient Reasoning [20.41220110321494]
コスト効率の良い推論のための信頼誘導ステップワイドモデルルーティングを提案する。
STEERはドメインに依存しないフレームワークで、小さくて大きな言語モデル間のきめ細かいステップレベルのルーティングを実行する。
その結果,モデルルーティングのための堅牢でドメインに依存しない信号として,モデル内部信頼が確立された。
論文 参考訳(メタデータ) (2025-11-09T02:33:08Z) - RAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic Retrieval Augmented Generation Systems [31.4909149697414]
Retrieval-Augmented Generation (RAG) はLarge Language Models (LLM) の重要な制限を緩和する
最近の研究はエージェントRAGシステムを通じてこのパラダイムを拡張しており、LLMは複雑なクエリを反復的に計画、検索、推論するエージェントとして機能する。
本稿では,エージェントRAGにおける中間タスクの微粒化評価のための機能指向ベンチマークであるRAGCap-Benchを提案する。
論文 参考訳(メタデータ) (2025-10-15T04:13:00Z) - Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models [99.85131798240808]
我々はtextitGuided Topology Diffusion (GTD) と呼ばれる新しい生成フレームワークを導入する。
条件付き離散グラフ拡散モデルにインスパイアされたGTD式は、反復的な構成過程としてトポロジー合成を行う。
各ステップで生成は、多目的報酬を予測する軽量プロキシモデルによって制御される。
実験により、GTDは高いタスク適応性、スパース、効率的な通信トポロジを生成できることが示されている。
論文 参考訳(メタデータ) (2025-10-09T05:28:28Z) - AMAS: Adaptively Determining Communication Topology for LLM-based Multi-Agent System [19.336020954831202]
大規模言語モデル (LLM) は自然言語処理能力に革命をもたらし、産業問題解決のための自律型マルチエージェントシステム (MAS) として実践的に実装されている。
我々は、新しい動的グラフデザイナを通じてLLMベースのMASを再定義するパラダイムシフトフレームワークであるAMASを紹介する。
AMASは個々の入力の固有の特性を利用して、タスク最適化エージェント経路を介してインテリジェントにクエリトラジェクトリをクエリする。
論文 参考訳(メタデータ) (2025-10-02T02:50:22Z) - Agentic Reinforced Policy Optimization [66.96989268893932]
検証可能な報酬付き大規模強化学習(RLVR)は,大規模言語モデル(LLM)を単一ターン推論タスクに活用する効果を実証している。
現在のRLアルゴリズムは、モデル固有のロングホライゾン推論能力と、マルチターンツールインタラクションにおけるその習熟性のバランスが不十分である。
エージェント強化ポリシー最適化(ARPO: Agentic Reinforced Policy Optimization)は,マルチターンLDMエージェントを学習するためのエージェントRLアルゴリズムである。
論文 参考訳(メタデータ) (2025-07-26T07:53:11Z) - Boosting LLM-based Relevance Modeling with Distribution-Aware Robust Learning [14.224921308101624]
本稿では,関係モデリングのための新しい分布認識ロバスト学習フレームワーク(DaRL)を提案する。
DaRLはAlipayの保険商品検索のためにオンラインで展開されている。
論文 参考訳(メタデータ) (2024-12-17T03:10:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。