論文の概要: Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems
- arxiv url: http://arxiv.org/abs/2608.25920v2
- Date: Sat, 29 Aug 2026 11:11:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 13:34:07.656606
- Title: Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems
- Title(参考訳): 修復・再サンプリング : LLMマルチエージェントシステムにおける障害デバッグの再考
- Abstract要約: 我々は、MAS実行軌跡を記録し、介入アンカーを確立する制御された評価フレームワークであるSymTraceを紹介する。
リプレイ中は、記録されたログを使用してアンカーの前の実行を効果的に再構築し、下流の軌道のみを再生する。
その結果,既存の無誘導再走行法は信頼性が低く,故障の再現率や修復率も低いことが明らかとなった。
- 参考スコア(独自算出の注目度): 15.825635807363499
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As large language model (LLM)-based multi-agent systems (MASs) are increasingly applied to long-horizon complex tasks, their reliability has emerged as the core bottleneck hindering their real-world deployment. Existing MAS debugging and repair methods typically rely on rerunning and resampling the entire execution trajectory. However, a fundamental question remains to be answered: do these methods causally repair MAS failures or merely stochastically repair by leveraging the randomness of LLM sampling? To evaluate the effectiveness of MAS repair methods, we introduce SymTrace, a controlled evaluation framework that records the MAS execution trajectory and establishes intervention anchors. During replay, it effectively reconstructs the execution before the anchor using recorded logs and only regenerates the downstream trajectory, thereby enabling the reliable reproduction of MAS failures. We further construct the dataset SymFail, comprising 536 human-annotated failure trajectories with graph-linked locations, categories, and trace evidence. Based on these foundations, we conduct a large-scale empirical study across three mainstream MAS frameworks. Our findings reveal that existing unguided rerun methods are highly unreliable, exhibiting low failure reproduction and repair rates (only 67.97% and 6.90%, respectively). Building upon these findings, we further explore the effectiveness of a symptom-driven intervention method, which successfully repairs 20.15% of the failed cases (a 191.89% improvement to state-of-the-art repair methods). This study aims to provide actionable insights for MAS debugging and repair research, paving the way for the robust deployment of multi-agent systems.
- Abstract(参考訳): 大規模言語モデル (LLM) ベースのマルチエージェントシステム (MAS) は、長期にわたる複雑なタスクにますます適用されつつあるため、その信頼性は現実のデプロイメントを妨げる中核的なボトルネックとして浮上している。
既存のMASデバッギングとリカバリの方法は、通常、実行軌跡全体の再実行と再サンプリングに依存します。
これらの手法はMASの故障を因果的に修復するか、あるいはLSMサンプリングのランダム性を利用して単に確率的に修復するのか?
我々は,MAS修復手法の有効性を評価するために,MAS実行軌跡を記録し,介入アンカーを確立する制御評価フレームワークであるSymTraceを導入する。
リプレイ中は、記録されたログを使用してアンカー前の実行を効果的に再構築し、下流の軌道のみを再生し、MAS障害の信頼性の高い再生を可能にする。
さらに、グラフリンクされた位置、カテゴリ、およびトレースエビデンスを含む、536の人手による故障軌跡を含むデータセットSymFailを構築した。
これらの基礎に基づいて、3つの主要なMASフレームワークにわたる大規模な実証的研究を行う。
既往の無誘導再走行法は信頼性が低く, 修復率も67.97%, 修復率6.90%と低いことがわかった。
以上の結果をもとに,20.15%の症例の修復に成功した症状駆動型介入法の有効性について検討した(最先端修復法191.89%の改善)。
本研究は,マルチエージェントシステムのロバストな展開の道を開くことを目的として,MASデバッグと修復研究のための実用的な洞察を提供することを目的とする。
関連論文リスト
- Autonomous Repair for Multi-Agent Systems via Monte-Carlo Tree Search [4.313916831146957]
モンテカルロ木探索(MCTS)プロセスとしてMAS修復を定式化する検索ベースフレームワークを提案する。
我々はまた,1,310個の再生可能なマルチエージェント障害軌跡を持つ大規模MAS修復ベンチマークであるStateMASを紹介する。
論文 参考訳(メタデータ) (2026-07-31T06:18:48Z) - PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents [62.36339598951133]
PhoenixRepairは、複数の候補編集場所を探索し、より良いパッチを生成するマルチエージェントフレームワークである。
PhoenixRepairはDeepSeek-V3.1の下でSWE-agentよりも7.8%の最大の相対的改善を実現し、MiniMax-M2.5で76.0%のPass@1の最高分解率を達成した。
論文 参考訳(メタデータ) (2026-07-21T08:49:30Z) - Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents [80.03824805228719]
コンピュータ利用エージェントを開発する上での大きな課題は、大規模で高品質な軌道を収集することである。
我々は、失敗した軌道をエージェント改善に変換するデータ中心のパラダイムを提案する。
この手法をOSWorldベンチマーク上で,最先端のOpenCUA-72Bモデルを用いて検証する。
論文 参考訳(メタデータ) (2026-06-30T07:44:37Z) - Self-Healing Agentic Orchestrators for Reliable Tool-Augmented Large Language Model Systems [0.10210859604701106]
セルフヒーリングエージェントオーケストレータは、信頼性をランタイム境界制御問題として扱う。
セルフヒーリングは98.8%のタスク成功を達成し、リトライオンリーでは94.5%、フルリプランでは93.8%を達成している。
論文 参考訳(メタデータ) (2026-05-31T19:27:22Z) - Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis [68.28714988482703]
プロセス・リワード・モデル(PRM)は、LLM(Large Language Models)の推論能力を増強することに成功した。
本稿では,一般ドメインのPRMがデータ分析エージェントの監督に苦慮していることを示す。
本稿では,新しい環境対応生成プロセス報酬モデルであるDataPRMを紹介する。
論文 参考訳(メタデータ) (2026-04-27T09:00:30Z) - TraceCoder: A Trace-Driven Multi-Agent Framework for Automated Debugging of LLM-Generated Code [11.207330722400764]
人間の観察・分析・修復過程をエミュレートするフレームワークであるTraceCoderを提案する。
このフレームワークはまずコードを診断プローブで測定し、粒度の細かいランタイムトレースをキャプチャする。
その後、これらのトレースについて因果解析を行い、失敗の根本原因を正確に特定する。
論文 参考訳(メタデータ) (2026-02-06T16:59:48Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction [58.51530390018909]
大規模言語モデルに基づくマルチエージェントシステムは、協調的な問題解決において優れているが、エラーのカスケードには脆弱である。
我々は,MASにリアルタイム,教師なし,ステップレベルの誤り検出と自己補正を付与するメタ認知フレームワークMASCを提案する。
論文 参考訳(メタデータ) (2025-10-16T05:35:37Z) - Testing and Enhancing Multi-Agent Systems for Robust Code Generation [21.38351747327572]
自動コード生成のための有望なパラダイムとしてマルチエージェントシステム(MAS)が登場した。
繁栄と採用にもかかわらず、その頑丈さはいまだに過小評価されている。
本稿ではファジィテストによるコード生成のためのMASのロバスト性を検証した最初の総合的研究について述べる。
論文 参考訳(メタデータ) (2025-10-12T05:45:04Z) - Why Do Multi-Agent LLM Systems Fail? [87.90075668488434]
MAST-Dataは7つの人気のあるMASフレームワークで収集された1600以上の注釈付きトレースの包括的なデータセットである。
我々はMAST(Multi-Agent System Failure Taxonomy)を初めて構築する。
MASTとMAST-Dataを利用して、モデル(GPT4、Claude 3、Qwen2.5、CodeLlama)とタスク(コーディング、数学、汎用エージェント)の障害パターンを分析します。
論文 参考訳(メタデータ) (2025-03-17T19:04:38Z) - Transferable, Controllable, and Inconspicuous Adversarial Attacks on
Person Re-identification With Deep Mis-Ranking [83.48804199140758]
システム出力のランキングを乱す学習とミスランクの定式化を提案する。
また,新たなマルチステージネットワークアーキテクチャを開発することで,バックボックス攻撃を行う。
そこで本手法では, 異なるマルチショットサンプリングにより, 悪意のある画素数を制御することができる。
論文 参考訳(メタデータ) (2020-04-08T18:48:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。