論文の概要: Diagnosis-Driven Automatic Repair for Agentic Workflow via Symbolic Inference
- arxiv url: http://arxiv.org/abs/2607.02882v1
- Date: Fri, 03 Jul 2026 02:28:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 13:20:09.672971
- Title: Diagnosis-Driven Automatic Repair for Agentic Workflow via Symbolic Inference
- Title(参考訳): シンボリック推論によるエージェントワークフローの自動修復
- Abstract要約: FlowFixerは、診断駆動の自動修復フレームワークである。
私たちは、Dify、Coze、n8nという3つの一般的な開発プラットフォームから収集されたワークフロー障害についてFlowFixerを評価します。
その結果、FlowFixerは71.3%の修復成功率を達成し、最先端のベースラインを11.9%から27.6%上回る結果となった。
- 参考スコア(独自算出の注目度): 23.048678930743467
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Platform-orchestrated agentic workflows have become a popular paradigm for developing LLM-based applications. However, their reliability remains a major challenge due to the uncertainty of LLM outputs, complex inter-node dependencies, and heterogeneous tool interactions. Existing agentic workflow optimization and agent enhancement methods primarily rely on trajectory-level feedback. Without explicitly identifying the underlying failure root causes, their resulting repair plans are often insufficiently targeted. We propose FlowFixer, a diagnosis-driven automated repair framework for agentic workflows. FlowFixer first transforms workflow executions into unified symbolic traces and performs symbolic inference to derive executable behavioral specifications that capture node correctness, temporal dependencies, and causal relationships. Based on specification verification, it conducts failure attribution and root cause analysis, and then generates targeted repair patches. To reduce verification costs, FlowFixer further employs a multi-dimensional pre-execution assessment to filter infeasible repairs before dynamic verification. We evaluate FlowFixer on workflow failures collected from three popular development platforms: Dify, Coze and n8n. Results show that FlowFixer achieves a repair success rate of 71.3%, outperforming state-of-the-art baselines by 11.9% to 27.6%. It also improves failure attribution accuracy by 4.8% to 33.1% and root cause analysis accuracy by 15.3% to 38.8%. This work offers a new perspective on reliable diagnosis and repair of agentic workflows through symbolic modeling and inference.
- Abstract(参考訳): プラットフォーム指向のエージェントワークフローは、LLMベースのアプリケーションを開発するための一般的なパラダイムとなっている。
しかし、LLM出力の不確実性、複雑なノード間の依存関係、異種ツールの相互作用などにより、信頼性は依然として大きな課題である。
既存のエージェントワークフロー最適化とエージェント拡張方法は、主に軌道レベルのフィードバックに依存している。
根本原因を明示的に特定しなければ、結果として生じる修復計画は、しばしば不十分なターゲットとなる。
エージェントワークフローのための診断駆動自動修復フレームワークであるFlowFixerを提案する。
FlowFixerはまずワークフローの実行を統一されたシンボリックトレースに変換し、ノードの正確性、時間的依存関係、因果関係をキャプチャする実行可能な振る舞い仕様を導出するシンボリック推論を実行する。
仕様検証に基づいて、障害の帰属と根本原因分析を行い、ターゲットとする修復パッチを生成する。
検証コストを削減するため、FlowFixerはさらに、動的検証の前に非実用的な修復をフィルタするために、多次元の事前実行アセスメントを採用している。
私たちは、Dify、Coze、n8nという3つの一般的な開発プラットフォームから収集されたワークフロー障害についてFlowFixerを評価します。
その結果、FlowFixerは71.3%の修復成功率を達成し、最先端のベースラインを11.9%から27.6%上回る結果となった。
また、故障原因の精度を4.8%から33.1%改善し、根本原因分析の精度を15.3%から38.8%向上させた。
本研究は,シンボリックモデリングと推論によるエージェントワークフローの信頼性診断と修復に関する新たな視点を提供する。
関連論文リスト
- Beyond Generalist LLMs: Specialist Agentic Systems for Structured Code Workflow Execution [0.40631409309544836]
大規模言語モデル(LLM)は、ソフトウェア開発エージェントの採用を加速し、現在、統合開発環境(IDE)拡張やスタンドアロンアプリケーションとして広く利用されています。
これらのエージェントは一般的に汎用的であるが、専門家がさらなる開発努力を正当化するかどうかは不明だ。
ビジネスプロセス・モデルと表記法(BPMN)のダイアグラムを実行可能なエージェントに変換することに焦点を当て、ビジネスプロセスの自動化という文脈でこの問題を考察する。
論文 参考訳(メタデータ) (2026-07-16T01:06:38Z) - Can Large Language Models Generate Observability-Aware Code? [51.30941152293301]
本稿では,エージェント生成システムにおける可観測性に関する系統的研究を行う。
その結果,ソースレベルでの診断的セマンティクスと実行時の障害信号との間には,一貫したギャップがあることが判明した。
本稿では,診断的意味論と故障信号暴露の両方を改善するためのガイダンスとして,可観測性指向のスキルを導入する。
論文 参考訳(メタデータ) (2026-07-07T03:20:52Z) - From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws [12.757205456771295]
本稿では,エージェント故障の診断と修復を行うためのトレースガイドフレームワークであるHarnessFixを提案する。
HarnessFixは生の実行トレースをコンパイルし、コードをHarness対応のトレース中間表現に変換する。
障害の原因は、責任ある軌道ステップとレイヤの活用、繰り返し診断を実行可能な欠陥レコードに集約し、スコープ化された修復オペレータにマップすることにある。
論文 参考訳(メタデータ) (2026-06-04T15:58:30Z) - CausalFlow: Causal Attribution and Counterfactual Repair for LLM Agent Failures [4.061481215870679]
フェールエージェントトレースを最小限の偽物修復と再利用可能な監視に変換する介入フレームワークであるCausalFlowを紹介した。
CaulFlowは、最小限の振る舞いドリフトで障害から回復するターゲットテスト時修復と、オフラインの優先度最適化や報酬モデリングに適したトレーニング時間監視の2つの補完的な使用をサポートする。
論文 参考訳(メタデータ) (2026-05-25T01:47:01Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Structural Verification for Reliable EDA Code Generation without Tool-in-the-Loop Debugging [0.6843491191969066]
本稿では,ツール・イン・ザ・ループのデバッグを,実行前に構造的正しさを強制することで除去することを提案する。
シングルステップタスクでは,パスレートが73.0% (LLM+RAG) から76.4% (tool-in-loop) から82.5% に向上する。
マルチステップタスクでは、パスレートは30.0%から70.0%に改善され、さらに軌道レベルの反射で84.0%に改善される。
論文 参考訳(メタデータ) (2026-04-20T20:58:52Z) - TRAJEVAL: Decomposing Code Agent Trajectories for Fine-Grained Diagnosis [23.834704102474927]
コードエージェントはGitHubの問題を解決することができるが、失敗した場合、現在の評価は場所や理由を可視化しない。
本稿では,エージェントトラジェクトリを3つの解釈段階に分解する診断フレームワークTRAJEVALを紹介する。
我々はこれらの診断が予測可能であることを確認し、0.87-2.1% MAEでモデルレベルのPass@1予測を達成する。
論文 参考訳(メタデータ) (2026-03-25T05:27:03Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - AgentDropoutV2: Optimizing Information Flow in Multi-Agent Systems via Test-Time Rectify-or-Reject Pruning [34.06688334066569]
AgentDropoutV2は、再トレーニングせずにMAS情報フローを動的に最適化するために設計されたテスト時間修正またはリジェクトプルーニングフレームワークである。
提案手法は, アクティブファイアウォールとして機能し, エージェントの出力を遮断し, 反復的に誤りを訂正する検索拡張を利用する。
広範なベンチマークによる実験結果から、AgentDropoutV2はMASのタスク性能を大幅に向上させることが示された。
論文 参考訳(メタデータ) (2026-02-26T17:31:43Z) - The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality Check [54.08619694620588]
本稿では,2つの異なるエージェントパラダイムであるEmbodied AgentsとTool-Calling AgentsにまたがるdLLMの包括的評価を行う。
Agentboard と BFCL では,現在の dLLM が信頼できるエージェントバックボーンとして機能しないという,"ビットレッスン" が報告されている。
論文 参考訳(メタデータ) (2026-01-19T11:45:39Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction [58.51530390018909]
大規模言語モデルに基づくマルチエージェントシステムは、協調的な問題解決において優れているが、エラーのカスケードには脆弱である。
我々は,MASにリアルタイム,教師なし,ステップレベルの誤り検出と自己補正を付与するメタ認知フレームワークMASCを提案する。
論文 参考訳(メタデータ) (2025-10-16T05:35:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。