論文の概要: PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows
- arxiv url: http://arxiv.org/abs/2605.18032v1
- Date: Mon, 18 May 2026 08:22:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:49.12006
- Title: PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows
- Title(参考訳): PROTEA:マルチエージェントLLMワークフローのオフライン評価と反復リファインメント
- Authors: Kazuki Kawamura, Satoshi Waki, Kei Tateno,
- Abstract要約: マルチエージェント LLM はシングルプロンプトベースラインよりも優れていることが多いが、デバッグや洗練は困難である。
マルチエージェントシステムのオフライン・テスト駆動型改善のための統一インターフェース PROTEA を提案する。
- 参考スコア(独自算出の注目度): 1.6429511119132734
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-agent LLM workflows -- systems composed of multiple role-specific LLM calls -- often outperform single-prompt baselines, but they remain difficult to debug and refine. Failures can originate from subtle errors in intermediate outputs that propagate to downstream nodes, requiring developers to inspect long traces and infer which agent to modify. We present PROTEA, a unified interface for offline, test-driven improvement of multi-agent workflows. PROTEA executes a workflow, scores intermediate node outputs with configurable rubrics, and overlays per-node states and rationales on the workflow graph to localize likely bottlenecks. To support complex systems where final-answer references are the primary supervision, PROTEA performs backward node evaluation: it generates candidate node-level expectations from final-answer references and graph context, then compares them with observed node outputs. For selected nodes, PROTEA presents targeted prompt revisions as editable before/after comparisons, then automatically reruns and re-evaluates the workflow to show output changes and score trajectories within the same interface. In two production-adjacent workflows, PROTEA improved document-inspection accuracy from 64.3% to 83.9% and recommendation Hit@5 from 0.30 to 0.38. In a formative study with six experienced LLM developers, participants valued graph-level localization, per-node rationales, and editable before/after prompt revisions.
- Abstract(参考訳): 複数のロール固有のLLMコールで構成されるマルチエージェントのLLMワークフローは、多くの場合、単一プロンプトベースラインよりも優れていますが、デバッグや洗練は難しいままです。
エラーは、下流ノードに伝播する中間出力の微妙なエラーから発生し、開発者は長いトレースを検査し、どのエージェントを変更するかを推測する必要がある。
マルチエージェントワークフローをオフラインでテスト駆動で改善するための統一インターフェース PROTEA を提案する。
PROTEAはワークフローを実行し、設定可能なルーリックで中間ノード出力をスコアし、ワークフローグラフ上のノードごとの状態と合理性をオーバーレイして、潜在的なボトルネックをローカライズする。
PROTEAは、最終回答参照とグラフコンテキストから候補ノードレベルの予測を生成し、観測ノード出力と比較する。
選択されたノードに対して、ProteAはターゲットのプロンプトリビジョンを編集可能な前後比較として提示し、ワークフローを自動的に再実行して再評価し、出力の変更を示し、同じインターフェイス内でトラジェクトリをスコアする。
2つのプロダクション対応ワークフローにおいて、PROTEAは文書検査の精度を64.3%から83.9%に改善し、Hit@5を0.30から0.38に推奨した。
経験豊富な6人のLLM開発者によるフォーマティブスタディでは、参加者はグラフレベルのローカライゼーション、ノードごとの合理性、修正前/後プロンプトの編集が重要だった。
関連論文リスト
- LLM-based Schema-Guided Extraction and Validation of Missing-Person Intelligence from Heterogeneous Data Sources [0.7734726150561088]
行方不明者や子どもの安全に関する調査は、構造化フォーム、掲示板スタイルのポスター、物語ウェブプロファイルなど、異種ケース文書に依存している。
レイアウト、用語、データ品質の変化は、急激なトリアージ、大規模分析、探索計画を妨げる。
本稿では、AIによる解析および正規化パイプラインであるGuardian Packを紹介し、マルチソース調査文書を統一されたスキーマ準拠の表現に変換する。
論文 参考訳(メタデータ) (2026-04-08T01:35:56Z) - Chimera: Latency- and Performance-Aware Multi-agent Serving for Heterogeneous LLMs [62.17306142810532]
ヘテロジニアスLSMクラスタ上で動作するマルチエージェントワークフローの予測スケジューリングシステムであるChimeraを提案する。
Chimeは最高のレイテンシをトレースし、エンドツーエンドのレイテンシを1.2-2.4$times$で削減し、タスクパフォーマンスを平均8.0-9.5ポイント改善する。
論文 参考訳(メタデータ) (2026-03-23T17:01:42Z) - Arrow-Guided VLM: Enhancing Flowchart Understanding via Arrow Direction Encoding [0.0]
フローチャートは、ソフトウェア設計とビジネスプロセス分析に欠かせないツールである。
現在の視覚言語モデル(VLM)は、方向矢印やグラフトポロジーをしばしば誤解している。
より広い3つのプロセスにグループ化された7段階のパイプラインを導入します。
論文 参考訳(メタデータ) (2025-05-09T04:27:36Z) - ComfyGPT: A Self-Optimizing Multi-Agent System for Comprehensive ComfyUI Workflow Generation [96.44354750396019]
ComfyGPTはタスク記述に基づいてComfyUIを生成するように設計された自動最適化マルチエージェントシステムである。
FlowDatasetは、13,571のワークフロー記述ペアを含む大規模なデータセットである。
FlowBenchはワークフロー生成システムを評価するためのベンチマークである。
論文 参考訳(メタデータ) (2025-03-22T06:48:50Z) - Benchmarking Agentic Workflow Generation [80.74757493266057]
複数面シナリオと複雑なグラフワークフロー構造を備えた統合ワークフロー生成ベンチマークであるWorfBenchを紹介する。
また,サブシーケンスとサブグラフマッチングアルゴリズムを利用したシステム評価プロトコルWorfEvalを提案する。
我々は、生成されたタスクが下流のタスクを強化し、推論中により少ない時間で優れたパフォーマンスを達成することを観察する。
論文 参考訳(メタデータ) (2024-10-10T12:41:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。