論文の概要: It Takes Workflows to Evolve Better Workflows
- arxiv url: http://arxiv.org/abs/2610.01026v1
- Date: Thu, 01 Oct 2026 04:15:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.891396
- Title: It Takes Workflows to Evolve Better Workflows
- Title(参考訳): ワークフローを改善するにはワークフローが必要だ
- Abstract要約: FloWrightは階層的な構造対応報酬パラダイムで、1つのロールが自己進化し、2つ以上のロールが共進化し、追加のモデル、ラベル、実行が存在しない。
ドキュメント、スライド、チャート、コード、数学、ファイナンスタスク全体にわたって、FloWrightで訓練された小さなオープンモデルは、最大で7.41%のパフォーマンス向上を実現している。
- 参考スコア(独自算出の注目度): 45.107534542511765
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tackling complex real-world tasks can exceed the capabilities of a single large language model (LLM), motivating the use of multi-agent workflows that coordinate specialized agents to work together on these tasks. Recent methods train LLMs to construct better workflows from execution outcomes, but they optimize only the workflow generator, while the other agents that build or execute each workflow remain fixed even though every outcome depends on all of them. However, extending training beyond the generator is challenging: the agents are coupled, and a workflow's outcome is a single sparse score that cannot tell which agent causes a failure. We propose FloWright, which leverages the workflow as a harness to optimize workflows. By introducing a hierarchical, structure-aware reward paradigm, FloWright enables one role to self-evolve and two or more roles to co-evolve, with no additional models, labels, or executions. Considering the limitation that workflows are commonly trained and evaluated on data that a single agent can already handle, we further propose DataWright, an adaptive data hardening approach that converts existing datasets into workflow-level tasks with increased difficulty. Across document, slide, chart, code, math, and finance tasks, small open models trained with FloWright achieve improved performance by up to $+7.41\%$, with co-evolving ($+5.03\%$) more roles gaining more than optimizing one of them alone ($+2.83\%$). Our project page: https://xhguo7.github.io/FloWright/.
- Abstract(参考訳): 複雑な現実世界のタスクに取り組むことは、単一の大きな言語モデル(LLM)の能力を超え、特別なエージェントを協調してこれらのタスクに取り組むためのマルチエージェントワークフローの使用を動機付けます。
最近のメソッドでは、実行結果からより良いワークフローを構築するためにLLMをトレーニングしているが、ワークフロージェネレータのみを最適化する一方で、ワークフローをビルドまたは実行する他のエージェントは、すべての結果がすべての結果に依存しているにも関わらず、固定されている。
しかし、ジェネレータを超えてトレーニングを拡張することは難しい。エージェントは結合され、ワークフローの結果は、どのエージェントが障害を引き起こすかを判断できない単一のスパーススコアである。
ワークフローを最適化するためのハーネスとしてワークフローを活用するFloWrightを提案する。
階層的で構造を意識した報酬パラダイムを導入することで、FloWrightは1つのロールが自己進化し、2つ以上のロールが共進化し、追加のモデル、ラベル、実行がなくなる。
単一のエージェントがすでに扱えるデータに基づいて、ワークフローが一般的に訓練され評価される制限を考えると、既存のデータセットをワークフローレベルのタスクに変換する適応型データハードニングアプローチであるDataWrightをさらに提案する。
ドキュメント、スライド、チャート、コード、数学、ファイナンスタスク全体において、FloWrightでトレーニングされた小さなオープンモデルは、最大で$7.41\%$でパフォーマンスが向上し、共進化(+5.03\%$)以上のロールは、そのうちの1つだけを最適化する(+2.83\%$)以上のものを得る。
私たちのプロジェクトページは、https://xhguo7.github.io/FloWright/です。
関連論文リスト
- Pay for the Fault, Not the Flow: Label-Free In-Flow Multi-Agent Workflow Optimization [37.560391408471595]
InFlowOpは、エージェントの能力がエージェントが実行に要する時間に対してサブタスクが要求するものにどの程度満足するかを測る1つのラベルフリーなコストで、すべての決定を価格に設定する。
実行中、InFlowOpは、ビルド時と実行時の両方でワークフローを提供するのと同じコストで、最も安い動きの失敗を修正する。
さまざまなドメインやバックボーンを通じて、InFlowOpは単一のエージェントベースラインを最大$+11.97%$でパフォーマンスし、インフロー最適化で$+9.64%$を達成した。
論文 参考訳(メタデータ) (2026-10-01T04:01:23Z) - Designing Agentic AI Workflow Portfolios under Imperfect Selection and Compute Cost [6.605722864302966]
本稿では,企業が複数のワークフローを実行するポートフォリオ・アンド・セレクタパラダイムについて検討し,最終回答を選択する。
我々は、正確な定式化、線形プログラミング緩和、ランダム化されたラウンドリング手順、計算可能な性能証明を開発する。
最高のスタンドアロンワークフローとは対照的に、ポートフォリオ最適化では、それぞれ3.1、7.5、0.9ポイントのホールドアウトセレクタ精度が向上している。
論文 参考訳(メタデータ) (2026-09-16T05:02:11Z) - Learning to Compose for Cross-domain Agentic Workflow Generation [56.630382886594184]
クロスドメインワークフロー生成のためのオープンソースのLLMを作成します。
さまざまなドメインにわたる再利用可能なワークフロー機能のコンパクトなセットを学びます。
当社の1パスジェネレータは、20イテレーションを消費するSOTAリファインメントベースラインを超えています。
論文 参考訳(メタデータ) (2026-02-11T18:27:22Z) - Flow: Modularized Agentic Workflow Automation [53.073598156915615]
大規模言語モデル(LLM)を利用したマルチエージェントフレームワークは、自動計画とタスク実行において大きな成功を収めている。
しかし, 実行中のエージェントの効果的な調整は十分に研究されていない。
本稿では,エージェントによる継続的なワークフロー改善を可能にするアクティビティ・オン・頂点(AOV)グラフを定義する。
提案するマルチエージェントフレームワークは,サブタスクの効率的な同時実行,効果的なゴール達成,エラー耐性の向上を実現している。
論文 参考訳(メタデータ) (2025-01-14T04:35:37Z) - WorkflowLLM: Enhancing Workflow Orchestration Capability of Large Language Models [105.46456444315693]
ワークフローオーケストレーションにおける大規模言語モデルの能力を高めるための,データ中心のフレームワークであるLLMを提案する。
最初は106,763のサンプルで大規模な微調整Benchを構築し、28のカテゴリにわたる83のアプリケーションから1,503のAPIをカバーしている。
LlamaLlamaは複雑なAPIをオーケストレーションする能力を示しながら、優れた一般化性能を実現している。
論文 参考訳(メタデータ) (2024-11-08T09:58:02Z) - AFlow: Automating Agentic Workflow Generation [36.61172223528231]
大規模言語モデル(LLM)は、様々な領域にわたる複雑なタスクを解く上で、顕著な可能性を示している。
我々は、Monte Carlo Tree Searchを使って、この空間を効率的に探索する自動化フレームワークであるAFlowを紹介します。
6つのベンチマークデータセットに対する実証的な評価は、AFlowの有効性を示し、最先端のベースラインよりも平均5.7%向上している。
論文 参考訳(メタデータ) (2024-10-14T17:40:40Z) - Benchmarking Agentic Workflow Generation [80.74757493266057]
複数面シナリオと複雑なグラフワークフロー構造を備えた統合ワークフロー生成ベンチマークであるWorfBenchを紹介する。
また,サブシーケンスとサブグラフマッチングアルゴリズムを利用したシステム評価プロトコルWorfEvalを提案する。
我々は、生成されたタスクが下流のタスクを強化し、推論中により少ない時間で優れたパフォーマンスを達成することを観察する。
論文 参考訳(メタデータ) (2024-10-10T12:41:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。