論文の概要: AgentFactory: Towards Automated Agentic System Design and Optimization
- arxiv url: http://arxiv.org/abs/2609.01045v1
- Date: Tue, 01 Sep 2026 10:45:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.58409
- Title: AgentFactory: Towards Automated Agentic System Design and Optimization
- Title(参考訳): AgentFactory: 自動エージェントシステム設計と最適化を目指して
- Authors: Enci Zhang, Haofeng Wang, Yuesheng Zhu, Xiaole Cui, Guibo Luo,
- Abstract要約: AgentFactoryは、エージェントシステムの基盤モデルとワークフロー構造を共同で最適化するフレームワークである。
我々は、一般的な推論、コーディング、数学、医学、ファイナンスを含む5つの領域にまたがる8つのベンチマークでAgenFactoryを評価した。
我々の実験は、AgentFactoryが手作業で設計した手法と既存の自動化アプローチの両方を一貫して上回っていることを示した。
- 参考スコア(独自算出の注目度): 19.84664549514199
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) have demonstrated remarkable capabilities as powerful components in agentic systems, enabling sophisticated reasoning and complex task execution. However, current approaches to manually designing and optimizing agentic systems heavily rely on manual effort, limiting their adaptability and scalability. Recent work has explored the automated optimization of workflow designs. However, these approaches often overlook the crucial role of model capabilities and focus on single performance metrics, failing to address real-world deployment constraints. In this paper, we present AgentFactory, a framework that jointly optimizes both foundation models and workflow structures in agentic systems while considering multiple objectives including performance, cost, and efficiency. AgentFactory leverages advanced LLMs as optimizers to navigate the vast search space of possible configurations, employing a three-stage optimization pipeline to automatically discover effective combinations of fine-tuned models and optimized workflows. Through an iterative optimization process, our framework systematically explores and evaluates different agentic system designs, adapting to task-specific requirements while maintaining operational efficiency. We evaluate AgentFactory across eight benchmarks spanning five domains, including general reasoning, coding, mathematics, medicine, and finance. Our experiments demonstrate that AgentFactory consistently outperforms both manually designed methods and existing automated approaches, achieving an average improvement of 9.1% across all benchmarks, with particularly significant gains in domain-specific tasks (19.6% on MedQA and 18.7% on FinEval). These results establish AgentFactory as a promising approach for developing more capable and efficient agentic systems through automated optimization.
- Abstract(参考訳): 大規模言語モデル(LLM)はエージェントシステムの強力なコンポーネントとして優れた機能を示しており、洗練された推論と複雑なタスク実行を可能にしている。
しかしながら、エージェントシステムを手動で設計し、最適化するための現在のアプローチは、手作業に大きく依存し、適応性とスケーラビリティを制限している。
最近の研究はワークフロー設計の自動化について検討している。
しかしながら、これらのアプローチはモデル機能の重要な役割を見落とし、実際のデプロイメント制約に対処できず、単一のパフォーマンスメトリクスに集中することが多い。
本稿では,エージェントシステムの基盤モデルとワークフロー構造を協調的に最適化するフレームワークであるAgentFactoryを提案する。
AgentFactoryは、高度なLCMを活用して、可能な構成の広大な検索スペースをナビゲートし、3段階最適化パイプラインを使用して、微調整されたモデルと最適化されたワークフローの効果的な組み合わせを自動的に検出する。
本フレームワークは,反復最適化プロセスを通じて,作業効率を維持しつつ,タスク固有の要求に適応し,異なるエージェントシステム設計を体系的に検討し,評価する。
我々は、一般的な推論、コーディング、数学、医学、ファイナンスを含む5つの領域にまたがる8つのベンチマークでAgenFactoryを評価した。
我々の実験は、AgentFactoryが手作業で設計した手法と既存の自動化アプローチの両方を一貫して上回り、すべてのベンチマークで平均9.1%の改善を実現し、特にドメイン固有のタスク(MedQAでは19.6%、FinEvalでは18.7%)が顕著に向上していることを示した。
これらの結果から,AgentFactoryは,自動最適化によってより有能で効率的なエージェントシステムを開発するための有望なアプローチとして確立された。
関連論文リスト
- From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents [90.3279207163486]
EvoSOPは、エージェントが実行軌跡からSOPを抽出し、反復的にツールセットを最適化することを可能にするフレームワークである。
EvoSOPはタスク成功率を大幅に向上し,インタラクションラウンドの回数を大幅に削減することを示す。
論文 参考訳(メタデータ) (2026-07-08T12:09:49Z) - Learning to Construct Practical Agentic Systems [23.70604962978331]
フィールド化されたエージェントシステムの研究により、生産システムはより単純さ、制御可能性、推論コストの予測可能性といった問題に重点を置いていることが示されている。
エージェントシステムにおいて,設計者がモジュール性を強制できるエージェントフレームワークについて述べる。
論文 参考訳(メタデータ) (2026-05-29T16:02:26Z) - LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering [90.84806758077536]
textbfLoCoBench-Agentは,大規模言語モデル(LLM)エージェントを現実的,長期的ソフトウェア工学で評価するための総合的な評価フレームワークである。
我々のフレームワークは、LoCoBenchの8000のシナリオを対話型エージェント環境に拡張し、マルチターン会話の体系的評価を可能にする。
我々のフレームワークは,8つの特殊なツール(ファイル操作,検索,コード解析)をエージェントに提供し,それを10Kから1Mトークンの範囲で評価する。
論文 参考訳(メタデータ) (2025-11-17T23:57:24Z) - ORFS-agent: Tool-Using Agents for Chip Design Optimization [0.8088986164437757]
大規模言語モデル(LLM)は、このような高次元最適化タスク内で学習と推論を行う新しい機会を提供する。
LLMをベースとした反復最適化エージェントORFS-agentを導入し,パラメータチューニングをオープンソースのハードウェア設計フローで自動化する。
2つの異なる技術ノードと様々な回路ベンチマークに関する実証的な評価は、ORFSエージェントがルーティングされたワイヤ長と有効クロック期間の両方を13%以上改善できることを示している。
論文 参考訳(メタデータ) (2025-06-10T01:38:57Z) - AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search [58.98450205734779]
大規模言語モデル(LLM)エージェントは、多様なドメインにまたがる強力な機能を示している。
既存のエージェントサーチ手法には3つの大きな制限がある。
これらの課題に対処するための包括的なフレームワークを導入します。
論文 参考訳(メタデータ) (2025-06-06T12:07:23Z) - Towards more Contextual Agents: An extractor-Generator Optimization Framework [0.0]
LLM(Large Language Model)ベースのエージェントは、幅広い汎用アプリケーションにわたる複雑なタスクの解決に顕著な成功を収めている。
しかしながら、それらのパフォーマンスは、専門産業や研究領域のようなコンテキスト固有のシナリオで劣化することが多い。
この課題に対処するため,本研究では,LLMエージェントの文脈適応性を高めるための体系的アプローチを提案する。
論文 参考訳(メタデータ) (2025-02-18T15:07:06Z) - Flow: Modularized Agentic Workflow Automation [53.073598156915615]
大規模言語モデル(LLM)を利用したマルチエージェントフレームワークは、自動計画とタスク実行において大きな成功を収めている。
しかし, 実行中のエージェントの効果的な調整は十分に研究されていない。
本稿では,エージェントによる継続的なワークフロー改善を可能にするアクティビティ・オン・頂点(AOV)グラフを定義する。
提案するマルチエージェントフレームワークは,サブタスクの効率的な同時実行,効果的なゴール達成,エラー耐性の向上を実現している。
論文 参考訳(メタデータ) (2025-01-14T04:35:37Z) - A Multi-AI Agent System for Autonomous Optimization of Agentic AI Solutions via Iterative Refinement and LLM-Driven Feedback Loops [3.729242965449096]
本稿では,産業間におけるエージェントAIソリューションを自律的に最適化するフレームワークを提案する。
このフレームワークは、仮説を自律的に生成し、テストすることで、人間の入力なしに最適な性能を達成する。
ケーススタディでは、アウトプットの品質、妥当性、動作性が大幅に改善された。
論文 参考訳(メタデータ) (2024-12-22T20:08:04Z) - A Dynamic LLM-Powered Agent Network for Task-Oriented Agent Collaboration [55.35849138235116]
本稿では,様々なタスクやドメインに対する動的コミュニケーション構造において,候補からエージェントのチームを自動的に選択する手法を提案する。
具体的には, LLMを利用したエージェント協調のための動的LLMパワーエージェントネットワーク(textDyLAN$)というフレームワークを構築した。
我々は、コード生成、意思決定、一般的な推論、算術的推論タスクにおいて、適度な計算コストで、DyLANが強力なベースラインを上回ることを実証する。
論文 参考訳(メタデータ) (2023-10-03T16:05:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。