論文の概要: Beyond the All-in-One Agent: Benchmarking Role-Specialized Multi-Agent Collaboration in Enterprise Workflows
- arxiv url: http://arxiv.org/abs/2605.08761v1
- Date: Sat, 09 May 2026 07:47:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.869743
- Title: Beyond the All-in-One Agent: Benchmarking Role-Specialized Multi-Agent Collaboration in Enterprise Workflows
- Title(参考訳): オールインワンエージェントを超えて: エンタープライズワークフローにおける役割特化マルチエージェントコラボレーションのベンチマーク
- Authors: Tao Yu, Hao Wang, Changyu Li, Shenghua Chai, Minghui Zhang, Zhongtian Luo, Yuxuan Zhou, Haopeng Jin, Zhaolu Kang, Jiabing Yang, YiFan Zhang, Xinming Wang, Hongzhu Yi, Zheqi He, Jing-Shu Zheng, Xi Yang, Yan Huang, Liang Wang,
- Abstract要約: 大規模言語モデル(LLM)エージェントは、企業環境での運用がますます期待されている。
既存のベンチマークでは、幅広いツールアクセスを持つ単一のエージェントが評価されている。
企業におけるマルチエージェントコラボレーションを評価するベンチマークである textscEntCollabBench を紹介する。
- 参考スコア(独自算出の注目度): 24.72893952080658
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents are increasingly expected to operate in enterprise environments, where work is distributed across specialized roles, permission-controlled systems, and cross-departmental procedures. However, existing enterprise benchmarks largely evaluate single agents with broad tool access, while existing multi-agent benchmarks rarely capture realistic enterprise constraints such as role specialization, access control, stateful business systems, and policy-based approvals. We introduce \textsc{EntCollabBench}, a benchmark for evaluating enterprise multi-agent collaboration. \textsc{EntCollabBench} simulates a permission-isolated organization with 11 role-specialized agents across six departments and contains two evaluation subsets: a Workflow subset, where agents collaboratively modify enterprise system states, and an Approval subset, where agents make policy-grounded decisions. Evaluation is based on execution traces, database state verification, and deterministic policy adjudication rather than natural-language response judging. Experiments with representative LLM agents show that current models still struggle with end-to-end enterprise collaboration, especially in delegation, context transfer, parameter grounding, workflow closure, and decision commitment. \textsc{EntCollabBench} provides a reproducible testbed for measuring and improving agent systems intended for realistic organizational environments.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、専門的な役割、パーミッション制御システム、部門間プロシージャに分散したエンタープライズ環境での運用がますます期待されている。
しかし、既存のエンタープライズベンチマークは、幅広いツールアクセスを持つ単一のエージェントを主に評価する一方、既存のマルチエージェントベンチマークはロールの専門化、アクセス制御、ステートフルなビジネスシステム、ポリシーベースの承認といった現実的なエンタープライズ制約をほとんど捉えない。
企業におけるマルチエージェントコラボレーションを評価するためのベンチマークである,‘textsc{EntCollabBench} を紹介した。
\textsc{EntCollabBench}は、6つの部門で11のロール特殊化エージェントを持つ権限分離組織をシミュレートし、2つの評価サブセットを含む。
評価は、自然言語応答判定よりも、実行トレース、データベース状態検証、決定論的ポリシー適応に基づく。
代表的LLMエージェントによる実験によると、現在のモデルは、特にデリゲート、コンテキスト転送、パラメータグラウンド、ワークフローの閉鎖、決定のコミットメントにおいて、エンド・ツー・エンドのエンタープライズコラボレーションに苦戦している。
\textsc{EntCollabBench}は、現実的な組織環境を目的としたエージェントシステムの測定と改善のための再現可能なテストベッドを提供する。
関連論文リスト
- OrgAgent: Organize Your Multi-Agent System like a Company [75.47076168155817]
企業スタイルの階層型マルチエージェントフレームワークであるOrgAgentを紹介します。
企業スタイルの階層で組織されたマルチエージェントシステムは、一般的に他の組織構造よりも優れています。
論文 参考訳(メタデータ) (2026-04-01T15:21:14Z) - EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents [12.7922877987936]
EntWorldは6つの代表的なエンタープライズドメインにわたる1,756タスクからなる大規模なベンチマークである。
基礎となるデータベーススキーマからビジネスロジックを直接リバースエンジニアリングするスキーマ基底タスク生成フレームワークを提案する。
現状のモデルでは,EntWorldで47.61%の成功率を達成した。
論文 参考訳(メタデータ) (2026-01-25T06:58:15Z) - Beyond Task Completion: An Assessment Framework for Evaluating Agentic AI Systems [0.0]
エージェントAIの最近の進歩は、スタンドアロンの大規模言語モデルから統合システムへと焦点を移している。
LLM、メモリ、ツール、環境を含む4つの評価柱を持つエンドツーエンドのエージェントアセスメントフレームワークを提案する。
我々はこのフレームワークを、従来のメトリクスによる振る舞いの偏りを示す、代表的なAutonomous CloudOpsユースケースで検証する。
論文 参考訳(メタデータ) (2025-12-14T18:17:40Z) - Evaluating Generalization Capabilities of LLM-Based Agents in Mixed-Motive Scenarios Using Concordia [100.74015791021044]
大規模言語モデル(LLM)エージェントは、社会的相互作用の素晴らしい能力を実証している。
既存の評価手法は、これらの能力がいかに新しい社会的状況に一般化するかを測ることに失敗する。
我々は,NeurIPS 2024 Concordia Contestで,エージェントが相互利得を達成する能力について評価した経験的結果を示す。
論文 参考訳(メタデータ) (2025-12-03T00:11:05Z) - Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation [47.85891728056131]
PRDBenchは、20のドメインにわたる50の現実のPythonプロジェクトからなる、新しいベンチマークである。それぞれに構造化された製品要求文書(PRD)要件、包括的な評価基準、リファレンス実装がある。
我々はエージェント・アズ・ア・ジャッジ(Agen-as-a-Judge)パラダイムを用いてエージェントの出力を評価する。
論文 参考訳(メタデータ) (2025-10-28T12:26:45Z) - AgentCompass: Towards Reliable Evaluation of Agentic Workflows in Production [4.031479494871582]
本稿では,エージェントパイプラインのデプロイ後監視と推論に特化して設計された,最初の評価フレームワークであるAgentを紹介する。
Agentは、主要なメトリクスに関する最先端の結果を達成すると同時に、人間のアノテーションで見逃された重要な問題を明らかにする。
論文 参考訳(メタデータ) (2025-09-18T05:59:04Z) - Visual Document Understanding and Question Answering: A Multi-Agent Collaboration Framework with Test-Time Scaling [83.78874399606379]
テスト時間スケーリングを備えたマルチエージェント協調フレームワークであるMACTを提案する。
4つの異なる小規模エージェントから構成され、明確に定義された役割と効果的なコラボレーションがある。
一般および数学的タスクの能力を犠牲にすることなく、より小さなパラメータスケールで優れた性能を示す。
論文 参考訳(メタデータ) (2025-08-05T12:52:09Z) - AgentOrchestra: Orchestrating Hierarchical Multi-Agent Intelligence with the Tool-Environment-Agent(TEA) Protocol [22.406849007798858]
本稿では,環境,エージェント,ツールを統一システムに統合するツール-環境-エージェントプロトコルを提案する。
本稿では,複雑な目的を分解し,特殊エージェントをコーディネートする中央計画エージェントを備えた階層型マルチエージェントフレームワークであるAgensOrchestraを紹介する。
論文 参考訳(メタデータ) (2025-06-14T13:45:37Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents [59.825725526176655]
大規模言語モデル(LLM)は、自律的なエージェントとして顕著な能力を示している。
既存のベンチマークでは、単一エージェントタスクにフォーカスするか、狭いドメインに限定されており、マルチエージェントのコーディネーションと競合のダイナミクスを捉えていない。
多様な対話シナリオにまたがってLLMベースのマルチエージェントシステムを評価するためのベンチマークであるMultiAgentBenchを紹介する。
論文 参考訳(メタデータ) (2025-03-03T05:18:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。