論文の概要: ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents
- arxiv url: http://arxiv.org/abs/2606.31174v2
- Date: Thu, 02 Jul 2026 07:39:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.498727
- Title: ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents
- Title(参考訳): ClawArena-Team: 言語モデルエージェントにおけるサブエージェントオーケストレーションと動的ワークフローのベンチマーク
- Abstract要約: ClawArena-Teamは、41のマルチターン、マルチモーダル、マルチエージェントシナリオのベンチマークである。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
- 参考スコア(独自算出の注目度): 61.184954205350984
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Production large language-model (LLM) agents are increasingly deployed not as lone problem-solvers but as managers: a main model creates specialized subagents, delegates work, and orchestrates their parallel, asynchronous returns through dynamic workflows. Whether one model can actually run such a team is largely unmeasured: existing benchmarks score a policy's own task-solving or a fixed multi-agent system's emergent behavior, but none isolate the management ability of the single LLM acting as leader. We introduce ClawArena-Team, a benchmark of 41 multi-turn, multimodal, multi-directory scenarios spanning 258 evaluation rounds and 72 staged updates that measures this management ability. The main agent is deliberately constrained: it natively perceives only text and directly accesses only part of the workspace. It commands a fixed, locally served subagent pool, so score differences reflect management skill, not raw capability. All scoring is execution-based with no LLM judge: an overall score -- the Subagent-Management Score (SMS) -- multiplies task correctness by a least-privilege and modality-routing factor. Across twelve proprietary, community-hosted, and self-hosted models, experiments show that the management bottleneck is privilege granting rather than perception (no model exceeds 50% workspace-permission precision); that cost and management quality are decoupled (API cost spans over 100 times while the overall score spans under 4 times, with the cheapest open models on the Pareto frontier); and that most leaderboard scores cluster within a 9.9-point band while orchestration behaviors diverge by more than an order of magnitude. Code is available at https://github.com/aiming-lab/ClawArena.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、単独の問題解決者としてではなく、マネージャとしてますますデプロイされる。 メインモデルは、特別なサブエージェントを作成し、処理を委譲し、動的ワークフローを通じて並列で非同期なリターンをオーケストレーションする。
既存のベンチマークでは、ポリシー独自のタスク解決か、固定されたマルチエージェントシステムの創発的な振る舞いをスコア付けするが、リーダとして機能する単一のLLMの管理能力を分離することはない。
ClawArena-Teamは、258回の評価ラウンドにまたがる41のマルチターン、マルチモーダル、マルチディレクティブシナリオのベンチマークであり、72回の更新でこの管理能力を計測している。
テキストのみをネイティブに知覚し、ワークスペースの一部だけに直接アクセスする。
固定されたローカルなサブエージェントプールをコマンドするので、スコアの違いは管理スキルを反映し、生の能力ではない。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
12のプロプライエタリでコミュニティがホストし、自己ホストされたモデルにおいて、管理ボトルネックは知覚よりも特権を与える(モデルがワークスペース・パーミッションの精度を50%以上上回ることはない)こと、コストと管理品質が分離されていること(APIコストは100倍以上、全体的なスコアは4倍以下で、Paretoフロンティアでは最も安価なオープンモデルである)、そしてほとんどのリーダーボードは9.9ポイントのバンド内でクラスタをスコアし、オーケストレーションの振る舞いは桁違いにバラつきます。
コードはhttps://github.com/aiming-lab/ClawArenaで入手できる。
関連論文リスト
- DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers [0.0]
固定データセットではなく再利用可能なフレームワークであるDynamicMCPBenchを紹介する。
現実的な目標を生成し、それぞれの目標を追求し、成功軌道を記録し、その軌跡をパスに依存しない効果チェックポイントに蒸留し、最終的な答えにはない、それらの効果を再現するかどうかをエージェントにスコアする。
最強のエージェントでさえタスクの約半分しか解決せず、タスクの31%はモデル無しで解決され、必要なツールチェーンが長くなるにつれて精度が低下する。
論文 参考訳(メタデータ) (2026-07-10T12:25:57Z) - Benchmarking Open-Ended Multi-Agent Coordination in Language Agents [48.1363632826625]
Alemは、手続き的に生成されたコーディネーションタスク、ソフトな特殊化、コミュニケーション、制御可能なコーディネーションの難しさを、長い水平サバイバルの世界に埋め込む。
Craftaxライクなダイナミックス上に構築されたオープンなマルチエージェント協調のためのJAXベースのベンチマークである$alem$を紹介します。
論文 参考訳(メタデータ) (2026-06-06T21:13:43Z) - Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles [32.54156025863882]
強化学習駆動オーケストレーションフレームワークであるMaestroを紹介します。
Maestroは、階層的なモデルスキルレジストリ上でのシーケンシャルな意思決定プロセスとして、異質なマルチモーダルタスクを再構成する。
数学的推論,チャート理解,高分解能知覚,ドメイン固有分析を対象とする10の代表的なマルチモーダルベンチマークに対して,Maestroの評価を行った。
論文 参考訳(メタデータ) (2026-05-21T08:47:49Z) - Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows [67.92316850084575]
ワークフローエージェントのライブベンチマークであるClaw-Eval-Liveを紹介する。
各リリースは、公開ワークフロー要求信号から構築される。
Claw-Eval-Liveは実行トレース、監査ログ、サービス状態、実行後のワークスペースアーティファクトを記録する。
論文 参考訳(メタデータ) (2026-04-30T17:23:19Z) - AgentForge: Execution-Grounded Multi-Agent LLM Framework for Autonomous Software Engineering [3.2126925586839623]
第一級原理として実行基盤検証を導入する。
我々はこの原理をマルチエージェントフレームワークである AgentFORGE でインスタンス化する。
AgentFORGEtokenはSWE-BENCH Lite上で40.0%の解像度を達成する。
論文 参考訳(メタデータ) (2026-04-13T13:51:13Z) - Rethinking the Value of Multi-Agent Workflow: A Strong Single Agent Baseline [38.16649115214312]
一つのエージェントがKVキャッシュの再利用による効率上の利点を生かして均一性を実現できることを示す。
本稿では,単一エージェントの実行を自動的に調整し,推論コストを削減するアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-01-18T08:16:09Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPO [24.532870400949424]
現在の訓練方法は、システム内のすべてのエージェントに対して統一された大きな言語モデルを訓練する。
これにより、異なるエージェントの基本的な分布が異なるため、パフォーマンスが制限される可能性がある。
垂直多エージェントシステムに対するグループ相対ポリシー最適化の階層的拡張であるM-GRPOを提案する。
論文 参考訳(メタデータ) (2025-11-17T12:06:30Z) - Multi-Agent Tool-Integrated Policy Optimization [67.12841355267678]
大規模言語モデル(LLM)は、知識集約的かつ複雑な推論タスクに対して、多ターンツール統合計画にますます依存している。
既存の実装は通常、単一のエージェントに依存するが、コンテキスト長とノイズの多いツールレスポンスに悩まされる。
ツール統合マルチエージェントフレームワークの効果的な強化学習をサポートする方法はない。
論文 参考訳(メタデータ) (2025-10-06T10:44:04Z) - CodeAgents: A Token-Efficient Framework for Codified Multi-Agent Reasoning in LLMs [16.234259194402163]
マルチエージェント推論を符号化し、マルチエージェントシステムにおける構造化されたトークン効率の計画を可能にするプロンプトフレームワークであるCodeAgentsを紹介する。
その結果, 計画性能は一貫した改善がみられ, 基本となる自然言語よりも3~36ポイントの絶対的な向上が見られた。
論文 参考訳(メタデータ) (2025-07-04T02:20:19Z) - Multi-Agent Collaboration via Evolving Orchestration [55.574417128944226]
大規模言語モデル(LLM)は、様々な下流タスクで顕著な成果を上げているが、そのモノリシックな性質は複雑な問題解決におけるスケーラビリティと効率を制限している。
LLMに基づくマルチエージェントコラボレーションのためのパウチスタイルのパラダイムを提案し,タスク状態の進化に応じて,中央集権的なオーケストレータ("puppeteer")がエージェント("puppets")を動的に指示する。
クローズドドメインおよびオープンドメインシナリオの実験により,この手法は計算コストを低減し,優れた性能が得られることが示された。
論文 参考訳(メタデータ) (2025-05-26T07:02:17Z) - CRAB: Cross-environment Agent Benchmark for Multimodal Language Model Agents [49.68117560675367]
Crabは、クロス環境タスクをサポートするように設計された最初のベンチマークフレームワークである。
私たちのフレームワークは複数のデバイスをサポートし、Pythonインターフェースで簡単に任意の環境に拡張できます。
実験の結果、GPT-4oの1剤が38.01%の最高完成率を達成することが示された。
論文 参考訳(メタデータ) (2024-07-01T17:55:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。