論文の概要: DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows
- arxiv url: http://arxiv.org/abs/2608.26546v1
- Date: Thu, 27 Aug 2026 02:36:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.217926
- Title: DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows
- Title(参考訳): DuMateBench: 複雑な実世界のワークフローにおける自律エージェントの評価
- Authors: Zechun Niu, Yukun Zhao, Jiaxin Zhang, Xu Shen, Jinhua Si, Han Tian, Can Xu, Yunfan Song, Jiaxin Mao, Yansong Gao, Yuchen Li, Jianmin Wu, Lingyong Yan, Shuaiqiang Wang, Dawei Yin,
- Abstract要約: 我々はDuMateBenchを紹介した。DuMateBenchは匿名化およびプライバシスクリーニングによるユーザセッションから再構築されたリアルセッションベンチマークである。
結果として得られたベンチマークは、8つの広いシナリオにまたがる200のタスクと、17のきめ細かい機能カテゴリで構成されている。
これらのタスクは、Isufficient、Unstable、Noisyの3種類の環境複雑性を注入した、分離されたDockerコンテナで実行します。
- 参考スコア(独自算出の注目度): 69.12339622053588
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous agents are increasingly adopted to complete complex, multi-tool workflows in real-world settings. However, existing benchmarks typically separate tasks by application or capability and evaluate agents in environments that are cleaner and more stable than those encountered in practice. We introduce DuMateBench, a real-session benchmark reconstructed from anonymized and privacy-screened user sessions collected from a large-scale production agent platform. Each task preserves the relevant pre-solution interaction history, persistent configurations, and workspace state, and is then validated through human verification. The resulting benchmark comprises 200 tasks spanning 8 broad scenarios and 17 fine-grained capability categories, with most tasks requiring multiple capability coordination. We execute these tasks in isolated Docker containers injected with three forms of real-world environmental complexity: Insufficient, Unstable, and Noisy, and assess performance using a hybrid deterministic and LLM-as-Judge evaluation protocol. Experiments across five representative autonomous-agent frameworks paired with four state-of-the-art LLMs reveal substantial gaps in strict task completion. Complementary robustness, efficiency, and diagnostic analyses further show that performance under environmental perturbations is jointly shaped by the capabilities of the LLM and the surrounding agent framework. The code and data are publicly available at https://dumatebench.com/.
- Abstract(参考訳): 自律エージェントは、現実の環境で複雑なマルチツールワークフローを完成させるために、ますます採用されている。
しかし、既存のベンチマークは通常、アプリケーションや能力によってタスクを分離し、実際に遭遇したエージェントよりもクリーンで安定した環境でエージェントを評価する。
我々は、大規模なプロダクションエージェントプラットフォームから収集された匿名化およびプライバシスクリーニングされたユーザセッションから再構成された、実際のセッションベンチマークであるDuMateBenchを紹介する。
各タスクは、関連するソリューション前のインタラクション履歴、永続的な構成、ワークスペースの状態を保持し、人間の検証によって検証される。
結果として得られたベンチマークは、8つの広いシナリオにまたがる200のタスクと17のきめ細かい機能カテゴリで構成され、ほとんどのタスクは複数の機能調整を必要とする。
これらのタスクは、実世界の3種類の環境難易度、不安定性、ノイズの3つの形式で注入された分離されたDockerコンテナで実行し、ハイブリッド決定性およびLCM-as-Judge評価プロトコルを使用してパフォーマンスを評価する。
最先端の4つのLLMと組み合わせた5つの代表的自律エージェントフレームワークを対象とした実験は、厳密なタスク完了において大きなギャップを顕在化している。
補完的ロバスト性, 効率, および診断分析により, 環境摂動下での性能は, LLMと周辺エージェントフレームワークの能力により, 共同で形成されていることが明らかとなった。
コードとデータはhttps://dumatebench.com/で公開されている。
関連論文リスト
- SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle [46.833916047516716]
SWE-Cycleは、489の厳格な自動コードエージェントのインスタンスのベンチマークである。
SWE-Judgeは静的コードレビューと動的テストを組み合わせて機能的正当性を正確に検証する。
その結果、分離されたタスクからFullCycle実行に移行する際の解決率の急落が明らかになった。
論文 参考訳(メタデータ) (2026-05-13T08:05:16Z) - Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning [62.499592503950026]
大規模言語モデル(LLM)は、ツールや環境とのマルチターンインタラクションを必要とする複雑なタスクを実行するために、自律エージェントに権限を与えている。
完全合成環境生成パイプラインであるエージェント・ワールド・モデル(AWM)を提案する。
私たちは、エージェントがリッチなツールセットと対話できる、毎日のシナリオをカバーする1,000の環境にスケールします。
論文 参考訳(メタデータ) (2026-02-10T18:55:41Z) - VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications [20.065087936770215]
実世界の環境に根ざした多目的対話型タスクのエージェントを評価するベンチマークであるVitaBenchを紹介する。
VitaBenchは、66のツールを含む、これまでで最も複雑な生命維持シミュレーション環境を持つエージェントを提示する。
総合評価の結果,最も先進的なモデルでさえ,クロスシナリオタスクにおいて30%の成功率しか達成できないことがわかった。
論文 参考訳(メタデータ) (2025-09-30T16:33:49Z) - CRAB: Cross-environment Agent Benchmark for Multimodal Language Model Agents [49.68117560675367]
Crabは、クロス環境タスクをサポートするように設計された最初のベンチマークフレームワークである。
私たちのフレームワークは複数のデバイスをサポートし、Pythonインターフェースで簡単に任意の環境に拡張できます。
実験の結果、GPT-4oの1剤が38.01%の最高完成率を達成することが示された。
論文 参考訳(メタデータ) (2024-07-01T17:55:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。