論文の概要: Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
- arxiv url: http://arxiv.org/abs/2606.14397v1
- Date: Fri, 12 Jun 2026 12:32:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 16:00:42.896283
- Title: Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
- Title(参考訳): Gauntletの実行: 慣れ親しんだ環境を超えたエージェントの能力の再評価
- Abstract要約: GauntletBenchは、挑戦的なシナリオでエージェントの一般化を評価するためのWebベースのベンチマークである。
調査されていない5つのプロフェッショナルアプリケーションにわたる3つの機能(時間的知覚、グラフィカルな理解、そして3D推論)に焦点を当てている。
実験結果から,フロンティアエージェントシステムは人間レベルの性能を達成するには程遠いことが判明した。
- 参考スコア(独自算出の注目度): 67.2234316079859
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: As agentic systems continue to evolve and are widely deployed in real-world scenarios, there is a growing demand to faithfully evaluate their capabilities. However, current benchmarks are typically built on popular applications with relatively simple tasks and focus on a narrow set of capabilities while overlooking broader dimensions, resulting in saturated performance on modern agents and failing to probe their limitations. To this end, we introduce GauntletBench, a web-based benchmark for evaluating agent generalisation in challenging scenarios, focusing on three underexplored capabilities (temporal perception, graphical understanding, and 3D reasoning), across five less-covered professional applications (Video Editor, Workflow Builder, 3D Modeller, Flight Analyser, and Circuit Designer), each with 20 vision-intensive tasks (100 in total). Our benchmark provides a modular pipeline that comprises an environment compatible with both open- and closed-source agent frameworks, a controlled web-based application, a well-structured task suite, and an automated evaluation engine with diverse metrics. Contrary to widespread expectations, our empirical results reveal that frontier agentic systems remain far from achieving human-level performance. Even the state-of-the-art agent achieves only a 19.1% success rate on our GauntletBench, highlighting the limitations in these overlooked capabilities and generalisation. By comparison, non-expert human annotators achieve over 80% success on our challenging yet feasible tasks, revealing the substantial gap between current agent capabilities and those required for complex real-world scenarios.
- Abstract(参考訳): エージェントシステムは進化を続け、現実世界のシナリオに広くデプロイされているため、その能力を忠実に評価する需要が高まっています。
しかしながら、現在のベンチマークは一般的に、比較的単純なタスクを持つ一般的なアプリケーション上に構築され、より広い次元を見渡しながら、限られた機能セットに焦点を合わせ、現代のエージェントに飽和したパフォーマンスをもたらし、それらの制限を調査することができない。
この目的のために、GuntletBenchというウェブベースでエージェントの一般化を挑戦シナリオで評価するベンチマークを導入し、未発見の機能(時間知覚、グラフィカルな理解、そして3D推論)を5つのプロアプリケーション(ビデオエディタ、ワークフロービルダー、3Dモデルラー、フライトアナライザ、サーキットデザイナ)に分けて、20の視覚集約タスク(合計100)に焦点をあてた。
我々のベンチマークでは、オープンソースのエージェントフレームワークとクローズドソースのエージェントフレームワーク、制御されたWebベースアプリケーション、よく構造化されたタスクスイート、さまざまなメトリクスを備えた自動評価エンジンと互換性のある環境を含むモジュールパイプラインを提供しています。
広範な期待とは対照的に、我々の経験的結果は、フロンティアエージェントシステムは人間レベルのパフォーマンスを達成するには程遠いままであることを示している。
最先端のエージェントでさえ、GauntletBenchでわずか19.1%の成功率しか達成せず、見落とされた機能と一般化の限界を強調している。
比較すると、熟練していない人間のアノテータは、難しいが実現不可能なタスクで80%以上の成功を達成し、現在のエージェント能力と複雑な現実世界のシナリオに必要なものの間に大きなギャップが浮かび上がっています。
関連論文リスト
- StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows [63.57092302641323]
textbfStartupBenchは、市場価値の高いAIスタートアップ製品に根ざしたE2Eエージェントベンチマークである。
我々は、AIが現実的な需要を確立した現実的なタスクを特定するために、製品やユーザとともに、AI製品の採用を実証して研究する。
以上の結果から,現在の汎用エージェントの信頼性を超越した,市場価値の高いエージェントが多数存在することが明らかとなった。
論文 参考訳(メタデータ) (2026-08-18T14:01:32Z) - UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks [43.36285223987099]
動的で現実的な設定でプロアクティブエージェントを評価するための最初の能力駆動型ベンチマークであるUniClawBenchを紹介する。
UniClawBenchは、Skill Usage、Exploration、Long-Context Reasoning、Multimodal Understanding、Cross-Platform Coordinationの5つの実行モデル機能を中心に構築されている。
静的で記録された回答に依存する以前のベンチマークとは異なり、我々のベンチマークは、詳細なステップバイステップの完了チェックポイントを使用して、Dockerコンテナ内のエージェントを評価します。
論文 参考訳(メタデータ) (2026-07-09T17:59:32Z) - WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation [26.889929086766003]
Webエージェントは、タスクの自動実行の能力をますます示しています。
既存のベンチマークでは、スケールが不十分で、ドメインの多様性が制限されている。
800のWebサイトと1,550のタスクを含む大規模なベンチマークであるWebRetrieverを紹介します。
論文 参考訳(メタデータ) (2026-07-07T10:27:31Z) - EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents [17.727481701114556]
ツール使用エージェントのための対話型マルチモーダルベンチマークであるEgoBenchを紹介する。
我々は3段階の相乗的パイプラインを実装し、各タスクは視覚知覚とツール強化マルチホップ推論の併用を強制的に行うように設計されている。
また,エージェントのインタラクション能力を評価するために,EgoBench内のマルチエージェントシミュレーションユーザを開発した。
論文 参考訳(メタデータ) (2026-05-27T01:28:15Z) - SimuWoB: Simulating Real-World Mobile Apps for Fast and Faithful GUI Agent Benchmarking [23.006082521142137]
SimuWoBは、さまざまなタイプと難易度にまたがる120の課題タスクを備えた、モバイルGUIエージェントのための完全な総合ベンチマークである。
我々は高忠実度タスクと環境を合成する堅牢な仮想環境生成フレームワークを構築した。
我々は、最先端のモバイルGUIエージェントについて包括的な実験を行う。
論文 参考訳(メタデータ) (2026-05-24T16:33:14Z) - BeyondSWE: Can Current Code Agent Survive Beyond Single-Repo Bug Fixing? [61.247730037229815]
BeyondSWEは2つの軸 – 解像度スコープと知識スコープ – に沿って既存の評価を拡張する包括的なベンチマークです。
外部知識の役割を解明するために,ディープ検索とコーディング能力を統合するフレームワークであるSearchSWEを開発した。
この作業は、現実的で挑戦的な評価ベンチマークと、より有能なコードエージェントに向けた研究を進めるための柔軟なフレームワークの両方を提供する。
論文 参考訳(メタデータ) (2026-03-03T17:52:01Z) - UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios [63.67884284105684]
textbfUltraHorizonは、複雑な現実世界の課題に不可欠な基礎的能力を測定する新しいベンチマークである。
エージェントは、隠されたルールを反復的に発見しなければならない、長期にわたる発見タスクで設計されている。
実験の結果, LLM-agents はこれらの設定において常に不利な成績を示し, ヒトは高いスコアを得ることができた。
論文 参考訳(メタデータ) (2025-09-26T02:04:00Z) - Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks [94.19506319646376]
本稿では,実世界のマルチモーダル環境での視覚中心エージェント評価のためのベンチマークであるAgent-Xを紹介する。
Agent-Xは、828のエージェントタスクと、イメージ、マルチイメージ比較、ビデオ、命令テキストを含む、真の視覚的コンテキストを備えている。
その結果、GPT、Gemini、Qwenファミリーを含む最高のパフォーマンスモデルでさえ、多段階視覚タスクの解決に苦慮していることが明らかとなった。
論文 参考訳(メタデータ) (2025-05-30T17:59:53Z) - WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks? [83.19032025950986]
本稿では,Webブラウザを介してソフトウェアと対話する大規模言語モデルベースエージェントについて検討する。
WorkArenaは、広く使用されているServiceNowプラットフォームに基づく33のタスクのベンチマークである。
BrowserGymは、そのようなエージェントの設計と評価のための環境である。
論文 参考訳(メタデータ) (2024-03-12T14:58:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。