論文の概要: AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
- arxiv url: http://arxiv.org/abs/2607.05174v1
- Date: Mon, 06 Jul 2026 14:56:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.198339
- Title: AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
- Title(参考訳): AgentGym2:De-Idealized Real-World環境における大規模言語モデルエージェントのベンチマーク
- Abstract要約: 我々はAgentGym2について紹介する。これは実世界の作業要求に根ざしたタスクインスタンスを備えた新しい評価フレームワークである。
エージェントのエンドツーエンドのプロシージャの実行能力を測定し、探索を通じてツールを発見し、目に見えないタスクのためのツールを作成し、ノイズや不特定情報に対して堅牢な状態を保つ。
- 参考スコア(独自算出の注目度): 84.8170304874972
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language agents, i.e., LLM agents, progress rapidly and are increasingly deployed in production environments. This trend underscores the urgent need for rigorous and realistic evaluations. However, most existing benchmarks evaluate agents in simplified, idealized settings. They typically rely on pre-packaged tool interfaces, overlook critical steps, and assume inputs are clean and fully specified. Consequently, they understate the difficulty of real deployments, where uncertainty and noise are ubiquitous and agents must proactively explore the environment to uncover new tools. To bridge this gap, we present AgentGym2, a new evaluation framework with task instances grounded in real-world end-to-end working demands. Beyond reasoning and planning, it measures agents' ability to execute end-to-end procedures, discover tools via exploration, compose tools for unseen tasks, and remain robust to noisy and underspecified information. Experiments on 15 proprietary and open-source models show that even SOTA systems like Gemini and GPT-5 struggle on AgentGym2, revealing a substantial gap between the capability of current agents and the demands of real-world applications.
- Abstract(参考訳): 言語エージェント、すなわちLLMエージェントは急速に進歩し、運用環境にますますデプロイされている。
この傾向は厳密で現実的な評価の緊急の必要性を浮き彫りにしている。
しかし、既存のベンチマークのほとんどは、単純化された理想的な設定でエージェントを評価する。
それらは通常、パッケージ化されたツールインターフェースに依存し、重要なステップを見落とし、入力がクリーンで完全に指定されていると仮定する。
その結果、不確実性とノイズがユビキタスであり、エージェントは新しいツールを明らかにするために積極的に環境を探索する必要がある、実際のデプロイメントの難しさを浮き彫りにしている。
このギャップを埋めるために、AgentGym2という、現実世界のエンドツーエンドの作業要求に根ざしたタスクインスタンスを持つ新しい評価フレームワークを紹介します。
推論と計画の他に、エージェントがエンドツーエンドの手順を実行し、探索を通じてツールを発見し、目に見えないタスクのためのツールを作成し、ノイズや不特定情報に対して堅牢なままにしておく能力を測定する。
15のプロプライエタリおよびオープンソースモデルに関する実験によると、GeminiやGPT-5のようなSOTAシステムでさえAgentGym2に苦戦している。
関連論文リスト
- AgentHijack: Benchmarking Computer Use Agent Robustness to Common Environment Corruptions [78.49000936275773]
我々は、一般的な汚職下でのコンピュータ利用エージェントの堅牢性を評価するために設計されたベンチマークであるAgentHijackを紹介する。
MLLMをベースとした各種デスクトップタスクを評価し, 汚職の小さな事例であっても, 大幅な性能劣化が生じることを確認した。
本稿では,動作の要約と環境チェックに責任を負う見物人として,アクションジェネレータと接地機能を統合したフレームワークであるAgent Hijack-Agentを提案する。
論文 参考訳(メタデータ) (2026-05-25T11:09:22Z) - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence [122.8626256816085]
textbfAgent-Worldは、スケーラブルな環境を通じて汎用エージェントインテリジェンスを前進させるための自己進化型トレーニングアリーナである。
Agent-World-8Bと14Bは、強力なプロプライエタリなモデルと環境スケーリングベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-04-20T14:01:10Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - From Task Solving to Robust Real-World Adaptation in LLM Agents [17.122224644097304]
大規模言語モデルは、拡張された地平線上での計画、呼び出し、アクションを行う特別なエージェントとして、ますます多くデプロイされている。
グリッド型ゲームにおけるエージェントLLMを、単純なゴールだが長距離実行でベンチマークする。
名目上のタスク解決と,デプロイメントのような堅牢性の間には,大きなギャップがあります。
論文 参考訳(メタデータ) (2026-02-02T20:10:40Z) - What Do LLM Agents Know About Their World? Task2Quiz: A Paradigm for Studying Environment Understanding [50.35012849818872]
大規模言語モデル(LLM)エージェントは、複雑な意思決定やツール使用タスクにおいて顕著な能力を示した。
本研究では,タスク実行と世界状態理解の分離を目的とした決定論的かつ自動評価パラダイムであるTask-to-Quiz(T2Q)を提案する。
実験の結果,タスク成功は環境理解の指標として不十分な場合が多く,現在の記憶機構はエージェントが環境の基底モデルを取得するのに有効ではないことが明らかとなった。
論文 参考訳(メタデータ) (2026-01-14T14:09:11Z) - ARE: Scaling Up Agent Environments and Evaluations [22.98982051873728]
本稿では,スケーラブルな環境構築のための研究プラットフォームであるMeta Agents Research Environments (ARE)を紹介する。
AREは、複雑で多様な環境を構築するための単純な抽象化を提供する。
また、AREで構築され、汎用エージェント能力を測定するために設計されたベンチマークであるGaia2を提案する。
論文 参考訳(メタデータ) (2025-09-21T16:59:45Z) - Shell or Nothing: Real-World Benchmarks and Memory-Activated Agents for Automated Penetration Testing [23.554239007767276]
本稿では,世界初の実世界のエージェント指向ペンテストベンチマークTermiBenchを紹介する。
本稿では,多エージェント浸透試験フレームワークTermiAgentを提案する。
評価において,本研究は最先端のエージェントより優れ,より強力な浸透試験能力を示す。
論文 参考訳(メタデータ) (2025-09-11T07:30:44Z) - ThinkGeo: Evaluating Tool-Augmented Agents for Remote Sensing Tasks [64.86209459039313]
ThinkGeoは、構造化ツールの使用とマルチステップ計画を通じて、リモートセンシングタスクにおけるツール拡張エージェントを評価するために設計されたエージェントベンチマークである。
我々はReActスタイルの対話ループを実装し,486 個の構造化エージェントタスク上でのオープンソース LLM とクローズドソース LLM の両方を1,773 個の専門家が検証した推論ステップで評価する。
分析の結果、ツールの精度とモデル間の計画整合性に顕著な相違が明らかになった。
論文 参考訳(メタデータ) (2025-05-29T17:59:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。