論文の概要: OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios
- arxiv url: http://arxiv.org/abs/2607.14989v1
- Date: Thu, 16 Jul 2026 13:38:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.124543
- Title: OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios
- Title(参考訳): OmniaBench: さまざまなシナリオにわたる汎用AIエージェントのベンチマーク
- Abstract要約: OmniaBenchは、明示的な状態空間を持つ様々なシナリオにまたがる汎用エージェントを評価するベンチマークである。
実行環境を構築し,4つの相補経路を通した単一ターンタスクと複数ターンタスクを合成する。
ベンチは現在のフロンティアモデルに重大な課題を示しており、クロード・ソネット-5とGPT-5.6-ソルもそれぞれ58.54点と57.14点の総合パス@1点を達成している。
- 参考スコア(独自算出の注目度): 25.68270661401607
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are increasingly evolving from text generators into general agents capable of understanding user requests, invoking external tools, and completing complex tasks through interaction. However, existing agent benchmarks often focus on limited scenarios, tool ecosystems, or interaction formats, making it difficult to systematically characterize model capabilities across heterogeneous application settings. We introduce OmniaBench, a benchmark for evaluating general agents across diverse scenarios with explicit state spaces. We derive application-oriented scenario knowledge from app stores, product documents, industry resources, Web retrieval, and human refinement, forming a hierarchical taxonomy that spans ToC, ToB and ToE with 90 level-1 and 354 level-2 domains. Based on this taxonomy, we construct executable environments and synthesize single-turn and multi-turn tasks through four complementary routes: DAG, DAG-S, Solver, and Program. OmniaBench further introduces a ten-dimensional capability taxonomy and eight compositional atomic difficulty factors to support fine-grained evaluation and analysis. The resulting dataset contains 1,431 tasks, together with a challenging subset of 644 tasks designed to reduce evaluation cost and mitigate potential contamination of the full set after public release. The bench presents substantial challenges to current frontier models, with even Claude-Sonnet-5 and GPT-5.6-Sol achieving Overall Pass@1 scores of only 58.54 and 57.14, respectively. Further analyses reveal clear differences across domains and capabilities, as well as persistent limitations in planning, constraint maintenance, and adaptive correction. OmniaBench provides a broad and diagnostic benchmark for characterizing the capability boundaries of general agents.
- Abstract(参考訳): 大規模な言語モデルは、テキストジェネレータから、ユーザ要求を理解し、外部ツールを呼び出し、インタラクションを通じて複雑なタスクを完了できる汎用エージェントへと、ますます進化している。
しかし、既存のエージェントベンチマークでは、限られたシナリオやツールエコシステム、インタラクションフォーマットに重点を置いていることが多いため、不均一なアプリケーション設定でモデル機能を体系的に特徴付けるのは困難である。
OmniaBenchは、明示的な状態空間を持つ様々なシナリオにまたがる汎用エージェントを評価するベンチマークである。
アプリケーション指向のシナリオ知識は、アプリケーションストア、製品ドキュメント、業界リソース、Web検索、人間による洗練から派生し、90のレベル1と354のレベル2ドメインを持つToC、ToB、ToEにまたがる階層的な分類を形成する。
そこで本研究では,DAG,DAG-S,Solver,Programの4つの相補経路を用いて,実行環境を構築し,一ターンタスクと多ターンタスクを合成する。
OmniaBenchはさらに、詳細な評価と分析をサポートするために、10次元の能力分類と8つの組成的原子難因子を導入している。
結果として得られたデータセットには、1,431のタスクと、評価コストを削減し、公開リリース後の完全なセットの潜在的汚染を軽減するために設計された644タスクの挑戦的なサブセットが含まれている。
ベンチは現在のフロンティアモデルに重大な課題を示しており、クロード・ソネット-5とGPT-5.6-ソルもそれぞれ58.54点と57.14点の総合パス@1点を達成している。
さらなる分析では、ドメインと機能間の明確な違いと、計画、制約維持、適応修正における永続的な制限を明らかにしている。
OmniaBenchは、汎用エージェントの能力境界を特徴付けるための広範かつ診断的なベンチマークを提供する。
関連論文リスト
- AgentOmnia: Scaling Agentic Models for Full-Scenario Applications [36.656762500581216]
大規模言語モデルエージェントは急速に進歩しているが、ドメイン、機能、タスクの難しさ、インタラクション設定にはまだ進歩が断片化されている。
これはTo-Consumer(ToC)、To-Business(ToB)、To-Employee(ToE)アプリケーション間でタスク空間の定義、データ合成、ポストトレーニング、評価、改善を調整するフレームワークです。
論文 参考訳(メタデータ) (2026-07-25T09:58:24Z) - T1-Bench: Benchmarking Multi-Scenario Agents in Real-World Domains [17.617235861426686]
T1-Benchは、現実的な顧客対応マルチドメイン環境でエージェントシステムを評価するための、高忠実で包括的なベンチマークである。
12のプロプライエタリモデルとオープンウェイトモデルを用いてT1-Benchを評価し,エージェントの動作,ツール利用,会話品質を評価するための標準フレームワークを提供する。
エージェントシステムの今後の研究を容易にするため,我々はデータと評価コードをオープンソースとして公開する。
論文 参考訳(メタデータ) (2026-06-09T16:32:14Z) - SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks [73.92333717662558]
SpaceWorldは、複雑な現実世界のタスクにおけるマルチモーダルエージェントのインタラクティブな空間的理解を評価するためのベンチマークである。
多様なドメイン(例えば、家庭のルーチン、旅行、社会協力など)にまたがる760の人称タスクが特徴である。
信頼性評価のために、各タスクは、人間検証された初期状態、参照軌跡、端末状態検証器を含む。
論文 参考訳(メタデータ) (2026-06-08T15:51:51Z) - Scaling Agentic Capabilities via Grounded Interaction Synthesis [12.796216573698677]
本稿では,多様な環境や複雑なタスクのスケーラブルな構築を自動化するフレームワークであるGarthed Agentic Interaction Synthesis (GAIS)を紹介する。
具体的には、機能的多様性と難易度を確保するために、実世界のモデルコンテキストプロトコル(MCP)サーバから派生したプロトコルアンコール環境を構築する。
BFCL、$2-Bench、ACEBenchの実験では、GAIS合成データが最先端のベースラインを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-06-01T09:57:52Z) - OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - CCTU: A Benchmark for Tool Use under Complex Constraints [66.87622847854337]
複雑な制約下での大規模言語モデル(LLM)を評価するためのベンチマークであるCCTUを紹介する。
ベンチマークは、さまざまなツール使用シナリオに対して、慎重にキュレートされ、挑戦的なテストケースが200から成っている。
ステップレベルの検証を行い、コンプライアンスを強制する実行可能な制約検証モジュールを開発する。
論文 参考訳(メタデータ) (2026-03-16T14:05:13Z) - AIDABench: AI Data Analytics Benchmark [62.45908988324612]
AIDABenchは、複雑なデータ分析タスクのAIシステムをエンドツーエンドで評価するためのベンチマークである。
AIDABenchは、質問応答、データビジュアライゼーション、ファイル生成という3つのコア機能ディメンションにまたがる600以上の多様なドキュメント分析タスクを含んでいる。
AIDABenchの11の最先端モデルを評価し、プロプライエタリ(Claude Sonnet 4.5、Gemini 3 Pro Previewなど)とオープンソース(Qwen3-Max-2026-01-23-Thinkingなど)の両方を対象とする。
論文 参考訳(メタデータ) (2026-02-27T08:58:05Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - MMAU: A Holistic Benchmark of Agent Capabilities Across Diverse Domains [54.117238759317004]
大規模マルチタスクエージェント理解(MMAU)ベンチマークは、複雑な環境設定を必要としない包括的なオフラインタスクを特徴としている。
ツールユース、DAG(Directed Acyclic Graph)QA、データサイエンスと機械学習コーディング、コンテストレベルのプログラミング、数学の5分野にわたるモデルを評価する。
3K以上の異なるプロンプトを含む20の精巧に設計されたタスクにより、MMAUはLLMエージェントの強度と限界を評価するための包括的なフレームワークを提供する。
論文 参考訳(メタデータ) (2024-07-18T00:58:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。