論文の概要: OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks
- arxiv url: http://arxiv.org/abs/2606.29537v1
- Date: Sun, 28 Jun 2026 17:59:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.953999
- Title: OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks
- Title(参考訳): OSWorld2.0: 長期のリアルタイムタスクにおけるコンピュータ利用エージェントのベンチマーク
- Authors: Mengqi Yuan, Zilong Zhou, Xinzhuang Xiong, Weiming Wu, Jiayang Sun, Jiamin Song, Kaiqian Cui, Bowen Wang, Haoyuan Wu, Yitong Li, Dunjie Lu, Haikong Lu, Qi Zhen, Xinyuan Wang, Jiaqi Deng, Yuhao Yang, Cheng Chen, Boyuan Zheng, Alex Su, Xiao Yu, Hao Zou, Saaket Agashe, Xing Han Lu, Manpreet Kaur, Zhengyang Qi, Vincent Sunn Chen, Frederic Sala, Dayiheng Liu, Junyang Lin, Zhou Yu, Yu Su, Siva Reddy, Xin Eric Wang, Peng Qi, Tianbao Xie, Tao Yu,
- Abstract要約: OSWorld 2.0は、日常的および専門的なタスクにまたがる108の長い水平コンピュータ使用のベンチマークである。
各タスクは現実的なエンド・ツー・エンドのワークフローを表しており、人間のユーザーの中央値は1.6時間である。
- 参考スコア(独自算出の注目度): 98.07146747892239
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing computer-use benchmarks fail to capture the realism, complexity, and long-horizon demands of real-world computer use, limiting their ability to reveal the limitations of frontier agents. We introduce OSWorld 2.0, a benchmark of 108 long-horizon computer-use workflows across everyday and professional tasks, designed to capture complex and challenging real-world phenomena. Each task represents a realistic end-to-end workflow that takes human users a median of about 1.6 hours to complete and requires an average of 318 tool calls with Claude Opus 4.7 using maximum thinking, compared with about 30 in OSWorld 1.0. OSWorld 2.0 targets challenge phenomena that are common in real workflows yet underrepresented in prior benchmarks, spanning interaction-design challenges such as streaming interaction and dynamic environments, as well as agent-pattern challenges such as cross-source reasoning, implicit-state inference, and visual-spatial precision. Tasks are grounded in authentic input artifacts and cross-referenced against realistic stateful user profile data, and include separate safety reports auditing safety-sensitive execution. Under our primary binary-completion metric at 500 steps, Claude Opus 4.8 with maximum thinking and batched tool calls scores best but still completes only 20.6% of tasks at a 54.8% partial score; GPT-5.5 is far more token-efficient yet plateaus near 13%. These results show that current agents are still far from professional-level computer use: rather than stumbling on basic GUI control or coding, they lose track of constraints, miss information that arrives mid-task, guess rather than ask the user, and skip verification, struggling most when a task hinges on hidden state they must recover.
- Abstract(参考訳): 既存のコンピュータ利用ベンチマークでは、現実世界のコンピュータ使用における現実主義、複雑さ、長期的な要求を捉えることができず、フロンティアエージェントの限界を明らかにする能力を制限することができる。
私たちは、日常的および専門的なタスクにまたがる108の長い水平コンピュータ使用ワークフローのベンチマークであるOSWorld 2.0を紹介します。
各タスクは現実的なエンド・ツー・エンドのワークフローを表しており、人間のユーザを約1.6時間、平均318回のツールコールをClaude Opus 4.7で行う必要がある。
OSWorld 2.0は、ストリーミングインタラクションや動的環境といったインタラクション設計の課題や、クロスソース推論、暗黙的状態推論、視覚空間的精度といったエージェントパターンの課題にまたがる、以前のベンチマークでは表現されていない実際のワークフローで一般的な課題をターゲットにしている。
タスクは、実際の入力アーティファクトに基礎を置いて、現実的なステートフルなユーザプロファイルデータと相互参照し、安全に敏感な実行を監査する別の安全レポートを含む。
500ステップの一次バイナリ・コンプリート・メトリックでは、最大思考とバッチツールコールのスコアが最高のクロードオプス4.8が、54.8%の部分スコアでタスクの20.6%しか完了していない。
これらの結果から、現在のエージェントは、基本的なGUIコントロールやコーディングではなく、制約の追跡を失い、タスク中に到着する情報を見逃し、ユーザを尋ねるのではなく推測し、検証を省略し、タスクが回復しなければならない隠れた状態にヒンジをかけた時に最も苦労している、という、まだプロレベルのコンピュータ利用には程遠いことが分かる。
関連論文リスト
- Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments [67.2234316079859]
GauntletBenchは、挑戦的なシナリオでエージェントの一般化を評価するためのWebベースのベンチマークである。
調査されていない5つのプロフェッショナルアプリケーションにわたる3つの機能(時間的知覚、グラフィカルな理解、そして3D推論)に焦点を当てている。
実験結果から,フロンティアエージェントシステムは人間レベルの性能を達成するには程遠いことが判明した。
論文 参考訳(メタデータ) (2026-06-12T12:32:24Z) - AcademiClaw: When Students Set Challenges for AI Agents [69.70303995121154]
AcademiClaw(アカデミクロー)は、大学生の実際の学術的切断から直接引き出された80の複雑な長い水平タスクのベンチマークである。
最高のモデルでさえ、55%のパスレートしか達成できないことを示す。
AcademiClawとそのオープンソースデータとコードが、OpenClawコミュニティにとって有用なリソースになることを願っています。
論文 参考訳(メタデータ) (2026-05-04T14:40:42Z) - WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments [34.06270058972]
WindowsWorldは、現実世界のプロのアクティビティを反映した複雑なマルチステップタスクでGUIエージェントを評価するように設計されている。
本手法では,16の職業によって構成されたマルチエージェント・フレームワークを用いて,4つの困難レベルタスクを生成する。
ベンチマークには181のタスクが含まれ、17の一般的なデスクトップアプリケーションで平均5.0のサブゴールがある。
論文 参考訳(メタデータ) (2026-04-30T12:13:27Z) - OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - World of Workflows: a Benchmark for Bringing World Models to Enterprise Systems [6.643798239990755]
最前線の大規模言語モデル(LLM)は多くの領域で優れているが、複雑なエンタープライズシステムではテストされていない。
WoW(World of Warcraft)は,4,000以上のビジネスルールと55のアクティブな組み込み機能を備えた,現実的なServiceNowベースの環境である。
筆者らは,(1)フロンティアLSMはダイナミックス障害に悩まされ,その行動の不可視的かつカスケードな副作用を常に予測できないこと,(2)不透明なシステムにおける信頼性には,隠れた状態遷移を精神的にシミュレートし,高忠実なフィードバックが得られない場合に可観測性ギャップを橋渡ししなければならない,という2つの主要な特徴を明らかにした。
論文 参考訳(メタデータ) (2026-01-29T18:51:54Z) - Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces [126.23612941699565]
Terminal-Bench 2.0は、現実世界の問題に触発されたコンピュータ端末環境における89のタスクからなるベンチマークである。
ベンチマークでは、フロンティアモデルとエージェントのスコアが65%未満であることが示されています。
将来的にはhttps://www.tbench.ai/で開発者や研究者を支援するために、データセットと評価ハーネスを公開しています。
論文 参考訳(メタデータ) (2026-01-17T01:29:30Z) - UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction [16.731754927372585]
UI-Visionは、コンピュータ使用エージェントのオフラインかつきめ細かい評価のための、最初の包括的なライセンス許容ベンチマークである。
オンラインベンチマークとは異なり、UI-Visionは人間のデモの密集した高品質なアノテーションを提供する。
評価の結果,UI-TARS-72Bのような最先端モデルの限界が明らかになった。
論文 参考訳(メタデータ) (2025-03-19T19:26:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。