論文の概要: DevicesWorld: Benchmarking Cross-Device Agents in Heterogeneous Environments
- arxiv url: http://arxiv.org/abs/2607.13465v1
- Date: Wed, 15 Jul 2026 05:53:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.664218
- Title: DevicesWorld: Benchmarking Cross-Device Agents in Heterogeneous Environments
- Title(参考訳): DevicesWorld:異種環境におけるクロスデバイスエージェントのベンチマーク
- Authors: Huatao Li, Xinwei Geng, Yuheng Wang, Yutong Li, Runde Yang, Hantao Chen, Shu Yao, Jingru Fan, Xuhui Ren, Yuanyuan Zhao, Fei Huang, Chen Qian,
- Abstract要約: デバイス間協調操作のための大規模実行可能ベンチマークであるDevicesWorldを紹介する。
各タスクは自然言語のユーザ目標、参加デバイスと初期状態、実行可能なアクション、ルールベースの検証、クリーンアップ手順を定義する。
マルチステージの構築と品質管理パイプラインは、タスクを現実的なユーザニーズに近づけつつ、最終的な結果を自動的に検証します。
- 参考スコア(独自算出の注目度): 28.931883857834038
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM-based agents have rapidly improved at operating individual digital environments such as mobile applications, desktop systems, and smart homes. However, real-world user goals often span multiple devices: information may come from a phone, be processed on a desktop, and the result may need to appear on another device. Most existing benchmarks center on a single dominant execution environment, making it difficult to evaluate whether agents can acquire and integrate information across heterogeneous devices and complete end-to-end tasks with cross-device dependencies. We introduce DevicesWorld, a large-scale executable benchmark for cross-device collaborative operation. DevicesWorld contains 6,140 tasks and integrates three classes of device environments -- mobile, desktop, and IoT -- into a unified cross-device interaction and evaluation framework. Each task defines a natural-language user goal, participating devices and initial states, executable actions, rule-based verifiers, and a cleanup procedure. A multi-stage construction and quality-control pipeline keeps tasks close to realistic user needs while allowing final outcomes to be automatically verified from device states and generated files. We evaluate five frontier LLM-agent systems on a fixed evaluation set. All methods achieve low success rates, with the best reaching only 12.5%. Among failed runs, about 28.7% satisfy at least one scoring condition yet still fail the full task. Trajectories show that agents become stuck acquiring information or manipulating interfaces, confuse source and output devices, or terminate before all conditions are jointly satisfied. DevicesWorld turns cross-device collaborative operation into an executable, reproducible, and diagnostically useful evaluation problem for research on reliable cross-device agents.
- Abstract(参考訳): LLMベースのエージェントは、モバイルアプリケーション、デスクトップシステム、スマートホームなど、個々のデジタル環境の運用において急速に改善されている。
しかし、実際のユーザ目標はしばしば複数のデバイスにまたがる: 情報は携帯電話から来てデスクトップで処理され、その結果は他のデバイスに表示される必要がある。
既存のベンチマークのほとんどは、単一の支配的な実行環境に重点を置いているため、エージェントが異機種間での情報を取得し、統合し、デバイス間の依存関係を持つエンドツーエンドタスクを完了させるかどうかを評価することは困難である。
デバイス間協調操作のための大規模実行可能ベンチマークであるDevicesWorldを紹介する。
DevicesWorldには6,140のタスクが含まれており、モバイル、デスクトップ、IoTという3つのデバイス環境のクラスをデバイス間のインタラクションと評価の統一フレームワークに統合している。
各タスクは自然言語のユーザ目標、参加デバイスと初期状態、実行可能なアクション、ルールベースの検証、クリーンアップ手順を定義する。
マルチステージの構築と品質管理パイプラインは、タスクを現実的なユーザニーズに近く保ちながら、最終的な結果がデバイス状態と生成されたファイルから自動的に検証されるようにする。
固定評価セットを用いて,5つのフロンティアLDMエージェントシステムの評価を行った。
すべての手法が成功率を低くし、最高は12.5%である。
失敗したうち、28.7%は少なくとも1つのスコアリング条件を満たすが、それでもフルタスクに失敗している。
トラジェクトリは、エージェントが情報を取得するか、インターフェースを操作するか、ソースと出力装置を混乱させるか、または全ての条件が満たされる前に終了することを示す。
DevicesWorldは、デバイス間のコラボレーティブな操作を、信頼できるクロスデバイスエージェントの研究のために実行可能な、再現可能な、診断に有用な評価問題に変える。
関連論文リスト
- WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments [34.06270058972]
WindowsWorldは、現実世界のプロのアクティビティを反映した複雑なマルチステップタスクでGUIエージェントを評価するように設計されている。
本手法では,16の職業によって構成されたマルチエージェント・フレームワークを用いて,4つの困難レベルタスクを生成する。
ベンチマークには181のタスクが含まれ、17の一般的なデスクトップアプリケーションで平均5.0のサブゴールがある。
論文 参考訳(メタデータ) (2026-04-30T12:13:27Z) - SPA-Bench: A Comprehensive Benchmark for SmartPhone Agent Evaluation [89.24729958546168]
スマートフォンエージェントは、ユーザーがデバイスを効率的に制御するのを助けるためにますます重要になっている。
We present SPA-Bench, a comprehensive SmartPhone Agent Benchmark designed to evaluate (M)LLM-based agent。
論文 参考訳(メタデータ) (2024-10-19T17:28:48Z) - CRAB: Cross-environment Agent Benchmark for Multimodal Language Model Agents [49.68117560675367]
Crabは、クロス環境タスクをサポートするように設計された最初のベンチマークフレームワークである。
私たちのフレームワークは複数のデバイスをサポートし、Pythonインターフェースで簡単に任意の環境に拡張できます。
実験の結果、GPT-4oの1剤が38.01%の最高完成率を達成することが示された。
論文 参考訳(メタデータ) (2024-07-01T17:55:04Z) - Benchmarking Mobile Device Control Agents across Diverse Configurations [19.01954948183538]
B-MoCAは、モバイルデバイス制御エージェントの評価と開発のためのベンチマークである。
我々は,大規模言語モデル (LLM) やマルチモーダル LLM を用いたエージェントを含む多種多様なエージェントをベンチマークする。
これらのエージェントは、簡単なタスクの実行の熟練度を示す一方で、複雑なタスクにおけるパフォーマンスの低さは、将来の研究が有効性を改善するための重要な機会を浮き彫りにしている。
論文 参考訳(メタデータ) (2024-04-25T14:56:32Z) - OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments [87.41051677852231]
マルチモーダルエージェントのための,第1世代のスケーラブルな実コンピュータ環境であるOSWorldを紹介する。
OSWorldは、オープンエンドのコンピュータタスクを評価する統合されたコンピュータ環境として機能する。
オープンドメインの実際のWebおよびデスクトップアプリケーション、OSファイルI/O、複数のアプリケーションにまたがる369のコンピュータタスクのベンチマークを作成します。
論文 参考訳(メタデータ) (2024-04-11T17:56:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。