論文の概要: APPSim-Bench: Bridging Real-world Apps and Reproducible Evaluation for Mobile GUI Agents
- arxiv url: http://arxiv.org/abs/2609.07712v1
- Date: Mon, 07 Sep 2026 16:25:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.468524
- Title: APPSim-Bench: Bridging Real-world Apps and Reproducible Evaluation for Mobile GUI Agents
- Title(参考訳): APPSim-Bench: 実世界のアプリケーションをブリッジし、モバイルGUIエージェントの再現可能な評価
- Abstract要約: 移動エージェントは自然言語命令からタスクを実行することができるが、その評価は現実的かつ再現性の高いものにすることは困難である。
既存のベンチマークは、これらの目標をトレードオフするのに対して、ライブの商用アプリは、推奨、広告、アカウント、コンテンツの変更から制御不能なバリエーションを導入している。
本稿では,タスク関連インタラクションロジックを保持する制御可能なシミュレートアプリを通じて,このトレードオフに対処するAppSim-Benchを提案する。
- 参考スコア(独自算出の注目度): 29.43824786048825
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mobile GUI agents can execute tasks from natural-language instructions, but their evaluation remains difficult to make both realistic and reproducible. Existing benchmarks typically trade off these goals: simplified apps lack real-world mobile complexity, whereas live commercial apps introduce uncontrolled variation from recommendations, advertisements, accounts, and changing content. We propose AppSim-Bench, which addresses this trade-off through controllable simulated apps that preserve task-relevant interaction logic while supporting deterministic evaluation. Built through a coding-agent-assisted and human-verified workflow, it contains 557 tasks across 17 high-frequency Chinese and English apps. Its controllable backend data and outcome-based verification remove major sources of environmental stochasticity, enabling reproducible cross-model comparison. Evaluating 19 GUI agents, spanning general-purpose and GUI-specialized systems, we find that autonomous mobile execution remains far from solved. The best model completes only 50.27% of tasks, and 28.55% of tasks are not solved by any agent. Further analysis shows that failures concentrate in longer workflows, numerical reasoning tasks, and inefficient trajectories marked by high action overhead and budget exhaustion. Our project is available at https://github.com/Acrab-Agentic-Labs/AppSim.
- Abstract(参考訳): モバイルGUIエージェントは自然言語命令からタスクを実行することができるが、その評価は現実的かつ再現性の高いものにすることは困難である。
既存のベンチマークでは、これらの目標とは対照的に、単純化されたアプリは現実のモバイルの複雑さを欠いているのに対して、ライブの商用アプリは推奨、広告、アカウント、コンテンツの変更から制御不能なバリエーションを導入している。
決定論的評価をサポートしながらタスク関連インタラクションロジックを保存する制御可能なシミュレートアプリを通じて,このトレードオフに対処するAppSim-Benchを提案する。
コーディングエージェントによる人間認証ワークフローによって構築され、中国語と英語の17の高周波アプリに57のタスクが組み込まれている。
制御可能なバックエンドデータと結果に基づく検証は、主要な環境確率性源を排除し、再現可能なクロスモデル比較を可能にする。
汎用およびGUI特化システムにまたがる19のGUIエージェントを評価することで、自律的なモバイル実行は未解決のままであることがわかった。
最高のモデルでは50.27%のタスクしか完了せず、28.55%のタスクはエージェントによって解決されない。
さらなる分析により、障害はより長いワークフロー、数値推論タスク、そして高い行動オーバーヘッドと予算の枯渇を特徴とする非効率な軌道に集中していることが示される。
私たちのプロジェクトはhttps://github.com/Acrab-Agentic-Labs/AppSimで利用可能です。
関連論文リスト
- AndroidDaily: A Verifiable Benchmark for Mobile GUI Agents on Real-World Closed-Source Applications [36.71396790403699]
94の高周波Androidアプリケーションにまたがる350の日常的タスクからなる大規模ベンチマークであるAndroidDailyを紹介した。
本稿では,3段階の外部ガイドラインに基づくプロセス認識評価システムGRADEを提案する。
GRADEはステップレベルの診断結果を生成し、長い水平なオープンエンドのモバイルインタラクションを、隠れた内部状態に頼ることなく検証可能な評価に変換する。
論文 参考訳(メタデータ) (2026-05-26T23:19:42Z) - SimuWoB: Simulating Real-World Mobile Apps for Fast and Faithful GUI Agent Benchmarking [23.006082521142137]
SimuWoBは、さまざまなタイプと難易度にまたがる120の課題タスクを備えた、モバイルGUIエージェントのための完全な総合ベンチマークである。
我々は高忠実度タスクと環境を合成する堅牢な仮想環境生成フレームワークを構築した。
我々は、最先端のモバイルGUIエージェントについて包括的な実験を行う。
論文 参考訳(メタデータ) (2026-05-24T16:33:14Z) - GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows [90.35728421223673]
GTA-2はジェネラル・ツール・エージェント(GTA)の階層的なベンチマークである
現実世界の認証に基づいて構築され、実際のユーザクエリ、デプロイツール、マルチモーダルコンテキストを活用する。
実験では、フロンティアモデルは既に原子タスクに苦戦しているが、トップモデルは14.39%の成功しか達成していない。
論文 参考訳(メタデータ) (2026-04-17T05:36:00Z) - Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces [126.23612941699565]
Terminal-Bench 2.0は、現実世界の問題に触発されたコンピュータ端末環境における89のタスクからなるベンチマークである。
ベンチマークでは、フロンティアモデルとエージェントのスコアが65%未満であることが示されています。
将来的にはhttps://www.tbench.ai/で開発者や研究者を支援するために、データセットと評価ハーネスを公開しています。
論文 参考訳(メタデータ) (2026-01-17T01:29:30Z) - AndroidLens: Long-latency Evaluation with Nested Sub-targets for Android GUI Agents [36.66219528445988]
モバイルGUIエージェントのための挑戦的な評価フレームワークであるAndroidLensを紹介する。
中国語と英語の両方の環境での長時間のタスクは571である。
我々の評価では、最高のモデルでさえ、12.7%のタスク成功率と50.47%のATPにしか達していない。
論文 参考訳(メタデータ) (2025-12-24T17:40:42Z) - The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution [86.4588675093384]
Toolathlonは、多様なアプリやツール、現実的な環境設定、信頼性の高い実行ベースの評価を提供する言語エージェントのベンチマークである。
このベンチマークには、手動でソースまたはクラフトされたタスクが108つ含まれており、平均20回以上にわたって複数のアプリと対話する必要がある。
Toolathlonは、より有能な言語エージェントを現実の長期タスク実行のために開発することを期待しています。
論文 参考訳(メタデータ) (2025-10-29T17:32:49Z) - How Can Input Reformulation Improve Tool Usage Accuracy in a Complex Dynamic Environment? A Study on $τ$-bench [58.114899897566964]
マルチターンの会話環境では、大きな言語モデル(LLM)は、一貫性のある推論とドメイン固有のポリシーへの固執にしばしば苦労する。
本稿では,関連するドメインルールを付加したユーザクエリを自動的に再構成するIRMA(Input-Reformulation Multi-Agent)フレームワークを提案する。
IRMAはReAct、Function Calling、Self-Reflectionをそれぞれ16.1%、12.7%、19.1%で大きく上回っている。
論文 参考訳(メタデータ) (2025-08-28T15:57:33Z) - Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation [83.92224427735859]
実際の実行に先立って効果的なフィードバックを提供する事前の批判機構を導入する。
そこで我々は,GUI-Critic-TrainとGUI-Critic-Testを作成するために,推論ブートストラップに基づくデータ収集パイプラインを開発した。
我々のモデルは、現在のMLLMと比較して、批評家の精度に大きな利点をもたらす。
論文 参考訳(メタデータ) (2025-06-05T04:12:36Z) - ThinkGeo: Evaluating Tool-Augmented Agents for Remote Sensing Tasks [64.86209459039313]
ThinkGeoは、構造化ツールの使用とマルチステップ計画を通じて、リモートセンシングタスクにおけるツール拡張エージェントを評価するために設計されたエージェントベンチマークである。
我々はReActスタイルの対話ループを実装し,486 個の構造化エージェントタスク上でのオープンソース LLM とクローズドソース LLM の両方を1,773 個の専門家が検証した推論ステップで評価する。
分析の結果、ツールの精度とモデル間の計画整合性に顕著な相違が明らかになった。
論文 参考訳(メタデータ) (2025-05-29T17:59:38Z) - MAPLE: A Mobile Agent with Persistent Finite State Machines for Structured Task Reasoning [46.18718721121415]
アプリケーションインタラクションをFSM(Finite State Machine)として抽象化する,状態認識型マルチエージェントフレームワークMAPLEを提案する。
それぞれのUI画面を離散状態として、ユーザアクションをトランジションとしてモデル化し、FSMがアプリケーション実行の構造化された表現を提供できるようにします。
MAPLEは、計画、実行、検証、エラー回復、知識保持という4段階のタスク実行に責任を持つ特殊エージェントで構成されている。
論文 参考訳(メタデータ) (2025-05-29T16:08:51Z) - MobileAgentBench: An Efficient and User-Friendly Benchmark for Mobile LLM Agents [7.4568642040547894]
大規模言語モデル(LLM)ベースのモバイルエージェントは、携帯電話のグラフィカルユーザインタフェース(GUI)と直接対話できることから、ますます人気が高まっている。
学術部門と産業部門の両方で有望な見通しにもかかわらず、既存のモバイルエージェントのパフォーマンスをベンチマークすることに注力する研究はほとんどない。
我々は、広範囲な手動テストの負担を軽減するために、効率的でユーザフレンドリなベンチマークMobileAgentBenchを提案する。
論文 参考訳(メタデータ) (2024-06-12T13:14:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。