論文の概要: MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks
- arxiv url: http://arxiv.org/abs/2608.23035v2
- Date: Tue, 25 Aug 2026 04:26:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.204831
- Title: MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks
- Title(参考訳): MobilePA-Bench: 複雑な実世界のタスクにおけるモバイルプランナエージェントのベンチマーク
- Abstract要約: モバイルプランニングエージェントのツールコールと計画能力を評価するための,インタラクティブでステートフルでツール中心のベンチマークである textbfMobilePA-Bench を提案する。
MobilePA-Benchは、ライブアプリケーションデータベースを保持し、構造化されたフィードバックを返す実行可能なサンドボックスで動作し、13ドルの機能ドメインと212ドルのリアルなモバイルツールにまたがる。
対話型関数呼び出しサンドボックスとエビデンスベースの検証を組み合わせることで、MobilePA-Benchは実用的な診断ベンチマークとエージェント強化学習のための対話型基盤の両方として機能する。
- 参考スコア(独自算出の注目度): 37.73689537216401
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As on-device LLM agents evolve into personal copilots, the mobile operating system has become a key testbed for this paradigm, making rigorous capability evaluation essential. Yet existing benchmarks fall into two camps, each with a critical blind spot: GUI-centric benchmarks test surface-level screen manipulation while overlooking background tool use and long-horizon planning, whereas static function-calling benchmarks rely on offline API matching that is detached from real runtime constraints. To close this gap, we present \textbf{MobilePA-Bench}, an interactive, stateful, and tool-centric benchmark for evaluating the tool-calling and planning abilities of mobile planning agents. MobilePA-Bench runs on an executable sandbox that maintains live application databases and returns structured feedback, spanning $13$ functional domains and $212$ realistic mobile tools. Beyond basic tool use, it evaluates a central planning agent along three advanced dimensions: \emph{(1)~Sub-agent Collaboration}---decomposing a complex task and delegating specialized work to capable sub-agents; \emph{(2)~Memory Usage}---recalling stored memories, user profiles, and past preferences to resolve implicit requests; and \emph{(3)~Skill Usage}---invoking pre-packaged composite skills instead of planning every step from scratch. Extensive experiments show that current frontier LLMs remain unreliable in mobile settings: performance drops sharply under strict tool ordering, permission limits, and unexpected runtime errors. By pairing an interactive function-calling sandbox with evidence-based verification, MobilePA-Bench serves as both a practical diagnostic benchmark and an interactive foundation for agentic reinforcement learning---accelerating the development of dependable mobile agents.
- Abstract(参考訳): デバイス上のLDMエージェントがパーソナルコピロに進化するにつれて、モバイルオペレーティングシステムはこのパラダイムの鍵となるテストベッドとなり、厳格な能力評価が不可欠になっている。
GUI中心のベンチマークは、バックグラウンドツールの使用と長期計画を見下ろしながら、表面レベルの画面操作をテストしますが、静的関数呼び出しベンチマークは、実際のランタイム制約から切り離されたオフラインAPIマッチングに依存しています。
このギャップを埋めるために、モバイルプランニングエージェントのツール呼び出しと計画能力を評価するためのインタラクティブでステートフルでツール中心のベンチマークである‘textbf{MobilePA-Bench} を提示する。
MobilePA-Benchは、ライブアプリケーションデータベースを保持し、構造化されたフィードバックを返す実行可能なサンドボックスで動作し、13ドルの機能ドメインと212ドルのリアルなモバイルツールにまたがる。
基本的なツールの使用以外にも、複雑なタスクを分解して有能なサブエージェントに専門的な作業を委譲する \emph{(1)~Sub-agent Collaboration}、暗黙の要求を解決するために記憶された記憶、ユーザープロファイル、過去の好みをリコールする \emph{(3)~Skill Usage}、パッケージ済みの複合スキルをスクラッチから計画する代わりに起動する \emph{(3)〜Skill Usage}の3つの先進的な側面に沿って中央計画エージェントを評価する。
大規模な実験では、現在のフロンティアLSMはモバイル環境では信頼性が低いことが示されている。
対話型関数呼び出しサンドボックスとエビデンスベースの検証を組み合わせることで、MobilePA-Benchは実用的な診断ベンチマークとエージェント強化学習のためのインタラクティブな基盤として機能し、信頼性の高いモバイルエージェントの開発を加速する。
関連論文リスト
- DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows [69.12339622053588]
我々はDuMateBenchを紹介した。DuMateBenchは匿名化およびプライバシスクリーニングによるユーザセッションから再構築されたリアルセッションベンチマークである。
結果として得られたベンチマークは、8つの広いシナリオにまたがる200のタスクと、17のきめ細かい機能カテゴリで構成されている。
これらのタスクは、Isufficient、Unstable、Noisyの3種類の環境複雑性を注入した、分離されたDockerコンテナで実行します。
論文 参考訳(メタデータ) (2026-08-27T02:36:23Z) - Trajectory2Task: Training Robust Tool-Calling Agents with Synthesized Yet Verifiable Data for Complex User Intents [52.30603055218294]
Trajectory2Taskは,3つの現実的なユーザシナリオの下で大規模なツール使用を研究するための,検証可能なデータ生成パイプラインである。
有効なツールコールトラジェクトリを、制御されたインテント適応を伴うユーザ向けタスクに変換する。
我々は、生成された複雑なユーザシナリオタスクに対して、7つの最先端のLCMをベンチマークし、頻繁な障害を観察する。
論文 参考訳(メタデータ) (2026-01-28T00:36:13Z) - DeepAgent: A General Reasoning Agent with Scalable Toolsets [111.6384541877723]
DeepAgentは、自律的な思考、ツール発見、アクション実行を実行するエンドツーエンドのディープ推論エージェントである。
長期にわたる相互作用の課題に対処するために,過去の相互作用を構造化エピソード,動作,ツール記憶に圧縮する自律的メモリ折り畳み機構を導入する。
LLMシミュレートされたAPIを活用し、ツール呼び出しトークンにきめ細かいクレジットを割り当てるツールコールアドバンテージ属性を適用した、エンドツーエンドの強化学習戦略であるToolPOを開発した。
論文 参考訳(メタデータ) (2025-10-24T16:24:01Z) - ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks [37.79008306764891]
実世界のタスクは複雑で、複数の有効なソリューションが可能である。
オフラインベンチマークは、1つの事前定義された"ゴールドパス"のみを検証することができる
オンライン動的テストは、実際のデバイスの複雑さと非再現性によって制約される。
本稿では,新しいグラフ構造化ベンチマークフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-16T12:30:05Z) - Visual Document Understanding and Question Answering: A Multi-Agent Collaboration Framework with Test-Time Scaling [83.78874399606379]
テスト時間スケーリングを備えたマルチエージェント協調フレームワークであるMACTを提案する。
4つの異なる小規模エージェントから構成され、明確に定義された役割と効果的なコラボレーションがある。
一般および数学的タスクの能力を犠牲にすることなく、より小さなパラメータスケールで優れた性能を示す。
論文 参考訳(メタデータ) (2025-08-05T12:52:09Z) - Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents [33.899782380901314]
VLMベースのモバイルエージェントは、スマートフォンのGUIやXML構造化テキストと対話できることから、ますます人気が高まっている。
既存のオンラインベンチマークは、動的環境変化による安定した報酬信号を得るのに苦労している。
Mobile-Bench-v2は共通タスク分割を含み、オフラインのマルチパス評価によってエージェントがステップ報酬を得る能力を評価する。
論文 参考訳(メタデータ) (2025-05-17T07:58:34Z) - SPA-Bench: A Comprehensive Benchmark for SmartPhone Agent Evaluation [89.24729958546168]
スマートフォンエージェントは、ユーザーがデバイスを効率的に制御するのを助けるためにますます重要になっている。
We present SPA-Bench, a comprehensive SmartPhone Agent Benchmark designed to evaluate (M)LLM-based agent。
論文 参考訳(メタデータ) (2024-10-19T17:28:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。