論文の概要: PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent
- arxiv url: http://arxiv.org/abs/2603.29318v1
- Date: Tue, 31 Mar 2026 06:37:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-01 15:25:03.23634
- Title: PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent
- Title(参考訳): PSPA-Bench: スマートフォンGUIエージェントのパーソナライズされたベンチマーク
- Authors: Hongyi Nie, Xunyuan Liu, Yudong Bai, Yaqing Wang, Yang Liu, Quanming Yao, Zhen Wang,
- Abstract要約: PSPA-Benchは、スマートフォンGUIエージェントのパーソナライゼーションを評価するためのベンチマークである。
PSPA-Benchは、現実世界のユーザの振る舞いに合わせて12,855以上のパーソナライズされた命令で構成されている。
その結果、現在の手法はパーソナライズされた設定下では不十分であることが判明した。
- 参考スコア(独自算出の注目度): 32.14146282263351
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Smartphone GUI agents execute tasks by operating directly on app interfaces, offering a path to broad capability without deep system integration. However, real-world smartphone use is highly personalized: users adopt diverse workflows and preferences, challenging agents to deliver customized assistance rather than generic solutions. Existing GUI agent benchmarks cannot adequately capture this personalization dimension due to sparse user-specific data and the lack of fine-grained evaluation metrics. To address this gap, we present PSPA-Bench, the benchmark dedicated to evaluating personalization in smartphone GUI agents. PSPA-Bench comprises over 12,855 personalized instructions aligned with real-world user behaviors across 10 representative daily-use scenarios and 22 mobile apps, and introduces a structure-aware process evaluation method that measures agents' personalized capabilities at a fine-grained level. Through PSPA-Bench, we benchmark 11 state-of-the-art GUI agents. Results reveal that current methods perform poorly under personalized settings, with even the strongest agent achieving limited success. Our analysis further highlights three directions for advancing personalized GUI agents: (1) reasoning-oriented models consistently outperform general LLMs, (2) perception remains a simple yet critical capability, and (3) reflection and long-term memory mechanisms are key to improving adaptation. Together, these findings establish PSPA-Bench as a foundation for systematic study and future progress in personalized GUI agents.
- Abstract(参考訳): スマートフォンGUIエージェントは、アプリインターフェースを直接操作することでタスクを実行する。
しかし、現実世界のスマートフォンの利用は非常にパーソナライズされており、ユーザーは多様なワークフローや好みを採用しており、汎用ソリューションではなくカスタマイズされたアシスタントを提供することに挑戦している。
既存のGUIエージェントベンチマークでは、ユーザ固有のデータが不足し、詳細な評価基準が欠如しているため、このパーソナライズ次元を適切に把握できない。
このギャップに対処するため,スマートフォンGUIエージェントのパーソナライズ評価のためのベンチマークPSPA-Benchを提案する。
PSPA-Benchは10の日用シナリオと22のモバイルアプリにまたがる現実世界のユーザ行動に合わせた12,855以上のパーソナライズされたインストラクションで構成されており、エージェントのパーソナライズされた機能をきめ細かいレベルで測定する構造対応プロセス評価手法を導入している。
PSPA-Benchを通じて、11の最先端GUIエージェントをベンチマークする。
その結果、現在の手法はパーソナライズされた設定下では性能が悪く、最強のエージェントでさえ限られた成功を収めていることがわかった。
分析では, パーソナライズされたGUIエージェントを進化させる3つの方向をさらに強調する: 1) 推論指向モデルが一般のLLMを一貫して上回り, (2) 認識がシンプルで重要な能力であり, (3) 反射と長期記憶機構が適応を改善する鍵となる。
これらの知見は,PSPA-Benchを,個人化されたGUIエージェントの体系的研究と今後の進歩の基盤として確立している。
関連論文リスト
- ProBench: Benchmarking GUI Agents with Accurate Process Information [15.519853892615272]
ProBenchは、広く使われているシナリオをカバーする200以上のGUIタスクからなる包括的なベンチマークである。
データセットをプロセス関連タスクに拡張し、特殊な評価手法を設計する。
先進的なGUIエージェントを評価した結果,現実のGUIシナリオには大きな制限があることがわかった。
論文 参考訳(メタデータ) (2025-11-12T09:49:31Z) - PersonaAgent: When Large Language Model Agents Meet Personalization at Test Time [87.99027488664282]
PersonaAgentは、汎用的なパーソナライゼーションタスクに対処するために設計されたフレームワークである。
パーソナライズされたメモリモジュールとパーソナライズされたアクションモジュールを統合する。
テストタイムのユーザ嗜好アライメント戦略は、リアルタイムのユーザの嗜好アライメントを保証する。
論文 参考訳(メタデータ) (2025-06-06T17:29:49Z) - Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation [83.92224427735859]
実際の実行に先立って効果的なフィードバックを提供する事前の批判機構を導入する。
そこで我々は,GUI-Critic-TrainとGUI-Critic-Testを作成するために,推論ブートストラップに基づくデータ収集パイプラインを開発した。
我々のモデルは、現在のMLLMと比較して、批評家の精度に大きな利点をもたらす。
論文 参考訳(メタデータ) (2025-06-05T04:12:36Z) - AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning [82.42421823672954]
AgentCPM-GUIは、堅牢で効率的なオンデバイスGUIインタラクションのために構築されている。
私たちのトレーニングパイプラインには、知覚を高めるためのグラウンドアウェア事前トレーニングが含まれています。
AgentCPM-GUIは5つの公開ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-06-02T07:30:29Z) - GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration [22.814882629516635]
GUI-Xploreは、クロスアプリケーションとクロスタスクの一般化を強化するために細心の注意を払って設計されたデータセットである。
GUI-Xploreのユニークな機能をフル活用するために,Action-aware GUI ModelingとGraph-Guided Environment Reasoningを組み合わせたGUIエージェントフレームワークであるXplore-Agentを提案する。
論文 参考訳(メタデータ) (2025-03-22T09:30:37Z) - UI-TARS: Pioneering Automated GUI Interaction with Native Agents [58.18100825673032]
本稿では,GUIエージェントのネイティブモデルであるUI-TARSを紹介する。
OSWorldベンチマークでは、UI-TARSはスコアが24.6、50ステップが22.7、15ステップが22.7でクロード(それぞれ22.0と14.9)を上回っている。
論文 参考訳(メタデータ) (2025-01-21T17:48:10Z) - Zero-Shot Prompting Approaches for LLM-based Graphical User Interface Generation [53.1000575179389]
LLMに基づくGUI検索とフィルタリング機構を統合した検索型GUI生成(RAGG)手法を提案する。
また,GUI 生成に Prompt Decomposition (PDGG) と Self-Critique (SCGG) を適用した。
UI/UX経験を持つ100人以上の集団作業者の3000以上のGUIアノテーションを対象とし,SPGGはPDGGやRAGGとは対照的に,より効果的なGUI生成につながる可能性が示唆された。
論文 参考訳(メタデータ) (2024-12-15T22:17:30Z) - ASSISTGUI: Task-Oriented Desktop Graphical User Interface Automation [30.693616802332745]
本稿では,ユーザが要求するタスクに応じて,Windowsプラットフォーム上でマウスとキーボードを操作することができるかどうかを評価するための新しいベンチマーク,AssistGUIを提案する。
本稿では,AIエージェントによって駆動される高度なGUIを組み込んだ高度なアクタ・クリティカル・フレームワークを提案する。
論文 参考訳(メタデータ) (2023-12-20T15:28:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。