論文の概要: UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization
- arxiv url: http://arxiv.org/abs/2604.13822v1
- Date: Wed, 15 Apr 2026 12:55:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-16 20:38:32.542572
- Title: UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization
- Title(参考訳): UI-Copilot: ツール統合ポリシー最適化による長距離GUI自動化の改善
- Authors: Zhengxi Lu, Fei Tang, Guangyi Liu, Kaitao Song, Xu Tan, Jin Ma, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen,
- Abstract要約: 実験の結果, UI-Copilot-7BはMemGUI-Benchに挑戦する上で最先端の性能を発揮することがわかった。
UI-Copilot-7BはAndroidWorldのQwenベースモデルに対して17.1%の絶対的な改善を提供する。
- 参考スコア(独自算出の注目度): 70.85564601986263
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: MLLM-based GUI agents have demonstrated strong capabilities in complex user interface interaction tasks. However, long-horizon scenarios remain challenging, as these agents are burdened with tasks beyond their intrinsic capabilities, suffering from memory degradation, progress confusion, and math hallucination. To address these challenges, we present UI-Copilot, a collaborative framework where the GUI agent focuses on task execution while a lightweight copilot provides on-demand assistance for memory retrieval and numerical computation. We introduce memory decoupling to separate persistent observations from transient execution context, and train the policy agent to selectively invoke the copilot as Retriever or Calculator based on task demands. To enable effective tool invocation learning, we propose Tool-Integrated Policy Optimization (TIPO), which separately optimizes tool selection through single-turn prediction and task execution through on-policy multi-turn rollouts. Experimental results show that UI-Copilot-7B achieves state-of-the-art performance on challenging MemGUI-Bench, outperforming strong 7B-scale GUI agents such as GUI-Owl-7B and UI-TARS-1.5-7B. Moreover, UI-Copilot-7B delivers a 17.1% absolute improvement on AndroidWorld over the base Qwen model, highlighting UI-Copilot's strong generalization to real-world GUI tasks.
- Abstract(参考訳): MLLMベースのGUIエージェントは、複雑なユーザインタフェースのインタラクションタスクにおいて強力な機能を示している。
しかし、これらのエージェントは、記憶の劣化、進行の混乱、数学の幻覚に苦しむ、本質的な能力以上のタスクに悩まされているため、長期的なシナリオは依然として困難なままである。
このような課題に対処するために,GUIエージェントがタスク実行に重点を置く協調フレームワークであるUI-Copilotを提案する。
本稿では,過渡的な実行状況から永続的な観測を分離するためにメモリデカップリングを導入し,タスク要求に基づいてポリシーエージェントを訓練してRetriever や Calculator としてコーピロを選択的に呼び出す。
効果的なツール実行学習を実現するため,TIPO (Tool-Integrated Policy Optimization) を提案する。
UI-Copilot-7Bは,GUI-Owl-7BやUI-TARS-1.5-7Bなど,強力な7BスケールのGUIエージェントよりも優れた性能を示す。
さらに、UI-Copilot-7Bは、Qwenモデルに対するAndroidWorldの17.1%の絶対的な改善をもたらし、UI-Copilotの現実世界のGUIタスクへの強力な一般化を強調している。
関連論文リスト
- UIPro: Unleashing Superior Interaction Capability For GUI Agents [33.77980648230746]
人間のようなグラフィカルユーザインタフェース(GUI)を知覚し、操作する自律エージェントの構築は、人工知能の分野における長年のビジョンである。
視覚言語モデル(VLM)のマルチモーダル理解能力に基づくGUIエージェントの開発が試みられている。
本稿では,多プラットフォーム・マルチタスクGUIインタラクションデータを用いた新しい汎用GUIエージェントであるtextUIProを提案する。
論文 参考訳(メタデータ) (2025-09-22T03:04:53Z) - UItron: Foundational GUI Agent with Advanced Perception and Planning [13.67797194012135]
本稿では,GUIの高度な認識,接地,計画機能を備えた自動GUIエージェントのオープンソースモデルを提案する。
UItronはGUIエージェント開発を進める上で,基本的なコンポーネントとして,システムデータエンジニアリングとインタラクティブインフラストラクチャの必要性を強調している。
私たちは手作業で100万以上の操作トラジェクトリを、最も人気のあるアプリのトップ100に集め、オフラインおよびオンラインエージェント評価環境を構築しました。
論文 参考訳(メタデータ) (2025-08-29T16:40:57Z) - MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents [88.35544552383581]
MMBench-GUIは、Windows、Linux、iOS、Android、WebプラットフォームでGUI自動化エージェントを評価する階層的なベンチマークである。
GUIコンテンツ理解、要素グラウンディング、タスク自動化、タスクコラボレーションの4つのレベルで構成されており、GUIエージェントに必要なスキルをカバーしています。
論文 参考訳(メタデータ) (2025-07-25T17:59:26Z) - MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment [63.62778707277929]
MobileGUI-RLは、オンライン環境でGUIエージェントをトレーニングするスケーラブルなフレームワークである。
自己探索とフィルタリングを通じて学習可能なタスクのカリキュラムを合成する。
GRPOをGUIナビゲーションに適応させ、軌道認識の利点と複合報酬を付与する。
論文 参考訳(メタデータ) (2025-07-08T07:07:53Z) - AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning [82.42421823672954]
AgentCPM-GUIは、堅牢で効率的なオンデバイスGUIインタラクションのために構築されている。
私たちのトレーニングパイプラインには、知覚を高めるためのグラウンドアウェア事前トレーニングが含まれています。
AgentCPM-GUIは5つの公開ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-06-02T07:30:29Z) - Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction [69.57190742976091]
Aguvisは、自律的なGUIエージェントのためのビジョンベースのフレームワークである。
クロスプラットフォームのインタラクションを標準化し、内部モノローグによる構造化推論を取り入れている。
オフラインおよび実世界のオンラインベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-12-05T18:58:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。