論文の概要: UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning
- arxiv url: http://arxiv.org/abs/2607.04425v1
- Date: Sun, 05 Jul 2026 17:37:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.926311
- Title: UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning
- Title(参考訳): UI-MOPD:連続GUIエージェント学習のためのマルチプラットフォームオンポリティ蒸留
- Abstract要約: GUIエージェントの連続学習に多教師のオンライン蒸留を組み込むUI-MOPDを提案する。
OSWorldとMobileWorldの実験では、UI-MOPDはそれぞれ38.2%と12.0%のタスク成功率が達成されている。
- 参考スコア(独自算出の注目度): 67.45909103605858
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in multimodal foundation models and agent systems have driven GUI agents from single-platform task execution toward cross-platform interaction. However, building multi-platform GUI agents remains challenging. On one hand, high-quality and executable cross-platform interaction trajectories are still scarce, and existing data often suffer from limited platform coverage. On the other hand, different platforms exhibit distinct interaction conventions, making joint or continual training prone to behavioral pattern mixing, platform-specific capability degradation, and catastrophic forgetting. To address these challenges, we construct Uni-GUI, a high-quality cross-platform GUI interaction dataset, and propose UI-MOPD, the first method that incorporates multi-teacher on-policy distillation into continual learning for GUI agents. UI-MOPD dynamically selects a platform-specific teacher according to the current environment and transfers platform-specific behavioral priors to a shared policy through platform-conditioned distillation, enabling adaptation to new platforms while preserving capabilities on existing ones. Experiments on OSWorld and MobileWorld show that UI-MOPD achieves task success rates of 38.2% and 12.0%, respectively, demonstrating its effectiveness in balancing cross-platform capability retention and new-platform adaptation. Project page: https://elispectre.github.io/UI-MOPD/.
- Abstract(参考訳): マルチモーダル基盤モデルやエージェントシステムの最近の進歩は、GUIエージェントを単一プラットフォームタスク実行からクロスプラットフォームインタラクションへと駆り立てている。
しかし、マルチプラットフォームGUIエージェントの構築は依然として困難である。
一方、高品質で実行可能なクロスプラットフォームのインタラクショントラジェクトリは依然として不足しており、既存のデータは制限されたプラットフォームカバレッジに悩まされることが多い。
一方、異なるプラットフォームは異なる相互作用の慣習を示しており、共同または連続的なトレーニングは、行動パターンの混合、プラットフォーム固有の能力劣化、破滅的な忘れをしがちである。
これらの課題に対処するため、高品質なクロスプラットフォームGUIインタラクションデータセットであるUni-GUIを構築し、マルチテラーオンライン蒸留をGUIエージェントの連続学習に組み込む最初の方法であるUI-MOPDを提案する。
UI-MOPDは、現在の環境に応じてプラットフォーム固有の教師を動的に選択し、プラットフォーム条件の蒸留を通じてプラットフォーム固有の行動先を共有ポリシーに転送する。
OSWorldとMobileWorldの実験では、UI-MOPDはそれぞれ38.2%と12.0%のタスク成功率を達成しており、クロスプラットフォームの能力維持と新しいプラットフォーム適応のバランスをとる上での有効性を示している。
プロジェクトページ: https://elispectre.github.io/UI-MOPD/。
関連論文リスト
- JarvisGUI: Towards Cross-Device GUI Agents with Dynamic Task Composition [51.15720718264743]
プラットフォーム間の協調的なインタラクションを必要とするデバイス間通信におけるGUIエージェントの評価を行う動的ベンチマークであるJarvisGUIを紹介する。
JarvisGUIは、GUIタスクを軽量な型システムの下で入力出力変換として定式化し、複数ステップのクロスデバイス変換を自動的に構成する。
我々は、最先端のオープンソースGUIエージェントが、実際の使用に必要な状態遷移認識、クロスプラットフォームのコンテキスト推論、長期水平依存性管理に苦労していることを示します。
論文 参考訳(メタデータ) (2026-09-09T16:59:59Z) - LLM-Augmented Digital Twin for Policy Evaluation in Short-Video Platforms [12.693132563364342]
ショートビデオプラットフォームはクローズドループ、ヒューマン・イン・ザ・ループのエコシステムであり、ポリシー、クリエーターのインセンティブ、ユーザー行動が共進化する。
モジュール式4ツインアーキテクチャを持つショートビデオプラットフォームに対して,大規模言語モデル(LLM)を付加したディジタルツインを提案する。
論文 参考訳(メタデータ) (2026-03-11T21:50:21Z) - Yanyun-3: Enabling Cross-Platform Strategy Game Operation with Vision-Language Models [30.591909012704978]
Yanyun-3は、ビジュアル推論のためのQwen2.5-VLとインターフェイス実行のためのUI-TARSを統合したVLMベースのエージェントである。
マルチモーダルデータのサンプル内融合とサンプル間混合を区別する新しいデータ組織原理を提案する。
Yanyun-3はGUI自動化のための汎用的なフレームワークを提供する。
論文 参考訳(メタデータ) (2025-11-17T03:45:15Z) - Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation [65.3648667980258]
視覚言語モデル(VLM)に基づくGUIエージェントは複雑なタスクの自動化を約束するが、強化学習(RL)の適用において大きな課題に直面している。
異種モジュールを高度に非結合的に協調するGUIエージェントのための非結合エージェントRLトレーニングフレームワークであるDARTを提案する。
OSWorldのベンチマークでは、DART-GUI-7Bは42.13%のタスク成功率、14.61%の絶対ゲイン、オープンソースSOTAよりも7.34%高い。
論文 参考訳(メタデータ) (2025-09-28T13:19:20Z) - UIPro: Unleashing Superior Interaction Capability For GUI Agents [33.77980648230746]
人間のようなグラフィカルユーザインタフェース(GUI)を知覚し、操作する自律エージェントの構築は、人工知能の分野における長年のビジョンである。
視覚言語モデル(VLM)のマルチモーダル理解能力に基づくGUIエージェントの開発が試みられている。
本稿では,多プラットフォーム・マルチタスクGUIインタラクションデータを用いた新しい汎用GUIエージェントであるtextUIProを提案する。
論文 参考訳(メタデータ) (2025-09-22T03:04:53Z) - MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment [63.62778707277929]
MobileGUI-RLは、オンライン環境でGUIエージェントをトレーニングするスケーラブルなフレームワークである。
自己探索とフィルタリングを通じて学習可能なタスクのカリキュラムを合成する。
GRPOをGUIナビゲーションに適応させ、軌道認識の利点と複合報酬を付与する。
論文 参考訳(メタデータ) (2025-07-08T07:07:53Z) - AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning [82.42421823672954]
AgentCPM-GUIは、堅牢で効率的なオンデバイスGUIインタラクションのために構築されている。
私たちのトレーニングパイプラインには、知覚を高めるためのグラウンドアウェア事前トレーニングが含まれています。
AgentCPM-GUIは5つの公開ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-06-02T07:30:29Z) - UI-TARS: Pioneering Automated GUI Interaction with Native Agents [58.18100825673032]
本稿では,GUIエージェントのネイティブモデルであるUI-TARSを紹介する。
OSWorldベンチマークでは、UI-TARSはスコアが24.6、50ステップが22.7、15ステップが22.7でクロード(それぞれ22.0と14.9)を上回っている。
論文 参考訳(メタデータ) (2025-01-21T17:48:10Z) - Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction [69.57190742976091]
Aguvisは、自律的なGUIエージェントのためのビジョンベースのフレームワークである。
クロスプラットフォームのインタラクションを標準化し、内部モノローグによる構造化推論を取り入れている。
オフラインおよび実世界のオンラインベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-12-05T18:58:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。