論文の概要: Step-GUI Technical Report
- arxiv url: http://arxiv.org/abs/2512.15431v2
- Date: Fri, 19 Dec 2025 17:36:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-12-22 13:33:13.530698
- Title: Step-GUI Technical Report
- Title(参考訳): Step-GUI技術報告
- Abstract要約: 本稿では,Calibrated Step Reward Systemを利用した自己進化型トレーニングパイプラインを提案する。
また、最先端のGUI性能を実現するモデル群であるStep-GUIについても紹介する。
エージェントが日常的に使えるかどうかを評価するために,AndroidDailyを紹介した。
- 参考スコア(独自算出の注目度): 84.83795946544292
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in multimodal large language models unlock unprecedented opportunities for GUI automation. However, a fundamental challenge remains: how to efficiently acquire high-quality training data while maintaining annotation reliability? We introduce a self-evolving training pipeline powered by the Calibrated Step Reward System, which converts model-generated trajectories into reliable training signals through trajectory-level calibration, achieving >90% annotation accuracy with 10-100x lower cost. Leveraging this pipeline, we introduce Step-GUI, a family of models (4B/8B) that achieves state-of-the-art GUI performance (8B: 80.2% AndroidWorld, 48.5% OSWorld, 62.6% ScreenShot-Pro) while maintaining robust general capabilities. As GUI agent capabilities improve, practical deployment demands standardized interfaces across heterogeneous devices while protecting user privacy. To this end, we propose GUI-MCP, the first Model Context Protocol for GUI automation with hierarchical architecture that combines low-level atomic operations and high-level task delegation to local specialist models, enabling high-privacy execution where sensitive data stays on-device. Finally, to assess whether agents can handle authentic everyday usage, we introduce AndroidDaily, a benchmark grounded in real-world mobile usage patterns with 3146 static actions and 235 end-to-end tasks across high-frequency daily scenarios (8B: static 89.91%, end-to-end 52.50%). Our work advances the development of practical GUI agents and demonstrates strong potential for real-world deployment in everyday digital interactions.
- Abstract(参考訳): マルチモーダルな大規模言語モデルの最近の進歩は、GUI自動化の先例のない機会を解放している。
しかし、基本的な課題は残る: アノテーションの信頼性を維持しながら、高品質なトレーニングデータを効率的に取得する方法。
モデル生成トラジェクトリをトラジェクトリレベルのキャリブレーションによって信頼性の高いトレーニング信号に変換し、10-100倍のコストで90%以上の精度でアノテーションを精度良く達成する、Calibrated Step Reward Systemによる自己進化型トレーニングパイプラインを導入する。
このパイプラインを活用して、最先端のGUIパフォーマンス(8B: 80.2% AndroidWorld、48.5% OSWorld、62.6% ScreenShot-Pro)を実現するモデルのファミリー(4B/8B)であるStep-GUIを紹介します。
GUIエージェントの能力が向上するにつれて、ユーザプライバシを保護すると同時に、異機種間のインターフェースの標準化が要求される。
そこで本研究では,GUI自動化のための最初のモデルコンテキストプロトコルであるGUI-MCPを提案する。
最後に、エージェントが真の日常的使用を処理できるかどうかを評価するために、AndroidDailyを紹介します。これは、3146の静的アクションと235のエンドツーエンドタスク(8B: static 89.91%、 end-to-end 52.50%)を備えた、実世界のモバイル利用パターンを基盤としたベンチマークです。
本研究は,実用的なGUIエージェントの開発を推進し,日々のデジタルインタラクションにおける現実世界の展開の可能性を示すものである。
関連論文リスト
- Xiaomi-GUI-0 Technical Report [39.05385476532886]
Xiaomi-GUI-0は、実際のモバイル環境向けのネイティブなマルチモーダルGUIエージェントである。
教師付き微調整、ステップレベルの強化学習、エージェントによる強化学習という3段階のパイプラインを通じて訓練される。
RealMobileで72.0%、AndroidWorldで78.9%を達成し、実際のタスクにおける実行安定性と異常状態認識を大幅に改善した。
論文 参考訳(メタデータ) (2026-06-30T09:36:35Z) - UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience [56.50613398808361]
本稿では,新しい2段階自己進化型モバイルGUIエージェントを提案する。
最初の段階では、完全に自律的なループでデータとモデルの継続的な共進化を可能にするRejection Fine-Tuning (RFT) を採用しています。
第2段階はグループ相対自己蒸留(GRSD)を導入し、グループロールアウトにおける重要なフォークポイントを特定し、成功軌道から失敗軌道の修正に至るまで、密度の高いステップレベルの監視を構築する。
論文 参考訳(メタデータ) (2026-03-25T17:10:29Z) - POINTS-GUI-G: GUI-Grounding Journey [22.35782799756431]
POINTS-GUIG-8Bは、ScreenSpotProで59.9、OSWorld-Gで66.0、ScreenSpot-v2で95.7、UIVisionで49.9のスコアで最先端のパフォーマンスを実現する。
モデルの成功は,(1)データ工学の精錬,(2)訓練戦略の改善,(3)検証されたリワードによる強化学習の3つの要因によって引き起こされる。
論文 参考訳(メタデータ) (2026-02-06T05:14:11Z) - Mano Technical Report [29.551514304095296]
Manoは、大規模なWebおよびコンピュータシステムデータに基づいて事前訓練されたマルチモーダル基盤モデル上に構築された堅牢なGUIエージェントである。
Mano氏は、Mind2WebやOSWorldなど、複数のGUIベンチマークで最先端のパフォーマンスをデモしている。
論文 参考訳(メタデータ) (2025-09-22T03:13:58Z) - UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning [155.51875080423883]
グラフィカルユーザインタフェースのための自律エージェントの開発は、人工知能における大きな課題を示している。
本稿では,GUI中心のエージェントモデルであるUI-TARS-2を提案する。
実証的な評価では、UI-TARS-2は以前のUI-TARS-1.5よりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-09-02T17:44:45Z) - MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents [88.35544552383581]
MMBench-GUIは、Windows、Linux、iOS、Android、WebプラットフォームでGUI自動化エージェントを評価する階層的なベンチマークである。
GUIコンテンツ理解、要素グラウンディング、タスク自動化、タスクコラボレーションの4つのレベルで構成されており、GUIエージェントに必要なスキルをカバーしています。
論文 参考訳(メタデータ) (2025-07-25T17:59:26Z) - Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation [83.92224427735859]
実際の実行に先立って効果的なフィードバックを提供する事前の批判機構を導入する。
そこで我々は,GUI-Critic-TrainとGUI-Critic-Testを作成するために,推論ブートストラップに基づくデータ収集パイプラインを開発した。
我々のモデルは、現在のMLLMと比較して、批評家の精度に大きな利点をもたらす。
論文 参考訳(メタデータ) (2025-06-05T04:12:36Z) - AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning [82.42421823672954]
AgentCPM-GUIは、堅牢で効率的なオンデバイスGUIインタラクションのために構築されている。
私たちのトレーニングパイプラインには、知覚を高めるためのグラウンドアウェア事前トレーニングが含まれています。
AgentCPM-GUIは5つの公開ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-06-02T07:30:29Z) - Breaking the Data Barrier -- Building GUI Agents Through Task Generalization [25.129269032612832]
本研究では,データ豊かで推論集約的なタスクにおける視覚言語モデル(VLM)のトレーニングを提案する。
本稿では,GUI認識,マルチモーダル推論,テキスト推論など,手軽に利用できるインストラクションチューニングデータを用いて,さまざまなタスクを探索する。
われわれの研究はGUIエージェントのドメイン間知識伝達に関する貴重な知見を提供し、データの不足に対処するための実践的なアプローチを提供する。
論文 参考訳(メタデータ) (2025-04-14T11:35:02Z) - AutoGLM: Autonomous Foundation Agents for GUIs [51.276965515952]
我々は、グラフィカルユーザインタフェース(GUI)を介してデジタルデバイスを自律的に制御するための基礎エージェントとして設計された、ChatGLMファミリーの新しいシリーズであるAutoGLMを紹介する。
実世界のGUIインタラクションのための実践的基礎エージェントシステムとしてAutoGLMを開発した。
評価では、AutoGLMが複数のドメインにまたがって有効であることを示す。
論文 参考訳(メタデータ) (2024-10-28T17:05:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。