論文の概要: Xiaomi-GUI-0 Technical Report
- arxiv url: http://arxiv.org/abs/2606.31410v2
- Date: Wed, 01 Jul 2026 03:59:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 17:29:49.645302
- Title: Xiaomi-GUI-0 Technical Report
- Title(参考訳): Xiaomi-GUI-0テクニカルレポート
- Abstract要約: Xiaomi-GUI-0は、実際のモバイル環境向けのネイティブなマルチモーダルGUIエージェントである。
教師付き微調整、ステップレベルの強化学習、エージェントによる強化学習という3段階のパイプラインを通じて訓練される。
RealMobileで72.0%、AndroidWorldで78.9%を達成し、実際のタスクにおける実行安定性と異常状態認識を大幅に改善した。
- 参考スコア(独自算出の注目度): 39.05385476532886
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Graphical user interface (GUI) agents build on vision-language models to complete user tasks end-to-end in real applications through interface actions such as tapping, swiping, text entry, and navigation. However, existing GUI agents are trained and evaluated largely on offline trajectories, simulated environments, and standardized benchmarks. These differ substantially from real applications in interface layout, interaction logic, and abnormal-state distribution, and cannot faithfully characterize execution stability in real-world use, where account states, permission dialogs, payment authentication, and risk control continually reshape the state distribution and open a persistent gap between benchmark scores and real usability. To close this gap, we propose Xiaomi-GUI-0, a native multimodal GUI agent for real mobile environments, trained and evaluated within a real-device closed loop. At its core is a real-device-dominant hybrid infrastructure, where physical devices are the primary execution environment and sandboxes provide auxiliary support, so that data collection, training, rollout, and evaluation share an execution distribution close to real deployment. We construct multi-source training data spanning high-frequency head tasks, high-generalization data for long-tail intents, and capability-enhancement data for reflection and memory, and introduce an error-driven data flywheel that turns failure trajectories into corrected actions, reflective explanations, and recovery demonstrations. The model is trained through a progressive three-stage pipeline of supervised fine-tuning, step-level reinforcement learning, and agentic reinforcement learning. Evaluated on public benchmarks and our in-house RealMobile, Xiaomi-GUI-0 achieves 72.0% success on RealMobile and 78.9% on AndroidWorld, while substantially improving execution stability and abnormal-state recognition in real-world tasks.
- Abstract(参考訳): グラフィカルユーザインタフェース(GUI)エージェントは視覚言語モデル上に構築され、タップ、スワイプ、テキスト入力、ナビゲーションなどのインターフェイスアクションを通じて、実際のアプリケーションのエンド・ツー・エンドのユーザータスクを完了させる。
しかし、既存のGUIエージェントは、主にオフラインのトラジェクトリ、シミュレーション環境、標準化されたベンチマークに基づいて訓練され、評価されている。
これらは、インターフェースレイアウト、インタラクションロジック、異常状態分布の実際のアプリケーションとは大きく異なり、アカウント状態、許可ダイアログ、支払い認証、リスクコントロールが状態分布を継続的に作り直し、ベンチマークスコアと実際のユーザビリティの間に永続的なギャップを開いているような、現実的な使用における実行安定性を忠実に特徴づけることはできない。
このギャップを埋めるため,実機用マルチモーダルGUIエージェントであるXiaomi-GUI-0を提案する。
物理デバイスが主要な実行環境であり、サンドボックスが補助的なサポートを提供し、データ収集、トレーニング、ロールアウト、評価が実際のデプロイメントに近い実行分布を共有する。
我々は、高周波ヘッドタスク、ロングテールインテントのための高一般化データ、リフレクションとメモリのための能力向上データにまたがるマルチソーストレーニングデータを構築し、エラー駆動型データフライホイールを導入し、障害トラジェクトリを修正動作、リフレクティブ説明、リカバリデモを行う。
このモデルは、監督された微調整、段階的な強化学習、エージェントによる強化学習という、進歩的な3段階のパイプラインを通じて訓練される。
公開ベンチマークと社内のRealMobileで評価したXiaomi-GUI-0は、RealMobileで72.0%、AndroidWorldで78.9%成功し、実際のタスクにおける実行安定性と異常状態認識を大幅に改善した。
関連論文リスト
- AndroidDaily: A Verifiable Benchmark for Mobile GUI Agents on Real-World Closed-Source Applications [36.71396790403699]
94の高周波Androidアプリケーションにまたがる350の日常的タスクからなる大規模ベンチマークであるAndroidDailyを紹介した。
本稿では,3段階の外部ガイドラインに基づくプロセス認識評価システムGRADEを提案する。
GRADEはステップレベルの診断結果を生成し、長い水平なオープンエンドのモバイルインタラクションを、隠れた内部状態に頼ることなく検証可能な評価に変換する。
論文 参考訳(メタデータ) (2026-05-26T23:19:42Z) - SimuWoB: Simulating Real-World Mobile Apps for Fast and Faithful GUI Agent Benchmarking [23.006082521142137]
SimuWoBは、さまざまなタイプと難易度にまたがる120の課題タスクを備えた、モバイルGUIエージェントのための完全な総合ベンチマークである。
我々は高忠実度タスクと環境を合成する堅牢な仮想環境生成フレームワークを構築した。
我々は、最先端のモバイルGUIエージェントについて包括的な実験を行う。
論文 参考訳(メタデータ) (2026-05-24T16:33:14Z) - How Mobile World Model Guides GUI Agents? [51.29718003718467]
デルタテキスト、フルテキスト、拡散ベースのイメージ、レンダリング可能なコードという、4つのモードでワールドモデルをトレーニングします。
これらのモデルはMobileWorldBenchとCode2WorldBenchの両方でSoTAのパフォーマンスを達成する。
低アクションエントロピーを持つ過信な移動体エージェントの場合、後部自己反射は限られた利得を与える。
論文 参考訳(メタデータ) (2026-05-11T10:49:31Z) - VenusBench-Mobile: A Challenging and User-Centric Benchmark for Mobile GUI Agents with Capability Diagnostics [23.71786084060511]
我々は,汎用的なモバイルGUIエージェントを評価する上で困難なオンラインベンチマークであるVenusBench-Mobileを紹介する。
VenusBench-Mobileは、実際のモバイル利用を反映したユーザインテリジェント駆動タスク設計による評価の定義と、詳細なエージェント動作分析のための機能指向アノテーションスキームによる評価方法という、2つの中核評価柱を構築している。
論文 参考訳(メタデータ) (2026-02-06T18:54:42Z) - MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment [17.207878975582556]
MobileBench-OLは、80の中国アプリから1080タスクのオンラインベンチマークである。
エージェントのタスク実行、複雑な推論、ノイズロバスト性を測定する。
MobileBench-OLは、現実世界の要件を満たすための重要な改善の余地を示している。
論文 参考訳(メタデータ) (2026-01-28T07:49:48Z) - Step-GUI Technical Report [84.83795946544292]
本稿では,Calibrated Step Reward Systemを利用した自己進化型トレーニングパイプラインを提案する。
また、最先端のGUI性能を実現するモデル群であるStep-GUIについても紹介する。
エージェントが日常的に使えるかどうかを評価するために,AndroidDailyを紹介した。
論文 参考訳(メタデータ) (2025-12-17T13:26:30Z) - UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning [155.51875080423883]
グラフィカルユーザインタフェースのための自律エージェントの開発は、人工知能における大きな課題を示している。
本稿では,GUI中心のエージェントモデルであるUI-TARS-2を提案する。
実証的な評価では、UI-TARS-2は以前のUI-TARS-1.5よりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-09-02T17:44:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。