論文の概要: BlueLM-GUI Technical Report: A Real-Device-Centric Flywheel for Self-Improving Mobile GUI Agents
- arxiv url: http://arxiv.org/abs/2609.12394v3
- Date: Tue, 15 Sep 2026 06:36:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.073647
- Title: BlueLM-GUI Technical Report: A Real-Device-Centric Flywheel for Self-Improving Mobile GUI Agents
- Title(参考訳): BlueLM-GUIテクニカルレポート:自己改善型モバイルGUIエージェントのための実機駆動型フライホイール
- Abstract要約: 実機中心のフライホイールとして構築された35B-A3BモバイルGUIエージェントであるBlueLM-GUIを紹介する。
Every Sample Matters: 異種トリプル・システム・コンセンサス評価とエラー補正・導出モジュールを備えたデュアルトラックパイプライン。
Every Rollout Is Real: 3段階のレシピ – 連続的な事前トレーニング、教師付き微調整、および数百台の実機上でのエージェント強化学習。
- 参考スコア(独自算出の注目度): 38.39627583261406
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mobile GUI agents are shifting from multi-module frameworks to native models trained end-to-end, yet industrial deployment faces three persistent gaps. Sandbox training produces a distribution mismatch with production environments; expensive real-device failures remain underutilized; and fixed benchmarks saturate, losing the power to guide iteration. We present BlueLM-GUI, a 35B-A3B mobile GUI agent built as a real-device-centric flywheel that closes these gaps through three principles. Every Sample Matters: a dual-track pipeline with Heterogeneous Triple-System Consensus evaluation and an Error Correction \& Derivation Module salvages every trajectory into usable supervision. Every Rollout Is Real: a three-stage recipe---continual pre-training, supervised fine-tuning, and agentic reinforcement learning on hundreds of real phones---grounds every rollout in real production environments, so the capability the model learns transfers directly to deployment. Every Query Evolves: a quota-driven benchmark methodology with three orthogonal axes enables precise attribution and allows the benchmark to be systematically upgraded as the model improves. BlueLM-GUI achieves 87.4 on MobileGUI-VBench, surpassing the best closed-source model by 5.1 points, and 84.9 on AndroidWorld, the best result among open-source models and competitive with closed-source models. These results demonstrate that grounding model training and iterative improvement in both real devices and the three Every principles yields strong, robust, and transferable mobile GUI capability.
- Abstract(参考訳): モバイルGUIエージェントは、マルチモジュールフレームワークから、エンドツーエンドでトレーニングされたネイティブモデルに移行している。
Sandboxのトレーニングでは、運用環境とのディストリビューションのミスマッチが発生し、高価な実デバイス障害が未使用のままであり、固定ベンチマークが飽和し、イテレーションをガイドする能力を失っている。
実機中心のフライホイールとして構築された,35B-A3BモバイルGUIエージェントであるBlueLM-GUIについて述べる。
Every Sample Matters: 異種トリプルシステムコンセンサス評価とエラー補正\&デリベーションモジュールを備えたデュアルトラックパイプラインは,すべてのトラジェクトリを監視対象とする。
Every Rollout Is Real: 3段階のレシピ – 連続的な事前トレーニング,教師付き微調整,エージェントによる強化学習 – 実運用環境でのロールアウトはすべて地上で実施されるため,モデルが直接デプロイメントに移行することができる。
すべてのクエリの進化: 3つの直交軸を持つクォータ駆動のベンチマーク手法は、正確な属性を可能にし、モデルの改善に伴ってベンチマークを体系的にアップグレードすることを可能にする。
BlueLM-GUIはMobileGUI-VBenchで87.4を達成し、クローズドソースモデルでは5.1ポイント、AndroidWorldでは84.9を突破した。
これらの結果は、実際のデバイスと3つのEvery原則の両方において、基盤となるモデルトレーニングと反復的な改善が、強力で堅牢で、移動可能なモバイルGUI能力をもたらすことを示している。
関連論文リスト
- HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents [57.53434680014667]
HyMobileAgentはHy3.0-VL-A3B上に開発されたビジョンネイティブ基盤モデルである。
我々は,モバイルインタラクションの重要なボトルネックに対処する,共同データと環境中心のスケーリングフレームワークを開発した。
論文 参考訳(メタデータ) (2026-07-16T04:12:42Z) - Xiaomi-GUI-0 Technical Report [39.05385476532886]
Xiaomi-GUI-0は、実際のモバイル環境向けのネイティブなマルチモーダルGUIエージェントである。
教師付き微調整、ステップレベルの強化学習、エージェントによる強化学習という3段階のパイプラインを通じて訓練される。
RealMobileで72.0%、AndroidWorldで78.9%を達成し、実際のタスクにおける実行安定性と異常状態認識を大幅に改善した。
論文 参考訳(メタデータ) (2026-06-30T09:36:35Z) - How Mobile World Model Guides GUI Agents? [51.29718003718467]
デルタテキスト、フルテキスト、拡散ベースのイメージ、レンダリング可能なコードという、4つのモードでワールドモデルをトレーニングします。
これらのモデルはMobileWorldBenchとCode2WorldBenchの両方でSoTAのパフォーマンスを達成する。
低アクションエントロピーを持つ過信な移動体エージェントの場合、後部自己反射は限られた利得を与える。
論文 参考訳(メタデータ) (2026-05-11T10:49:31Z) - Generative Visual Code Mobile World Models [33.86938466546132]
Mobile Graphical User Interface (GUI) World Models (WMs) は、列車や推論時にモバイルGUIエージェントのパフォーマンスを改善するための有望な道を提供する。
本稿では,1つのビジョンランゲージモデル(VLM)が次のGUI状態を実行可能なWebコードとして予測する,レンダリング可能なコード生成によるビジュアルワールドモデリングを提案する。
我々は,このパラダイム上に構築された最初のオープンウェイトなビジュアルモバイルGUI WMであるgWorldと,コードベースのトレーニングデータを自動生成するデータ生成フレームワーク(gWorld)を紹介する。
論文 参考訳(メタデータ) (2026-02-02T03:12:16Z) - UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning [155.51875080423883]
グラフィカルユーザインタフェースのための自律エージェントの開発は、人工知能における大きな課題を示している。
本稿では,GUI中心のエージェントモデルであるUI-TARS-2を提案する。
実証的な評価では、UI-TARS-2は以前のUI-TARS-1.5よりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-09-02T17:44:45Z) - Mobile-Agent-v3: Fundamental Agents for GUI Automation [59.775510710011325]
本稿では,オープンソースエンド・ツー・エンド・モデル間の最先端性能を実現する基礎的なGUIエージェントモデルを提案する。
汎用GUIエージェントフレームワークであるMobile-Agent-v3を提案し,AndroidWorldでは73.3,OSWorldでは37.7に向上した。
論文 参考訳(メタデータ) (2025-08-21T00:39:12Z) - MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment [63.62778707277929]
MobileGUI-RLは、オンライン環境でGUIエージェントをトレーニングするスケーラブルなフレームワークである。
自己探索とフィルタリングを通じて学習可能なタスクのカリキュラムを合成する。
GRPOをGUIナビゲーションに適応させ、軌道認識の利点と複合報酬を付与する。
論文 参考訳(メタデータ) (2025-07-08T07:07:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。