論文の概要: HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents
- arxiv url: http://arxiv.org/abs/2607.14548v1
- Date: Thu, 16 Jul 2026 04:12:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.982859
- Title: HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents
- Title(参考訳): HyMobileAgent: 効率的なGUIエージェントのためのデータ環境協調スケーリング
- Abstract要約: HyMobileAgentはHy3.0-VL-A3B上に開発されたビジョンネイティブ基盤モデルである。
我々は,モバイルインタラクションの重要なボトルネックに対処する,共同データと環境中心のスケーリングフレームワークを開発した。
- 参考スコア(独自算出の注目度): 57.53434680014667
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: As large multimodal models move from understanding content to operating on digital environments, mobile GUI has emerged as a challenging and consequential testbed for digital embodied intelligence. Mobile agents operate under three coupled constraints: precise perception of complex interfaces, scalable acquisition of high-quality interaction data, and robust long-horizon decision making under compounding execution errors. This report presents HyMobileAgent, a mobile GUI agent built on Hy3.0-VL-A3B, a vision-native foundation model featuring native any-resolution input, an A3B-scale deployment budget, and a 32K context window to model extended interaction histories. Rather than relying solely on model scaling, we develop a joint data and environment centric scaling framework to address the key bottlenecks of mobile interaction. Our framework integrates a GUI perception flywheel combining mock-interface synthesis, rejection sampling, and icon-specific augmentation; a knowledge pipeline that transforms tutorial videos into structured interaction data; a million-scale action data pipeline deployed across more than 2000 sandbox and real-device instances with automated failure attribution; the PhoneWorld Mock App Factory, providing a resettable training environment with 34 mock applications and over 34000 tasks; and a structured Planning-and-Reflection mechanism with explicit dead-loop detection for reliable long-horizon execution. We also introduce a progressive training recipe consisting of mid-training, supervised fine-tuning, and reinforcement learning with task-specific reward designs.
- Abstract(参考訳): 大規模なマルチモーダルモデルがコンテンツ理解からデジタル環境の操作へと移行するにつれ、モバイルGUIはデジタルエンボディインテリジェンスのための挑戦的で簡潔なテストベッドとして登場した。
モバイルエージェントは、複雑なインタフェースの正確な認識、高品質なインタラクションデータのスケーラブルな取得、実行エラーの複合化による堅牢なロングホライゾン決定の3つの制約の下で機能する。
本稿では,Hy3.0-VL-A3B上に構築されたモバイルGUIエージェントHyMobileAgentについて述べる。
モデルスケーリングにのみ依存するのではなく,モバイルインタラクションの重要なボトルネックに対処する,共同データと環境中心のスケーリングフレームワークを開発した。
本フレームワークは,モックインターフェース合成,リジェクションサンプリング,アイコン固有化を組み合わせたGUI知覚フライホイール,チュートリアル映像を構造化されたインタラクションデータに変換する知識パイプライン,2000以上のサンドボックスおよび実デバイスインスタンスに展開する100万件以上のアクションデータパイプライン,34以上のモックアプリケーションと34000以上のタスクを備えたリセット可能なトレーニング環境を提供するPhoneWorld Mock App Factory,および信頼性のある長期水平実行のための明示的なデッドループ検出機能を備えた構造化プランニング・アンド・リフレクション機構を統合した。
また、中間訓練、教師付き微調整、タスク固有の報酬設計による強化学習からなるプログレッシブ・トレーニング・レシピも導入する。
関連論文リスト
- BlueLM-GUI Technical Report: A Real-Device-Centric Flywheel for Self-Improving Mobile GUI Agents [38.39627583261406]
実機中心のフライホイールとして構築された35B-A3BモバイルGUIエージェントであるBlueLM-GUIを紹介する。
Every Sample Matters: 異種トリプル・システム・コンセンサス評価とエラー補正・導出モジュールを備えたデュアルトラックパイプライン。
Every Rollout Is Real: 3段階のレシピ – 連続的な事前トレーニング、教師付き微調整、および数百台の実機上でのエージェント強化学習。
論文 参考訳(メタデータ) (2026-09-11T03:36:35Z) - AFRAgent : An Adaptive Feature Renormalization Based High Resolution Aware GUI agent [21.148033135113927]
インストラクトBLIPに基づくマルチモーダルアーキテクチャを導入し,GUI自動化における優れた性能を実現する。
低解像度画像埋め込みを効果的に強化する適応的特徴正規化(トークンレベルのアフィン変換)手法を提案する。
我々はAFRAgentをMeta-GUIおよびAITWベンチマークで評価し、スマートフォン自動化のための新しい最先端のベースラインを確立する。
論文 参考訳(メタデータ) (2025-11-30T11:32:54Z) - GUI-360$^\circ$: A Comprehensive Dataset and Benchmark for Computer-Using Agents [59.107657859025586]
GUI-360$circ$は、コンピュータ利用エージェント(CUA)を進化させるために設計された大規模で包括的なデータセットとベンチマークスイートである。
リリースされたコーパスには、人気のあるWindowsオフィスアプリケーションにおける数千のトラジェクトリにわたる1.2万以上の実行されたアクションステップが含まれている。
このデータセットは、3つの標準タスク、GUIグラウンド、スクリーン解析、アクション予測、ハイブリッドGUI+APIアクションスペースをサポートする。
論文 参考訳(メタデータ) (2025-11-06T12:19:02Z) - Mano Technical Report [29.551514304095296]
Manoは、大規模なWebおよびコンピュータシステムデータに基づいて事前訓練されたマルチモーダル基盤モデル上に構築された堅牢なGUIエージェントである。
Mano氏は、Mind2WebやOSWorldなど、複数のGUIベンチマークで最先端のパフォーマンスをデモしている。
論文 参考訳(メタデータ) (2025-09-22T03:13:58Z) - UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning [155.51875080423883]
グラフィカルユーザインタフェースのための自律エージェントの開発は、人工知能における大きな課題を示している。
本稿では,GUI中心のエージェントモデルであるUI-TARS-2を提案する。
実証的な評価では、UI-TARS-2は以前のUI-TARS-1.5よりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-09-02T17:44:45Z) - MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning [83.81404871748438]
MagicGUIは、現実のモバイルGUI環境における認識、接地、推論における重要な課題に対処するために設計された、基本的なモバイルGUIエージェントである。
フレームワークには、包括的で正確なデータセット、知覚と接地能力の強化、包括的で統一されたアクション空間、計画指向の推論メカニズムを含む6つの重要なコンポーネントが含まれている。
論文 参考訳(メタデータ) (2025-07-19T12:33:43Z) - Hijacking JARVIS: Benchmarking Mobile GUI Agents against Unprivileged Third Parties [19.430061128447022]
本稿では,モバイルGUIエージェントの脆弱性に関する最初の系統的研究について述べる。
本稿では,スケーラブルな攻撃シミュレーションフレームワークであるAgentHazardを紹介した。
動的タスク実行環境と攻撃シナリオの静的データセットの両方からなるベンチマークスイートを開発する。
以上の結果から, 調査対象となったエージェントは, 誤解を招く第三者コンテンツに大きく影響していることが判明した。
論文 参考訳(メタデータ) (2025-07-06T03:31:36Z) - AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning [82.42421823672954]
AgentCPM-GUIは、堅牢で効率的なオンデバイスGUIインタラクションのために構築されている。
私たちのトレーニングパイプラインには、知覚を高めるためのグラウンドアウェア事前トレーニングが含まれています。
AgentCPM-GUIは5つの公開ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-06-02T07:30:29Z) - Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents [57.59830804627066]
実世界のモバイルOSナビゲーションをキャプチャする20Kの指導ビデオから,313Kの注釈付きフレームの大規模データセットであるMONDAYを紹介した。
MONDAYを事前学習フェーズに含むモデルは、堅牢なクロスプラットフォームの一般化機能を示す。
公開されているビデオコンテンツを利用して、包括的なタスクデータセットを作成する自動化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-19T02:39:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。