論文の概要: Scaling GUI Agents with Visual State Transitions
- arxiv url: http://arxiv.org/abs/2607.24112v1
- Date: Mon, 27 Jul 2026 07:54:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.349937
- Title: Scaling GUI Agents with Visual State Transitions
- Title(参考訳): ビジュアル状態遷移によるGUIエージェントのスケーリング
- Authors: Xiangyan Liu, Kaixin Li, Haonan Wang, Biao Wu, Meng Fang, Longxu Dou, Chao Du, Michael Qizhe Shieh, Tianyu Pang,
- Abstract要約: State Transition Pretraining (STP)はGUIエージェントのための新しいスケーリング軸である。
STPは、視覚状態遷移に関する統一マルチモーダルモデルを継続的に事前訓練する。
私たちのモデルは、エージェントベンチマークを直接微調整することでトレーニングされたベースラインを一貫して上回ります。
- 参考スコア(独自算出の注目度): 83.06866209578706
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce State Transition Pretraining (STP) as a new scaling axis for GUI agents. During the STP stage, we continually pretrain a unified multimodal model on visual state transitions by jointly optimizing inverse dynamics (predicting actions from state changes) and forward dynamics (predicting next states from current states and actions). This optimization equips the model with better action-grounded visual representations and an internal world model of GUI dynamics. When subsequently fine-tuned on trajectories with task instructions, our STP-trained models consistently outperform baselines trained solely via direct trajectory fine-tuning across agent benchmarks in both desktop and mobile GUI scenarios (AgentNetBench, AndroidControl, and GUIOdyssey). Further empirical studies show that joint dynamics optimization yields stable improvements over single-objective training, and downstream performance scales steadily with the volume of transition data.
- Abstract(参考訳): 本稿では,GUIエージェントの新たなスケーリング軸として状態遷移事前学習(STP)を導入する。
STPの段階では、逆ダイナミクス(状態変化からの動作予測)とフォワードダイナミクス(現在の状態と動作からの次の状態予測)を協調的に最適化することで、視覚状態遷移に関する統一マルチモーダルモデルを継続的に事前訓練する。
この最適化は、より優れたアクショングラウンドの視覚表現とGUIダイナミクスの内部世界モデルを備える。
その後、タスク命令でトラジェクトリを微調整すると、STPで訓練されたモデルは、デスクトップおよびモバイルGUIシナリオ(AgentNetBench、AndroidControl、GUIOdyssey)のエージェントベンチマークを直接的に微調整することで、トレーニングされたベースラインを一貫して上回ります。
さらに実験的な研究により、関節力学の最適化は単目的トレーニングよりも安定した改善をもたらすことが示され、ダウンストリーム性能は遷移データの量とともに着実に向上する。
関連論文リスト
- LeapTS: Rethinking Time Series Forecasting as Adaptive Multi-Horizon Scheduling [74.94985663101906]
本稿では,予測地平線上での動的スケジューリングプロセスとして時系列予測を再構成する新しいフレームワーク LeapTSを提案する。
LeapTSは、Transformerベースのモデルよりも2.6$times$から5.3$times$推論スピードアップを実現しつつ、全体的な予測性能を少なくとも7.4%向上させる。
論文 参考訳(メタデータ) (2026-05-11T09:54:02Z) - Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization [38.863014369090074]
本稿では,エージェントQ推定とステップワイドポリシ最適化という2つのコンポーネントで構成される,GUIエージェントのためのMLLM中心のフレームワークを紹介する。
Ovis2.5-9Bには強力なGUIインタラクション機能があり、GUIナビゲーションやグラウンドベンチマークでの優れたパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2026-02-14T07:44:47Z) - UI-Oceanus: Scaling GUI Agents with Synthetic Environmental Dynamics [25.60139960043983]
本稿では,ハイレベルな軌道の模倣からインタラクション物理の習得に焦点を移すフレームワークを提案する。
UI-Oceanusは、低コストの自律探査を高密度生成監視に変換することで、堅牢な内部世界モデルを構築する。
論文 参考訳(メタデータ) (2026-02-11T17:02:38Z) - ANCHOR: Branch-Point Data Generation for GUI Agents [52.22377425487]
デスクトップ環境向けのエンドツーエンドGUIエージェントは、大量の高品質なインタラクションデータを必要とする。
本稿では,拡張フレームワークであるAnchorについて紹介する。このフレームワークは,小規模で検証済みのシードデモから,スケーラブルなデスクトップ監視をブートストラップする。
OSWorldとWindowsAgentArenaの標準デスクトップベンチマークの実験では、拡張されたコーパスに微調整されたモデルが一貫した改善を実現している。
論文 参考訳(メタデータ) (2026-02-06T19:55:26Z) - Progressive Scaling Visual Object Tracking [38.28834233600855]
本稿では,学習データ量,モデルサイズ,入力解像度がトラッキング性能に与える影響を系統的に分析し,視覚オブジェクト追跡のための漸進的スケーリングトレーニング戦略を提案する。
実験により, 各因子のスケーリングは, 追跡精度を大幅に向上させるが, ナイーブトレーニングは最適下最適化と反復改善の制限に悩まされることがわかった。
DT-Trainingは、モデルポテンシャルを最大化するために、小さな教師の移動とデュアルブランチアライメントを統合するプログレッシブスケーリングフレームワークである。
論文 参考訳(メタデータ) (2025-05-26T13:45:27Z) - Guiding VLM Agents with Process Rewards at Inference Time for GUI Navigation [101.09478572153239]
本稿では,GUIナビゲーションにおける報酬モデルと推論時の制御により,VLMエージェントをプロセス監視で誘導する手法を提案する。
このガイダンスにより、VLMエージェントは各推論ステップでのアクションを最適化し、静的環境と動的環境の両方のパフォーマンスを改善することができる。
論文 参考訳(メタデータ) (2025-04-22T17:52:42Z) - An Efficient Occupancy World Model via Decoupled Dynamic Flow and Image-assisted Training [50.71892161377806]
DFIT-OccWorldは、分離されたダイナミックフローとイメージアシストトレーニング戦略を活用する、効率的な3D占有世界モデルである。
提案モデルでは, 静止ボクセルはポーズ変換により容易に得られるのに対し, 既存のボクセルフローを用いて既存の観測を歪曲することで, 将来のダイナミックボクセルを予測できる。
論文 参考訳(メタデータ) (2024-12-18T12:10:33Z) - Emergent Agentic Transformer from Chain of Hindsight Experience [96.56164427726203]
簡単なトランスフォーマーベースモデルが時間差と模倣学習に基づくアプローチの両方と競合することを示す。
単純なトランスフォーマーベースのモデルが時間差と模倣学習ベースのアプローチの両方で競合するのはこれが初めてである。
論文 参考訳(メタデータ) (2023-05-26T00:43:02Z) - EUCLID: Towards Efficient Unsupervised Reinforcement Learning with
Multi-choice Dynamics Model [46.99510778097286]
教師なし強化学習(URL)は,タスクに依存しない環境で有用な行動を学ぶための,有望なパラダイムである。
本研究では,事前学習フェーズにおける動的モデルと教師なし探索ポリシーを協調的に事前学習するための,新しいモデル融合パラダイムを提案する。
本研究では,EUCLIDが高サンプリング効率で最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2022-10-02T12:11:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。