論文の概要: A Task-State Representation for Long-Horizon Mobile GUI Agents
- arxiv url: http://arxiv.org/abs/2607.00502v1
- Date: Wed, 01 Jul 2026 06:37:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.758334
- Title: A Task-State Representation for Long-Horizon Mobile GUI Agents
- Title(参考訳): 長距離移動GUIエージェントのタスク状態表現
- Authors: Yujie Zheng, Zikang Liu, Xin Zhao, Ji-Rong Wen,
- Abstract要約: Task-State Representation (TSR)は、感覚入力からタスク状態を明示的に分離する、トレーニング不要のフレームワークである。
4つのモバイルGUIベンチマークによる実験では、TSRの有効性が検証され、成功率が12ポイントまで向上した。
- 参考スコア(独自算出の注目度): 53.359524744953575
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While long-horizon mobile GUI agents typically rely on thought-action-observation loops, they struggle to separate persistent task states from transient screen observations. As execution histories grow, this entanglement imposes a severe context burden, causing agents to forget initial requirements, hallucinate progress, or repeatedly interact with stale interfaces. To address this, we introduce Task-State Representation (TSR), a training-free framework that explicitly decouples task state from sensory input. Acting as a lightweight external wrapper, TSR maintains three structured components: a global instruction summary, a dynamic progress tracker for subgoals, and a transition-aware action verifier. By continuously updating through pre- and post-action visual comparisons, TSR effectively guides the agent's reasoning without requiring architectural modifications. Experiments across four mobile GUI benchmarks validate TSR's effectiveness, yielding up to a 12 absolute point increase in success rate on complex cross-application and memory-intensive tasks.
- Abstract(参考訳): 長い水平移動GUIエージェントは一般的に思考・行動・観測ループに依存するが、過渡的な画面観察から永続的なタスク状態を切り離すのに苦労する。
実行履歴が大きくなると、この絡み合いは厳しいコンテキスト負荷を課し、エージェントは初期要求を忘れたり、進行を幻覚させたり、古いインターフェイスと繰り返し対話する。
そこで我々は,タスク状態を感覚入力から明示的に分離する,トレーニング不要のフレームワークであるタスク状態表現(TSR)を紹介した。
TSRは軽量な外部ラッパーとして機能し、グローバルな命令サマリ、サブゴール用の動的プログレストラッカー、トランジッション対応のアクション検証という3つの構造化されたコンポーネントを維持している。
プレアクションとポストアクションの視覚的比較を通じて継続的に更新することにより、TSRは、アーキテクチャの変更を必要とせずに、エージェントの推論を効果的にガイドする。
4つのモバイルGUIベンチマークによる実験では、TSRの有効性が検証され、複雑なクロスアプリケーションやメモリ集約タスクにおける12ポイントの成功率が向上した。
関連論文リスト
- PIRA-Bench: A Transition from Reactive GUI Agents to GUI-based Proactive Intent Recommendation Agents [32.98769345205729]
PIRA-Benchは、マルチモーダルな大規模言語モデル(MLLM)を、連続的、弱い教師付き視覚入力で評価するための新しいベンチマークである。
本稿では,複数のタスクスレッドを管理し,誤った視覚的入力を処理する汎用MLLMを実現する,メモリ対応の状態追跡フレームワークであるPIRFベースラインを提案する。
論文 参考訳(メタデータ) (2026-03-09T06:41:32Z) - ANCHOR: Branch-Point Data Generation for GUI Agents [52.22377425487]
デスクトップ環境向けのエンドツーエンドGUIエージェントは、大量の高品質なインタラクションデータを必要とする。
本稿では,拡張フレームワークであるAnchorについて紹介する。このフレームワークは,小規模で検証済みのシードデモから,スケーラブルなデスクトップ監視をブートストラップする。
OSWorldとWindowsAgentArenaの標準デスクトップベンチマークの実験では、拡張されたコーパスに微調整されたモデルが一貫した改善を実現している。
論文 参考訳(メタデータ) (2026-02-06T19:55:26Z) - AgentProg: Empowering Long-Horizon GUI Agents with Program-Guided Context Management [24.465443389008055]
AgentProgはエージェントコンテキスト管理のためのプログラム誘導型アプローチである。
インタラクション履歴を変数と制御フローを備えたプログラムとして再構成する。
AndroidWorldと拡張ロングホライゾンタスクスイートの実験では、AgentProgが最先端の成功率を達成したことが示されています。
論文 参考訳(メタデータ) (2025-12-11T07:37:38Z) - GUI-PRA: Process Reward Agent for GUI Tasks [25.20594694997543]
プロセスリワードモデル(Process Reward Models, PRM)は、推論中に重要なプロセス信号でこれらのエージェントをガイドできる、有望なソリューションである。
PRMは「中間の失われた」現象に悩まされ、歴史的に圧倒的な状況が現在の段階の評価を損なう。
GUI-PRA(Process Reward Agent for GUI Tasks)は,標準的なPRMよりも優れたプロセス報酬の提供を目的とした判定エージェントである。
論文 参考訳(メタデータ) (2025-09-27T11:42:36Z) - MAPLE: A Mobile Agent with Persistent Finite State Machines for Structured Task Reasoning [46.18718721121415]
アプリケーションインタラクションをFSM(Finite State Machine)として抽象化する,状態認識型マルチエージェントフレームワークMAPLEを提案する。
それぞれのUI画面を離散状態として、ユーザアクションをトランジションとしてモデル化し、FSMがアプリケーション実行の構造化された表現を提供できるようにします。
MAPLEは、計画、実行、検証、エラー回復、知識保持という4段階のタスク実行に責任を持つ特殊エージェントで構成されている。
論文 参考訳(メタデータ) (2025-05-29T16:08:51Z) - DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving [62.62464518137153]
DriveTransformerは、スケールアップを簡単にするためのシンプルなE2E-ADフレームワークである。
タスク・セルフ・アテンション、センサー・クロス・アテンション、時間的クロス・アテンションという3つの統合された操作で構成されている。
シミュレーションされたクローズドループベンチマークBench2Driveと、FPSの高い実世界のオープンループベンチマークnuScenesの両方で、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-03-07T11:41:18Z) - Mobile-Agent-E: Self-Evolving Mobile Assistant for Complex Tasks [85.48034185086169]
Mobile-Agent-Eは、過去の経験を通じて自己進化できる階層的なマルチエージェントフレームワークである。
Mobile-Agent-Eは従来の最先端アプローチよりも22%の絶対的な改善を実現している。
論文 参考訳(メタデータ) (2025-01-20T20:35:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。