論文の概要: Efficient GUI Agents: A Systems Survey of Observation, Memory, Action, and Runtime Optimization
- arxiv url: http://arxiv.org/abs/2609.02309v1
- Date: Wed, 02 Sep 2026 08:54:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.207865
- Title: Efficient GUI Agents: A Systems Survey of Observation, Memory, Action, and Runtime Optimization
- Title(参考訳): 効率的なGUIエージェント: 観測、記憶、アクション、実行時の最適化に関するシステム調査
- Authors: Bizhe Bai, Jiakang Yuan, Hongming Wu, Xinyue Wang, Jie Ren, Siyao Chen, Yuchen Ya, Fan Bai, Pai Peng, Huafeng Qin, Tao Chen,
- Abstract要約: 本研究は,エンド・ツー・エンド・システム・レンズを用いた効率的なGUIエージェントの研究である。
各節について,対象検索と前後励磁連鎖により種文を拡大する。
検証コストの正直な説明を含め、主要なオープンな問題を特定することで結論付ける。
- 参考スコア(独自算出の注目度): 21.66081129153382
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: GUI agents increasingly operate across websites, mobile apps, and desktop environments, yet the field still reports progress primarily through task success. We argue that practical deployment depends equally on efficiency: how much context, computation, action budget, and runtime overhead an agent consumes while succeeding. This survey studies efficient GUI agents through an end-to-end systems lens that preserves the current technical axes of observation efficiency, context and memory efficiency, action efficiency, and planner-side/system efficiency. For each subsection, we expand the seed literature through targeted search plus backward and forward citation chaining, then synthesize the dominant mechanisms, reported efficiency signals, and new overheads they introduce. Across the literature, recent progress converges on a small set of recurring ideas: selective reading instead of full-context ingestion, global-to-local visual allocation, recoverable memory rather than raw history replay, verification-aware control, and hybrid runtimes that can switch between GUI and non-GUI execution. We conclude by identifying the main open problems, including honest accounting of verifier cost, cross-benchmark comparability, and co-design of observation, memory, and execution layers under real latency and privacy constraints.
- Abstract(参考訳): GUIエージェントはますますWebサイト、モバイルアプリ、デスクトップ環境にまたがって動作している。
私たちは、現実的なデプロイメントは、どの程度のコンテキスト、計算、アクション予算、そしてエージェントが成功したときに消費するランタイムのオーバーヘッドなど、効率に等しく依存する、と論じています。
本研究は, 観測効率, コンテキスト, メモリ効率, アクション効率, プランナー側/システム効率の現在の技術軸を保存するエンド・ツー・エンドのシステムレンズを用いて, 効率的なGUIエージェントについて検討する。
それぞれのサブセクションに対して,対象の探索と前後の引用連鎖を通じて種文を拡大し,支配的なメカニズムを合成し,効率を報告し,それらが導入する新たなオーバーヘッドを報告した。
文献全体を通じて、最近の進歩は、フルコンテキストの取り込みの代わりに選択的な読み込み、グローバルからローカルへの視覚的割り当て、生の履歴の再生ではなくリカバリ可能なメモリ、検証対応コントロール、GUIと非GUI実行を切り替えることができるハイブリッドランタイムといった、小さな反復的なアイデアに集約されている。
検証コストの正直な説明、ベンチマーク間の互換性、実際のレイテンシとプライバシの制約の下での監視層、メモリ層、実行層の共同設計など、主要なオープンな問題を特定します。
関連論文リスト
- Exploring Interaction Paradigms for LLM Agents in Scientific Visualization [7.22431217973039]
本稿では,大規模言語モデル(LLM)エージェントが科学的可視化(SciVis)タスクでどのように機能するかを検討する。
我々は、ドメイン固有のエージェントと構造化ツールの使用、コンピュータ利用エージェント、汎用コーディングエージェントの3つの主要な相互作用パラダイムを比較した。
論文 参考訳(メタデータ) (2026-04-30T15:22:28Z) - Step-level Optimization for Efficient Computer-use Agents [51.29573359027217]
我々は、強力なコンピュータ利用エージェントは、実際は高価で遅いと論じている。
本稿では,コンピュータ利用エージェントのためのイベント駆動ステップレベルカスケードを提案する。
論文 参考訳(メタデータ) (2026-04-29T19:59:36Z) - ActionEngine: From Reactive to Programmatic GUI Agents via State Machine Memory [3.279665979821265]
ActionEngineは、リアクティブ実行からプログラム計画に移行する、トレーニング不要のフレームワークである。
我々のエージェントは、平均して1回のLDMコールで95%のタスク成功を達成するが、最強のビジョンのみのベースラインでは66%である。
論文 参考訳(メタデータ) (2026-02-24T03:03:18Z) - ANCHOR: Branch-Point Data Generation for GUI Agents [52.22377425487]
デスクトップ環境向けのエンドツーエンドGUIエージェントは、大量の高品質なインタラクションデータを必要とする。
本稿では,拡張フレームワークであるAnchorについて紹介する。このフレームワークは,小規模で検証済みのシードデモから,スケーラブルなデスクトップ監視をブートストラップする。
OSWorldとWindowsAgentArenaの標準デスクトップベンチマークの実験では、拡張されたコーパスに微調整されたモデルが一貫した改善を実現している。
論文 参考訳(メタデータ) (2026-02-06T19:55:26Z) - Learning to Share: Selective Memory for Efficient Parallel Agentic Systems [49.78267008828593]
エージェントシステムは、反復的に推論する複数のエージェントを調整することで複雑なタスクを解決し、ツールを呼び出し、中間結果を交換する。
最近のアプローチでは、さまざまな推論の軌跡を探索するために、複数のエージェントチームが並行して運用されている。
我々は並列エージェントフレームワークのための学習された共有メモリ機構であるLearning to Share (LTS)を提案する。
論文 参考訳(メタデータ) (2026-02-05T18:20:21Z) - EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration [16.593979443102754]
エージェントに動的にアクセス可能なメモリを装備することで、人間のような体験学習を模倣する新しいフレームワークであるEchoTrail-GUIを紹介する。
まず、エージェントがGUI環境と自律的に対話して、成功しているタスク軌跡のキュレートされたデータベースを構築し、報酬モデルで検証する。
第2に、メモリインジェクションの段階では、新しいタスクを受信すると、最も関連性の高い過去の軌跡を効率よく検索して「記憶」として機能させる。
第3に、GUIタスク推論において、これらの記憶は、エージェントの推論と意思決定プロセスに通知するためのコンテキスト内ガイダンスとして注入される。
論文 参考訳(メタデータ) (2025-12-22T13:42:18Z) - MEMTRACK: Evaluating Long-Term Memory and State Tracking in Multi-Platform Dynamic Agent Environments [6.12783571098263]
MEMTRACKは、マルチプラットフォームエージェント環境における長期記憶と状態追跡を評価するために設計されたベンチマークである。
それぞれのベンチマークインスタンスは、ノイズ、競合、相互参照情報を備えた、時系列的にプラットフォームインターリーブされたタイムラインを提供する。
ベンチマークでは、取得、選択、競合解決などのメモリ機能をテストしています。
論文 参考訳(メタデータ) (2025-10-01T18:34:03Z) - Less is More: Empowering GUI Agent with Context-Aware Simplification [62.02157661751793]
我々は,SimpAgentと呼ばれる,効率的かつ効果的なGUIエージェントを構築するためのコンテキスト認識フレームワークを提案する。
上記のコンポーネントにより、SimpAgentは27%のFLOPを削減し、優れたGUIナビゲーション性能を実現する。
論文 参考訳(メタデータ) (2025-07-04T17:37:15Z) - FindingDory: A Benchmark to Evaluate Memory in Embodied Agents [49.18498389833308]
本研究では,Habitatシミュレータに長距離エンボディタスクのための新しいベンチマークを導入する。
このベンチマークは、持続的なエンゲージメントとコンテキスト認識を必要とする60タスクにわたるメモリベースの機能を評価する。
論文 参考訳(メタデータ) (2025-06-18T17:06:28Z) - Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation [83.92224427735859]
実際の実行に先立って効果的なフィードバックを提供する事前の批判機構を導入する。
そこで我々は,GUI-Critic-TrainとGUI-Critic-Testを作成するために,推論ブートストラップに基づくデータ収集パイプラインを開発した。
我々のモデルは、現在のMLLMと比較して、批評家の精度に大きな利点をもたらす。
論文 参考訳(メタデータ) (2025-06-05T04:12:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。