論文の概要: EchoPath: Execution-Level Replayable Memory for GUI Agents
- arxiv url: http://arxiv.org/abs/2609.16635v1
- Date: Tue, 15 Sep 2026 04:56:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.346045
- Title: EchoPath: Execution-Level Replayable Memory for GUI Agents
- Title(参考訳): EchoPath: GUIエージェントの実行レベル再生可能メモリ
- Abstract要約: 本稿では,アーチファクト検証されたGUIトラジェクトリを標準化されたパラメータ制御型コール可能なメモリに変換する,モデルに依存しないハーネスであるEchoPathを紹介する。
各メモリにはタスクインテントキー、アプリケーションと状態の事前条件、フレキシブルな入力パラメータ、GUIエビデンス、バリデーション証明、ライフサイクル状態が格納される。
実際のコンピュータ使用タスクの実験では、EchoPathは中央値トークンのコストを90%以上削減し、中央値の実行時間を約60%削減した。
- 参考スコア(独自算出の注目度): 45.101663136838916
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Computer-use agents increasingly operate browsers, software, and desktop applications via CLI or API portals, but graphical user interface (GUI) still plays an important role in common industrial production scenarios. GUI agents commonly employ fresh observe-plan-ground-act loops, which is inefficient for enterprise tasks that repeatedly update records, process forms, configure tools, and export reports. We introduce EchoPath, a model-agnostic harness that converts artifact-validated GUI trajectories into standardized, parameter-controlled callable memories, analogous to Model Context Protocol (MCP)-style tool calls rather than unstructured experience records. Each memory stores task-intent keys, application and state preconditions, flexible input parameters, GUI evidence, validation provenance, and lifecycle state, so the host agent invokes a targeted procedure only when it can be deterministically replayed in the current runtime. The core mechanism enabling replay is an image-based target-reaiming algorithm that treats stored coordinates as visual evidence, matches the remembered GUI target against the current screen, and emits corrected operation coordinates before execution. During replay, EchoPath rebinds only declared modifiable inputs and rejects ambiguous or incompatible steps to bounded grounding repair or fresh planning. In experiments with real computer-use tasks, EchoPath reduced median token cost by more than 90% and median execution time by about 60%. These results support a bounded form of enterprise GUI memory: validated execution experience can become a controllable callable asset for recurrent work rather than only context for another reasoning pass.
- Abstract(参考訳): コンピュータ利用エージェントは、CLIやAPIポータルを介してブラウザ、ソフトウェア、デスクトップアプリケーションを操作する傾向にあるが、一般的な工業生産シナリオでは、GUI(GUI)が依然として重要な役割を果たす。
GUIエージェントは通常、記録の更新、プロセスフォームの更新、ツールの設定、レポートのエクスポートを繰り返すエンタープライズタスクでは非効率な、新しいオブザーブ・プラン・グラウンド・アクトループを使用する。
本稿では,アーチファクト検証されたGUIトラジェクトリを,構造化されていない経験記録ではなく,モデルコンテキストプロトコル(MCP)スタイルのツールコールに類似した,標準化されたパラメータ制御型コール可能なメモリに変換する,モデルに依存しないハーネスであるEchoPathを紹介する。
各メモリはタスクインテントキー、アプリケーションと状態の前提条件、フレキシブルな入力パラメータ、GUIエビデンス、バリデーション証明、ライフサイクル状態を保持するため、ホストエージェントは現在のランタイムで決定論的に再生できる場合にのみターゲットのプロシージャを起動する。
リプレイを可能にするコアメカニズムは、保存された座標を視覚的証拠として扱い、記憶されたGUIターゲットと現在の画面とを一致させ、実行前に修正された操作座標を出力するイメージベースのターゲット評価アルゴリズムである。
リプレイ中、EchoPathのリビンドは変更可能な入力のみを宣言し、バウンドグラウンド修復やフレッシュプランニングに対する曖昧または互換性のないステップを拒否する。
実際のコンピュータ使用タスクの実験では、EchoPathは中央値トークンのコストを90%以上削減し、中央値の実行時間を約60%削減した。
これらの結果は、エンタプライズGUIメモリのバウンド形式をサポートする。検証された実行エクスペリエンスは、他の推論パスのコンテキストだけでなく、再実行作業のための制御可能な呼び出し可能なアセットになる可能性がある。
関連論文リスト
- JarvisGUI: Towards Cross-Device GUI Agents with Dynamic Task Composition [51.15720718264743]
プラットフォーム間の協調的なインタラクションを必要とするデバイス間通信におけるGUIエージェントの評価を行う動的ベンチマークであるJarvisGUIを紹介する。
JarvisGUIは、GUIタスクを軽量な型システムの下で入力出力変換として定式化し、複数ステップのクロスデバイス変換を自動的に構成する。
我々は、最先端のオープンソースGUIエージェントが、実際の使用に必要な状態遷移認識、クロスプラットフォームのコンテキスト推論、長期水平依存性管理に苦労していることを示します。
論文 参考訳(メタデータ) (2026-09-09T16:59:59Z) - Efficient GUI Agents: A Systems Survey of Observation, Memory, Action, and Runtime Optimization [21.66081129153382]
本研究は,エンド・ツー・エンド・システム・レンズを用いた効率的なGUIエージェントの研究である。
各節について,対象検索と前後励磁連鎖により種文を拡大する。
検証コストの正直な説明を含め、主要なオープンな問題を特定することで結論付ける。
論文 参考訳(メタデータ) (2026-09-02T08:54:58Z) - GUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent Environments [20.28422479068168]
エージェント環境としてGUIワールドモデルのコンテキスト整合性を評価するベンチマークGUI-CCを紹介する。
我々はGUIOdysseyから500のオフライントラジェクトリタスクを構築し、30のモバイルアプリで200のエミュレータ認証オンラインタスクを構築した。
実験により、信頼性の高い環境シミュレーションは保証されないことが示された。
論文 参考訳(メタデータ) (2026-08-30T05:19:43Z) - STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments [63.39393178045112]
モバイルエージェントは即座に反応制御を行うが、メモリを必要とする現実的なロングホライゾンタスクでは頻繁に失敗する。
制御可能な仮想環境を通じて,モバイルエージェントの明示的なメモリをトレーニングするフレームワークSTAMPを提案する。
結果のStampGUIエージェントは、メモリワールドベンチマークに新たなハイウォーターマークを設定し、例外的なメモリ精度とタスクレジリエンスを実証します。
論文 参考訳(メタデータ) (2026-05-28T04:00:13Z) - Mem-W: Latent Memory-Native GUI Agents [50.87647372904382]
本稿では,メモリをエージェントの連続的コンテキストの一部として扱う,潜在メモリネイティブなGUIエージェントであるMem-Wを紹介する。
4つのWebおよびモバイルナビゲーションベンチマークで、Mem-Wはさまざまなバックボーンとメモリ拡張ベースラインを一貫して改善している。
論文 参考訳(メタデータ) (2026-05-10T04:31:23Z) - ActionEngine: From Reactive to Programmatic GUI Agents via State Machine Memory [3.279665979821265]
ActionEngineは、リアクティブ実行からプログラム計画に移行する、トレーニング不要のフレームワークである。
我々のエージェントは、平均して1回のLDMコールで95%のタスク成功を達成するが、最強のビジョンのみのベースラインでは66%である。
論文 参考訳(メタデータ) (2026-02-24T03:03:18Z) - ANCHOR: Branch-Point Data Generation for GUI Agents [52.22377425487]
デスクトップ環境向けのエンドツーエンドGUIエージェントは、大量の高品質なインタラクションデータを必要とする。
本稿では,拡張フレームワークであるAnchorについて紹介する。このフレームワークは,小規模で検証済みのシードデモから,スケーラブルなデスクトップ監視をブートストラップする。
OSWorldとWindowsAgentArenaの標準デスクトップベンチマークの実験では、拡張されたコーパスに微調整されたモデルが一貫した改善を実現している。
論文 参考訳(メタデータ) (2026-02-06T19:55:26Z) - GUI-360$^\circ$: A Comprehensive Dataset and Benchmark for Computer-Using Agents [59.107657859025586]
GUI-360$circ$は、コンピュータ利用エージェント(CUA)を進化させるために設計された大規模で包括的なデータセットとベンチマークスイートである。
リリースされたコーパスには、人気のあるWindowsオフィスアプリケーションにおける数千のトラジェクトリにわたる1.2万以上の実行されたアクションステップが含まれている。
このデータセットは、3つの標準タスク、GUIグラウンド、スクリーン解析、アクション予測、ハイブリッドGUI+APIアクションスペースをサポートする。
論文 参考訳(メタデータ) (2025-11-06T12:19:02Z) - MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment [63.62778707277929]
MobileGUI-RLは、オンライン環境でGUIエージェントをトレーニングするスケーラブルなフレームワークである。
自己探索とフィルタリングを通じて学習可能なタスクのカリキュラムを合成する。
GRPOをGUIナビゲーションに適応させ、軌道認識の利点と複合報酬を付与する。
論文 参考訳(メタデータ) (2025-07-08T07:07:53Z) - ScaleTrack: Scaling and back-tracking Automated GUI Agents [11.046190201201348]
自動GUIエージェントのグラウンドニングとバックトラック計画のスケーリングによるトレーニングフレームワークであるScaleTrackを提案する。
さまざまなソースから異なる合成基準のGUIサンプルを収集し,GUIグラウンドモデルをトレーニングするための同一テンプレートに統一する。
現在のGUIイメージから次のアクションを予測する新しいトレーニング戦略を設計し、GUIイメージに繋がった過去のアクションをバックトラックする。
論文 参考訳(メタデータ) (2025-05-01T09:27:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。