論文の概要: UI-Evol: Automatic Knowledge Evolving for Computer Use Agents
- arxiv url: http://arxiv.org/abs/2505.21964v1
- Date: Wed, 28 May 2025 04:32:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-05-29 20:07:45.800784
- Title: UI-Evol: Automatic Knowledge Evolving for Computer Use Agents
- Title(参考訳): UI-Evol: コンピュータ利用エージェントのための知識自動生成
- Authors: Ziyun Zhang, Xinyi Liu, Xiaoyi Zhang, Jun Wang, Gang Chen, Yan Lu,
- Abstract要約: 自律的なGUI知識進化のためのプラグイン・アンド・プレイモジュールであるUI-Evolを提案する。
UI-Evolは、実際のエージェントと環境の相互作用から忠実な客観的なアクションシーケンスを抽出するRetrace Stageと、これらのシーケンスを外部参照と比較することによって既存の知識を洗練するCritique Stageの2つのステージで構成されている。
この結果から,UI-Evolはタスク性能を著しく向上させるだけでなく,コンピュータ利用エージェントの行動標準偏差がこれまで見過ごされていた問題にも対処できることがわかった。
- 参考スコア(独自算出の注目度): 19.978272700123004
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: External knowledge has played a crucial role in the recent development of computer use agents. We identify a critical knowledge-execution gap: retrieved knowledge often fails to translate into effective real-world task execution. Our analysis shows even 90\% correct knowledge yields only 41\% execution success rate. To bridge this gap, we propose UI-Evol, a plug-and-play module for autonomous GUI knowledge evolution. UI-Evol consists of two stages: a Retrace Stage that extracts faithful objective action sequences from actual agent-environment interactions, and a Critique Stage that refines existing knowledge by comparing these sequences against external references. We conduct comprehensive experiments on the OSWorld benchmark with the state-of-the-art Agent S2. Our results demonstrate that UI-Evol not only significantly boosts task performance but also addresses a previously overlooked issue of high behavioral standard deviation in computer use agents, leading to superior performance on computer use tasks and substantially improved agent reliability.
- Abstract(参考訳): 外部知識は近年のコンピュータ利用エージェントの発展において重要な役割を担っている。
抽出された知識は、しばしば実世界の効果的なタスク実行に変換できない。
我々の分析では、90 %の正確な知識が 41 % の実行成功率しか得られていない。
このギャップを埋めるために、我々は自動GUI知識進化のためのプラグイン・アンド・プレイモジュールであるUI-Evolを提案する。
UI-Evolは、実際のエージェントと環境の相互作用から忠実な客観的なアクションシーケンスを抽出するRetrace Stageと、これらのシーケンスを外部参照と比較することによって既存の知識を洗練するCritique Stageの2つのステージで構成されている。
我々はOSWorldベンチマークの総合的な実験を最先端のエージェントS2で実施する。
その結果、UI-Evolはタスク性能を著しく向上させるだけでなく、コンピュータ利用エージェントの行動標準偏差がこれまで見過ごされていた問題にも対処し、コンピュータ利用タスクの性能向上とエージェントの信頼性の向上を実現した。
関連論文リスト
- Agent S2: A Compositional Generalist-Specialist Framework for Computer Use Agents [30.253353551910404]
コンピュータ利用エージェントは、コンピュータやモバイルデバイスのグラフィカルユーザインタフェース(GUI)と直接対話することで、デジタルタスクを自動化する。
本稿では,様々なジェネラリストおよびスペシャリストモデルにまたがって認知的責任を委譲する新しい構成フレームワークであるAgens S2を紹介する。
Agent S2は、3つの著名なコンピュータ使用ベンチマーク上でのSOTA(State-of-the-art)のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2025-04-01T15:40:27Z) - AppAgentX: Evolving GUI Agents as Proficient Smartphone Users [34.70342284525283]
本稿では,インテリジェンスと柔軟性を維持しつつ,操作効率を向上させるGUIエージェントの進化的フレームワークを提案する。
本手法は,エージェントのタスク実行履歴を記録するメモリ機構を組み込んだものである。
複数のベンチマークタスクに対する実験結果から,本手法は既存の手法よりも効率と精度が優れていることが示された。
論文 参考訳(メタデータ) (2025-03-04T04:34:09Z) - Interactive Agents to Overcome Ambiguity in Software Engineering [61.40183840499932]
AIエージェントは、あいまいで不明確なユーザー指示に基づいて、タスクを自動化するためにますますデプロイされている。
不安定な仮定をし、明確な質問をしないことは、最適以下の結果につながる可能性がある。
対話型コード生成設定において,LLMエージェントが不明瞭な命令を処理する能力について,プロプライエタリモデルとオープンウェイトモデルを評価して検討する。
論文 参考訳(メタデータ) (2025-02-18T17:12:26Z) - Memento No More: Coaching AI Agents to Master Multiple Tasks via Hints Internalization [56.674356045200696]
本稿では,複雑なメモシステムや事前の高品質な実演データを必要としない,複数のタスクに対する知識とスキルを取り入れたAIエージェントの訓練手法を提案する。
このアプローチでは,エージェントが新たな経験を収集し,ヒントの形で人間から補正フィードバックを受け取り,このフィードバックを重みに組み込む,反復的なプロセスを採用している。
Llama-3をベースとしたエージェントに実装することで,数ラウンドのフィードバックの後,高度なモデルGPT-4oとDeepSeek-V3をタスクセットで性能向上させる手法の有効性を実証する。
論文 参考訳(メタデータ) (2025-02-03T17:45:46Z) - Agent S: An Open Agentic Framework that Uses Computers Like a Human [31.16046798529319]
我々は、GUI(Graphical User Interface)を通じてコンピュータとの自律的なインタラクションを可能にするオープンエージェントフレームワークであるAgent Sを提案する。
Agent Sは、ドメイン固有の知識の取得、長いタスクの水平線の計画、動的で一様でないインターフェイスの処理という、コンピュータタスクの自動化における3つの重要な課題に対処することを目指している。
論文 参考訳(メタデータ) (2024-10-10T17:43:51Z) - WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks? [83.19032025950986]
本稿では,Webブラウザを介してソフトウェアと対話する大規模言語モデルベースエージェントについて検討する。
WorkArenaは、広く使用されているServiceNowプラットフォームに基づく33のタスクのベンチマークである。
BrowserGymは、そのようなエージェントの設計と評価のための環境である。
論文 参考訳(メタデータ) (2024-03-12T14:58:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。