論文の概要: Interactive Reward Agent: GUI Task Evaluation via Environment-State Verification
- arxiv url: http://arxiv.org/abs/2607.25904v2
- Date: Wed, 29 Jul 2026 05:13:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.740475
- Title: Interactive Reward Agent: GUI Task Evaluation via Environment-State Verification
- Title(参考訳): 対話型リワードエージェント:環境状態検証によるGUIタスク評価
- Authors: Chenrui Shi, Yuwei Wu, Yang Liu, Ruining Feng, Zirui Shang, Zhi Gao, Lifeng Fan, Che Sun,
- Abstract要約: 本稿では,ポストエグゼクティブ環境からエビデンスを取得し,検証するための提案検証フレームワークに基づく対話型報酬エージェント(IRA)を提案する。
IRAはGUI-RewardBenchで86.9%の精度を実現し、既存のベースライン評価器を上回っている。
- 参考スコア(独自算出の注目度): 26.725458847440507
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Graphical user interface task evaluation aims to determine whether a GUI agent has successfully completed a user instruction. Automated GUI task evaluation has received increasing attention because the evaluation results can serve as reward signals for both test-time scaling and post-training. However, reliable GUI task evaluation remains challenging because the judgments often require access to environment states, such as system configurations, file data, and application settings, beyond the screenshots of execution trajectories. In this paper, we propose an interactive reward agent (IRA) based on a propose-then-verify framework to acquire and verify evidence from the post-execution environment. Given a task instruction and a GUI environment after the GUI agent execution, IRA first proposes the task completion conditions and then verifies them by invoking system tools, application tools, and GUI tools. This design combines evidence from both visible interfaces and the environment state in an interactive process. We further introduce GUI-RewardBench, a benchmark of 321 GUI task trajectories spanning 10 Ubuntu desktop application categories. Experiments show that IRA achieves 86.9% accuracy on GUI-RewardBench, outperforming existing evaluator baselines. We further apply IRA to reinforcement learning of GUI agents, achieving a 34.0% OSWorld success rate, which demonstrates that IRA can provide effective reward signals for training GUI agents.
- Abstract(参考訳): グラフィカルユーザインタフェースタスク評価は、GUIエージェントがユーザ命令を完了したかどうかを判定することを目的としている。
自動GUIタスク評価は,テストタイムスケーリングとポストトレーニングの両方において,評価結果が報奨信号として機能するため,注目度が高まっている。
しかし、信頼性の高いGUIタスク評価は、システム設定、ファイルデータ、アプリケーション設定などの環境状態へのアクセスを、実行軌跡のスクリーンショットを超えて要求することが多いため、依然として困難である。
本稿では,ポストエグゼクティブ環境からエビデンスを取得し,検証するための提案検証フレームワークに基づく対話型報酬エージェント(IRA)を提案する。
GUIエージェントの実行後にタスク命令とGUI環境が与えられた後、IRAはまずタスク完了条件を提案し、システムツール、アプリケーションツール、GUIツールを呼び出してそれらを検証する。
この設計は、インタラクティブなプロセスにおける可視インターフェイスと環境状態の両方からの証拠を組み合わせる。
さらに10のUbuntuデスクトップアプリケーションカテゴリにまたがる321のGUIタスクトラジェクトリのベンチマークであるGUI-RewardBenchを紹介します。
実験の結果、IRAはGUI-RewardBenchで86.9%の精度を達成し、既存の評価基準よりも優れていた。
我々はさらに、GUIエージェントの強化学習にIRAを適用し、OSWorldの成功率34.0%を達成し、GUIエージェントのトレーニングに効果的な報酬信号を提供できることを示す。
関連論文リスト
- UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization [70.85564601986263]
実験の結果, UI-Copilot-7BはMemGUI-Benchに挑戦する上で最先端の性能を発揮することがわかった。
UI-Copilot-7BはAndroidWorldのQwenベースモデルに対して17.1%の絶対的な改善を提供する。
論文 参考訳(メタデータ) (2026-04-15T12:55:46Z) - GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents [39.807839972627015]
GUIタスクにおける能動的視覚知覚のための強化学習フレームワークであるGUI-Eyesを提案する。
我々は、意思決定を粗い探索ときめ細かい接地に分解する進歩的認識戦略を導入する。
ScreenSpot-Proベンチマークでは、GUI-Eyes-3Bは3kラベルのサンプルのみを使用して44.8%のグラウンド精度を達成した。
論文 参考訳(メタデータ) (2026-01-14T14:27:28Z) - ProBench: Benchmarking GUI Agents with Accurate Process Information [15.519853892615272]
ProBenchは、広く使われているシナリオをカバーする200以上のGUIタスクからなる包括的なベンチマークである。
データセットをプロセス関連タスクに拡張し、特殊な評価手法を設計する。
先進的なGUIエージェントを評価した結果,現実のGUIシナリオには大きな制限があることがわかった。
論文 参考訳(メタデータ) (2025-11-12T09:49:31Z) - MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents [88.35544552383581]
MMBench-GUIは、Windows、Linux、iOS、Android、WebプラットフォームでGUI自動化エージェントを評価する階層的なベンチマークである。
GUIコンテンツ理解、要素グラウンディング、タスク自動化、タスクコラボレーションの4つのレベルで構成されており、GUIエージェントに必要なスキルをカバーしています。
論文 参考訳(メタデータ) (2025-07-25T17:59:26Z) - GTA1: GUI Test-time Scaling Agent [97.58177633084915]
グラフィカルユーザインタフェース(GUI)は、ユーザ命令をアクションプロポーザルに順次分解することで、プラットフォーム(例えばLinux)間で自律的にタスクを完了させる。
本稿では,前述の textbfGUI textbfTest-time Scaling textbfAgent,すなわち GTA1 の課題について検討する。
論文 参考訳(メタデータ) (2025-07-08T08:52:18Z) - MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment [63.62778707277929]
MobileGUI-RLは、オンライン環境でGUIエージェントをトレーニングするスケーラブルなフレームワークである。
自己探索とフィルタリングを通じて学習可能なタスクのカリキュラムを合成する。
GRPOをGUIナビゲーションに適応させ、軌道認識の利点と複合報酬を付与する。
論文 参考訳(メタデータ) (2025-07-08T07:07:53Z) - ScaleTrack: Scaling and back-tracking Automated GUI Agents [11.046190201201348]
自動GUIエージェントのグラウンドニングとバックトラック計画のスケーリングによるトレーニングフレームワークであるScaleTrackを提案する。
さまざまなソースから異なる合成基準のGUIサンプルを収集し,GUIグラウンドモデルをトレーニングするための同一テンプレートに統一する。
現在のGUIイメージから次のアクションを予測する新しいトレーニング戦略を設計し、GUIイメージに繋がった過去のアクションをバックトラックする。
論文 参考訳(メタデータ) (2025-05-01T09:27:13Z) - WorldGUI: An Interactive Benchmark for Desktop GUI Automation from Any Starting Point [17.165899818213475]
We introduced WorldGUI, a comprehensive GUI benchmark including tasks across 10 wide used desktop and web applications。
WorldGUI-Agentは3つのコアモジュールを統一する普遍的なフレームワークである。高レベルプラン修正のためのPlanner-Critic、中間検証のためのStep-Check、アクションレベルの最適化のためのActor-Criticである。
論文 参考訳(メタデータ) (2025-02-12T01:06:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。