論文の概要: EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding
- arxiv url: http://arxiv.org/abs/2607.17050v1
- Date: Sun, 19 Jul 2026 03:29:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.344528
- Title: EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding
- Title(参考訳): EvoGUI: GUI状態遷移理解のための進化型ベンチマーク
- Authors: Yaohan Yang, Minglei Shi, Borui Zhang, Jie Zhou, Jiwen Lu,
- Abstract要約: EvoGUIは、正規化されたGUI軌跡を3つの補完的な視覚的質問応答プローブに変換するフレームワークである。
私たちはMind2WebとWebLINXからEvoGUI-Benchをインスタンス化し、120ドメインで3,000のインスタンスを生成します。
最強のモデルは60.4 EvoGainにしか達しないが、モデルスケールとGUIの特殊化は性能を確実に予測しない。
- 参考スコア(独自算出の注目度): 54.222234064832
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: GUI agents must reason about how actions transform interface states, but end-to-end success rates entangle this ability with perception, grounding, planning, and recovery. We introduce EvoGUI, a diagnostic framework that converts normalized GUI trajectories into three complementary visual question answering probes: temporal ordering, inverse action/value prediction, and contrastive one-step successor discrimination. Their labels are derived from trajectory order and logged actions, requiring no additional task-label annotation after trajectory normalization. We instantiate EvoGUI-Bench from Mind2Web and WebLINX, yielding 3,000 instances across 120 domains, and evaluate 28 vision-language model configurations zero-shot. The strongest model reaches only 60.4 EvoGain, while model scale and GUI specialization do not reliably predict performance. These results establish EvoGUI-Bench as a scalable diagnostic complement to end-to-end GUI-agent evaluation while exposing substantial headroom in state-transition understanding. The source code is publicly available at https://github.com/Yyhhh6/EvoGUI.
- Abstract(参考訳): GUIエージェントは、アクションがインターフェイスの状態をどのように変換するかを推論する必要がありますが、エンドツーエンドの成功率は、この能力を認識、接地、計画、回復と結び付けなければなりません。
正規化GUIトラジェクトリを3つの相補的な視覚的質問応答プローブに変換する診断フレームワークであるEvoGUIを紹介した。
ラベルはトラジェクトリ順序とログ化されたアクションから派生しており、トラジェクトリ正規化後に追加のタスクラベルアノテーションを必要としない。
我々はMind2WebとWebLINXからEvoGUI-Benchをインスタンス化し、120ドメインに3000のインスタンスを生成し、28の視覚言語モデル構成をゼロショットで評価する。
最強のモデルは60.4 EvoGainにしか達しないが、モデルスケールとGUIの特殊化は性能を確実に予測しない。
これらの結果から、EvoGUI-Benchは、エンドツーエンドのGUIエージェント評価のためのスケーラブルな診断補完であり、状態遷移理解においてかなりのヘッドルームを誇示している。
ソースコードはhttps://github.com/Yyhh6/EvoGUIで公開されている。
関連論文リスト
- ShowUI-$π$: Flow-based Generative Models as GUI Dexterous Hands [59.222064425122795]
そこで我々は,GUI dexterous Handとして最初のフローベース生成モデルである ShowUI-$ を開発した。
ShowUI-$$は、たった450万のパラメータで26.98を達成する。
論文 参考訳(メタデータ) (2025-12-31T16:51:14Z) - GUI-ReWalk: Massive Data Generation for GUI Agent via Stochastic Exploration and Intent-Aware Reasoning [11.909652592163896]
GUI-ReWalkは、現実的で多様なGUIトラジェクトリを合成するための多段階フレームワークである。
GUI-ReWalkは、ランダム性と構造に対するゴール認識推論を組み合わせることで、人間のコンピュータインタラクションの意図認識、適応性をよりよく反映したデータを生成する。
その結果、GUI-ReWalkは、多様な相互作用フロー、より高い軌道エントロピー、よりリアルなユーザインテントのカバレッジを向上できることを示した。
論文 参考訳(メタデータ) (2025-09-19T08:09:18Z) - GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning [21.964100514016504]
GUIエージェントのための効果的なビジョンランゲージモデル(VLM)のトレーニングは通常、大規模な注釈付きデータセットに依存する。
本稿では,2つのGUI状態間の遷移を引き起こす初期動作を予測することで,VLMがGUIダイナミクスを学習する自己教師型逆動的タスクであるKステップGUIトランジションを紹介する。
本稿では,ルールベースの最適化とデータフィルタリングを組み合わせることで,VLM性能を向上させるための強化学習フレームワークであるGUI-Shiftを提案する。
論文 参考訳(メタデータ) (2025-05-18T16:34:30Z) - WorldGUI: An Interactive Benchmark for Desktop GUI Automation from Any Starting Point [17.165899818213475]
We introduced WorldGUI, a comprehensive GUI benchmark including tasks across 10 wide used desktop and web applications。
WorldGUI-Agentは3つのコアモジュールを統一する普遍的なフレームワークである。高レベルプラン修正のためのPlanner-Critic、中間検証のためのStep-Check、アクションレベルの最適化のためのActor-Criticである。
論文 参考訳(メタデータ) (2025-02-12T01:06:10Z) - UI-TARS: Pioneering Automated GUI Interaction with Native Agents [58.18100825673032]
本稿では,GUIエージェントのネイティブモデルであるUI-TARSを紹介する。
OSWorldベンチマークでは、UI-TARSはスコアが24.6、50ステップが22.7、15ステップが22.7でクロード(それぞれ22.0と14.9)を上回っている。
論文 参考訳(メタデータ) (2025-01-21T17:48:10Z) - Falcon-UI: Understanding GUI Before Following User Instructions [57.67308498231232]
インテリジェンスフリーなGUIナビゲーションデータセットであるInsight-UIデータセットを導入し、GUI環境のモデル理解を強化する。
Insight-UIデータセットはCommon Crawlコーパスから自動的に生成され、さまざまなプラットフォームをシミュレートする。
我々は、最初Insight-UIデータセットで事前訓練され、その後AndroidおよびWeb GUIデータセットで微調整されたGUIエージェントモデルFalcon-UIを開発した。
論文 参考訳(メタデータ) (2024-12-12T15:29:36Z) - Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction [69.57190742976091]
Aguvisは、自律的なGUIエージェントのためのビジョンベースのフレームワークである。
クロスプラットフォームのインタラクションを標準化し、内部モノローグによる構造化推論を取り入れている。
オフラインおよび実世界のオンラインベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-12-05T18:58:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。