論文の概要: WinDeskGround: A Benchmark for Robust GUI Grounding in Complex Multi-Window Desktop Environments
- arxiv url: http://arxiv.org/abs/2605.16402v1
- Date: Wed, 13 May 2026 02:48:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:46.290668
- Title: WinDeskGround: A Benchmark for Robust GUI Grounding in Complex Multi-Window Desktop Environments
- Title(参考訳): WinDeskGround: 複雑なマルチウィンドウデスクトップ環境におけるロバストGUIグラウンドのベンチマーク
- Authors: Haoren Zhao, Tianyi Chen, Zhen Wang,
- Abstract要約: MLLM (Multimodal Large Language Models) はGUIの自動化に革命をもたらしたが、その効果は理想化された単一層インタフェースでほぼ確立されている。
本稿では,最先端のエージェントが現実のデスクトップ環境において,異なる課題に直面しているという,重要な信頼性ギャップを明らかにする。
我々はGUI基盤の堅牢性を評価するための新しいベンチマークと合成フレームワークであるWinDeskGroundを紹介する。
- 参考スコア(独自算出の注目度): 49.98994180610182
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) have revolutionized GUI automation, yet their efficacy is largely established on idealized, single-layer interfaces. This paper identifies a critical reliability gap: state-of-the-art agents face distinct robustness challenges in real-world desktop environments characterized by multi-window stacking, occlusion, and visual clutter. To address this, we introduce WinDeskGround, a novel benchmark and synthesis framework tailored for evaluating GUI grounding robustness. Unlike static datasets, our framework parametrically generates complex desktop scenarios by controlling window occlusion, layout density, and semantic similarity, thereby simulating the distribution shifts of authentic workflows. We construct a diverse meta-dataset of 1,356 high-fidelity instruction-target pairs and conduct comprehensive evaluations of five leading MLLMs. Our results demonstrate that while top-tier agents excel in simplified settings, their accuracy declines under partial occlusion. WinDeskGround provides a valuable benchmark to facilitate the assessment and advancement of GUI agent robustness in realistic environments. The code is available at https://github.com/ZZZhr-1/WinDeskGround.
- Abstract(参考訳): MLLM (Multimodal Large Language Models) はGUIの自動化に革命をもたらしたが、その効果は理想化された単一層インタフェースでほぼ確立されている。
本稿では,マルチウィンドウ・スタックリング,オクルージョン,視覚的クラッタを特徴とする,最先端のエージェントが現実のデスクトップ環境において,それぞれ異なる堅牢性課題に直面していることを明らかにする。
そこで我々は,GUI基盤の堅牢性を評価するための新しいベンチマークと合成フレームワークWinDeskGroundを紹介した。
静的なデータセットとは異なり、我々のフレームワークはウィンドウ閉塞、レイアウト密度、セマンティックな類似性を制御することで複雑なデスクトップシナリオをパラメトリックに生成し、実際のワークフローの分散シフトをシミュレートする。
我々は1,356個の高忠実度命令ターゲットペアからなる多種多様なメタデータセットを構築し、5つのMLLMの包括的な評価を行う。
その結果,トップレベルエージェントは簡易な設定では優れるが,部分閉塞下では精度が低下することがわかった。
WinDeskGroundは、現実的な環境でGUIエージェントの堅牢性の評価と向上を容易にする貴重なベンチマークを提供する。
コードはhttps://github.com/ZZhr-1/WinDeskGround.comで公開されている。
関連論文リスト
- ANCHOR: Branch-Point Data Generation for GUI Agents [52.22377425487]
デスクトップ環境向けのエンドツーエンドGUIエージェントは、大量の高品質なインタラクションデータを必要とする。
本稿では,拡張フレームワークであるAnchorについて紹介する。このフレームワークは,小規模で検証済みのシードデモから,スケーラブルなデスクトップ監視をブートストラップする。
OSWorldとWindowsAgentArenaの標準デスクトップベンチマークの実験では、拡張されたコーパスに微調整されたモデルが一貫した改善を実現している。
論文 参考訳(メタデータ) (2026-02-06T19:55:26Z) - SparkUI-Parser: Enhancing GUI Perception with Robust Grounding and Parsing [13.521180435948791]
本稿ではGUI知覚のための新しいエンドツーエンドフレームワークを提案する。
確率ベース離散モデリングの代わりに、座標の連続モデリングを行う。
これにより、離散出力特性に固有の制限を効果的に緩和する。
論文 参考訳(メタデータ) (2025-09-05T08:24:12Z) - CRAB: Cross-environment Agent Benchmark for Multimodal Language Model Agents [49.68117560675367]
Crabは、クロス環境タスクをサポートするように設計された最初のベンチマークフレームワークである。
私たちのフレームワークは複数のデバイスをサポートし、Pythonインターフェースで簡単に任意の環境に拡張できます。
実験の結果、GPT-4oの1剤が38.01%の最高完成率を達成することが示された。
論文 参考訳(メタデータ) (2024-07-01T17:55:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。