論文の概要: GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs
- arxiv url: http://arxiv.org/abs/2608.03270v1
- Date: Tue, 04 Aug 2026 07:47:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.085853
- Title: GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs
- Title(参考訳): GUI-Lens: 汎用VLMを用いたGUIグラウンドニングのための粗大なクロップ
- Authors: Zichuan Fu, Shirong Wang, Wenlin Zhang, Guojing Li, Yimin Deng, Jingtong Gao, Junjia Qi, Hanyu Yan, Yefeng Zheng, Xiaopeng Li, Wanyu Wang, Xian Wu, Xiangyu Zhao,
- Abstract要約: 視覚言語モデル(VLM)は、要求された制御を、インタラクションに十分な精度で特定することなく認識することができる。
GUI-Lens(GUI-Lens)は、汎用的なVLMがアクティブな視覚観察を通してターゲットを判断できる粗大な接地フレームワークである。
実験の結果、GUI-Lensは全体の接地精度を最大24.9ポイント改善し、GPT-5.5で最先端の性能を達成した。
- 参考スコア(独自算出の注目度): 40.30152384879941
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: GUI grounding maps natural-language instructions to click locations and is essential for reliable GUI agents. The task remains difficult on high-resolution, densely populated interfaces because a vision-language model (VLM) may recognize a requested control without locating it precisely enough for interaction. Most existing methods provide various forms of localization assistance, but still rely on a direct click prediction, allowing visual ambiguity or an inaccurate initial estimate to propagate to the final result. In this paper, we introduce GUI-Lens, a coarse-to-fine grounding framework that allows a general-purpose VLM to determine the target through active visual observations. Specifically, GUI-Lens extracts OCR text and detected UI components from the screenshot and presents their positions as coordinate references. Using the instruction, the current view, and these references, the VLM selects the region and scale of the next view, which is cropped and enlarged to provide finer visual details. This process continues over successively focused views until the target is determined. Proposed crops and clicks are checked against the instruction throughout the process, and the final local position is mapped back to the original screen coordinates. Experiments on four GUI grounding benchmarks and three general-purpose VLM backends show that GUI-Lens improves overall grounding accuracy by up to 24.9 percentage points and achieves state-of-the-art performance with GPT-5.5.
- Abstract(参考訳): GUIグラウンディングは、場所をクリックするために自然言語の命令をマッピングし、信頼性の高いGUIエージェントに必須である。
視覚言語モデル(VLM)は、対話に十分な位置を特定することなく、要求された制御を認識できるため、高分解能で人口密度のインタフェースでは、このタスクは依然として困難である。
既存のほとんどの手法は様々な形態のローカライズ支援を提供するが、それでも直接クリック予測に依存しており、視覚的曖昧さや不正確な初期推定が最終結果に伝播する。
本稿では,GUI-Lensについて紹介する。このGUI-Lensは,汎用的なVLMがアクティブな視覚観察を通して目標を決定するための粗い接地フレームワークである。
特にGUI-Lensは、スクリーンショットからOCRテキストと検出されたUIコンポーネントを抽出し、それらの位置を座標参照として表示する。
命令、現在のビュー、およびこれらの参照を使用して、VLMは次のビューの領域とスケールを選択し、より細かい視覚的詳細を提供するために、トリミングして拡大する。
このプロセスは、目標が決定されるまで、連続的に集中したビューを継続する。
提案された作物とクリックはプロセス全体を通して命令に対してチェックされ、最終的なローカル位置は元のスクリーン座標にマッピングされる。
4つのGUI接地ベンチマークと3つの汎用VLMバックエンドの実験により、GUI-Lensは全体の接地精度を最大24.9ポイント改善し、GPT-5.5で最先端のパフォーマンスを達成することが示された。
関連論文リスト
- Generalist Scanner Meets Specialist Locator: A Synergistic Coarse-to-Fine Framework for Robust GUI Grounding [53.14935624161711]
GMS: Generalist Scanner Meets Specialist LocatorはGUIグラウンディングのパフォーマンスを効果的に改善する相乗的粗大なフレームワークです。
このデザインは、人間がGUIグラウンドを実行する方法にインスパイアされ、目がインターフェイスをスキャンし、脳が解釈と局所化に焦点を当てる。
ScreenSpot-Proデータセットの実験結果によると、'Scanner'モデルと'Locator'モデルは、それぞれ独立して使用する場合、それぞれ2.0%$と3.7%$の精度しか達成していないが、GMSフレームワークへの統合により、全体的な精度は35.7%$である。
論文 参考訳(メタデータ) (2025-09-29T00:06:31Z) - Learning GUI Grounding with Spatial Reasoning from Visual Feedback [46.66862168972301]
我々は,多段階オンライン強化学習を用いたGUIグラウンドモデル GUI-Cursor を訓練する。
実験の結果、Qwen2.5-VL-7Bに基づくGUI-Cursorは、GUIグラウンドの精度を向上し、最先端の結果が得られることがわかった。
論文 参考訳(メタデータ) (2025-09-25T20:38:01Z) - DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning [53.42606072841585]
トレーニング不要なGUIグラウンドティングフレームワークであるDiMo-GUIを紹介する。
GUIをモノリシックなイメージとして扱う代わりに、入力をテキスト要素とアイコン要素に分割する。
DiMo-GUIは、予測が曖昧で不正確である場合、候補焦点領域を生成することにより、動的に注意を集中する。
論文 参考訳(メタデータ) (2025-06-12T03:13:21Z) - GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents [93.49577107524176]
座標自由なGUIグラウンドリングのためのVLMに基づくGUI-Actorを提案する。
GUI-Actorの中核となるのは、アテンションベースのアクションヘッドで、専用のACTOR>トークンと関連するすべての視覚的パッチトークンの整合を学ぶ。
実験により、GUI-Actorは、複数のGUIアクショングラウンドベンチマークにおいて、最先端のメソッドよりも優れていることが示された。
論文 参考訳(メタデータ) (2025-06-03T17:59:08Z) - TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents [0.6827423171182154]
TRISHULは、総合的なGUI理解のための一般のLVLMを強化する、トレーニング不要のフレームワークである。
この結果は、ScreenSpot、VisualWebBench、AITW、Mind2WebデータセットをまたいだアクショングラウンドにおけるTRISHULの優れたパフォーマンスを示している。
GUI参照の場合、TRISHULはScreenPRベンチマークのToLエージェントを超え、堅牢で適応可能なGUI理解のための新しい標準を設定している。
論文 参考訳(メタデータ) (2025-02-12T09:12:30Z) - Improved GUI Grounding via Iterative Narrowing [0.03375622857152329]
本稿では,GUIグラウンディングにおける汎用モデルと微調整モデルの両方の性能向上のために,反復的絞り機構を用いた視覚的プロンプトフレームワークを提案する。
評価のために、様々なUIプラットフォームからなる包括的なベンチマークで手法を検証し、その結果を再現するコードを提供した。
論文 参考訳(メタデータ) (2024-11-18T05:47:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。