論文の概要: PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control
- arxiv url: http://arxiv.org/abs/2605.15963v1
- Date: Fri, 15 May 2026 13:55:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-18 21:22:26.302055
- Title: PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control
- Title(参考訳): PAGER:ポイント精度幾何GUI制御における意味的実行ギャップのブリッジ化
- Authors: Jingxuan Wei, Xi Bai, Shan Liu, Caijun Jia, Zheng Sun, Xinglong Xu, Siyuan Li, Linzhuang Sun, Bihui Yu, Conghui He, Cheng Tan,
- Abstract要約: 大規模な視覚言語モデルにはGUIエージェントが大幅に進歩し、Web、モバイル、デスクトップインターフェース間で実行可能な対話を可能にする。
しかし、これらの利得は、近隣の多くのピクセルが同じコンポーネント内で有効であるような、地域寛容なパラダイムに大きく依存している。
我々は,この状態を精度の高いGUIタスクとして認識し,点レベルの精度,幾何学的検証,依存性駆動型エラー伝播に対する堅牢性を必要とする。
構成を依存型計画とピクセルレベルの実行に分解するトポロジ対応エージェントであるPAGERを提案する。
- 参考スコア(独自算出の注目度): 43.10024632595698
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large vision-language models have significantly advanced GUI agents, enabling executable interaction across web, mobile, and desktop interfaces. Yet these gains largely rely on a forgiving region-tolerant paradigm, where many nearby pixels inside the same component remain valid. Precise geometric construction breaks this assumption: actions must land on points in continuous canvas space rather than tolerant regions. Because geometric primitives carry ontological dependencies, a local coordinate error can induce cascading topological failures that distort downstream objects and invalidate the final construction. We identify this regime as precision-sensitive GUI tasks, requiring point-level accuracy, geometry-aware verification, and robustness to dependency-driven error propagation. To benchmark it, we introduce PAGE Bench, with 4,906 problems and over 224K process-supervised, pixel-level GUI actions. We further propose PAGER, a topology-aware agent that decomposes construction into dependency-structured planning and pixel-level execution. Pixel-grounded supervised tuning establishes executable action grammar, while precision-aligned reinforcement learning mitigates rollout-induced exposure bias through state-conditioned geometric feedback. Experiments reveal a pronounced Semantic-Execution Gap: general multimodal models can exceed 88% action type accuracy yet remain below 6% task success. PAGER closes this gap, delivering 4.1x higher task success than the strongest evaluated general baseline and raising step success rate from below 9% for GUI-specialized agents to over 62%, establishing a new state of the art for point-precise GUI control.
- Abstract(参考訳): 大規模な視覚言語モデルにはGUIエージェントが大幅に進歩し、Web、モバイル、デスクトップインターフェース間で実行可能な対話を可能にする。
しかし、これらの利得は、近隣の多くのピクセルが同じコンポーネント内で有効であるような、地域寛容なパラダイムに大きく依存している。
厳密な幾何学的構成は、この仮定を破る: 行動は寛容領域ではなく連続キャンバス空間の点に着地しなければならない。
幾何学的プリミティブは存在論的依存関係を持つため、局所座標誤差は下流の物体を歪ませて最終構成を無効にするカスケードトポロジカルな失敗を引き起こす。
我々は,この状態を精度の高いGUIタスクとして認識し,点レベルの精度,幾何学的検証,依存性駆動型エラー伝播に対する堅牢性を必要とする。
PAGE Benchには4,906の問題と224K以上のプロセス管理されたピクセルレベルのGUIアクションがある。
さらに,構成を依存型計画とピクセルレベルの実行に分解するトポロジ対応エージェントであるPAGERを提案する。
画素接地型教師付きチューニングは実行可能な動作文法を確立し、精度整合強化学習は状態条件の幾何フィードバックを通じてロールアウト誘起露光バイアスを緩和する。
一般的なマルチモーダルモデルは、アクションタイプの精度は88%を超えますが、タスクの成功率は6%以下です。
PAGERはこのギャップを埋め、最も評価の高い一般的なベースラインよりも4.1倍高いタスク成功を実現し、GUI特化エージェントの9%未満から62%以上までステップ成功率を高め、ポイント精度GUI制御のための新しい最先端技術を確立した。
関連論文リスト
- Step-level Optimization for Efficient Computer-use Agents [51.29573359027217]
我々は、強力なコンピュータ利用エージェントは、実際は高価で遅いと論じている。
本稿では,コンピュータ利用エージェントのためのイベント駆動ステップレベルカスケードを提案する。
論文 参考訳(メタデータ) (2026-04-29T19:59:36Z) - See, Point, Refine: Multi-Turn Approach to GUI Grounding with Visual Feedback [8.080056970922483]
Computer Use Agents (CUA) は基本的にグラフィカルユーザインタフェース(GUI)に依存しており、言語命令を実行可能なスクリーンアクションに変換する。
既存のアプローチは通常単発座標予測に依存しており、誤り訂正のメカニズムが欠如しており、しばしば高密度インタフェースで失敗する。
本稿では,符号化環境における画素精度カーソルのローカライゼーションに関する実証的研究を行う。
我々は,GPT-5.4,Claude,Qwenにまたがるアプローチを複雑な符号化ベンチマークで評価し,マルチターン改良が,クリック精度とクリック精度の両方において,最先端のシングルショットモデルよりも著しく優れていることを示した。
論文 参考訳(メタデータ) (2026-04-14T17:55:46Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - See, Plan, Snap: Evaluating Multimodal GUI Agents in Scratch [20.231957791642635]
本稿では,Scratchにおけるプログラム・バイ・コンストラクションタスクにおけるマルチモーダルGUIエージェントの評価ベンチマークであるScratchWorldを紹介する。
ScratchWorldは、Create、Debug、Extended、Computeの4つの異なる問題カテゴリにまたがる83のキュレートされたタスクで構成されている。
信頼性の高い評価を実現するため,構築したScratchプログラムの機能的正当性を検証した実行ベース評価プロトコルを提案する。
論文 参考訳(メタデータ) (2026-02-11T12:54:53Z) - GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents [93.49577107524176]
座標自由なGUIグラウンドリングのためのVLMに基づくGUI-Actorを提案する。
GUI-Actorの中核となるのは、アテンションベースのアクションヘッドで、専用のACTOR>トークンと関連するすべての視覚的パッチトークンの整合を学ぶ。
実験により、GUI-Actorは、複数のGUIアクショングラウンドベンチマークにおいて、最先端のメソッドよりも優れていることが示された。
論文 参考訳(メタデータ) (2025-06-03T17:59:08Z) - AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning [82.42421823672954]
AgentCPM-GUIは、堅牢で効率的なオンデバイスGUIインタラクションのために構築されている。
私たちのトレーニングパイプラインには、知覚を高めるためのグラウンドアウェア事前トレーニングが含まれています。
AgentCPM-GUIは5つの公開ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-06-02T07:30:29Z) - GEM: Gaussian Embedding Modeling for Out-of-Distribution Detection in GUI Agents [13.415165482033395]
環境制約に違反したり、GUIエージェントの現在の能力を超えたりするアウト・オブ・ディストリビューション(OOD)命令は、タスクの故障やセキュリティ上の脅威を引き起こす可能性がある。
従来のOOD検出手法は、複雑な埋め込み空間とGUI環境の進化により、この領域でサブ最適化される。
本稿では,その機能境界を反映したGUIエージェントから抽出した入力埋め込み距離にガウス混合モデルを適用する新しい手法であるGEMを提案する。
論文 参考訳(メタデータ) (2025-05-19T08:29:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。