論文の概要: Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?
- arxiv url: http://arxiv.org/abs/2607.26041v2
- Date: Wed, 29 Jul 2026 19:07:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.265828
- Title: Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?
- Title(参考訳): Desktop-Delta Bench: コンピュータ利用モデルはデスクトップGUIトランジションを理解するか?
- Authors: Abhishek Pillai, Samir Kumar Nayak, Yuan Chen,
- Abstract要約: 現在のベンチマークは、主にエンドタスクの成功または単一フレームグラウンドを測定する。
推論、リモート入力、アプリのレンダリング、スクリーンショットキャプチャが非同期であるため、これは難しい。
オフラインのステップレベルベンチマークであるDesktop-Delta Bench (DDB)を紹介した。
- 参考スコア(独自算出の注目度): 3.9561795512466413
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Computer-use agents (CUAs) increasingly act through desktop GUIs to complete long-horizon tasks. Current benchmarks primarily measure end-task success or single-frame grounding. Neither isolates whether a model can reconstruct the causal, task-relevant transition produced by an action- crucial for rejecting stale observations, verifying progress, and recovering from failure. This is difficult because inference, remote input, app rendering, and screenshot capture are asynchronous: the next observation may be delayed, occluded, transient, or unrelated, then misread as progress and carried into subsequent planning. We introduce Desktop-Delta Bench (DDB), an offline step-level benchmark with 2,013 human-verified instances from novel, multi-app Linux trajectories across ~15 applications and 50 task domains. DDB trajectories targets 3 failure dimensions- state verification, source tracking, and context-aware control- through 2 complementary tasks: 463 3-frame temporal-ordering instances, including 105 with a cross-trajectory decoy, and 1,550 before-after pairs labeled from 5 actions + its payload. We evaluate 8 closed and open-source model families across 32 ordering and 16 single-action settings, observing consistent gaps. Ordering remains unsaturated: best non-decoy and decoy exact-match rates are 65.1% and 65.7%. Task context improves decoy identification by 6.9 percentage points but reduces non-decoy exact match by 2.2 points; error analysis reveals systematic copying of the presented A-B-C order. Single-action results show that inferring the action family is harder than locating it: click F1 is 0.96 vs, 0.76 for drag, while recognized drags are generally localized well. DDB, thus, complements end-to-end benchmarks by filling the missing diagnostic layer between GUI grounding and final task success, enabling targeted improvements to desktop CUA verification, reliability, and recovery.
- Abstract(参考訳): コンピュータ・ユース・エージェント(CUA)はデスクトップのGUIを通して長時間のタスクをこなすようになっている。
現在のベンチマークは、主にエンドタスクの成功または単一フレームグラウンドを測定する。
モデルが因果的、タスク関連トランジションを再構築できるかどうかも、古い観察を拒絶し、進捗を検証し、失敗から回復するために不可欠なアクション-によって生成されるものではない。
推論、リモートインプット、アプリのレンダリング、スクリーンショットキャプチャは非同期であるため、これは難しい。次の観察は遅れたり、無視されたり、過渡的だったり、あるいは無関係だったりして、進歩として誤解され、その後の計画に実行されます。
オフラインのステップレベルベンチマークであるDesktop-Delta Bench (DDB)を紹介した。
DDBトラジェクトリは、状態検証、ソーストラッキング、コンテキスト認識コントロールという2つの補完的なタスクを目標としています。
我々は、32の順序と16のシングルアクション設定にまたがる8つのクローズドおよびオープンソースモデルファミリーを評価し、一貫したギャップを観察した。
最良の非デコイとデコイの正確なマッチレートは65.1%と65.7%である。
タスクコンテキストはデコイの識別を6.9ポイント改善するが、非デコイの正確な一致を2.2ポイント削減する。
シングルアクションの結果は、アクションファミリの推測が位置付けよりも難しいことを示している: F1 のクリックはドラッグで 0.96 対 0.76 であり、認識されたドラッグは一般的によくローカライズされる。
したがって、DDBはGUIグラウンディングと最終タスク成功の間に欠落した診断層を埋めることでエンドツーエンドのベンチマークを補完し、デスクトップCUAの検証、信頼性、リカバリを目標とする改善を可能にする。
関連論文リスト
- ReacTOD: Bounded Neuro-Symbolic Agentic NLU for Zero-Shot Dialogue State Tracking [2.2573512203799626]
本稿では,NLUを独立したツールコールとして再構成する有界神経シンボルアーキテクチャであるReacTODを提案する。
有界ReActループは反復自己補正を可能にし、MultiWOZ上のシングルパス推論よりも最大9.3ポイント精度を向上させる。
論文 参考訳(メタデータ) (2026-05-18T20:06:04Z) - PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control [43.10024632595698]
大規模な視覚言語モデルにはGUIエージェントが大幅に進歩し、Web、モバイル、デスクトップインターフェース間で実行可能な対話を可能にする。
しかし、これらの利得は、近隣の多くのピクセルが同じコンポーネント内で有効であるような、地域寛容なパラダイムに大きく依存している。
我々は,この状態を精度の高いGUIタスクとして認識し,点レベルの精度,幾何学的検証,依存性駆動型エラー伝播に対する堅牢性を必要とする。
構成を依存型計画とピクセルレベルの実行に分解するトポロジ対応エージェントであるPAGERを提案する。
論文 参考訳(メタデータ) (2026-05-15T13:55:05Z) - Step-level Optimization for Efficient Computer-use Agents [51.29573359027217]
我々は、強力なコンピュータ利用エージェントは、実際は高価で遅いと論じている。
本稿では,コンピュータ利用エージェントのためのイベント駆動ステップレベルカスケードを提案する。
論文 参考訳(メタデータ) (2026-04-29T19:59:36Z) - VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation [98.38575149237442]
VLAA-GUIは3つの統合コンポーネントを中心に構築されたモジュラーGUIフレームワークである。
必須完全性検証は、UIで観測可能な成功基準と検証を、各完了ステップで実施する。
強制的なループブレーカは、繰り返し失敗した後、多層切替インタラクションモードを提供する。
論文 参考訳(メタデータ) (2026-04-23T07:42:37Z) - ANCHOR: Branch-Point Data Generation for GUI Agents [52.22377425487]
デスクトップ環境向けのエンドツーエンドGUIエージェントは、大量の高品質なインタラクションデータを必要とする。
本稿では,拡張フレームワークであるAnchorについて紹介する。このフレームワークは,小規模で検証済みのシードデモから,スケーラブルなデスクトップ監視をブートストラップする。
OSWorldとWindowsAgentArenaの標準デスクトップベンチマークの実験では、拡張されたコーパスに微調整されたモデルが一貫した改善を実現している。
論文 参考訳(メタデータ) (2026-02-06T19:55:26Z) - GUI-360$^\circ$: A Comprehensive Dataset and Benchmark for Computer-Using Agents [59.107657859025586]
GUI-360$circ$は、コンピュータ利用エージェント(CUA)を進化させるために設計された大規模で包括的なデータセットとベンチマークスイートである。
リリースされたコーパスには、人気のあるWindowsオフィスアプリケーションにおける数千のトラジェクトリにわたる1.2万以上の実行されたアクションステップが含まれている。
このデータセットは、3つの標準タスク、GUIグラウンド、スクリーン解析、アクション予測、ハイブリッドGUI+APIアクションスペースをサポートする。
論文 参考訳(メタデータ) (2025-11-06T12:19:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。