論文の概要: DeskForge: Dense Supervision from Desktop Environments for Computer-Use Agents
- arxiv url: http://arxiv.org/abs/2610.02320v1
- Date: Thu, 01 Oct 2026 18:00:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.0375
- Title: DeskForge: Dense Supervision from Desktop Environments for Computer-Use Agents
- Title(参考訳): DeskForge:コンピュータ利用エージェントのためのデスクトップ環境からの高密度スーパービジョン
- Abstract要約: コンピュータ利用エージェントは、複雑なデスクトップシーンで確実にアクションターゲットを接地する必要がある。
DeskForgeはコントロール可能なデスクトップ環境で、実際のアプリケーションの構成と探索を行う。
この環境を利用して、1.2Mの注釈付きデスクトップ観測コーパスであるDeskForge-1Mを構築する。
- 参考スコア(独自算出の注目度): 48.71749944456216
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computer-use agents need to reliably ground action targets in complex desktop scenes, where multiple applications, overlapping windows, and visually similar controls compete for attention. Existing training data rarely pair such scenes with dense annotations or vary them in a controlled way. We introduce DeskForge, a controllable desktop environment that composes and explores real applications to generate large-scale supervision for computer-use agents. It varies application states, content, window layout, appearance, and resolution, and fuses screenshots, accessibility trees, and window geometry into dense element annotations while recording the outcome of each executed action. Using this environment, we construct DeskForge-1M, a corpus of 1.2M annotated desktop observations containing 159.7M element instances. We fine-tune four vision-language models on 200K grounding examples drawn from DeskForge-1M. All four improve across held-out desktop conditions and on all five external GUI grounding benchmarks; for Qwen3.5-4B, accuracy increases by 11.51 percentage points on ScreenSpot-Pro and 10.11 points on OSWorld-G. The gains also translate to long-horizon task completion: under a fixed planner, the fine-tuned action models solve more WebArena-Infinity and OpenApps tasks, with Qwen3.5-4B increasing from 31 to 50 of 119 tasks and from 3 to 15 of 100 tasks, respectively. These results show that controllable composition of real desktop environments provides a scalable source of supervision for improving both GUI grounding and long-horizon computer use. The framework code, the dataset, and the fine-tuned model are available from the project page: https://saidgurbuz.github.io/deskforge/
- Abstract(参考訳): コンピュータ利用エージェントは、複数のアプリケーション、重なり合うウィンドウ、視覚的に類似したコントロールが注目を集める複雑なデスクトップシーンにおいて、アクションターゲットを確実に接地する必要がある。
既存のトレーニングデータは、このようなシーンを高密度のアノテーションと組み合わせたり、制御された方法で変更したりすることはめったにない。
本稿では,コンピュータ利用エージェントの大規模監視を実現するための実アプリケーションの構築と探索を行う,制御可能なデスクトップ環境であるDeskForgeを紹介する。
アプリケーション状態、コンテンツ、ウィンドウレイアウト、外観、解像度を変え、実行された各アクションの結果を記録しながら、スクリーンショット、アクセシビリティツリー、ウィンドウ幾何学を高密度な要素アノテーションに融合する。
この環境を利用して、159.7M要素インスタンスを含む1.2Mのアノテートされたデスクトップ観測コーパスであるDeskForge-1Mを構築する。
我々は,DeskForge-1Mから抽出した200Kグラウンドの4つの視覚言語モデルを微調整する。
Qwen3.5-4Bでは、ScreenSpot-Proでは11.51ポイント、OSWorld-Gでは10.11ポイントの精度が向上した。
固定プランナーの下では、細調整されたアクションモデルにより、WebArena-InfinityタスクとOpenAppsタスクがより解決され、Qwen3.5-4Bは119タスクの31から50、Qwen3.5-4Bは100タスクの3から15に増加した。
これらの結果は、実際のデスクトップ環境の制御可能な構成は、GUIの接地と長期のコンピュータ利用を改善するためのスケーラブルな管理源を提供することを示している。
フレームワークのコード、データセット、微調整されたモデルは、プロジェクトページから入手できる。
関連論文リスト
- AutoGUIWorld: Image Generators as Visual World Models for GUI Agent [24.045452652419858]
本稿では,GUIインタラクショントラジェクトリを,対応するソフトウェア環境のデプロイや実行なしに合成するフレームワークであるAutoGUIWorldを紹介する。
AutoGUIWorldは、オペレーティングシステムコンテキスト、視覚的外観、インターフェース状態の構造化仕様から初期GUIシーンをサンプリングし、それらのシーンで条件付けられたタスクを生成する。
その後、プランナーはアトミックアクションとその意図した視覚効果を指定し、画像生成器は現在のスクリーンショットを反復的に編集してその後の観察を行う。
論文 参考訳(メタデータ) (2026-10-01T07:22:53Z) - Qwen-CUA: Native Computer Use for (almost) Everything [104.78368489343713]
本稿では,Qwen-CUAについて紹介する。
DOMツリー、アクセシビリティメタデータ、タスク固有のAPIなしで、スクリーンショットのみを観察し、キーボードやマウスのイベントを通じて動作します。
足場は最大20個のアクティブなスクリーンショットを保持し、最近の証拠を保持するために固定サイズのブロックで古い視覚履歴を折り畳む。
論文 参考訳(メタデータ) (2026-08-03T15:04:20Z) - WinDeskGround: A Benchmark for Robust GUI Grounding in Complex Multi-Window Desktop Environments [49.98994180610182]
MLLM (Multimodal Large Language Models) はGUIの自動化に革命をもたらしたが、その効果は理想化された単一層インタフェースでほぼ確立されている。
本稿では,最先端のエージェントが現実のデスクトップ環境において,異なる課題に直面しているという,重要な信頼性ギャップを明らかにする。
我々はGUI基盤の堅牢性を評価するための新しいベンチマークと合成フレームワークであるWinDeskGroundを紹介する。
論文 参考訳(メタデータ) (2026-05-13T02:48:52Z) - Scaling Computer-Use Grounding via User Interface Decomposition and Synthesis [57.371814877372515]
グラフィカルユーザインタフェース(GUI)の基盤は、コンピュータ利用エージェント開発において依然として重要なボトルネックとなっている。
多様なタスクタイプにまたがる564の細かな注釈付きサンプルからなる総合ベンチマークであるOSWorld-Gを紹介する。
我々は、400万のサンプルを含む、最大のコンピュータ利用基盤データセットであるJediを合成してリリースする。
論文 参考訳(メタデータ) (2025-05-19T15:09:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。