論文の概要: SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL
- arxiv url: http://arxiv.org/abs/2607.11185v1
- Date: Mon, 13 Jul 2026 07:32:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.365673
- Title: SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL
- Title(参考訳): SCALECUA: 検証可能なタスク合成と効率的なオンラインRLによるコンピュータ利用エージェントのスケーリング
- Authors: Bowen Lv, Xiao Liu, Yanyu Ren, Hanyu Lai, Bohao Jing, Hanchen Zhang, Yanxiao Zhao, Shuntian Yao, Jie Tang, Yuxiao Dong,
- Abstract要約: コンピュータ利用エージェント(CUA)は、視覚認識とGUI実行を通じて複雑なデジタルを自動化する強力なインターフェースとして登場しつつある。
検証可能な報酬(RLVR)を備えたオンライン強化学習は、その能力をスケールアップするための重要な方向として現れている。
検証可能なタスク合成と効率的なトレーニングを通じてCUAのオンラインRLをスケールする統合フレームワークであるScaleCUAを紹介する。
- 参考スコア(独自算出の注目度): 38.05711358650287
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computer use agents (CUAs) are emerging as a powerful interface for automating complex digital workflows through visual perception and GUI execution. Online reinforcement learning with verifiable rewards (RLVR) has emerged as a key direction for scaling their capabilities. However, this paradigm is bottlenecked by verifiable data scarcity and online RL inefficiency. To break these barriers, we introduce ScaleCUA, a unified framework that scales online RL for CUAs via verifiable task synthesis and efficient training. At the data level, we design VeriGen, an end-to-end framework for generating verifiable RL tasks through iterative docker interactions and a multi-agent feedback loop. Scaled to 100+ concurrent agent workers via a shared docker interaction probe, this pipeline produces 24K+ verifiable tasks and nearly 3K high-quality RL tasks. To maximize sample efficiency, we propose Frontier Sampling, which tracks per-task capability and allocates rollouts to the current learning frontier. On the training side, we further design Visual Context Segmentation, a sliding window over recent visual context that balances rollout and training-engine pressure, yielding a 2.83x training speedup over step-wise decomposition. Together, ScaleCUA achieves 68.7% on OSWorld and 54.0% on ScienceBoard, establishing new state-of-the-art performance among open-source computer use agents. Code, models, and datasets are available at https://github.com/THUDM/SCALE-CUA.
- Abstract(参考訳): コンピュータ利用エージェント(CUA)は、視覚認識とGUI実行を通じて複雑なデジタルワークフローを自動化するための強力なインターフェースとして登場した。
検証可能な報酬(RLVR)を備えたオンライン強化学習は、その能力をスケールアップするための重要な方向として現れている。
しかし、このパラダイムは検証可能なデータの不足とオンラインRL非効率によってボトルネックとなっている。
これらの障壁を解消するために、検証可能なタスク合成と効率的なトレーニングを通じてCUAのオンラインRLをスケールする統合フレームワークであるScaleCUAを紹介します。
データレベルでは、反復的なdockerインタラクションとマルチエージェントフィードバックループを通じて検証可能なRLタスクを生成するエンドツーエンドフレームワークであるVeriGenを設計する。
共有dockerインタラクションプローブによって100以上の並行エージェントワーカーにスケールアップされたこのパイプラインは、24K以上の検証可能なタスクと、約3Kの高品質なRLタスクを生成する。
サンプル効率を最大化するために,タスク毎の機能を追跡し,現在の学習フロンティアにロールアウトを割り当てるフロンティアサンプリングを提案する。
トレーニング側では、最近のビジュアルコンテキスト上のスライディングウィンドウであるVisual Context Segmentationをさらに設計し、ロールアウトとトレーニングエンジンの圧力をバランスさせ、ステップワイズ分解よりも2.83倍のスピードアップを実現した。
ScaleCUAはOSWorldで68.7%、ScienceBoardで54.0%を達成し、オープンソースのコンピュータ利用エージェントで最先端のパフォーマンスを確立した。
コード、モデル、データセットはhttps://github.com/THUDM/SCALE-CUA.comで入手できる。
関連論文リスト
- AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs [57.86040075371121]
強化学習(Reinforcement Learning, RL)は、大規模言語モデルの推論、コーディング、ツール使用能力の向上にますます利用されている。
エージェントRLは違法に高価である。
本稿では,従来のトレーナー中心制御を原則的コンポーネント抽象化に置き換えるデータフロー指向RLシステムであるAstraFlowを提案する。
論文 参考訳(メタデータ) (2026-05-15T03:13:35Z) - From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents [23.583947864141162]
EigenDataは階層的なマルチエージェントエンジンで、ツール基底の対話と実行可能なインスタンスごとのチェッカーを合成する。
合成データに基づいて、まずユーザモデルを微調整し、GRPOスタイルのトレーニングを適用するRLレシピを開発する。
以上の結果から,高価なアノテーションを使わずに,複雑なツールの動作をブートストラップするためのスケーラブルな経路が示唆された。
論文 参考訳(メタデータ) (2026-01-30T06:01:23Z) - Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels [96.35283762778137]
我々は、強化学習のためのスケーラブルなデータエンジンであるWebscale-RLパイプラインを紹介した。
9ドメイン以上にわたる120万のサンプルを含むWebscale-RLデータセットを構築した。
我々の研究は、RLを事前学習レベルに拡張するための実行可能なパスを示し、より有能で効率的な言語モデルを可能にします。
論文 参考訳(メタデータ) (2025-10-07T22:30:59Z) - AgentRL: Scaling Agentic Reinforcement Learning with a Multi-Turn, Multi-Task Framework [76.96794548655292]
大規模言語モデル(LLM)は、オンラインインタラクションを通じて学習できる汎用エージェントの構築への関心が高まっている。
マルチターンでLLMエージェントをトレーニングするために強化学習(RL)を適用することで、スケーラブルなインフラストラクチャと安定したトレーニングアルゴリズムが欠如しているため、マルチタスク設定は依然として困難である。
本稿では、スケーラブルなマルチターンマルチタスクエージェントRLトレーニングのためのAgentRLフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-05T13:40:01Z) - Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation [65.3648667980258]
視覚言語モデル(VLM)に基づくGUIエージェントは複雑なタスクの自動化を約束するが、強化学習(RL)の適用において大きな課題に直面している。
異種モジュールを高度に非結合的に協調するGUIエージェントのための非結合エージェントRLトレーニングフレームワークであるDARTを提案する。
OSWorldのベンチマークでは、DART-GUI-7Bは42.13%のタスク成功率、14.61%の絶対ゲイン、オープンソースSOTAよりも7.34%高い。
論文 参考訳(メタデータ) (2025-09-28T13:19:20Z) - ComputerRL: Scaling End-to-End Online Reinforcement Learning for Computer Use Agents [40.033250603445246]
自律デスクトップインテリジェンスのためのフレームワークComputerRLを紹介する。
ComputerRLは、プログラム的なAPI呼び出しと直接GUIインタラクションを統合するAPI-GUIパラダイムを備えている。
本稿では,強化学習と教師付き微調整を交互に行う訓練戦略であるEntropulseを提案する。
論文 参考訳(メタデータ) (2025-08-19T17:59:45Z) - Spreeze: High-Throughput Parallel Reinforcement Learning Framework [19.3019166138232]
Spreezeは強化学習のための軽量並列フレームワークである。
単一のデスクトップハードウェアリソースを効率よく利用し、スループット制限にアプローチする。
最大15,000Hzのサンプリングと370,000Hzのネットワーク更新フレームレートを達成することができる。
論文 参考訳(メタデータ) (2023-12-11T05:25:01Z) - Efficient Parallel Reinforcement Learning Framework using the Reactor
Model [2.190190313041532]
強化学習(RL)フレームワークは、RLワークロードを複数の計算リソースにマッピングするために不可欠である。
Rayのような既存のフレームワークは、このオーケストレーションを効率的に管理していない。
我々は,アクターの集合が固定的な通信パターンを持つように強制するリアクターモデルを実装するソリューションを提案している。
論文 参考訳(メタデータ) (2023-12-07T21:19:57Z) - Mastering the Unsupervised Reinforcement Learning Benchmark from Pixels [112.63440666617494]
強化学習アルゴリズムは成功するが、エージェントと環境の間の大量の相互作用を必要とする。
本稿では,教師なしモデルベースRLを用いてエージェントを事前学習する手法を提案する。
我々はReal-Word RLベンチマークにおいて、適応中の環境摂動に対する抵抗性を示唆し、堅牢な性能を示す。
論文 参考訳(メタデータ) (2022-09-24T14:22:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。