論文の概要: EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents
- arxiv url: http://arxiv.org/abs/2607.09773v1
- Date: Tue, 07 Jul 2026 16:36:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.189011
- Title: EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents
- Title(参考訳): EvoCUA-1.5:マルチターンコンピュータ利用エージェントのためのオンライン強化学習
- Authors: Mianqiu Huang, Taofeng Xue, Chong Peng, Jinrui Ding, Sicheng Fan, Jiale Hong, Yufei Gao, Xiaocheng Zhang, Linsen Guo, Xin Yang, Dengchang Zhao, Yuchen Xie, Peng Pei, Xunliang Xie, Xipeng Qiu,
- Abstract要約: EvoCUA-1.5は、オフライン体験からオンライン強化学習まで、自己進化するコンピュータ利用エージェントを拡張している。
この設定でのオンラインRLは、シングルターン言語-RLレシピを直接再利用する以上のものを必要とします。
- 参考スコア(独自算出の注目度): 37.78845989345579
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Computer-use agents must solve long-horizon tasks through repeated interaction with partially observable, multimodal desktop environments. Although imitation learning and offline trajectory refinement provide strong priors, static traces cannot cover the causal feedback loop of real computer use: each action changes the screen state, future action space, and recovery options. EvoCUA-1.5 extends self-evolving computer-use agents from offline experience learning to online reinforcement learning, where policies interact with executable sandbox environments and improve from verifiable task outcomes. Online RL in this setting requires more than directly reusing single-turn language-RL recipes. Multi-turn interaction introduces context-managed observations, sparse terminal rewards, variable-length trajectories, and slow environment feedback. EvoCUA-1.5 addresses these challenges with Step-Level Policy Optimization (STEPO), which preserves trajectory-level advantage balance after decomposition into step-level samples; policy-aware filtering and pass-rate calibration over verifiable synthesized tasks; Dynamic Tri-Adaptive Curriculum (DTAC), which combines learnable tasks, difficult positive replay, and controlled infeasible-task exposure; and a fully asynchronous RL infrastructure with staleness control and mini-group batching. Experiments show that these components improve training stability and downstream performance. EvoCUA-1.5 achieves 63.2\% success on OSWorld-Verified, outperforming comparable 32B/35B-scale open-weight baselines and even approaching models with significantly larger parameter counts. Overall, EvoCUA-1.5 provides a practical framework for scaling online RL in multi-turn computer-use agents.
- Abstract(参考訳): コンピュータ利用エージェントは、部分的に観察可能なマルチモーダルなデスクトップ環境との繰り返しの相互作用を通じて、長い水平タスクを解決しなければならない。
模倣学習とオフライン軌道修正は強い先行性を提供するが、静的トレースは実際のコンピュータ使用の因果フィードバックループをカバーできない。
EvoCUA-1.5は、オフライン体験学習からオンライン強化学習まで、自己進化型のコンピュータエージェントを拡張し、ポリシーが実行可能なサンドボックス環境と相互作用し、検証可能なタスク結果から改善する。
この設定でのオンラインRLは、シングルターン言語-RLレシピを直接再利用する以上のものを必要とします。
マルチターンインタラクションでは、コンテキスト管理された観察、スパース端末報酬、可変長軌道、環境フィードバックが遅い。
EvoCUA-1.5はステップレベルポリシー最適化(STEPO)でこれらの課題に対処し、ステップレベルサンプルへの分解後の軌道レベルの優位性バランスを保ち、検証可能な合成タスクに対するポリシー対応のフィルタリングとパスレートのキャリブレーション、学習可能なタスク、困難なポジティブリプレイ、制御不能タスクの露光を組み合わせた動的トライアダプティブカリキュラム(DTAC)、安定度制御とミニグループバッチを備えた完全に非同期なRLインフラを設計した。
実験によると、これらのコンポーネントはトレーニングの安定性と下流のパフォーマンスを改善する。
EvoCUA-1.5はOSWorld-Verifiedで63.2\%の成功を達成し、32B/35Bスケールのオープンウェイトベースラインを上回り、パラメータ数が大幅に大きいモデルにもアプローチした。
全体として、EvoCUA-1.5はマルチターンコンピュータ使用エージェントでオンラインRLをスケールするための実践的なフレームワークを提供する。
関連論文リスト
- From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents [23.583947864141162]
EigenDataは階層的なマルチエージェントエンジンで、ツール基底の対話と実行可能なインスタンスごとのチェッカーを合成する。
合成データに基づいて、まずユーザモデルを微調整し、GRPOスタイルのトレーニングを適用するRLレシピを開発する。
以上の結果から,高価なアノテーションを使わずに,複雑なツールの動作をブートストラップするためのスケーラブルな経路が示唆された。
論文 参考訳(メタデータ) (2026-01-30T06:01:23Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation [65.3648667980258]
視覚言語モデル(VLM)に基づくGUIエージェントは複雑なタスクの自動化を約束するが、強化学習(RL)の適用において大きな課題に直面している。
異種モジュールを高度に非結合的に協調するGUIエージェントのための非結合エージェントRLトレーニングフレームワークであるDARTを提案する。
OSWorldのベンチマークでは、DART-GUI-7Bは42.13%のタスク成功率、14.61%の絶対ゲイン、オープンソースSOTAよりも7.34%高い。
論文 参考訳(メタデータ) (2025-09-28T13:19:20Z) - ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation [57.399685080574756]
既存のMLLMベースのVLNメソッドは模倣学習(IL)に依存しており、ポストトレーニングにDAggerを使用することが多い。
マルチターンRLによるアクティブな探索を可能にするVLNフレームワークであるActiveVLNを提案する。
実験の結果,ActiveVLN は DAgger ベースと RL ベースのポストトレーニング手法と比較して,IL ベースラインよりも最大の性能向上を実現していることがわかった。
論文 参考訳(メタデータ) (2025-09-16T03:31:46Z) - UI-S1: Advancing GUI Automation via Semi-online Reinforcement Learning [78.86567400365392]
オフライン軌道上でオンラインRLをシミュレートする新しいパラダイムであるセミオンライン強化学習を提案する。
長期トレーニング信号をキャプチャするために、Semi-online RLは報酬計算に割引先を返す。
実験の結果,Semi-online RLは4つの動的ベンチマークで7Bモデル間でSOTA性能を実現することがわかった。
論文 参考訳(メタデータ) (2025-09-15T03:24:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。