論文の概要: ComputerSD: Online Self-Distillation from Real-Time Feedback for Computer-Use Agents
- arxiv url: http://arxiv.org/abs/2609.40253v2
- Date: Thu, 01 Oct 2026 17:50:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.572348
- Title: ComputerSD: Online Self-Distillation from Real-Time Feedback for Computer-Use Agents
- Title(参考訳): ComputerSD: リアルタイムフィードバックからコンピュータ利用エージェントへのオンライン自己蒸留
- Abstract要約: ComputerSDは、コンピュータ使用エージェントのオンライン自己蒸留方法である。
実行中のGUIトランジションからのリアルタイムフィードバックをポリシー学習のガイダンスに変換する。
- 参考スコア(独自算出の注目度): 20.898392640912853
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Online training enables computer-use agents (CUAs) to improve through interaction with executable environments. However, existing methods primarily rely on sparse outcome rewards, which provide no supervision for intermediate actions. On-policy self-distillation (OPSD) offers token-level learning signals through privileged rescoring, but directly applying it to CUA online training presents two challenges: fixed guidance may become misaligned with the student's current state, and guidance-induced probability shifts may conflict with step-level correctness. We introduce ComputerSD, an online self-distillation method for CUAs that converts real-time feedback from executed GUI transitions into guidance for policy learning. A fine-tuned GUI analyzer produces guidance and a step-level value score after each action; the guidance provides privileged context, while the score regulates the resulting OPSD signals. ComputerSD jointly optimizes token-level OPSD and trajectory-level GRPO in a fully asynchronous training framework. On OSWorld-Verified, ComputerSD outperforms outcome-only GRPO by 1.9 and 4.1 percentage points on the general-purpose Qwen3-VL-8B-Thinking and specialized EvoCUA-8B backbones, respectively. Evaluation in out-of-distribution settings further supports the generalizability of ComputerSD. These results demonstrate the effectiveness of learning from real-time feedback through online self-distillation for CUAs.
- Abstract(参考訳): オンライントレーニングにより、コンピュータ利用エージェント(CUA)は実行可能な環境とのインタラクションによって改善できる。
しかし、既存の手法は主にスパースな結果報酬に依存しており、中間動作の監督は提供されない。
OPSD(On-policy Self-distillation)は、特権的再構成を通じてトークンレベルの学習信号を提供するが、CUAオンライントレーニングに直接適用することで、2つの課題が提示される。
我々は,実行されたGUI遷移からのリアルタイムフィードバックをポリシー学習のガイダンスに変換するCUAのオンライン自己蒸留手法であるComputerSDを紹介する。
微調整GUIアナライザは、アクション毎にガイダンスとステップレベルの値スコアを生成し、ガイダンスは特権付きコンテキストを提供し、スコアは結果のOPSD信号を制御する。
ComputerSDはトークンレベルのOPSDとトラジェクトリレベルのGRPOを、完全に非同期なトレーニングフレームワークで共同で最適化する。
OSWorld-Verifiedでは、ComputerSDは、汎用Qwen3-VL-8B-Thinkingと特殊EvoCUA-8Bのバックボーンにおいて、結果のみのGRPOを1.9と4.1で上回っている。
アウト・オブ・ディストリビューション・セッティングの評価は、さらにComputerSDの一般化性を支持している。
これらの結果は,CUAのオンライン自己蒸留によるリアルタイムフィードバックからの学習の有効性を示す。
関連論文リスト
- Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training? [0.07340017786387766]
自己監督(Self-supervision)は、ラベルのないデータから視覚表現を学ぶための強力なテクニックである。
既存の手法では、ラベル付きデータに対する事前訓練段階とラベル付きデータに対する微調整段階の2段階学習(SSL)が採用されている。
訓練中に自己監督的・監督的目的を協調的に最適化することがより良い選択肢となるかどうかを検討する。
論文 参考訳(メタデータ) (2026-07-14T18:45:04Z) - EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents [37.78845989345579]
EvoCUA-1.5は、オフライン体験からオンライン強化学習まで、自己進化するコンピュータ利用エージェントを拡張している。
この設定でのオンラインRLは、シングルターン言語-RLレシピを直接再利用する以上のものを必要とします。
論文 参考訳(メタデータ) (2026-07-07T16:36:25Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models [49.463896453707065]
VLA(Vision-Language-Action)モデルは目覚ましい進歩を遂げているが、展開時の分散シフトには弱いままである。
近年のVLAモデルは、プロンプトが政策行動の効率的なインターフェースとして機能することを示唆しているが、既存のプロンプトベースのステアリングは通常、外部ガイダンスに依存している。
VLAのテストタイムトレーニング(TTT)は、プロンプトの最適化によって実現可能か?
我々は、遅延プロンプト最適化(LPO)に基づくテスト時間トレーニングフレームワークであるTTT-VLAでこの問題に対処する。
論文 参考訳(メタデータ) (2026-06-02T04:10:39Z) - PRO-CUA: Process-Reward Optimization for Computer Use Agents [25.2822788411397]
PRO-CUAは、コンピュータ使用エージェントを訓練するためのプロセス・リワード最適化フレームワークである。
政策最適化から政治環境の相互作用を分離する。
エージェント自身の実行状態のトレーニングによる分散シフトを低減する。
論文 参考訳(メタデータ) (2026-05-27T21:28:26Z) - Harnessing LLM Agents with Skill Programs [58.356514745548026]
HASPは、実行可能なプログラム関数(PF)にスキルをアップグレードする新しいフレームワークです。
PFは障害が発生しやすい状態を起動し、次のアクションを変更したり、修正コンテキストを注入する実行可能なガードレールとして機能する。
HASPは、Web検索、数学推論、コーディングタスクにおいて、トレーニング不要とトレーニングベースの両方の手法と比較して、大幅に向上している。
論文 参考訳(メタデータ) (2026-05-18T01:35:11Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - UI-S1: Advancing GUI Automation via Semi-online Reinforcement Learning [78.86567400365392]
オフライン軌道上でオンラインRLをシミュレートする新しいパラダイムであるセミオンライン強化学習を提案する。
長期トレーニング信号をキャプチャするために、Semi-online RLは報酬計算に割引先を返す。
実験の結果,Semi-online RLは4つの動的ベンチマークで7Bモデル間でSOTA性能を実現することがわかった。
論文 参考訳(メタデータ) (2025-09-15T03:24:08Z) - CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks [11.121687042616974]
Reinforcement Learning (RL) は動的対話型GUI環境においてエージェントのパフォーマンスを効果的に向上させる。
ほとんどのアプローチはタスク固有のニュアンスを1つの粗い報酬に分解し、エージェントに非効率なポリシー更新をもたらす均一な信号を残す。
我々は,グループ相対政策最適化(GRPO)に基づくカリキュラム学習フレームワークであるCRAFT-GUIを提案する。
論文 参考訳(メタデータ) (2025-08-15T09:55:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。