論文の概要: SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents
- arxiv url: http://arxiv.org/abs/2607.23263v1
- Date: Sat, 25 Jul 2026 16:00:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.040051
- Title: SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents
- Title(参考訳): SeekJudge: コンピュータ利用エージェントの強化学習のための実践的リワードフレームワーク
- Abstract要約: ルールベースの評価は、人間の意図に合わせるのに苦労し、アプリが更新されたり、オンラインコンテンツがドリフトしたりすると停滞する。
我々は,4つの役割特化エージェント,コンデンス,グラウンド,Seek,Analyzeエージェントを判定するtextbfSeekJudgeフレームワークを提案する。
SeekJudgeは、オンラインRLにおけるネイティブルールベースの監視に適合するか、あるいは追い越すための、最初の実用的なモデルベースの報酬である。
- 参考スコア(独自算出の注目度): 43.62427340281939
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deciding whether a trajectory actually fulfills its instruction governs how we measure computer-use agents on long-horizon graphical-user-interface tasks and how we train them with reinforcement learning. This judgment has long relied on rule-based evaluation, which struggles to align with human intention and goes stale when an app updates or its online content drifts. Existing model-based judges attempt to address these problems but still leave a performance gap to the rule-based evaluation. We propose the \textbf{SeekJudge} framework, in which four role-specialized agents, a Condense, a Ground, a Seek and an Analyze agent, reach a verdict through a Seek--Analyze loop over the trajectory. A seed-calibrated distillation pipeline trains one specialized $9$B model to serve as the shared backbone for all four agents. Measured by downstream success rate on held-out RL test goals, SeekJudge is the first practical model-based reward to match or surpass native rule-based supervision in online RL. Beyond accuracy, SeekJudge provides step-level judgments, runs far cheaper than a closed-source large model, and keeps a small per-call context that scales to much longer trajectories. We further contribute a general architectural improvement to the reward server that speeds up judging in RL. Together these make model-based reward a practical drop-in for rule-based supervision in CUA reinforcement learning.
- Abstract(参考訳): 軌道が実際にその指示を満たすかどうかを決定することは、長期のグラフィカルユーザインタフェースタスクにおけるコンピュータ利用エージェントの計測方法と、強化学習を用いてそれらを訓練する方法を規定する。
この判断は長い間、ルールに基づく評価に依存しており、それは人間の意図に沿うのに苦労しており、アプリの更新やオンラインコンテンツがドリフトする際には停滞している。
既存のモデルベースの審査員はこれらの問題に対処しようとするが、それでもパフォーマンスのギャップはルールベースの評価に任せる。
本稿では,4つの役割特化エージェント,コンデンス,グラウンド,Seek,Analyzeのエージェントが,Seek-Analyzeループの軌道上での判定に到達する「textbf{SeekJudge}」フレームワークを提案する。
シードキャリブレーションされた蒸留パイプラインは、4つのエージェントの共有バックボーンとして機能する9ドルの特別モデル1台を訓練する。
SeekJudgeは、オンラインRLにおけるネイティブルールベースの監視に適合または超える、最初の実用的なモデルベースの報酬である。
正確性以外にも、SeekJudgeはステップレベルの判断を提供し、クローズドソースの大規模モデルよりもはるかに安く動作し、はるかに長いトラジェクトリにスケールする小さなコール単位のコンテキストを維持している。
さらに、RLの判定を高速化する報奨サーバに、全体的なアーキテクチャ改善を貢献する。
これらのモデルベースの報酬は、CUA強化学習におけるルールベースの監督のための実践的なドロップインとなる。
関連論文リスト
- TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents [51.523913302114266]
TRACE(Turn-level Reward Assignment via Credit Estimation)は、エージェント強化学習のための高密度クレジットアサインメント手法である。
ツールコール境界における状態遷移としてロールアウトを表現し、凍結参照モデルからゴールド・アンサー・ログ確率を取得し、それらをログ比の状態値に変換し、それらの値の時間差変化としてアクション毎の報酬を導出する。
純粋なRLを用いたベースモデルツール使用能力を大幅に向上させ、冷間開始制御された微調整ステージ、エージェント訓練ステージ、ライブWebデータによるトレーニングを不要とした。
論文 参考訳(メタデータ) (2026-07-15T16:16:42Z) - Multimodal Reinforcement Learning with Agentic Verifier for AI Agents [131.46008226323423]
Argosは、エージェントタスクの推論モデルをトレーニングするための、原則化されたマルチモーダル報酬エージェントである。
エージェント検証をSFTデータとRLトレーニングの両方で活用することにより、我々のモデルは最先端の結果を得ることができる。
論文 参考訳(メタデータ) (2025-12-03T04:42:47Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - Knowledge Graph Reasoning with Self-supervised Reinforcement Learning [30.359557545737747]
本稿では,RLトレーニング前の政策ネットワークを温めるための自己指導型事前学習手法を提案する。
教師付き学習段階において、エージェントはポリシーネットワークに基づいて行動を選択し、生成されたラベルから学習する。
我々のSSRLモデルは、すべてのHits@kおよび平均相互ランク(MRR)メトリクスにおいて、現在の最先端結果と一致または超えていることを示す。
論文 参考訳(メタデータ) (2024-05-22T13:39:33Z) - DRL4Route: A Deep Reinforcement Learning Framework for Pick-up and
Delivery Route Prediction [21.335721424944257]
ルート予測タスクにRL(Reinforcement Learning)を一般化する最初の試みとして,DRL4Routeと呼ばれる新しいRLベースのフレームワークを提案する。
DRL4Routeは既存のディープラーニングモデルを強化するためのプラグイン・アンド・プレイコンポーネントとして機能する。
これは、一般化アドバンテージ推定器を備えたアクター批判アーキテクチャに従う。
論文 参考訳(メタデータ) (2023-07-30T14:50:31Z) - Mastering the Unsupervised Reinforcement Learning Benchmark from Pixels [112.63440666617494]
強化学習アルゴリズムは成功するが、エージェントと環境の間の大量の相互作用を必要とする。
本稿では,教師なしモデルベースRLを用いてエージェントを事前学習する手法を提案する。
我々はReal-Word RLベンチマークにおいて、適応中の環境摂動に対する抵抗性を示唆し、堅牢な性能を示す。
論文 参考訳(メタデータ) (2022-09-24T14:22:29Z) - Robust Deep Reinforcement Learning through Adversarial Loss [74.20501663956604]
近年の研究では、深層強化学習剤は、エージェントの入力に対する小さな逆方向の摂動に弱いことが示されている。
敵攻撃に対する堅牢性を向上した強化学習エージェントを訓練するための原則的フレームワークであるRADIAL-RLを提案する。
論文 参考訳(メタデータ) (2020-08-05T07:49:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。