論文の概要: OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
- arxiv url: http://arxiv.org/abs/2607.28609v2
- Date: Thu, 06 Aug 2026 17:55:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.606501
- Title: OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
- Title(参考訳): OSReward: クロスプラットフォームコンピュータ・ユーザ・リワードモデルの標準化評価の実施
- Authors: Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong,
- Abstract要約: コンピュータ利用エージェント(CUA)はデジタル世界で急速に進歩している。
この分野は、CUA軌道の審査員として、視覚言語モデル(VLM)に変わりつつある。
我々は,CUA軌道上のVLM判定値を評価する,現実的で高品質なベンチマークOSRewardを紹介する。
- 参考スコア(独自算出の注目度): 87.08963239083614
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computer-using agents (CUAs) are advancing rapidly across the digital world. A CUA trajectory records the agent's actions, states, and reasoning. Verifying whether it fulfilled the task instruction is central to CUA evaluation, data curation, and reinforcement learning. Neither human-written verifiers nor human annotators can provide such verification at scale, so the field increasingly turns to vision-language models (VLMs) as judges of CUA trajectories. But a fundamental question has long gone unexamined: are these VLM judges reliable enough? To study it systematically, we introduce OSReward, a realistic, high-quality benchmark that evaluates VLM judges on CUA trajectories. The trajectories come from diverse agent backbones executing human-verified instructions across platforms, and are then rigorously labeled with ground-truth verdicts through multi-stage human annotation. Building on it, we derive OSReward-Hard, a challenge set concentrating genuinely hard cases, and OSReward-Multi for fine-grained efficiency and alignment scoring. The most comprehensive evaluation of VLM judges to date finds even state-of-the-art models fall short of an ideal judge, sharing a systematic leniency bias that mislabels failed runs as successes. The few reliable enough to trust are too expensive to run at scale, while affordable open models trail far behind. To close this gap, we construct and release OS-Shepherd-100K, an open corpus of reasoning-annotated trajectory judgments for the CUA community. On it, we train OS-Shepherd (9B and 35B), open reward models that supply low-cost, stable, and reliable reward signals, matching commercial judges at 30-60x lower cost than the frontier. Extensive analyses further inform the design of reliable CUA reward at scale. Our code, benchmark, dataset, and model checkpoints are available at https://os-copilot.github.io/OSReward-Home/.
- Abstract(参考訳): コンピュータ利用エージェント(CUA)はデジタル世界で急速に進歩している。
CUA軌道はエージェントの行動、状態、推論を記録する。
タスク命令を満たすかどうかを検証することは、CUA評価、データキュレーション、強化学習の中心である。
人間による検証も人間によるアノテータも大規模な検証はできないため、CUA軌道の審査員として視覚言語モデル(VLM)に変換される。
しかし、VLMの審査員たちは十分信頼できるのだろうか?
系統的に研究するために,CUA軌道上のVLM判定値を評価する,現実的で高品質なベンチマークOSRewardを紹介する。
軌道は多種多様なエージェントのバックボーンがプラットフォームにまたがって人間認証された指示を実行し、その後、多段階の人間のアノテーションを通じて地味の判断で厳格にラベル付けされる。
OSReward-Hardは、真に難しいケースに集中する挑戦セットであり、OSReward-Multiはきめ細かい効率とアライメントのスコアリングを目的としています。
VLM審査員の最も包括的な評価では、最先端のモデルでさえ理想的な審査員の手に届かず、ミスラベルの失敗が成功に繋がる体系的な怠慢のバイアスを共有している。
信頼性の低い機種は大規模に運用するには高すぎるが、安価なオープンモデルははるかに遅れている。
このギャップを埋めるために、我々はCUAコミュニティのための推論注釈付き軌道判断のオープンコーパスであるOS-Shepherd-100Kを構築し、リリースする。
OS-Shepherd(9Bと35B)をトレーニングし、低コストで安定的で信頼性の高い報酬信号を提供するオープン報酬モデルを作成し、フロンティアの30~60倍のコストで商業裁判官とマッチングする。
大規模な分析により、信頼性の高いCUA報酬を大規模に設計することができる。
私たちのコード、ベンチマーク、データセット、モデルチェックポイントはhttps://os-copilot.github.io/OSReward-Home/.com/で利用可能です。
関連論文リスト
- SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents [43.62427340281939]
ルールベースの評価は、人間の意図に合わせるのに苦労し、アプリが更新されたり、オンラインコンテンツがドリフトしたりすると停滞する。
我々は,4つの役割特化エージェント,コンデンス,グラウンド,Seek,Analyzeエージェントを判定するtextbfSeekJudgeフレームワークを提案する。
SeekJudgeは、オンラインRLにおけるネイティブルールベースの監視に適合するか、あるいは追い越すための、最初の実用的なモデルベースの報酬である。
論文 参考訳(メタデータ) (2026-07-25T16:00:45Z) - TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents [51.523913302114266]
TRACE(Turn-level Reward Assignment via Credit Estimation)は、エージェント強化学習のための高密度クレジットアサインメント手法である。
ツールコール境界における状態遷移としてロールアウトを表現し、凍結参照モデルからゴールド・アンサー・ログ確率を取得し、それらをログ比の状態値に変換し、それらの値の時間差変化としてアクション毎の報酬を導出する。
純粋なRLを用いたベースモデルツール使用能力を大幅に向上させ、冷間開始制御された微調整ステージ、エージェント訓練ステージ、ライブWebデータによるトレーニングを不要とした。
論文 参考訳(メタデータ) (2026-07-15T16:16:42Z) - 3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects [17.49934543489464]
本稿では,3次元欠陥検出パイプラインの解析のためのベンチマークおよびフレームワークである3D-DefectBenchを紹介する。
VLM, カメラプロトコル, 視覚入力, プロンプトスキーマの4つのパイプライン要素は, 84の推論設計によって異なる。
12人のVLM審査員のベストは、トレーニングされた人間のラベルをまだ遅れている一方、専門家と契約したラベルをノイズの多いシルバーラベルに置き換えると、テクスチャの合意は急落する。
論文 参考訳(メタデータ) (2026-07-12T16:41:24Z) - Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation [15.119045051735633]
自律的な視覚言語評価をGUIエージェントのスケーラブルな監視信号として利用するRLファインチューニングフレームワークを提案する。
自律評価器は不完全であるため、ノイズ補正報酬推定器を導出するノイズ補正報酬チャネルとしてフィードバックをモデル化する。
実験により、補正された評価器の報酬はゼロショットベースラインと生評価器の報酬の両方を上回り、ゼロショット性能で平均12.6ポイント、生評価器の微調整で平均5.1ポイントの成功率を向上させることが示された。
論文 参考訳(メタデータ) (2026-06-23T12:46:29Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering [0.0]
大規模な言語モデルは、コードのアーティファクトを評価するために裁判官としてますます使われています。
現在のプラクティスには、信頼性とバイアスの原則的な説明が欠けている。
計測ファーストレンズを用いたLCM-as-a-Judgeの符号化について検討する。
論文 参考訳(メタデータ) (2026-04-18T02:35:05Z) - OS-Themis: A Scalable Critic Framework for Generalist GUI Rewards [44.03496012544118]
OS-Themisはスケーラブルで正確なマルチエージェント批判フレームワークである。
軌跡を検証可能なマイルストーンに分解し、意思決定のための重要な証拠を分離する。
最終判決を下す前に、エビデンスチェーンを厳格に監査するために、レビューメカニズムを採用している。
AndroidWorldの実験では、OS-ThemisはオンラインRLトレーニングをサポートする際に10.3%改善されている。
論文 参考訳(メタデータ) (2026-03-19T17:47:47Z) - One Token to Fool LLM-as-a-Judge [52.45386385722788]
大規模言語モデル(LLM)は、自動化された審査員としてますます信頼され、評価を支援し、他のモデルを訓練するための報酬信号を提供する。
生成的報酬モデルは、ハッキングに対して体系的に影響を受けやすい。
論文 参考訳(メタデータ) (2025-07-11T17:55:22Z) - Revisiting Few-Shot Object Detection with Vision-Language Models [49.79495118650838]
我々は、最近の基礎視覚言語モデル(VLM)の文脈で、少数ショットオブジェクト検出(FSOD)のタスクを再考する。
我々は,任意の外部データ上で事前学習された検出器を評価する新しいベンチマークプロトコルであるFoundational FSODを提案する。
CVPR 2024 Foundational FSOD コンペティションについて論じ,コミュニティからの洞察を共有した。
論文 参考訳(メタデータ) (2023-12-22T07:42:00Z) - RobustBench: a standardized adversarial robustness benchmark [84.50044645539305]
ロバストネスのベンチマークにおける主な課題は、その評価がしばしばエラーを起こし、ロバストネス過大評価につながることである。
我々は,白箱攻撃と黒箱攻撃のアンサンブルであるAutoAttackを用いて,敵対的ロバスト性を評価する。
分散シフト,キャリブレーション,アウト・オブ・ディストリビューション検出,フェアネス,プライバシリーク,スムースネス,転送性に対するロバスト性の影響を解析した。
論文 参考訳(メタデータ) (2020-10-19T17:06:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。