論文の概要: Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
- arxiv url: http://arxiv.org/abs/2605.07872v1
- Date: Fri, 08 May 2026 15:29:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 19:43:39.159026
- Title: Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
- Title(参考訳): ビデオ理解リワードモデリング:ロバストベンチマークと高性能リワードモデル
- Authors: Yuancheng Wei, Linli Yao, Lei Li, Haojie Zhang, Hao Zhou, Fandong Meng, Xu Sun,
- Abstract要約: 本稿では,ベンチマーク設計,データ構築,報酬モデルトレーニングを対象とする統一フレームワークを提案する。
VURB(Video Understanding Reward Bench)は、2,100対の選好ペアと長い連鎖推論トレース(1,143トークン)と、一般的な、長い、推論指向のビデオタスクにおける多数投票評価を特徴とするベンチマークである。
我々は、VURBとVideoRewardBenchの最先端性能を達成するために、差別的かつ生成的な報酬モデルであるVideoDRMとVideoGRMを訓練する。
- 参考スコア(独自算出の注目度): 51.616920646492524
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal reward models have advanced substantially in text and image domains, yet progress in video understanding reward modeling remains severely limited by the lack of robust evaluation benchmarks and high-quality preference data. To address this, we propose a unified framework spanning benchmark design, data construction, and reward model training. We introduce Video Understanding Reward Bench (VURB), a benchmark featuring 2,100 preference pairs with long chain-of-thought reasoning traces (averaging 1,143 tokens) and majority voting evaluation across general, long, and reasoning-oriented video tasks. We further construct Video Understanding Preference Dataset (VUP-35K) via a fully automated pipeline, providing large-scale high-quality supervision for video reward training. Building on the data, we train VideoDRM and VideoGRM, a discriminative and a generative reward model, both achieving state-of-the-art performance on VURB and VideoRewardBench. Further analysis confirms that VUP-35K enhances both reward performance and model reasoning capability, while VideoDRM and VideoGRM yield significant gains under best-of-$N$ test-time scaling.
- Abstract(参考訳): マルチモーダル報酬モデルはテキスト領域や画像領域において大きく進歩しているが、ロバストな評価ベンチマークと高品質な嗜好データがないため、ビデオ理解報酬モデリングの進歩は著しく制限されている。
そこで本研究では,ベンチマーク設計,データ構築,報酬モデルトレーニングを対象とする統一フレームワークを提案する。
VURB(Video Understanding Reward Bench)は、2,100対の選好ペアと長い連鎖推論トレース(1,143トークン)と、一般的な、長い、推論指向のビデオタスクにおける多数投票評価を特徴とするベンチマークである。
さらに、完全自動化パイプラインを介してVUP-35K(Video Understanding Preference Dataset)を構築し、ビデオ報酬トレーニングのための大規模な高品質な監視を提供する。
データに基づいて、VURB と VideoRewardBench で最先端のパフォーマンスを達成するための識別モデルと生成モデルである VideoDRM と VideoGRM を訓練する。
さらなる分析では、VUP-35Kは報酬性能とモデル推論能力を向上し、 VideoDRM と VideoGRM はテストタイムのベスト・オブ・N$で大幅に向上した。
関連論文リスト
- You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass [40.11359880802771]
本稿では,1回の前方通過で全ての候補応答を判定する識別的マルチモーダル報酬モデルを提案する。
マルチレスポンス設計では、従来のシングルレスポンススコアよりも最大$Ntimes$ウォールクロックのスピードアップとFLOPの削減も得られる。
我々のモデルは、既存のより大きな生成的および差別的な報酬モデルよりも優れています。
論文 参考訳(メタデータ) (2026-04-13T04:02:03Z) - Q-Save: Towards Scoring and Attribution for Generated Video Evaluation [65.83319736145869]
本稿では,AIGV品質の総合評価のためのベンチマークデータセットとモデルであるQ-Saveを紹介する。
データセットには10000近いビデオが含まれており、それぞれにスカラー平均評価スコア(MOS)と微粒な属性ラベルが付与されている。
品質評価と属性に基づく説明を共同で行う統一評価モデルを提案する。
論文 参考訳(メタデータ) (2025-11-24T07:00:21Z) - VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning [49.610569478718226]
マルチモーダル報酬モデル(RM)は、視覚生成モデルのトレーニング後を大幅に改善した。
VideoReward Thinker (VR-Thinker)は、RMに視覚的推論操作と視覚的メモリウィンドウを備えた思考とイメージのフレームワークである。
提案手法は,映像選好ベンチマークにおいて,オープンソースモデル間で最先端の精度を提供する。
論文 参考訳(メタデータ) (2025-10-12T09:29:50Z) - VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding [19.54215281137561]
マルチモーダル報酬モデル(MRM)は、LVLM(Large Vision Language Models)の訓練、推論、評価において重要な役割を果たしている。
ビデオ領域でMRMを評価するための既存のベンチマークは、限られた数と多様な質問に悩まされている。
ビデオ理解の4つの中核的な側面をカバーする最初の総合的なベンチマークであるVideoRewardBenchを紹介する。
論文 参考訳(メタデータ) (2025-08-30T12:50:55Z) - RewardBench: Evaluating Reward Models for Language Modeling [100.28366840977966]
本稿では,報酬モデル評価のためのベンチマークデータセットとコードベースであるRewardBenchを紹介する。
データセットは、チャット、推論、安全性にまたがる、プロンプト・チョーゼン・リジェクトされたトリオのコレクションである。
RewardBenchのリーダーボードでは、様々な方法で訓練された報酬モデルを評価する。
論文 参考訳(メタデータ) (2024-03-20T17:49:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。