論文の概要: RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling
- arxiv url: http://arxiv.org/abs/2609.22947v2
- Date: Wed, 23 Sep 2026 02:00:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.662513
- Title: RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling
- Title(参考訳): RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling
- Abstract要約: ビデオ生成モデルの最適化には強化学習が不可欠である。
ビデオ報酬モデルは、複雑な主観的なビデオ品質を直接1つのスコアにマッピングするため、不安定なスカラースコアを生成する。
RewardVerseは,ルーリックベースのビデオ報酬フレームワークである。
- 参考スコア(独自算出の注目度): 30.036504233085623
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) is vital for optimizing video generation models, with a robust reward model (RM) serving as the cornerstone. However, existing video reward models often produce unstable scalar scores because they directly map complex, subjective video quality into a single score without explicit evaluation criteria. This leads to scalar drift, where the scoring scale collapses or shifts across different prompts, making the reward unreliable for RL. Drawing inspiration from professional human annotation engineering, we address this problem with RewardVerse, a rubric-based video reward framework that introduces a dynamic rubric as an intermediate representation between the evaluation query and the scorer. Instead of unconstrained direct scoring, RewardVerse first generates explicit evaluation criteria and then performs rubric-guided scoring, providing a stable semantic anchor that mitigates scalar drift. To efficiently optimize this collaborative pipeline, we propose Rubric-Guided Policy Optimization (RGPO), a two-stage training algorithm. RGPO first warms up the scorer using self-evolving seed rubrics and then jointly optimizes the rubric generator to produce query-adaptive evaluation criteria while continuously aligning the scorer with human ratings. Extensive experiments on the 16-dimensional EvalVerse benchmark and external datasets demonstrate that RewardVerse mitigates scalar drift, achieves state-of-the-art performance on both pointwise and pairwise evaluation, and provides a robust and interpretable reward signal for RL in video generation.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)は、映像生成モデルの最適化に不可欠であり、ロバスト報酬モデル(RM)が基礎となる。
しかしながら、既存のビデオ報酬モデルは、しばしば不安定なスカラースコアを生成する。
これによりスカラードリフトが発生し、スコアスケールが崩壊したり、異なるプロンプトを移動したりすることで、RLに対する報酬が信頼できない。
専門家のアノテーション工学からインスピレーションを得たRewardVerseは、評価クエリとスコアラーの中間表現として動的ルーリックを導入するルーリックベースのビデオ報酬フレームワークである。
制約のない直接スコアではなく、RewardVerseはまず明示的な評価基準を生成し、次にルーリック誘導スコアを実行し、スカラードリフトを緩和する安定したセマンティックアンカーを提供する。
本稿では,この協調パイプラインを効率的に最適化するために,2段階の学習アルゴリズムであるRGPO(Rubric-Guided Policy Optimization)を提案する。
RGPOはまず、自己進化するシードルーリックを用いてスコアラーをウォームアップし、次いで、ルーリックジェネレータを協調的に最適化してクエリ適応評価基準を作成し、スコアラーと人間の評価を連続的に調整する。
16次元のEvalVerseベンチマークと外部データセットの大規模な実験により、RewardVerseはスカラードリフトを緩和し、ポイントワイドとペアワイドの両方で最先端のパフォーマンスを実現し、ビデオ生成におけるRLの堅牢かつ解釈可能な報酬信号を提供する。
関連論文リスト
- Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling [39.325422496065435]
MRRG(Multi-Role Generation)は、複数の役割から評価基準を引き出すトレーニングフリーで参照フリーなフレームワークである。
MRRGは、ペアワイズ選好の検証と、RLOスタイルのReinforcement Learning with Verifiable Rewards(RLVR)に対する報酬の提供の両方に使用できる。
論文 参考訳(メタデータ) (2026-07-02T07:50:38Z) - RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time [51.256131853751754]
本研究では,多次元的批判を明示的に生成するために報酬モデルを教えることで,受動的評価器から能動的最適化ツールへ変換することを示す。
提案手法では, 嗜好データから高品質な論理を復元する原理的フレームワークであるpreference-Anchored Rationalization (PARROT) を導入する。
その結果、RationalRewards (8B) は、オープンソース報酬モデル間の最先端の好み予測を実現する。
論文 参考訳(メタデータ) (2026-04-13T15:38:09Z) - SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models [53.19726629537694]
ビデオ生成モデルと人間の好みのトレーニング後のアライメントは、重要な目標である。
現在のデータ収集パラダイムは、プロンプト内のペアワイズアノテーションに依存しており、ノイズのラベル付けに悩まされている。
ビデオRMトレーニングのための体系的フレームワークであるSoliRewardを提案する。
論文 参考訳(メタデータ) (2025-12-17T14:28:23Z) - OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment [38.1645520104553]
OpenRubricsは,ルーブリック世代とルーブリックベースの報酬モデルをトレーニングするための,大規模な(プロンプト,エクスプリシット)ペアのコレクションである。
識別的・包括的評価信号を引き出すために,優先的・拒否的な応答を対比することにより,厳格な規則(単純質)と原則(簡易品質)の両方を導出するコントラスト生成(CRG)を導入する。
この結果から,ごみは費用対人評価と自動報酬モデリングのギャップを狭めるような,スケーラブルなアライメント信号を提供することがわかった。
論文 参考訳(メタデータ) (2025-10-09T03:31:26Z) - Intra-Trajectory Consistency for Reward Modeling [67.84522106537274]
軌道内整合性正則化を開発し、より高い次トーケン生成確率を持つプロセスがより一貫した報酬を維持することを強制する。
提案した正規化でトレーニングした報酬モデルにより、より優れたDPO整合ポリシーが導出され、より優れたベスト・オブ・N(BON)検証結果が得られることを示す。
論文 参考訳(メタデータ) (2025-06-10T12:59:14Z) - RewardBench 2: Advancing Reward Model Evaluation [71.65938693914153]
リワードモデルは、好みのデータからニュアンスされた信号をキャプチャするために、言語モデルの訓練後を通して使用される。
コミュニティは報酬モデルを評価するためのベストプラクティスを確立し始めている。
本稿では,新しいマルチスキル報酬モデルベンチマークであるRewardBench 2を紹介する。
論文 参考訳(メタデータ) (2025-06-02T17:54:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。