論文の概要: Reward Models Are Secretly Value Functions: Temporally Coherent Reward Modeling
- arxiv url: http://arxiv.org/abs/2604.22981v1
- Date: Fri, 24 Apr 2026 19:49:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-28 17:12:07.081083
- Title: Reward Models Are Secretly Value Functions: Temporally Coherent Reward Modeling
- Title(参考訳): Reward Models is Secretly Value Function: Temporally Coherent Reward Modeling
- Authors: Alex Nikulkov,
- Abstract要約: RLHFのリワードモデルは、応答の最終トークンのみを取得するように訓練される。
十分に訓練された報酬モデルの任意のトークンでの出力は、最終的な報酬の条件付き期待を表すべきです。
我々は、標準的なBradley-Terry損失の上に2つの正規化項を通してこの特性を誘導するテンポラリコヒーレント・リワード・モデリングを導入する。
- 参考スコア(独自算出の注目度): 0.68233044479196
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reward models in RLHF are trained to score only the final token of a response - a choice that discards rich signal from every intermediate position and produces models whose token-level outputs are noise. We argue this is a missed opportunity: a well-trained reward model's output at any token should represent the conditional expectation of the final reward given the response so far. We introduce Temporally Coherent Reward Modeling (TCRM), which induces this property via two regularization terms on top of the standard Bradley-Terry loss, with minimizers provably equal to conditional expectations. The regularizers correspond to Monte Carlo and TD value-learning objectives, establishing a direct connection to RL value functions. TCRM requires zero changes to architecture, data, or inference, yet unlocks three capabilities from one principle: interpretable token-level reward trajectories (middle-token pairwise accuracy improved from 50% to 88.9%, final-token accuracy preserved); state-of-the-art PRM performance on ProcessBench (44.9% average F1) among models trained only on outcome data; and unified reward/value modeling in PPO, reducing peak GPU memory by 27% and step time by 19% with matching LLM quality.
- Abstract(参考訳): RLHFのリワードモデルは、応答の最終トークン(全ての中間位置からリッチ信号を捨て、トークンレベルの出力がノイズであるモデルを生成する選択)のみをスコアするように訓練されている。
十分に訓練された報酬モデルの任意のトークンでの出力は、これまで応答が与えられた場合の最終的な報酬の条件付き期待を表すべきである。
我々は,この特性を標準的なBradley-Terry損失の上に2つの正規化項によって誘導するテンポラリー・コヒーレント・リワード・モデリング(TCRM)を導入する。
正規化器はモンテカルロとTD値学習の目的に対応し、RL値関数に直接接続する。
TCRMは、アーキテクチャ、データ、推論にゼロの変更を必要としないが、1つの原則から3つの機能をアンロックする: 解釈可能なトークンレベルの報酬軌跡(中間整合精度が50%から88.9%改善、最終整合精度は44.9%向上) 結果データのみに基づいてトレーニングされたモデルのうち、ProcessBench(平均F1)における最先端のPRMパフォーマンス(平均F1)、PPOにおける統一的な報酬/価値モデリング、ピークGPUメモリの27%削減、ステップタイムの19%削減。
関連論文リスト
- Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models [16.460841602259787]
本稿では、デュアルプロセス理論にインスパイアされたハイブリッドRMアーキテクチャであるFast-Slow Thinking Reward Models (F/S-RM)を紹介する。
ひとつは、スカラースコア(高速思考)としての第一段階の予測と、CoTベースの判断(スロー思考)である。
F/S-RMは、最先端モデルの相対的な性能を1.2%向上させ、トークン消費量を20.8%削減する。
論文 参考訳(メタデータ) (2026-03-02T15:48:54Z) - Learning Ordinal Probabilistic Reward from Preferences [25.069054134899744]
確率的リワードモデル(PRM: Probabilistic Reward Model)を提案する。
提案手法では,報酬を決定論的スカラーとしてモデル化する代わりに,ランダム変数として扱い,各応答の品質の完全な確率分布を学習する。
OPRM上に構築したRerea Flooding Tuning(RgFT)と呼ばれるデータ効率のトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2026-02-13T06:43:02Z) - SPARK: Synergistic Policy And Reward Co-Evolving Framework [84.22494672256894]
我々は、RLVR上に構築された効率的でオン・ポリティクス、安定した手法であるSPARK(Synergistic Policy and Reward Co-Evolving Framework)を紹介する。
ロールアウトと正確性データを捨てる代わりに、SPARKはこの貴重な情報をリサイクルし、生成的報酬モデルとしてモデル自体をトレーニングする。
SPARK は複数の LLM モデルと LVLM モデル,および複数の推論,報酬モデル,一般ベンチマークにおいて,大幅な性能向上を実現していることを示す。
論文 参考訳(メタデータ) (2025-09-26T17:50:12Z) - Discriminative Policy Optimization for Token-Level Reward Models [55.98642069903191]
プロセス報酬モデル(PRM)は、結果報酬モデル(ORM)と比較して、よりきめ細かい監督を提供する。
Q-RMは、微粒なアノテーションに頼ることなく、優先データからトークンレベルのQ関数を明示的に学習する。
Q-RMによる強化学習は、トレーニング効率を大幅に向上させ、GSM8KでのORMの12倍、MATHでのステップレベルPRMの11倍の収束を実現した。
論文 参考訳(メタデータ) (2025-05-29T11:40:34Z) - Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models [50.4652276723694]
Think-RMは、高度な機能をサポートするフレキシブルで自己誘導的な推論トレースを生成する。
Think-RM は RM-Bench 上で最先端の結果を達成し,BT RM と GenRM の垂直スケールを8% 上回った。
論文 参考訳(メタデータ) (2025-05-22T05:56:11Z) - RM-R1: Reward Modeling as Reasoning [81.50471199906738]
Reasoning Reward Models (ReasRMs) は、報酬モデリングを推論タスクとして定式化する。
我々は推論指向のトレーニングパイプラインを提案し、ReasRMのファミリーであるRM-R1を訓練する。
我々のモデルは、平均して3つの報酬モデルベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-05-05T06:11:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。