論文の概要: The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning
- arxiv url: http://arxiv.org/abs/2606.09078v1
- Date: Mon, 08 Jun 2026 06:22:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:06.731782
- Title: The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning
- Title(参考訳): プロセスリワードモデルの隠れバイアス:右リワードのためのPRISM
- Authors: Aakriti Agrawal, Souradip Chakraborty, Armin Saghafian, Nihal Sharma, Rizal Fathony, Nam H Nguyen, C. Bayan Bruss, Amrit Singh Bedi, Furong Huang,
- Abstract要約: プロセス・リワード・モデル (Process Reward Models, PRM) は、段階的なフィードバックを提供することで、推論のためのクレジット割り当てを改善する。
ステップレベルのトレーニングデータにおいて,重度の不均衡に起因するPRMの隠れバイアスを同定する。
対照的な段階比較から学習するポリシ対応のPRMトレーニングフレームワークであるPRISMを提案する。
- 参考スコア(独自算出の注目度): 54.0056619145783
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Process Reward Models (PRMs) improve credit assignment for reasoning by providing step-level feedback. However, we identify a hidden bias in PRMs caused by severe imbalance in step-level training data. Standard cross-entropy training amplifies this bias, causing PRMs to overcredit plausible but incorrect steps and produce high false-positive rates. We show that these false positives have an asymmetric downstream effect: false negatives mainly slow exploration, whereas false positives actively steer Best-of-N selection, guided decoding, and policy optimization toward flawed reasoning. This suggests that PRM training should shift from pointwise label fitting to reliable relative comparisons. To address this, we propose PRISM (Precision Ranking for Improved Step Modeling), a policy-aware PRM training framework that learns from contrastive step-level comparisons and hard negatives generated by a temporal lookahead strategy, requiring no new human labels. We further use a difficulty-aware curriculum to optimize the contrastive step margin. Across PRMBench and ProcessBench, PRISM substantially reduces false positives (22% on PRMBench) and improves macro F1 over strong discriminative PRMs. When applied to policy optimization and search tasks, including guided decoding and Best-of-N selection, it consistently improves accuracy (up to 22% for guided decoding and 33% for Best-of-N) and robustness. More broadly, trustworthy process supervision is not just about assigning high rewards, but about rewarding the right reasoning for the right reasons.
- Abstract(参考訳): プロセス・リワード・モデル (Process Reward Models, PRM) は、段階的なフィードバックを提供することで、推論のためのクレジット割り当てを改善する。
しかし、ステップレベルのトレーニングデータにおいて、重度の不均衡に起因するPRMの隠れバイアスを同定する。
標準的なクロスエントロピートレーニングは、このバイアスを増幅し、PRMは可視だが誤ったステップを過大評価し、高い偽陽性率を生み出す。
偽陰性は主に探索が遅いのに対し、偽陰性はN選択のベスト・オブ・N選択、誘導復号化、欠陥推論に対するポリシー最適化を積極的に行う。
このことは、PRMトレーニングがポイントワイドなラベル適合から信頼性のある相対比較にシフトすべきであることを示唆している。
そこで我々は,PRISM(Precision Ranking for Improved Step Modeling)を提案する。PRISM(Precision Ranking for Improved Step Modeling)とは,PRMの学習フレームワークである。
さらに、コントラストのあるステップマージンを最適化するために、困難を意識したカリキュラムを使用します。
PRMBenchとProcessBench全体では、PRISMは偽陽性(PRMBenchでは22%)を大幅に低減し、強い識別性PRMよりもマクロF1を改善する。
誘導復号化やBest-of-N選択を含むポリシー最適化や検索タスクに適用すると、常に精度(ガイド復号化では22%、Best-of-Nでは33%)とロバスト性を改善する。
より広範に言えば、信頼できるプロセスの監督は、高い報酬を割り当てるだけでなく、正しい理由の適切な理由に報酬を与えることです。
関連論文リスト
- Unsupervised Process Reward Models [22.283171054858496]
プロセス・リワード・モデル(Process Reward Models、PRM)は、大規模言語モデル推論を操る強力なメカニズムである。
PRMは、すべての推論ステップに専門家のアノテーションを必要とします。
そこで本研究では,段階別アノテーションのレベルにおいても,最終回答の真正性検証においても,人間の監督を必要としない教師なしPRMの訓練方法を提案する。
論文 参考訳(メタデータ) (2026-05-11T08:05:27Z) - Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization [74.91418266859297]
インプシットプロセス報酬モデル(PRM)は、推論プロセスに沿ってきめ細かな報酬信号を提供する。
トレーニングはシーケンスレベルの集約のみを制限しますが、推論はローカルステップの品質を反映するためにトークンレベルのスコアが必要です。
本稿では,予測精度を推定するプレフィックス条件付き値関数を直接学習する新しいインプリシット・プレフィックス・バリュー・リワード・モデル(IPVRM)を提案する。
また,サンプルトークンと高確率候補トークンの両方に対してTDの利点を演算する分散レベルRL(DistRL)を提案する。
論文 参考訳(メタデータ) (2026-04-14T18:19:54Z) - LLM Reasoning with Process Rewards for Outcome-Guided Steps [7.3312414850609215]
プロセス報酬モデル(PRM)を導入し、中間段階のスコアとより密集した監視を行う。
PRMスコアは最終的な正しさと不完全な整合性を持つことが多く、不正確な答えで終わっている局所的な流動的な推論に報酬を与えることができる。
結果の正しさを優位に保ちつつ,PRMを活用するフレームワークであるPROGRSを提案する。
論文 参考訳(メタデータ) (2026-02-08T06:38:20Z) - Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning [59.76691952347156]
強化学習(RL)は,大規模言語モデル(LLM)の推論能力向上のための強力なフレームワークとして登場した。
既存のRLアプローチの多くは疎結果報酬に依存しており、部分的に成功した解では正しい中間段階を信用できない。
本稿では、PRMを用いてRL中の最初のエラーをローカライズする検証済み事前修正ポリシー最適化(VPPO)を提案する。
論文 参考訳(メタデータ) (2026-01-26T21:38:20Z) - Towards Robust Process Reward Modeling via Noise-aware Learning [33.1289107681179]
騒音の監視を緩和する2段階の枠組みを提案する。
ラベル付け段階では,大言語モデル(LLM)を判断として用いたリフレクション対応ラベル補正機構を導入する。
トレーニング段階において、PRMが徐々にノイズラベルを洗練させるアンダーラインテキストbfIterative underlinetextbfTrainingフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-19T06:03:58Z) - Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning [49.21525229904197]
本研究では,長いCoT推論プロセスのスコアリングに特化して設計されたPRMのための新しいデータアノテーション手法を提案する。
本稿では, 誤り伝播と誤認識の概念を導入し, PRMの効果的な自己訂正行動と誤ったステップに基づく推論の両方を識別する能力を高めた。
我々のPRMは,探索誘導,BoN,F1スコアなど,様々な指標で優れた性能を実現している。
論文 参考訳(メタデータ) (2025-05-20T14:12:05Z) - Free Process Rewards without Process Labels [55.14044050782222]
より安価な応答レベルラベルでORMをトレーニングすることで,テキストシンプルなPRMを追加のコストで得ることができることを示す。
我々の暗黙のPRMは、クロスエントロピー(CE)損失でインスタンス化されると、よりデータ効率が良く、命令1回に1回しか応答しない訓練でも生成モデルを改善することができることを示す。
論文 参考訳(メタデータ) (2024-12-02T21:20:02Z) - Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning [90.23629291067763]
大規模言語モデルにおける推論を改善するための有望なアプローチは、プロセス報酬モデル(PRM)を使用することである。
PRMは多段階の推論トレースの各ステップでフィードバックを提供し、結果報酬モデル(ORM)よりも信用割当を改善する可能性がある。
PRMに対して探索を行ったり、強化学習(RL)の報酬として使ったりすることで、基本方針を改善するために、「プロセス報酬をどう設計すべきか?」と質問する。
理論的には,良質なプロデューサの集合を特徴付けるとともに,このようなプロデューサからのプロセス報酬の最適化が,テスト時間探索やオンラインRLの探索を改善することを示す。
論文 参考訳(メタデータ) (2024-10-10T17:31:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。