論文の概要: EnGRICH: Enhancing Generative Reward Modeling with Critiques from Humans
- arxiv url: http://arxiv.org/abs/2610.05370v2
- Date: Tue, 06 Oct 2026 16:53:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.370636
- Title: EnGRICH: Enhancing Generative Reward Modeling with Critiques from Humans
- Title(参考訳): EnGRICH:人間からの批評による生成的リワードモデリングの強化
- Abstract要約: 人間の批判から得られた評価基準は、より広範な結果のみの選好データに一般化することができると論じる。
本稿では,GRMのトレーニングフレームワークであるbfEnGRICHを提案する。
- 参考スコア(独自算出の注目度): 35.354335064740916
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative reward models (GRMs) are important for LLM optimization. Unlike scalar reward models, GRMs generate natural-language critiques alongside preference judgments, providing finer-grained evaluation signals. Their effectiveness depends heavily on critique reliability. However, existing GRM training typically uses final preference correctness as outcome supervision. Because the preference outcome space is highly constrained, unreliable critiques can still yield correct outcomes and thus be reinforced. Recent work leverages human critiques for process supervision, but such critiques are scarce and are often reduced to scalar rewards, leaving their fine-grained evaluative information underutilized. We argue that evaluative criteria learned from human critiques can be generalized to broader outcome-only preference data. To this end, we propose \textbf{EnGRICH}, a GRM training framework that pairs the GRM with a training-time MetaCritic learned from a small set of human critiques. MetaCritic constructs response-specific rubrics and uses them to evaluate the evidence coverage and correctness of generated critiques. The resulting signals provide both process rewards for fine-grained credit assignment and structured guidance for exploring better critiques. During GRM training, MetaCritic is further optimized to generalize human-grounded evaluative criteria to outcome-only data. At inference, the trained GRM operates independently. Experiments across seven reward-model benchmarks show that EnGRICH consistently improves over competitive baselines, while further analyses validate the effectiveness of its core mechanisms.
- Abstract(参考訳): ジェネレーティブ報酬モデル(GRM)はLLM最適化において重要である。
スカラー報酬モデルとは異なり、GRMは好みの判断とともに自然言語の批評を生成し、よりきめ細かい評価信号を提供する。
その効果は批判的信頼性に大きく依存する。
しかし、既存のGRMトレーニングでは、結果の監督として最終優先性を使用するのが一般的である。
選好結果空間は高度に制約されているため、信頼できない批判は依然として正しい結果をもたらすことができ、したがって強化される。
近年の研究では、人間の批判をプロセスの監督に活用しているが、そのような批判は少なく、しばしばスカラー報酬に還元され、詳細な評価情報が未利用のまま残されている。
人間の批判から得られた評価基準は、より広範な結果のみの選好データに一般化することができると論じる。
そこで本研究では,GRMとトレーニングタイムのMetaCriticを組み合わせたGRMトレーニングフレームワークである「textbf{EnGRICH}」を提案する。
MetaCriticは応答特異的なルーリックを構築し、生成した批判のエビデンスカバレッジと正しさを評価するためにそれらを使用する。
結果として得られる信号は、きめ細かいクレジット割り当てのためのプロセス報酬と、より良い批判を探求するための構造化されたガイダンスの両方を提供する。
GRMトレーニング中、MetaCriticはさらに人間の地上評価基準を結果のみのデータに一般化するよう最適化されている。
推測では、訓練されたGRMは独立して動作する。
7つの報酬モデルベンチマーク実験により、EnGRICHは競争ベースラインよりも一貫して改善され、コアメカニズムの有効性がさらに検証された。
関連論文リスト
- ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework [12.57107352208971]
ジェネレーティブ・リワード・モデル(GRM)は優れたパラダイムとして登場している。
我々は自己回帰を利用して分析品質を評価する新しいGRMであるReflectRMを提案する。
本研究では,Qwen3-4Bで平均精度+3.7を達成することにより,ReflectRMの性能を継続的に向上することを示す。
論文 参考訳(メタデータ) (2026-04-08T18:46:12Z) - ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training [11.579744186304895]
ジェネレーティブ報酬モデル(GRM)は、大規模言語モデル(LLM)と人間の嗜好を整合させるための有望なアプローチとして登場した。
我々は,人間のアノテーションを使わずに,効果的かつ安定したGRMトレーニングを可能にする自己学習フレームワークであるConsistRMを提案する。
論文 参考訳(メタデータ) (2026-04-08T18:25:02Z) - R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging [69.96389360650072]
解析精度は, 標準ラベルの精度を超えて, 下流RLHFの結果を高い精度で予測できることが示される。
我々は,金の判断でトレーニングを増強し,合理的アライメントを明示的に監督するR-Alignを提案する。
論文 参考訳(メタデータ) (2026-02-06T15:17:11Z) - Reward Modeling from Natural Language Human Feedback [77.75758630455357]
RLVR(Reinforcement Learning with Verifiable reward)は、GAM(Generative Reward Models)のトレーニングにおいて、プライオリティデータに対する強化学習が主流となっている。
本稿では,このような二項分類タスクにより,音質批判を伴わない正しい結果の推測が可能であることを実証する。
本稿では、自然言語フィードバックを利用してプロセス報酬信号を得る自然言語ヒューマンフィードバック(RM-NLHF)からのリワードモデリングを提案する。
論文 参考訳(メタデータ) (2026-01-12T09:23:43Z) - Training Language Model to Critique for Better Refinement [58.73039433159486]
textbfRefinement-oriented textbfCritique textbfOptimization (RCO)を導入する。
RCOは、批評家モデルによって生成された批評がアクターモデルに応答を洗練させるためのフィードバックループを使用する。
より良い改善につながる批判に焦点を当てることで、RCOは直接的な批判的嗜好評価の必要性を排除している。
論文 参考訳(メタデータ) (2025-06-27T12:10:57Z) - Self-Evolving Critique Abilities in Large Language Models [59.861013614500024]
本稿では,Large Language Models (LLM) の批判能力の向上について検討する。
SCRITは、LCMを自己生成データで訓練し、批判能力を進化させるフレームワークである。
分析の結果,SCRITの性能はデータやモデルサイズと正の相関関係にあることが明らかとなった。
論文 参考訳(メタデータ) (2025-01-10T05:51:52Z) - Self-Generated Critiques Boost Reward Modeling for Language Models [57.60881438647227]
Critic-RMは、余分な監督なしに自己生成した批評を使って報酬モデルを改善するフレームワークである。
実験の結果、Critic-RMは標準報酬モデルやLLM審査員と比較して報酬モデリングの精度を3.7%-7.3%改善していることがわかった。
論文 参考訳(メタデータ) (2024-11-25T18:28:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。