論文の概要: Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling
- arxiv url: http://arxiv.org/abs/2607.01830v1
- Date: Thu, 02 Jul 2026 07:50:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.735545
- Title: Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling
- Title(参考訳): 複数音声, ワン・リワード: LLM判断とリワードモデリングのためのマルチロール・ルーブリック生成
- Authors: Dazhi Fu, Jiuding Yang, Yiwen Guo, Jicong Fan,
- Abstract要約: MRRG(Multi-Role Generation)は、複数の役割から評価基準を引き出すトレーニングフリーで参照フリーなフレームワークである。
MRRGは、ペアワイズ選好の検証と、RLOスタイルのReinforcement Learning with Verifiable Rewards(RLVR)に対する報酬の提供の両方に使用できる。
- 参考スコア(独自算出の注目度): 39.325422496065435
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reliable reward and preference signals are critical for evaluating and optimizing large language models on open-ended tasks. Rubric-based judges offer a transparent way to decompose such judgments into explicit evaluation criteria, but existing annotation-free rubric generators typically rely on a single generic evaluator. As a result, they may overlook important dimensions of human preference, a failure mode we term dimensional blind spots. To address this limitation, we propose Multi-Role Rubric Generation (MRRG), a training-free and reference-free framework that elicits evaluation criteria from multiple complementary roles and consolidates them into an auditable rubric-based scorer. This scorer can be used both to validate pairwise preferences and to provide rewards for GRPO-style Reinforcement Learning with Verifiable Rewards (RLVR). Experiments on preference validation benchmarks show that MRRG consistently outperforms single-role rubric generation baselines across multiple backbone models. Further RLVR experiments demonstrate that MRRG yields a stronger reward signal for improving open-ended generation.
- Abstract(参考訳): 信頼性の高い報酬と選好信号は、大規模言語モデルをオープンなタスクで評価し、最適化するために重要である。
ルーブリックベースの裁判官は、これらの判断を明確な評価基準に分解する透過的な方法を提供しているが、既存のアノテーションのないルーブリックジェネレータは通常、単一のジェネリック評価器に依存している。
その結果、人間の嗜好の重要な次元である、次元ブラインドスポットと呼ばれる障害モードを見落としてしまう可能性がある。
この制限に対処するために,複数の補完的役割から評価基準を抽出し,それらを監査可能なルーブリックベースのスコアラーに集約する,トレーニングフリーかつ参照フリーなフレームワークであるMulti-Role Rubric Generation (MRRG)を提案する。
このスコアラは、ペアワイズ選好の検証と、GRPOスタイルのReinforcement Learning with Verifiable Rewards(RLVR)に対する報酬の提供の両方に使用することができる。
選好評価ベンチマークの実験では、MRRGは複数のバックボーンモデルにおいて、シングルロールのルーリック生成ベースラインを一貫して上回っている。
さらなるRLVR実験により、MRRGはより強力な報酬信号をもたらすことが示されている。
関連論文リスト
- RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time [51.256131853751754]
本研究では,多次元的批判を明示的に生成するために報酬モデルを教えることで,受動的評価器から能動的最適化ツールへ変換することを示す。
提案手法では, 嗜好データから高品質な論理を復元する原理的フレームワークであるpreference-Anchored Rationalization (PARROT) を導入する。
その結果、RationalRewards (8B) は、オープンソース報酬モデル間の最先端の好み予測を実現する。
論文 参考訳(メタデータ) (2026-04-13T15:38:09Z) - CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling [61.75914342638658]
CDRRM(Contrast-Driven Reward Model)は、高品質なルーリック生成と優先判断のためのフレームワークである。
この作業は、報酬モデリングのためのスケーラブルで解釈可能で、データ効率のよいパスを提供する。
論文 参考訳(メタデータ) (2026-03-09T07:15:23Z) - From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning [7.6602542594279335]
本稿では,報酬形成を絶対得点から相対ランクへシフトさせるために,相対報酬を用いた強化学習を提案する。
RLRRは、推論ベンチマークやオープン・エンド・ジェネレーションタスクにおいて、標準グループベースベースラインよりも一貫した性能向上をもたらすことを示す。
論文 参考訳(メタデータ) (2026-01-30T15:07:06Z) - OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment [38.1645520104553]
OpenRubricsは,ルーブリック世代とルーブリックベースの報酬モデルをトレーニングするための,大規模な(プロンプト,エクスプリシット)ペアのコレクションである。
識別的・包括的評価信号を引き出すために,優先的・拒否的な応答を対比することにより,厳格な規則(単純質)と原則(簡易品質)の両方を導出するコントラスト生成(CRG)を導入する。
この結果から,ごみは費用対人評価と自動報酬モデリングのギャップを狭めるような,スケーラブルなアライメント信号を提供することがわかった。
論文 参考訳(メタデータ) (2025-10-09T03:31:26Z) - Intra-Trajectory Consistency for Reward Modeling [67.84522106537274]
軌道内整合性正則化を開発し、より高い次トーケン生成確率を持つプロセスがより一貫した報酬を維持することを強制する。
提案した正規化でトレーニングした報酬モデルにより、より優れたDPO整合ポリシーが導出され、より優れたベスト・オブ・N(BON)検証結果が得られることを示す。
論文 参考訳(メタデータ) (2025-06-10T12:59:14Z) - Writing-Zero: Bridge the Gap Between Non-verifiable Tasks and Verifiable Rewards [11.149294285483782]
我々は、検証不可能なタスクと検証可能な報酬のギャップを埋める統一的なRLVRベースのトレーニングパラダイムを提案する。
本稿では,GenRMとBootstrapped Relative Policy Optimization (BRPO)アルゴリズムを提案する。
提案手法は,LLMが微調整を監督せずに堅牢な書込み機能を開発する上で有効である。
論文 参考訳(メタデータ) (2025-05-30T14:34:57Z) - RAG-Zeval: Towards Robust and Interpretable Evaluation on RAG Responses through End-to-End Rule-Guided Reasoning [64.46921169261852]
RAG-Zevalは、ルール誘導推論タスクとして忠実さと正しさの評価を定式化する、新しいエンドツーエンドフレームワークである。
提案手法は、強化学習による評価者を訓練し、コンパクトなモデルにより包括的および音質評価を生成する。
実験では、RAG-Zevalの優れた性能を示し、人間の判断と最も強い相関性を達成した。
論文 参考訳(メタデータ) (2025-05-28T14:55:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。