Small Language Models as Judges for Rubric-Based Reinforcement Learning
Abstractの概要
本論文は、完全一致の検証器ではなくインスタンス固有の基準に基づいて回答を評価するルーブリックベース強化学習において、小規模言語モデルが効率的かつ信頼性の高い評価者(ジャッジ)として機能するかを調査しています。これを体系的に評価するため、著者らは明示的な基準、候補回答、基準ごとのラベル、重み付け集約ルールを提供する2つのポイントワイズ・ルーブリック評価ベンチマーク「PointRubric」と「RaR-Science-Static」を構築しました。小規模なQwen3バックボーンから基準判定を抽出する3つの読み出し手法(生成判定、Yes/No対数確率スコアリング、隠れ層状態プローブ分類器)を比較しています。その結果、特に科学ドメインにおいて、凍結されたバックボーンからのプローブ読み出しは、生成手法や対数確率手法よりも信頼性高く評価シグナルを抽出できることが示されました。最後に、Qwen3-1.7Bプローブ評価者を強化学習のオンライン報酬モデルとして適用したところ、より大規模な生成評価者ベースラインと比較して方策パフォーマンスが向上し、計算効率も大幅に改善することが実証されました。
新規性
本研究は、標準的な生成ベースの評価ではなく、凍結バックボーンの線形プローブ読み出しを用いて、小規模言語モデルを強化学習のための基準レベル・ルーブリック評価者として定式化および実証評価した点に新規性があります。また、ポイントワイズのルーブリック評価に特化して構造化された2つの新しいベンチマークリソースを提供し、静的なルーブリック一致度と下流の強化学習方策最適化を直接関連付けました。
成果
RaR-Science-Staticにおいて、Qwen3-1.7BプローブはマクロF1で0.835を達成し、同バックボーンの生成型(0.443)および対数確率型(0.449)の読み出しを大幅に上回りました。GRPO報酬モデルとして使用した場合、1.7Bプローブはアクターのルーブリック得点を0.232から0.643へと向上させ、累積評価時間を10.7分の1に削減しながら8B生成評価者ベースライン(0.594)を上回りました。さらに、プローブで訓練された方策はGPQA-Diamondへと汎化し精度が0.335から0.388へ向上したほか、科学領域で訓練されたプローブはRaR-Medicineへゼロショット転移して0.718のマクロF1を達成しました。
論文の注目点
- 明示的な基準、基準ごとのラベル、重み付けスコア集約を備えたポイントワイズ・ルーブリック評価ベンチマークとして「PointRubric」と「RaR-Science-Static」を構築した。
- 小規模言語モデルの凍結表現に対するプローブベースの読み出しは、基準レベルのルーブリック評価において生成や対数確率スコアリングを一貫して上回る。
- Qwen3-1.7Bプローブ評価者は効果的な強化学習報酬モデルとして機能し、累積評価計算量を10.7分の1に抑えつつ8B生成評価者よりも高い方策スコアを達成した。