論文の概要: RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges
- arxiv url: http://arxiv.org/abs/2608.24231v1
- Date: Tue, 25 Aug 2026 08:35:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.885165
- Title: RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges
- Title(参考訳): 再帰的再帰的自己評価
- Abstract要約: RecurSEは、訓練可能な裁判官と同期されたポリシーコピーチェッカーをペアにして、裁判官のメタルーブリックに対する推論を監査し、スカラープロセスの報酬を提供する。
本稿では,RecurSEが医療,ペアワイド,要約,プロフェッショナルベンチマークにおいて一貫した一般化を実現していることを示す。
- 参考スコア(独自算出の注目度): 48.831446371402414
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-as-judge is essential for evaluating open-ended text and steering post-training, yet improving the judge itself typically relies on expensive annotations, reward models, or distillation from stronger teachers. In this work, we eliminate external gold supervision from the RL training reward: the model's own evaluative capability generates learning signals for its optimization -- a closed-loop setting of bounded recursive self-improvement (RSI) termed Recursive Self-Evaluation (RecurSE). We study two central questions: when can self-improvement occur, and when must it stop? First, RecurSE pairs a trainable judge evaluating candidate responses under per-rule rubrics (Pass 1) with a synchronized policy-copy checker that audits the judge's reasoning against meta-rubrics to supply a scalar process reward (Pass 2). To enable learning, interface decoupling structurally isolates the checker's scalar score from the judge's verdict tokens, eliminating a degenerative token-copying shortcut that inflates self-assigned rewards. Second, because unanchored recursive learning is inherently bounded, Pairwise Advantage Validity (PAV) serves as an unbiased validation monitor that jointly tracks judge accuracy and checker fidelity to reliably identify the optimal early-stopping window. Across Qwen3.5-9B, Gemma-4-E4B-it, and Qwen3.6-27B, RecurSE achieves consistent generalization gains across held-out medical, pairwise, summarization, and professional benchmarks. Ablations demonstrate that synchronized judge-checker co-evolution outperforms frozen checkers, external meta-judges, self-consistency, and scaled teacher distillation. Furthermore, preference pairs curated by our judge effectively enhance downstream policy alignment. Bounded RSI for LLM-as-judge is thus viable when self-produced reward validity is explicitly decoupled and monitored.
- Abstract(参考訳): LLM-as-judgeは、オープンエンドテキストの評価とポストトレーニングのステアリングに不可欠であるが、裁判官自体の改善は通常、より強力な教師からの高価なアノテーション、報酬モデル、蒸留に依存している。
本研究では、RLトレーニング報酬から外的金監督を排除し、モデル自身の評価能力は、その最適化のための学習信号を生成する -- 再帰的自己評価(Recursive Self-Evaluation, Recurse)と呼ばれる有界再帰自己改善(RSI)の閉ループ設定である。
自己改善はいつ起こり得るのか、いつ止まらなければならないのか、という2つの中心的な問いについて研究する。
第一に、RecurSEは、ルール毎のルーリック(Pass1)の下で候補応答を評価する訓練可能な審査員と、審査員のメタルーブリックに対する推論を監査してスカラープロセス報酬を提供する同期ポリシーコピーチェッカー(Pass2)とをペアリングする(Pass2)。
学習を可能にするために、インターフェイスの疎結合は、チェッカーのスカラースコアを裁判官の評定トークンから構造的に分離し、自己代入報酬を膨らませる縮退的なトークンコピーショートカットを除去する。
第二に、未分類再帰学習は本質的に境界づけられているため、Pairwise Advantage Validity(PAV)は、判定精度とチェッカー忠実性を共同で追跡し、最適な早期停止ウィンドウを確実に識別する、バイアスのない検証モニターとして機能する。
Qwen3.5-9B、Gemma-4-E4B-it、Qwen3.6-27Bで、RecurSEは保持された医療、ペア、要約、およびプロのベンチマークで一貫した一般化を達成している。
アブレーションは、同期されたジャッジチェッカーと共進化が凍結チェッカー、外部メタジャッジ、自己整合性、スケールした教師の蒸留よりも優れていることを示している。
さらに,審査員が算出した選好ペアは,下流政策アライメントを効果的に向上させる。
LLM-as-judgeのバウンドRSIは、自己生成報酬の妥当性を明示的に分離し、監視する場合に有効である。
関連論文リスト
- SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - LOTAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning [12.013691798765594]
LOTAPOは、後戻り一ターン属性に基づく自己生成プロセススーパービジョン手法である。
各検索ターンに対して、LOTAPOはターンとその検索観察を固定[DELETE]プレースホルダーで置き換える。
このAnswer-Likelihood Gainは、すべての下流相互作用を保存しながらターンの寄与を推定する。
論文 参考訳(メタデータ) (2026-07-15T06:55:28Z) - Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation [60.55792673956761]
我々は, ルブリックを構造化, きめ細かいフィードバックとして組み込んだフレームワークであるtextbfRubric-Conditioned Self-Distillationを提案する。
その結果, ルーリック条件の自己蒸留は, ルーリックレベルの基準をトークンレベルのガイダンスに効果的に変換することを示した。
論文 参考訳(メタデータ) (2026-06-17T17:54:04Z) - Is Fairness Truly Fair? Towards Reliable Lipschitz Fairness in Multi-Task Learning via Fixed-\texorpdfstring{$δ$}{delta} Alignment [0.32792728203318305]
リプシッツ様式の個人公正は、意味論的に類似した例が同様の予測を受けるべきだという考えを定式化する。
本稿では,各モデルの表現距離から監査耐性を導出した場合,異なるセマンティックしきい値の下で異なるアルゴリズムを比較する。
トレーニング時間制御正規化から評価時間固定値の監査を分離する信頼性対応フレームワークである textbfReLiF を提案する。
論文 参考訳(メタデータ) (2026-06-09T09:36:54Z) - AI Alignment via Incentives and Correction [14.986111703734222]
我々は、抑止と執行の法・経済モデルのレンズを通してAIアライメントを研究する。
解決者は、説得力があるが誤った答えを出し、不確実性を隠蔽したり、急激なショートカットを悪用する恩恵を受けることができる。
この相互作用を、主成分が共同補正結果よりも報酬を選択する2エージェントモデルで定式化する。
論文 参考訳(メタデータ) (2026-05-02T23:28:02Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。