論文の概要: Co-Evolving LLM Evaluators and Policies via DynamicRubric
- arxiv url: http://arxiv.org/abs/2607.20083v2
- Date: Thu, 23 Jul 2026 06:34:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 14:12:06.752596
- Title: Co-Evolving LLM Evaluators and Policies via DynamicRubric
- Title(参考訳): ダイナミックRubricによるLLM評価器と政策の共進化
- Authors: Beining Wang, Weihang Su, Hongtao Tian, Hao Kong, Tao Yang, Ting Yao, Qingyi Pan, Yueyue Wu, Qingyao Ai, Min Zhang, Yiqun Liu,
- Abstract要約: 政策によって引き起こされたサンプルに対する評価者フィードバックによるポストトレーニングは、大きな言語モデルを改善するための主要なメカニズムとなる。
反応条件付き評価器であるDynamicRubricを提案する。
8Bバックボーンを用いた実験では、DynamicRubricは評価器のパフォーマンスを改善し、ベースラインよりも強力なポリシー管理を提供する。
- 参考スコア(独自算出の注目度): 67.2962847914162
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training with evaluator feedback on policy-induced samples serves as a major mechanism for improving large language models. As policies improve, these sampled responses become close in quality. These close candidates create a bottleneck for policy optimization: collapsed relative evaluator score gaps yield weak or misleading policy supervision. We theoretically characterize why these gaps matter through a probability allocation view, showing that the directional gain of shifting probability mass from one response to another is exactly the evaluator score gap between them. This identifies relative score gaps as the policy optimization signals that guide updates. Motivated by this view, we propose DynamicRubric, a response-set-conditioned evaluator--policy co-evolution framework that generates weighted binary rubric items for each candidate set and aggregates the resulting judgments into response-level scores. In our experiments with 8B backbones, DynamicRubric improves evaluator performance and provides stronger policy supervision than baselines using a 70B reward model or a 235B static rubric generator. DynamicRubric-optimized policies also show gains on verifiable reasoning and coding tasks. A DynamicRubric-optimized model is fully deployed in WeChat Search's AI answering scenario, where it serves all online traffic across tens of millions of requests per day and improves key online metrics. These results suggest a principle for evaluator-guided post-training: evaluators should evolve with the policies they supervise.
- Abstract(参考訳): 政策によって引き起こされたサンプルに対する評価者フィードバックによるポストトレーニングは、大きな言語モデルを改善するための主要なメカニズムとなる。
ポリシーが改善するにつれて、これらのサンプルレスポンスは品質が近くなる。
これらの密接な候補は、政策最適化のボトルネックを生み出している。
これらのギャップが確率割り当ての観点で重要である理由を理論的に特徴付け、ある応答から別の応答へ確率質量をシフトさせる方向の利得が、その間のスコアギャップを正確に評価するものであることを示す。
これは、相対的なスコアギャップを、更新をガイドするポリシー最適化信号として識別する。
この観点から,反応条件付き評価器であるDynamicRubricを提案する。このフレームワークは,各候補集合に対して重み付けされたバイナリルーブリックアイテムを生成し,その結果の判定結果を応答レベルスコアに集約する。
8Bバックボーンを用いた実験では、DynamicRubricは評価器の性能を改善し、70B報酬モデルや235B静的ルーリックジェネレータを用いてベースラインよりも強力なポリシー管理を提供する。
DynamicRubricに最適化されたポリシーは、検証可能な推論とコーディングタスクに利益をもたらす。
動的Rubric最適化モデルは、WeChat SearchのAI応答シナリオに完全にデプロイされている。
これらの結果は、評価者が指導する政策で評価者が進化すべき、訓練後指導の原則を示唆している。
関連論文リスト
- SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning [38.54413500261524]
アウトカムベース強化学習(RL)は、実用的な最適化パラダイムを提供するが、その疎度な軌道レベルの報酬は、中間決定に関する限られたガイダンスを提供する。
筆者らは,自己進化型フレームワークSEED(Self-Evolving On-Policy Distillation)を提案する。
論文 参考訳(メタデータ) (2026-07-16T09:57:18Z) - EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments [64.33452656100393]
本稿では,固定的なインタラクション予算の下で,ハーネスモデルエージェントが繰り返し実行可能なポリシシステムを編集する制御された評価設定である自律ポリシー進化を紹介する。
この設定を、コンパクトなインタラクティブRL環境から構築されたベンチマークであるEvoPolicyGymでインスタンス化する。
EvoPolicyGymスイートでは、GPT-5.5が16の環境で最強のランキングスコアとトップ2のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2026-07-02T17:10:13Z) - EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning [22.209572966965165]
EvoRubricsは、ポリシージェネレータとRLジェネレータが、各トレーニングステップ内の対角的相互作用を通じて共同で改善される、共進化的なフレームワークである。
EvoRubricsは、ベンチマーク全体で、静的および動的ルーブリックを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-22T08:46:23Z) - From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape [79.30826980815927]
ルーブリックは、複雑な品質判断を構造化され、実行可能な標準に変換する明示的な基準セットです。
我々は,既存のルーリックデザインを体系的に整理し,その構築と最適化を検証し,評価と訓練をまたいだ役割を解析する。
論文 参考訳(メタデータ) (2026-06-07T13:34:55Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement [32.29319213544292]
言語モデルアライメントのための強力な報酬モデル(RM)の構築は、多種多様な信頼性のある嗜好データを取得するコストと難しさによってボトルネックとなる。
本稿では,自己監督型報酬モデルの改善手法であるSAVE(Self-supervised reward model improve via Value-Anchored On-policy feedback)を提案する。
論文 参考訳(メタデータ) (2026-05-29T06:25:16Z) - Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies [17.672063433232196]
オフ・ポリティ・アセスメント(OPE)は、ランキングシステムにおいて重要な実践的問題である。
目標は、異なるログポリシの下で収集されたオフラインデータのみを使用して、新たなランキングポリシのパフォーマンスを見積もることである。
本稿では,この課題に対処するために,ユーザクリック動作の本質性を活かしたClick-based Inverse Propensity Score (CIPS) を提案する。
論文 参考訳(メタデータ) (2026-03-23T02:13:39Z) - Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning [52.97053840476386]
我々は、よく設計された行動ポリシーを用いて、分散リターン推定を確実に低くするために、政治外のデータを収集できることを示します。
我々は、この重要な洞察を、政策評価と改善の両方がインターリーブされるオンライン強化学習環境に拡張する。
論文 参考訳(メタデータ) (2025-11-13T23:06:40Z) - Offline Reinforcement Learning with Implicit Q-Learning [85.62618088890787]
現行のオフライン強化学習手法では、トレーニング中に見つからない行動の価値を問い合わせて、ポリシーを改善する必要がある。
本稿では,データセット外の動作を評価する必要のないオフラインRL手法を提案する。
この方法により、学習したポリシーは、一般化によってデータの最良の振る舞いを大幅に改善することができる。
論文 参考訳(メタデータ) (2021-10-12T17:05:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。