論文の概要: Enhancing Rubric-based RL via Self-Distillation
- arxiv url: http://arxiv.org/abs/2607.18082v2
- Date: Tue, 21 Jul 2026 03:34:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.440769
- Title: Enhancing Rubric-based RL via Self-Distillation
- Title(参考訳): 自己蒸留によるゴム系RLの促進
- Authors: Mingxuan Xia, Yuhang Yang, Chao Ye, Shuai Zhu, Shenzhi Yang, Guangcheng Zhu, Yuhang Zhang, Cheng Peng, Haobo Wang, Siqing Wang,
- Abstract要約: 本稿では, ルブリックをベースとしたRLをオンライン自己蒸留により強化するCriPO(Criterion-Distilled Policy Optimization)を提案する。
CriPOはルーブリックベースのRLを一貫して上回り、最適化手順を減らした約2ドルで、より強力な最終性能を実現している。
- 参考スコア(独自算出の注目度): 23.111278687216544
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Rubric-based RL has recently shown promise in improving LLMs on open-ended tasks. A widely recognized limitation of rubric-based RL is limited exploration: criteria that no rollout manages to satisfy (Unexplored Criteria, UC) receive no optimization signal. Recent methods address this by incorporating rubric information as external guidance during rollout, yet they introduce a train-inference mismatch: the policy is optimized on rollouts produced under external guidance while this guidance is absent at inference time, causing error accumulation through autoregressive decoding. Moreover, these exploration-focused approaches overlook a fundamentally different failure mode that we term Suppressed Criteria (SC) -- criteria that are satisfied by some rollouts yet whose learning signals are lost during optimization because scalar reward aggregation assigns them non-positive aggregate advantages. Our analysis reveals that SC are remarkably prevalent: over 57% of samples exhibit this failure mode throughout training, with an average of 1.8 SC per sample. To simultaneously address both UC and SC without introducing training-inference mismatch, we propose Criterion-Distilled Policy Optimization (CriPO), which enhances rubric-based RL via on-policy self-distillation. For UC, CriPO constructs a criterion-injection self-teacher and computes a localized forward-KL loss to inject missing behaviors into the policy. For SC, CriPO employs a counterfactual self-teacher to locate criterion-relevant tokens in negative-advantage rollouts and flips their token-level advantages to positive values, preserving useful patterns that would otherwise be suppressed. Experiments on medicine and science benchmarks demonstrate that CriPO consistently outperforms rubric-based RL, achieving stronger final performance with approximately $2\times$ fewer optimization steps.
- Abstract(参考訳): ルブリックベースのRLは、最近、オープンエンドタスクにおけるLLMの改善を約束している。
ロールアウトが満たされないという基準(Unexplored Criteria, UC)は、最適化信号を受け取らない。
近年の手法では、ロールアウト時にルーリック情報を外部ガイダンスとして組み込む手法が提案されているが、この手法は、外部ガイダンスで生成されたロールアウトに最適化されており、このガイダンスは推論時に欠落しており、自動回帰復号によるエラー蓄積を引き起こす。
さらに、これらの探索に焦点を当てたアプローチは、我々がSuppressed Criteria (SC)と呼ぶ、基本的に異なる障害モードを見落としている。
57%以上のサンプルがトレーニングを通してこの障害モードを示し、1サンプルあたり平均1.8 SCである。
トレーニング・推論ミスマッチを導入することなく,UCとSCの両方に同時に対処するために,ルール・ディスタンス・ポリシー・最適化(CriPO)を提案する。
UCの場合、CryPOはクレーター注入自習機を構築し、局所的なフォワードKL損失を計算し、欠落した振る舞いをポリシーに注入する。
SCにとってCryPOは、負のアドバンテージのロールアウトで基準関連トークンを見つけ出し、トークンレベルのアドバンテージを正の値に反転させ、そうでなければ抑制されるであろう有用なパターンを保存するために、反実的な自己教育者を用いる。
医学と科学のベンチマークの実験では、CryPOはルビリックベースのRLを一貫して上回り、約2ドル以上の最適化ステップでより強力な最終性能を達成している。
関連論文リスト
- LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL [64.4276583943816]
検証不能な指導のための強化学習は、報酬信号としてプロンプト固有のルーリックを持つ裁判官に依存している。
最近の手法は、トレーニング中にこれらのルーリックを進化するポリシーに適応させるが、トレーニングのプロンプト自体は静的のままである。
この静的なアプローチは、しばしば急激な困難と政策能力の間に重大なミスアライメントをもたらし、裁判官は差別的な報酬信号を取り戻すことができない。
論文 参考訳(メタデータ) (2026-07-05T17:05:13Z) - Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning [2.384534878752428]
校正された大言語モデルを強化学習訓練ループに統合するフレームワークである,不確実性を考慮した LLM-Guided Policy Shaping (ULPS) を提案する。
ULPS は A* ベースのオラクルを用いて最適な記号軌道を合成し、BERT ベースの言語モデルを微調整する。
成功率、報酬効率、サンプルの複雑さを、無誘導、非校正、標準のRLベースラインで一貫した改善を観察する。
論文 参考訳(メタデータ) (2026-06-04T19:46:45Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards [73.44333771806282]
RLVR(Reinforcement Learning with Verifiable Rewards)は,大規模言語モデルの推論能力向上に有効なパラダイムとして登場した。
本稿では,RLVRの簡易かつ効果的な拡張であるCIPO(Correction-Oriented Policy Optimization)を提案する。
CIPOは学習効率を向上し、モデルが自身のエラーを修正する能力を明示的に強化する。
論文 参考訳(メタデータ) (2026-05-14T08:22:21Z) - What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time [57.533031432715084]
TTRL(Test-Time Reinforcement Learning)は、Large Language Models(LLM)が、ラベルのないテストストリームの推論能力を向上することを可能にする。
既存のTTRL法は、正の擬似ラベル戦略にのみ依存している。
本研究では,ラベル雑音増幅を効果的に緩和する堅牢なテスト時間強化学習フレームワークであるSCRLを提案する。
論文 参考訳(メタデータ) (2026-03-20T11:47:12Z) - Proximal Action Replacement for Behavior Cloning Actor-Critic in Offline Reinforcement Learning [22.17044827069627]
安定なアクターによって生成される高価値なアクションに置き換える,プラグアンドプレイのトレーニングサンプル置換器を提案する。
実験の結果、PARはパフォーマンスを継続的に改善し、基礎的なTD3+BCと組み合わせることで最先端にアプローチすることがわかった。
論文 参考訳(メタデータ) (2026-02-07T08:44:27Z) - A Step Back: Prefix Importance Ratio Stabilizes Policy Optimization [58.116300485427764]
強化学習のポストトレーニングは、大きな言語モデルにおける推論の振る舞いを引き出すことができる。
トークンレベルの補正は、オフポリシーネスの度合いが大きい場合、不安定なトレーニングダイナミクスにつながることが多い。
我々は,最小固定率 (MinPRO) を簡易かつ効果的に提案する。
論文 参考訳(メタデータ) (2026-01-30T08:47:19Z) - Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization [22.67700436936984]
ステップレベルのオフライン強化学習アルゴリズムであるDAPO(Direct Advantage Policy Optimization)を導入する。
DAPOは、各ステップにおける推論精度を予測するために批判機能を使用し、それによって高密度信号を生成して生成戦略を洗練させる。
その結果,DAPO は SFT モデルと RL モデルの両方の数学的・コード的能力を効果的に向上し,DAPO の有効性を示すことができた。
論文 参考訳(メタデータ) (2024-12-24T08:39:35Z) - Supervised Advantage Actor-Critic for Recommender Systems [76.7066594130961]
本稿では、RL成分を学習するための負のサンプリング戦略を提案し、それを教師付き逐次学習と組み合わせる。
サンプル化された(負の)作用 (items) に基づいて、平均ケース上での正の作用の「アドバンテージ」を計算することができる。
SNQNとSA2Cを4つのシーケンシャルレコメンデーションモデルでインスタンス化し、2つの実世界のデータセットで実験を行う。
論文 参考訳(メタデータ) (2021-11-05T12:51:15Z) - BRAC+: Improved Behavior Regularized Actor Critic for Offline
Reinforcement Learning [14.432131909590824]
オフライン強化学習は、以前に収集したデータセットを使用して効果的なポリシーをトレーニングすることを目的としている。
標準的なオフ・ポリティクスRLアルゴリズムは、アウト・オブ・ディストリビューション(探索されていない)アクションの値を過大評価する傾向がある。
動作の規則化によるオフライン強化学習を改善し,BRAC+を提案する。
論文 参考訳(メタデータ) (2021-10-02T23:55:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。