論文の概要: On-policy Distillation with Verifiable Reward
- arxiv url: http://arxiv.org/abs/2608.24696v2
- Date: Fri, 28 Aug 2026 05:23:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 15:11:36.076009
- Title: On-policy Distillation with Verifiable Reward
- Title(参考訳): バリバリゼーション・リワードによるオンライン蒸留
- Abstract要約: オンライン蒸留(OPD)とRLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの訓練後に広く採用されている2つのパラダイムとなっている。
本稿では,OPDVR と RLVR をシームレスに組み合わせた簡易かつ効果的な方法である OPDVR (On-policy Distillation with Verifiable Reward) を提案する。
6つの推論ベンチマークの実験は、PDVRが標準PDより一貫して優れていることを示している。
- 参考スコア(独自算出の注目度): 32.72049308672042
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) and on-policy distillation (OPD) have become two widely adopted paradigms for post-training large language models. However, RLVR suffers from sparse task-level feedback, while OPD provides dense token-level guidance but ignores trajectory correctness, limiting its performance to that of the teacher. Combining them is a promising direction: OPD supplies dense supervisory signals, while RLVR provides task-level correctness. Nevertheless, existing integrations often rely on weighted combination or heuristic switching, introducing extra hyperparameters and trade-offs. We propose On-policy Distillation with Verifiable Reward (OPDVR), a simple yet effective method that seamlessly combines OPD and RLVR without adding any hyperparameters. We first reformulate the implicit reward of sampled-token OPD based on trajectory correctness, then apply a ReLU gating mechanism to ensure that correct trajectories receive non-negative rewards and incorrect ones receive non-positive rewards---thereby aligning the distillation signal with task success while preserving the teacher's distributional guidance. Furthermore, our modification transforms sampled-token OPD into a proper RLVR method, making it readily combinable with any policy gradient algorithm, such as GRPO. Experiments on six reasoning benchmarks show that OPDVR consistently outperforms standard OPD. Our code is available at https://github.com/LeapLabTHU/OPDVR.
- Abstract(参考訳): RLVR(Reinforcement Learning with Verifiable Rewards)とOPD(On-policy distillation)は、大規模言語モデルの訓練後において広く採用されている2つのパラダイムである。
しかし、RLVRはタスクレベルの少ないフィードバックに悩まされ、OPDは密集したトークンレベルのガイダンスを提供するが、軌跡の正確さは無視し、その性能は教師のそれに限定される。
OPDは密集した監視信号を供給し、RLVRはタスクレベルの正確性を提供する。
それでも、既存の統合はしばしば重み付けされた組み合わせやヒューリスティックな切り替えに依存し、追加のハイパーパラメータやトレードオフを導入している。
OPDとRLVRをシームレスに組み合わせて過度パラメータを付加することなく, 簡便かつ効果的な方法である, 検証型リワードによるオンライン蒸留(OPDVR)を提案する。
提案手法は,まず,正解率が非負の報奨を受け,不正な報奨が非正の報奨を受けることを保証するためのReLUゲーティング機構を用いて,教師の分布指導を保ちながら,蒸留信号とタスク成功との整合を図ったものである。
さらに,本修正では,サンプルトークンOPDを適切なRLVR法に変換することにより,GRPOなどの任意のポリシー勾配アルゴリズムと容易に結合可能である。
6つの推論ベンチマークの実験は、PDVRが標準PDより一貫して優れていることを示している。
私たちのコードはhttps://github.com/LeapLabTHU/OPDVRで利用可能です。
関連論文リスト
- RISE: Recursive Improvement via Self-Extrapolating Policy Distillation [47.92477203057629]
textbfRISE (textbfRecursive textbfImprovement via textbfSelf-textbfExtrapolating Policy Distillation)を提案する。
RISEは、モデル自身のRLVRトレーニング軌道から直接合成教師を構築する。
数学的推論、マルチドメインSTEM、コード生成、マルチターンエージェントタスクにまたがる実験により、RISEはRLVRのみのトレーニングや政治上の自己蒸留よりも優れていることが示された。
論文 参考訳(メタデータ) (2026-09-04T15:47:51Z) - Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR [31.617522438897236]
単純な2段階スキームであるOPD-then-RLは、純粋PD、純粋RLVR、および論理および数理推論ベンチマークの全てのジョイントベースラインを一貫して上回ることを示す。
実用的なレシピとして、OPD検証スコアがRLに切り替える際の鍵信号であり、PDはSFTよりもRLのコールドスタートであることがわかった。
論文 参考訳(メタデータ) (2026-09-03T17:14:27Z) - Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance [50.77757355236912]
本稿では,RSTG(Recovering Learning Signals via Adaptive Teacher Guidance)を提案する。
RSTGは数学では+4.02%、コードでは+3.05%の速さでGRPO+OPDを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-08-01T17:29:14Z) - Verifier-Induced Support Reshaping in On-Policy Optimization [27.782412748608255]
検証可能な報酬(RLVR)によるオンライン強化学習は、現在の目標を改善できる一方で、後の目標に対する行動の成功は、サンプリングや強化が極めて稀であることを示す。
我々は、この検証者によるサポートの再構築と呼び、有効な報奨支援を、固定されたロールアウト予算内で到達可能な軌道として定義する。
論文 参考訳(メタデータ) (2026-07-31T19:05:43Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - Self-Distilled RLVR [57.37526213765131]
特権教師からのみ派生した学習信号が,情報漏洩と不安定な長期学習をもたらすことを示す。
textbfSelf-textbfDistillationを用いたtextbfRLSD(textbfRLVR)を提案する。
これにより、RSSDはRLVRとOPSDの両方の強度を同時に利用でき、高い収束天井と優れたトレーニング安定性を実現することができる。
論文 参考訳(メタデータ) (2026-04-03T15:50:07Z) - Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards [69.74686029941881]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論能力を改善するための効果的なパラダイムである。
トレーニングを通して高価値ロールアウトを適応的に選択する統合型ニューラルネットワークスケジューリングフレームワークを提案する。
6つの数学的推論ベンチマークの実験では、複数のRLVR最適化手法で性能と訓練効率が一貫した向上を示した。
論文 参考訳(メタデータ) (2026-02-09T10:51:58Z) - From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation [52.62655622099456]
検証基準ベース報酬(RLVRR)を用いた強化学習を提案する。
最後の答えをチェックする代わりに、RLVRRは高品質な参照(すなわち報酬連鎖)から順序付けられた言語信号を抽出する。
このようにして、RLVRRは報酬を2つの次元に分解する。
論文 参考訳(メタデータ) (2026-01-26T14:39:58Z) - Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards [13.064343544668283]
MR-RLVR(Masked-and-Reordered RLVR)を提案する。
MR-RLVRをQwen2.5-3BとDeepSeek-R1-Distill-Qwen-1.5Bで実装し,AIME24,AIME25,AMC23,MATH500で評価した。
論文 参考訳(メタデータ) (2025-11-21T18:23:04Z) - The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable Reward [57.56453588632619]
Reinforcement Learning with Verifiable Reward (RLVR) を用いた細調整大型言語モデル(LLM)における中心的パラドックスは、多目的性能の頻繁な劣化である。
これはしばしば破滅的な忘れが伴い、モデルが以前獲得したスキルを失う。
我々は,標準RLVR目標には知識保持のための重要なメカニズムが欠如していると主張している。
論文 参考訳(メタデータ) (2025-09-09T06:34:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。