論文の概要: Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance
- arxiv url: http://arxiv.org/abs/2608.00782v1
- Date: Sat, 01 Aug 2026 17:29:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.906518
- Title: Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance
- Title(参考訳): 失敗する場所の希薄化:適応型教師指導から負のRLグループを学習信号として回収する
- Authors: Zhuowen Han, Jinwei Xiao, Zhengxi Lu, Renren Jin, Zhiyuan Yao, Yuxin Liu, Hongyan Hao, Yueqing Sun, Yu Yang, Qi GU, Xunliang Cai, Deyi Xiong,
- Abstract要約: 本稿では,RSTG(Recovering Learning Signals via Adaptive Teacher Guidance)を提案する。
RSTGは数学では+4.02%、コードでは+3.05%の速さでGRPO+OPDを大幅に上回ることを示した。
- 参考スコア(独自算出の注目度): 50.77757355236912
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) has become a standard paradigm for post-training large language models (LLMs). While Group Relative Policy Optimization (GRPO) is widely adopted, it suffers from sparse reward signals and loses gradients entirely when all responses within a group receive identical rewards. On-policy distillation (OPD) offers a natural remedy by providing dense, token-level supervision from a teacher model. However, naively combining GRPO with OPD leads to degraded performance, due to three underlying causes: not all samples benefit from distillation; fitting too quickly to the teacher undermines the exploratory capacity of RL; and OPD's advantages are asymmetric, suppressing most tokens. To address these challenges, we propose RSTG (Recovering Learning Signals via Adaptive Teacher Guidance), which applies distillation selectively and precisely where it matters most. At the sample level, OPD is restricted to negative zero-variance prompts with each sample weighted by the teacher's confidence score. At the token level, distillation targets only tokens with high student entropy or large teacher-student divergence. We further augment training with SFT on correct trajectories generated by the teacher model, injecting positive gradient signals where RL yields none. Experiments demonstrate that RSTG substantially outperforms naive GRPO+OPD by +4.02% on math and +3.05% on code.
- Abstract(参考訳): 検証可能な報酬付き強化学習(RLVR)は,大規模言語モデル(LLM)の訓練後の標準パラダイムとなっている。
グループ相対政策最適化(GRPO)は広く採用されているが、グループ内の全ての応答が同じ報酬を受けると、疎い報酬信号に悩まされ、完全に勾配を失う。
オンライン蒸留(OPD)は、教師モデルから密集したトークンレベルの監督を提供することにより、自然な対策を提供する。
しかし、GRPOとOPDを鼻で組み合わせることで、3つの根本的な原因により性能が低下する。全てのサンプルが蒸留の恩恵を受けるわけではないこと、教師がRLの探索能力に早すぎること、PDの利点は非対称であり、ほとんどのトークンを抑えること、である。
これらの課題に対処するため,RSTG (Recovering Learning Signals via Adaptive Teacher Guidance)を提案する。
サンプルレベルでは、OPDは教師の信頼度スコアで重み付けられた各サンプルに対して負のゼロ分散プロンプトに制限される。
トークンレベルでは、蒸留は高い学生エントロピーまたは大きな教師/学生の分散を持つトークンのみを対象としている。
さらに,教師モデルが生成した正しい軌道上でのSFTによるトレーニングを増強し,RLが生成しない正の勾配信号を注入する。
RSTGは数学では+4.02%、コードでは+3.05%の速さでGRPO+OPDを大幅に上回ることを示した。
関連論文リスト
- H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - CAST: Non-Privileged Clipped Asymmetric Self-Teaching with Advantage Flipping for GRPO [9.443660785229719]
検証可能な報酬付き強化学習(RLVR)は、大規模言語モデルの推論を改善するために広く用いられている。
本研究は,GRPO型RLVRに対する無回答自己蒸留法であるCASTを提案する。
論文 参考訳(メタデータ) (2026-05-29T13:21:30Z) - Self-Distilled Agentic Reinforcement Learning [65.24201057390938]
自己蒸留型エージェント強化学習は、トークンレベルの信号をシグモノイドゲートにマップする。
SDARはモデルスケール全体のハイブリッドRL--OPSDベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-14T17:51:26Z) - Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training [20.04756350098974]
ラベル付き検証可能なトレーニングデータがバインディング制約である場合、各チェックされた例は、最も情報のあるモデルと報酬密度に割り当てるべきである。
スパース・シークエンス・レベルの報酬は、より良い振る舞いを探索し発見できるモデルにおいて最も有用であるが、より密集したトークンレベルの教師監督は、その振る舞いをより小さなデプロイメントモデルに圧縮するのにより適している。
論文 参考訳(メタデータ) (2026-05-12T17:57:48Z) - Self-Distilled RLVR [57.37526213765131]
特権教師からのみ派生した学習信号が,情報漏洩と不安定な長期学習をもたらすことを示す。
textbfSelf-textbfDistillationを用いたtextbfRLSD(textbfRLVR)を提案する。
これにより、RSSDはRLVRとOPSDの両方の強度を同時に利用でき、高い収束天井と優れたトレーニング安定性を実現することができる。
論文 参考訳(メタデータ) (2026-04-03T15:50:07Z) - Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes [31.95045602299568]
オンライン蒸留(OPD)は,教師の学習履歴ではなく,学生が生み出すロールアウトに対するフィードバックを評価するため,大規模言語モデル(LLM)のポストトレーニングにアピールしている。
推定器と実装側からOPDを再検討する。
不均衡な1-token信号、学生が生成した接頭辞に対する教師の信頼できない指導、トークン化器や特殊-tokenミスマッチによる歪みの3つの失敗モードを同定する。
論文 参考訳(メタデータ) (2026-03-26T15:35:59Z) - Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation [57.524909883706556]
オンライン蒸留(OPD)は、学生のパフォーマンス向上に強い経験的利益をもたらしている。
この研究は、フレキシブルな参照モデルと報酬項の相対重みをKL正規化に対して制御する報酬スケーリング係数を導入している。
特に、同じ学生モデルにドメイン固有RLを適用して得られた異なるドメインエキスパートの知識をマージする環境では、ExOPDは生徒が教師のパフォーマンス境界を越えられるようにします。
論文 参考訳(メタデータ) (2026-02-12T16:14:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。