論文の概要: RL Starts before RL: On Policy Distillation for Better Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.28145v2
- Date: Sat, 26 Sep 2026 12:51:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:25.491609
- Title: RL Starts before RL: On Policy Distillation for Better Reinforcement Learning
- Title(参考訳): RLより前に始まるRL:強化学習の改善のための政策蒸留について
- Abstract要約: 強化学習(RL)は推論を改善するが、その性能は学習開始の方針に依存する。
RLの調製段階としての政治蒸留(OPD)について検討した。
OPDの学生は、直接RLや教師付き微調整の訓練を受けた生徒よりも高い最終成績を得た。
- 参考スコア(独自算出の注目度): 57.705005126006085
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) improves reasoning, but its performance depends on the policy from which training begins. We study on-policy distillation (OPD) as a preparation stage for RL and ask whether its benefits extend beyond improvements in the distilled model's initial accuracy. Under shared RL settings, students initialized with OPD reach higher final performance than those trained with direct RL or supervised fine-tuning followed by RL. This advantage can emerge even when OPD produces little immediate improvement in accuracy. Pre-RL Pass@k does not fully explain the benefit: similar or even higher values do not necessarily lead to better performance after RL. Behavioral analyses point to alignment with the teacher's distribution beyond top-1 agreement as a possible explanation. Such alignment may favor higher-quality reasoning paths while retaining alternatives that RL can further refine using outcome feedback. We further examine how trajectory sources and divergence objectives affect the value of distillation for subsequent RL. Standard reverse-KL OPD performs better before RL, but forward-KL OPD overtakes it afterward. Student rollouts outperform teacher rollouts under both objectives before and after RL. These findings highlight the importance of both objective choice and the states receiving supervision for subsequent RL. Our results support OPD as preparation for RL and favor forward KL when OPD is followed by RL in our comparison.
- Abstract(参考訳): 強化学習(RL)は推論を改善するが、その性能は学習開始の方針に依存する。
我々は, オンライン蒸留(OPD)をRLの調製段階として検討し, その利点が蒸留モデルの初期精度の改善を超えて拡大するか否かを問う。
共有RL設定では、OPDで初期化した学生は、直接RLや教師付き微調整、RLで訓練された生徒よりも高い最終成績を得た。
この利点は、OPDが精度の即時改善をほとんど生まない場合でも現れる。
Pre-RL Pass@kは、その利点を十分に説明していない。
行動分析は、トップ1合意を超えて教師の分布と一致していることを説明として示している。
このようなアライメントは、RLが結果フィードバックを使ってさらに洗練できる代替手段を維持しながら、高品質な推論パスを好むかもしれない。
さらに, トラジェクトリ源および分散目的がその後のRLの蒸留値に与える影響について検討した。
標準逆KL OPDはRLよりも性能がよいが、フォワードKL OPDはその後、それを上回っている。
学生のロールアウトは、RLの前と後の両方の目的の下で、教師のロールアウトよりも優れています。
これらの知見は、目的選択とその後のRLの監督を受ける国家の両方の重要性を強調している。
以上の結果から,OPD を RL の準備としてサポートし,OPD を RL に後続する場合には KL を優先した。
関連論文リスト
- RL-Native Distillation: Exploiting Scored Trajectories for Few-Step Image Generation [38.215412661414604]
効率的なテキスト・ツー・イメージ生成には、強化学習(RL)ベースの報酬アライメントと数ステップの蒸留が必要である。
本稿では,REST (Reward-Enhanced Scored-Trajectory Distillation) を提案する。
私たちは、RESTが40ステップのRL教師と一致するか、または超えるCFGフリーな推論を可能にすることを示しています。
論文 参考訳(メタデータ) (2026-08-10T07:49:05Z) - Distilled Reinforcement Learning for LLM Post-training [8.435213882597546]
大規模言語モデル(LLM)のポストトレーニングは推論、適応、アライメントの改善に不可欠である。
既存の方法は、強化学習(RL)とオンライン蒸留(OPD)の2つのパラダイムに主に従っている。
本稿では,教師の指導をRL目標に統合し,詳細な指導を行う蒸留RL(Distilled Reinforcement Learning)を提案する。
論文 参考訳(メタデータ) (2026-07-19T13:32:54Z) - Understanding Reasoning from Pretraining to Post-Training [53.890128750021375]
チェスは前訓練から後訓練までのパイプライン全体にわたって推論を研究するための制御テストベッドとして使用します。
所定のRL計算レベルでのポストRL性能は、事前学習損失からよく予測できる。
さらに,数学領域のテキスト上での1B言語モデルの訓練により,我々の研究結果がチェスを超えるか否かを検証した。
論文 参考訳(メタデータ) (2026-07-17T16:31:58Z) - RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training [18.932290080075685]
RLは非常に早期に有効であることが分かっており、SFT$to$RLパイプラインと早期にマッチすることが多い。
ベースチェックポイントに直接RLを適用すると、モデルの分布が拡大する。
モデル全体の能力は基本的にRLによって変わらず、SFTの後に劣化する。
論文 参考訳(メタデータ) (2026-06-02T22:55:18Z) - Experience is the Best Teacher: Motivating Effective Exploration in Reinforcement Learning for LLMs [17.47321135631444]
HeRLは、強化学習フレームワークをガイドしたHindsightエクスペリエンスである。
我々は,HRLがLLMに対して,報酬に指定された望ましい振る舞いを明示的に示すことによって,効果的な探索を行う方法を示す。
論文 参考訳(メタデータ) (2026-03-20T15:32:06Z) - Reinforcement-aware Knowledge Distillation for LLM Reasoning [63.53679456364683]
強化学習(Reinforcement Learning, RL)ポストトレーニングは、最近、大型言語モデル(LLM)の長いチェーン・オブ・プリーティングにおいて、進歩をもたらした。
既存の知識蒸留法の多くは、教師による微調整(SFT)のために設計されており、固定された教師のトレースや教師の学生であるKulback-Leibler(KL)の発散に基づく正規化に依存している。
本稿では,RLにおける選択的な模倣を行うRL-aware distillation (RLAD)を提案する。
論文 参考訳(メタデータ) (2026-02-26T00:20:39Z) - Diversity or Precision? A Deep Dive into Next Token Prediction [19.30494719444709]
本研究では,事前学習したトークン出力分布が,その後の強化学習の探索ポテンシャルをいかに形成するかを検討する。
精度指向の勾配を先行させると、RLのより優れた探索空間が得られることが分かる。
論文 参考訳(メタデータ) (2025-12-28T14:53:24Z) - Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning [55.36978389831446]
我々はベイズ適応RLフレームワークにおける反射探査を再放送する。
我々のアルゴリズムであるBARLは、観測結果に基づいて戦略を縫い替えるようにLLMに指示する。
論文 参考訳(メタデータ) (2025-05-26T22:51:00Z) - AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning [50.02117478165099]
大規模強化学習は, 強大・中小モデルの推論能力を大幅に向上させることができることを示す。
まずは算数のみのプロンプト、次にコードのみのプロンプトのトレーニングを行う。
論文 参考訳(メタデータ) (2025-05-22T08:50:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。