論文の概要: Transfer-Stratified On-Policy Distillation for RL-Improved Reasoning Teachers
- arxiv url: http://arxiv.org/abs/2610.05974v1
- Date: Mon, 05 Oct 2026 08:26:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 02:46:01.109936
- Title: Transfer-Stratified On-Policy Distillation for RL-Improved Reasoning Teachers
- Title(参考訳): RL-Improved Reasoning Teachers におけるトランスファーストラティファイドオンポリシィ蒸留
- Abstract要約: 強化学習は理科教師を著しく改善させることができるが、教師がより小さな政治学の学生を監督する場合にその改善が残るかは定かではない。
本研究では, GRPO前後の教師系統, 複数の学生尺度, 直接GRPO, およびいくつかのオンライン蒸留目標を比較して, 数学的推論においてこの問題を考察する。
- 参考スコア(独自算出の注目度): 14.928358057434394
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning can substantially improve a reasoning teacher, but it is unclear which of those improvements survive when the teacher supervises a smaller on-policy student. We study this question in mathematical reasoning by comparing teacher lineages before and after GRPO, multiple student scales, direct GRPO, and several on-policy distillation objectives. The central finding is that transfer is structured rather than scalar: teacher strength alone does not make dense distillation competitive, while an RL-improved teacher creates useful but metric-dependent student gains. This motivates Transfer-Stratified On-Policy Distillation (TS-OPD), which screens training problems by the joint sampled success of the student and teacher, routes acquisition problems to gated forward KL, routes consolidation problems to gated reverse KL, and adds an entropy brake to protect sampled coverage. Across the main comparison, TS-OPD is the strongest student objective for macro average correctness with the GRPO-improved teacher, while pass@K remains more mixed. Ablations show that the gains come from routing and token gating rather than skipping problems. These results support a transfer-aware view of OPD: stronger teachers help when the supervision direction and token budget match the student's observed ability, not merely because the teacher endpoint is stronger.
- Abstract(参考訳): 強化学習は理科教師を著しく改善させることができるが、教師がより小さな政治学の学生を監督する場合にその改善が残るかは定かではない。
本研究では, GRPO前後の教師系統, 複数の学生尺度, 直接GRPO, およびいくつかのオンライン蒸留目標を比較して, 数学的推論においてこの問題を考察する。
教師の強度だけでは高密度蒸留競争を起こさないが、RLに改良された教師は役に立つがメートル法に依存した生徒の利益を生み出す。
これは、学生と教師が共同で試行したサンプルサンプルによるトレーニング問題をスクリーニングし、取得した問題をゲートフォワードKLにルーティングし、コンソリデーション問題をゲートリバースKLにルーティングし、サンプルカバレッジを保護するエントロピーブレーキを追加するTS-OPD(Transfer-Stratified On-Policy Distillation)のモチベーションである。
主な比較では,TS-OPD は GRPO を改良した教師に対してマクロ平均正当性を示す最強の学生目標であり,pass@K はより混在している。
アブレーションは、問題をスキップするのではなく、ルーティングとトークンゲーティングによって得られる利益を示している。
これらの結果は、教師のエンドポイントが強いことだけでなく、監督方向とトークン予算が生徒の観察能力と一致した場合に、より強い教師が助けとなる。
関連論文リスト
- Teacher-Student Gaps Are Not Enough: Outcome-Guided On-Policy Distillation for Multi-Turn Autonomous Agents [18.008085411758177]
オンライン蒸留は、教師の監督が密集した独自の軌道で学生を訓練する。
大きなギャップは無視できるが、小さなギャップは結果クリティカルである。
教師の指導に軌道相対重み付けを適用したOG-OPD(Outcome-Guided On-Policy Distillation)を提案する。
論文 参考訳(メタデータ) (2026-09-28T14:49:13Z) - TeacherGRPO: Closing the Capacity Gap in Reasoning Distillation via Teacher Alignment [70.40748464576045]
強力な教師モデルから小さな学生への蒸留はギャップカースに面している。
教師がより高度に成長するにつれて、複雑な分布は生徒が近似できるものから多様化し、パフォーマンスが低下する。
本研究では,教師がデータを捨てたり,推論品質を劣化させたりすることなく,直接生徒の分布に適応する教師アライメントを提案する。
論文 参考訳(メタデータ) (2026-09-27T10:13:54Z) - Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation [41.854144563456046]
弱強一般化は、より弱いスーパーバイザーからより強力なモデルを学び、それらを上回ることができるかどうかを問う。
本稿では,教師の政策シフトを評価し,学生の検証者主導の政策勾配を増幅するOn-Policy Reverse Distillationを紹介する。
連続したモデル転送とマルチティーチンガー蒸留の両方において、OPRDは既存のRLや蒸留手法よりも学生更新が少なく、極めて高い性能を達成している。
論文 参考訳(メタデータ) (2026-09-08T14:26:35Z) - Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold [4.090731563364332]
我々は、強化学習ポリシーをマルチベース推論解多様体の局所的なプローブと見なすべきであると主張する。
本稿では,教師が多教師政策の蒸留で構築する拡張型圧縮フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-30T07:05:37Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - Teacher-Guided Policy Optimization for LLM Distillation [90.49982387646861]
Teacher-Guided Policy Optimization (TGPO) は、生徒のロールアウトに条件付き教師予測を活用することで、高密度な方向性誘導を取り入れたオンラインアルゴリズムである。
複雑な推論ベンチマークの実験では、TGPOは標準ベースラインを著しく上回り、異なる教師にとって堅牢であることが示されている。
論文 参考訳(メタデータ) (2026-05-13T09:20:03Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。