論文の概要: Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation
- arxiv url: http://arxiv.org/abs/2609.08798v1
- Date: Tue, 08 Sep 2026 14:26:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.678321
- Title: Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation
- Title(参考訳): On-Policy Reverse Distillation による弱-ストロング一般化の緩和
- Abstract要約: 弱強一般化は、より弱いスーパーバイザーからより強力なモデルを学び、それらを上回ることができるかどうかを問う。
本稿では,教師の政策シフトを評価し,学生の検証者主導の政策勾配を増幅するOn-Policy Reverse Distillationを紹介する。
連続したモデル転送とマルチティーチンガー蒸留の両方において、OPRDは既存のRLや蒸留手法よりも学生更新が少なく、極めて高い性能を達成している。
- 参考スコア(独自算出の注目度): 41.854144563456046
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Weak-to-strong generalization asks whether stronger models can learn from weaker supervisors and surpass them. This question is particularly important for successive model generations and multi-domain consolidation, where repeating frontier-scale post-training from scratch can be prohibitively expensive. Yet conventional distillation treats the weak teacher as an optimization target, potentially imposing its capacity ceiling on the student. We introduce On-Policy Reverse Distillation (OPRD), which evaluates the teacher's policy shift relative to its reference policy on student rollouts and amplifies the component of the student's verifier-driven policy gradient along that direction. By rescaling only verifier-supported updates, OPRD preserves the stationary points of policy optimization while accelerating learning beyond the teacher. In both successive model transfer and multi-teacher distillation, OPRD achieves higher performance with fewer student updates than existing RL and distillation approaches. Response-style analysis shows that OPRD students remain closer to models trained with verifier-based RL alone than to their weak teachers, suggesting that teacher guidance accelerates rather than redirects the student's own optimization. Results in conventional strong-to-weak distillation further demonstrate that OPRD effectively combines verifier-driven policy optimization with teacher guidance regardless of capacity ordering.
- Abstract(参考訳): 弱強一般化は、より弱いスーパーバイザーからより強力なモデルを学び、それらを上回ることができるかどうかを問う。
この問題は、連続したモデル世代とマルチドメインの統合において特に重要であり、スクラッチからフロンティアスケールのポストトレーニングを繰り返すことは違法にコストがかかる。
しかし、従来の蒸留法では、弱い教師を最適化目標として扱い、学生に容量の上限を与える可能性がある。
本稿では,学生のロールアウトに対する基準方針に対する教師の方針シフトを評価し,その方向に沿って学生の検証者主導の方針勾配の要素を増幅するOn-Policy Reverse Distillation (OPRD)を紹介する。
検証者をサポートする更新のみを再スケーリングすることで、OPRDは教師を超えて学習を加速しながら、ポリシー最適化の定常的なポイントを保ちます。
連続したモデル転送とマルチティーチンガー蒸留の両方において、OPRDは既存のRLや蒸留手法よりも学生更新が少なく、高い性能を達成している。
応答型分析の結果, OPRD の学生は, 教師よりも, 検証者に基づく RL で訓練したモデルに近づき, 教師の指導は生徒自身の最適化をリダイレクトするのではなく, 加速することが示唆された。
従来の強弱蒸留実験の結果, OPRDは検証者主導の政策最適化と教師指導を, キャパシティオーダによらず効果的に組み合わせることを示した。
関連論文リスト
- H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization [22.479229036646156]
検証リワードを用いた強化学習のためのPrivileged Tutoring Distillation Policy Optimizationフレームワークを提案する。
PTD-POは、生徒の方針に答えることなく、密集したガイダンスを提供する。
2Bから8BまでのLVLM実験では、PTD-POはRLVRや蒸留ベースラインより一貫して優れていた。
論文 参考訳(メタデータ) (2026-06-05T07:43:22Z) - SocraticPO: Policy Optimization via Interactive Guidance [64.7524628699057]
大規模言語モデルのための強化学習(RL)は通常、二項正当性のようなスカラー結果の報酬を伴う推論を監督する。
我々は、ソクラティックスタイルの自然言語ガイダンスでRLロールアウトを強化する政策最適化フレームワークであるtextbf SocraticPO(Socratic Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-06-03T09:08:29Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - Teacher-Guided Policy Optimization for LLM Distillation [90.49982387646861]
Teacher-Guided Policy Optimization (TGPO) は、生徒のロールアウトに条件付き教師予測を活用することで、高密度な方向性誘導を取り入れたオンラインアルゴリズムである。
複雑な推論ベンチマークの実験では、TGPOは標準ベースラインを著しく上回り、異なる教師にとって堅牢であることが示されている。
論文 参考訳(メタデータ) (2026-05-13T09:20:03Z) - Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization [18.027254451537342]
既存の自己蒸留法は、文脈拡張型教師モデルに向けた学習をKLマッチングに大きく還元する。
textbfPreference-textbfBased textbfSelf-textbfDistillation (textbfPBSD)を提案する。
論文 参考訳(メタデータ) (2026-05-06T15:31:50Z) - Reinforcement-aware Knowledge Distillation for LLM Reasoning [63.53679456364683]
強化学習(Reinforcement Learning, RL)ポストトレーニングは、最近、大型言語モデル(LLM)の長いチェーン・オブ・プリーティングにおいて、進歩をもたらした。
既存の知識蒸留法の多くは、教師による微調整(SFT)のために設計されており、固定された教師のトレースや教師の学生であるKulback-Leibler(KL)の発散に基づく正規化に依存している。
本稿では,RLにおける選択的な模倣を行うRL-aware distillation (RLAD)を提案する。
論文 参考訳(メタデータ) (2026-02-26T00:20:39Z) - Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation [57.524909883706556]
オンライン蒸留(OPD)は、学生のパフォーマンス向上に強い経験的利益をもたらしている。
この研究は、フレキシブルな参照モデルと報酬項の相対重みをKL正規化に対して制御する報酬スケーリング係数を導入している。
特に、同じ学生モデルにドメイン固有RLを適用して得られた異なるドメインエキスパートの知識をマージする環境では、ExOPDは生徒が教師のパフォーマンス境界を越えられるようにします。
論文 参考訳(メタデータ) (2026-02-12T16:14:29Z) - KEPO: Knowledge-Enhanced Preference Optimization for Reinforcement Learning with Reasoning [24.072603982041798]
強化学習は、大規模言語や視覚言語モデルにおいて、明示的な推論行動を引き起こすための有望なパラダイムとして登場した。
しかしながら、推論指向のRLポストトレーニングは、低軌道レベルの報酬のため、基本的には困難である。
近年のオンライン蒸留法では,教師の集中管理によって最適化の安定化が図られている。
論文 参考訳(メタデータ) (2026-01-30T23:28:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。