論文の概要: Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations
- arxiv url: http://arxiv.org/abs/2607.13399v1
- Date: Wed, 15 Jul 2026 02:52:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.626036
- Title: Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations
- Title(参考訳): 公共事業における蒸留の廃止--役割・病理・規制
- Abstract要約: オンライン蒸留(OPD)は,高濃度のトークンレベルの誘導を通じて,高機能天井を拡大することなく,学生を正しい推論経路へと導いてくれることを示す。
教師と教師のミスマッチは、教師と生徒の分布ギャップが大きくなり、指導信号がタスクの正しさに悪影響を及ぼし、反生産的な方向を探索するときに起こる。
長さ爆発は、集約されたトークンレベルの目的が長さ依存のショートカットを生成し、学生が応答の切り離しや冗長なパディングを通じて報酬のランドスケープをゲームできるようにするときに起こる。
これらの病態に対処するために、我々は軽量信号規制、すなわち、クリップとログスケール圧縮について検討する。
- 参考スコア(独自算出の注目度): 41.8393565183611
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy distillation (OPD) has become a key paradigm in LLM post-training, yet its training dynamics remain poorly understood. We present a systematic study examining the role, pathologies, and regulations of OPD. We first clarify the role of OPD as an exploration catalyst: it steers the student toward correct reasoning paths via dense token-level guidance, without expanding capability ceiling. We confirm this by showing that prompt diversity matters more than per-problem sampling numbers, and critically, that the effectiveness of OPD hinges entirely on the quality of its guiding signal. This dependency exposes two pathologies that derail exploration. The Student-Teacher Mismatch occurs when a large teacher-student distributional gap causes the guiding signal to misalign with task correctness, steering exploration in counterproductive directions. Length Exploitation arises when the aggregated token-level objective creates length-dependent shortcuts, allowing the student to game the reward landscape through response truncation or redundant padding, exploring degenerate length modes rather than reasoning strategies. To tame these pathologies, we investigate lightweight signal regulations: advantage clipping and log-scale compression, ensuring exploration is guided by faithful signals. Experiments across seven benchmarks demonstrate that these regulations alleviate length exploitation and enable effective distillation, stably surpassing OPD variants and RLVR baselines, thereby confirming that well-regulated signal quality, rather than mere teacher scale, governs successful exploration in OPD.
- Abstract(参考訳): オンライン蒸留(OPD)はLLMのポストトレーニングにおいて重要なパラダイムとなっているが、そのトレーニング力学はいまだに理解されていない。
本研究は, OPDの役割, 病態, 規制について検討した。
まず,OPDが探索触媒として果たす役割を明らかにし,高濃度のトークンレベルの誘導を通じて,高機能天井を拡張することなく,学生を正しい推論経路へと導出する。
本研究は,本手法の有効性が誘導信号の品質に完全に依存していることを示すことにより,本手法の有効性を確認した。
この依存は、探究を妨げている2つの病理を明らかにする。
教師と教師のミスマッチは、教師と生徒の分布ギャップが大きくなり、指導信号がタスクの正しさに悪影響を及ぼし、反生産的な方向を探索するときに起こる。
集合トークンレベルの目的が長さ依存のショートカットを生成し、学生は応答の切り抜きや冗長なパディングを通じて報酬のランドスケープをゲームし、推論戦略よりも退化長モードを探索することができる。
これらの病態を解明するために、我々は軽量信号規制について検討する: 有利なクリッピングとログスケール圧縮、探索が忠実な信号によって導かれることを保証する。
7つのベンチマークでの実験では、これらの規則が長小評価を緩和し、有効蒸留を可能にし、PDの変種やRLVRベースラインを安定的に超えることが示され、教師の規模というよりは、十分に規制された信号品質がPDの探索の成功を左右することが確認された。
関連論文リスト
- Adaptive Supervised Anchoring for On-Policy Self-Distillation [15.445625053566244]
オンライン自己蒸留は、学生から採取した軌道上の凍結教師からの指導を蒸留することにより、言語モデルに適応する。
本研究は,学生が目標軌跡から遠ざかると,教師の目標外接頭辞の条件がタスク関連監督を著しく弱めることを示す。
本稿では,2つの補完的な指導経路を分離する統合トレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-08T05:46:32Z) - Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance [50.77757355236912]
本稿では,RSTG(Recovering Learning Signals via Adaptive Teacher Guidance)を提案する。
RSTGは数学では+4.02%、コードでは+3.05%の速さでGRPO+OPDを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-08-01T17:29:14Z) - DemoPSD: Disagreement-Modulated Policy Self-Distillation [49.30809363804017]
大規模言語モデルを訓練するための実践的な方法として、オンデマンド自己蒸留が登場している。
DemoPSDは、教師と生徒の分布の重み付けされた幾何学的組み合わせに向けて学生を操縦する。
論文 参考訳(メタデータ) (2026-07-02T17:58:29Z) - Purified OPSD: On-Policy Self-Distillation Without Losing How to Think [52.879387744920415]
オンライン自己蒸留(OPSD)は長いチェーン・オブ・ソート(Long-CoT)推論モデルでは一貫して失敗する。
まず,教師が指導信号の非伝達可能成分を分離するために,参照のみの教師を構築する。
第2に、この残差をよく形成されたPMIターゲット分布に変換するメカニズムとして、ポイントワイズ相互情報(PMI)を用いる。
論文 参考訳(メタデータ) (2026-07-02T14:33:07Z) - DOPD: Dual On-policy Distillation [59.65986569617147]
オンライン蒸留は、高密度のトークンレベルの信号で学生サンプルの軌跡を監督することで、優れた容量転送を提供する。
特権教師と特権学生の政策の間のトークンレベルの監督を動的にルーティングするアドバンテージ・アウェアな二重蒸留パラダイムであるDOPDを提案する。
大きな言語モデル(LLM)と視覚言語モデル(VLM)の両方の実験は、DOPDがバニラPDを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-06-29T17:55:53Z) - RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation [46.554172283247915]
オンライン自己蒸留は、推論モデルに対する密集したトークンレベルの監督を提供する。
この分布ギャップから引き出された学習信号は、タスクを持つものよりもスタイルトークンに集中していることが示される。
我々は,このドリフトを緩和するためのtextbfRLCSD (Reinforcement Learning with Contrastive on-policy Self-Distillation) を提案する。
論文 参考訳(メタデータ) (2026-06-10T06:31:59Z) - Trajectory-Refined Distillation [25.346810464266497]
トラジェクトリ精製蒸留(Trjectory-Refined Distillation, TRD)は、教師指導下で生徒のロールアウトをオンライン支援中に修正するトラジェクトリレベルの補正法である。
TRDは、特権情報に規定された学生モデルを教師として使用するパラメータ共有型である、オンライン自己蒸留(OPSD)にも適用することができる。
論文 参考訳(メタデータ) (2026-06-07T03:17:25Z) - Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning [41.384652481442735]
我々は,一様教師模倣からエントロピー制御された指向性監視へと特権的な自己蒸留を再構成するtextbfDirection-Adaptive Self-Distillation (textbfDASD)を提案する。
6つの数学的推論ベンチマークで、DASDは強力なRLVRと自己蒸留ベースラインよりも優れたマクロAvg@16を達成する。
論文 参考訳(メタデータ) (2026-05-21T10:07:46Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。