論文の概要: LastOPD: Taming Collapse in Latent On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2609.28845v1
- Date: Wed, 23 Sep 2026 23:22:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.604532
- Title: LastOPD: Taming Collapse in Latent On-Policy Distillation
- Title(参考訳): LastOPD: 潜伏型on-policy蒸留における崩壊のテーピング
- Abstract要約: 我々は,LastOPDを提案する。LastOPDは,最後の層状態,LMヘッドの両方の共通インタフェース,トークンレベルPDへの10ステップのクロスフェード中のみに適用する。
これは潜伏信号の有用な部分を保持し、崩壊が起こる前に学生にトークンレベルの監督を任せる。
実験の結果、LastOPDは4Bと8Bの教師と5.55点と4.02点のトークンオンリーのPDよりもMATH-500を改善し、ほとんどの保持されたデータセットを導き、トークンオンリーのPDの最終スコアを約半分に到達した。
- 参考スコア(独自算出の注目度): 31.27206955259948
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation (OPD) corrects a student on the responses it writes, but its signal is the teacher's next-token distribution: it tells the student what the teacher says but misses how it thinks. Latent supervision promises the missing part by aligning the student's latent states to the teacher's. Recent methods such as OPRD bring this signal into on-policy distillation. However, we observe two failures of this recipe when distilling Qwen3-4B and Qwen3-8B into Qwen3-1.7B-Base. Early gain, late collapse: latent supervision alone lifts MATH-500 accuracy from 25 to 46 in 10 steps, but subsequent training degrades performance down to 11 with no recovery. Better alignment, worse behavior: although the alignment metric steadily improves throughout this collapse, the most aligned model turns out to be the worst performing. Further analysis suggests a mismatch in how the latent signal is applied: layers paired by depth play different roles in the two models, so continued alignment may pull the student toward teacher states it cannot understand. To address this, we propose LastOPD, which applies the latent signal only at the last-layer state, the common interface both LM heads read, and only during a 10-step crossfade into token-level OPD. This keeps the useful part of the latent signal and hands the student to token-level supervision before the collapse sets in. Extensive experiments show that LastOPD improves MATH-500 over token-only OPD by 5.55 and 4.02 points with the 4B and 8B teachers, leads on most held-out datasets, and reaches the final score of token-only OPD in about half the steps. Code is available at https://github.com/Muyiiiii/LastOPD.
- Abstract(参考訳): オンライン蒸留(On-policy distillation、OPD)は、学生が書いた反応を補正するが、そのシグナルは教師の次の話題である。
潜伏監督は、学生の潜伏した状態を教師のものと整合させることによって、行方不明な部分を約束する。
OPRDのような最近の方法は、この信号をオン・ポリケート蒸留にもたらす。
しかし, Qwen3-4B と Qwen3-8B を Qwen3-1.7B-Base に蒸留する際の2つの失敗を観察した。
早期獲得、後期崩壊:潜伏監視単独で10ステップで25から46までMATH-500の精度を引き上げるが、その後のトレーニングでは回復することなく11に低下する。
アライメントの基準は、この崩壊を通じて着実に改善されるが、最も整列したモデルは、最悪のパフォーマンスであることが判明した。
さらに分析した結果、潜伏信号の応用方法のミスマッチが示唆されている: 奥行きによってペアリングされた層は、2つのモデルで異なる役割を担っているため、継続的なアライメントは、教師が理解できない状態に学生を引き寄せる可能性がある。
これを解決するためにLastOPDを提案する。LastOPDは、最後の層状態にのみ潜時信号を適用し、LMヘッドの共通インタフェースを読み取り、トークンレベルPDへの10ステップのクロスフェイド時にのみ適用する。
これは潜伏信号の有用な部分を保持し、崩壊が起こる前に学生にトークンレベルの監督を任せる。
大規模な実験により、LastOPDはトークンのみのPDよりも5.55点、および4.02点のMATH-500を改良し、4Bと8Bの教師はほとんどの保持されたデータセットを導き、トークンのみのPDの最終スコアを約半分で達成した。
コードはhttps://github.com/Muyiiiii/LastOPD.comで入手できる。
関連論文リスト
- A Token-Level Analysis of Sampled-Token Reverse-KL On-Policy Distillation [59.43605629311855]
学生ログに対する逆KLのトーケンK2推定器の勾配を解析した。
そこで我々は,SuReを1つの経験的インスタンス化として,K2推定器で訓練した逆KL OPDの勾配レベル評価を行った。
論文 参考訳(メタデータ) (2026-08-26T11:14:42Z) - WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training [48.290951447286744]
WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
論文 参考訳(メタデータ) (2026-08-10T11:22:53Z) - OPRD: On-Policy Representation Distillation [30.278946794750976]
オンライン蒸留(OPD)は、次の確率に合わせて出力空間でのみ学生を監督する。
本研究では,学生と教師の表現を選択層に整列させることで,蒸留を隠れ状態空間に引き上げるOn-Policy Representation Distillation (OPRD)を提案する。
OPRD は AIME 2024/2025 と AIMO の生徒と教師のギャップを埋める。
論文 参考訳(メタデータ) (2026-06-04T11:13:01Z) - Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation [81.10000755917712]
オンライン蒸留は,教師からのトークンレベルのフィードバックを用いて,学生モデルを自作の軌道上で訓練することにより,推論能力を伝達する。
生徒が生成した接頭辞が長くなるにつれて、教師の次点の分布は自信を減らし、差別性が低下する。
SFDを緩和するため, textbfLookahead Group Reward (ours) を導入する。
論文 参考訳(メタデータ) (2026-05-29T04:39:20Z) - Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation [28.572361799234784]
生のKL不一致が学習価値の粗いプロキシであることを示す。
我々はこの局所的な互換性をトークンの教育可能性として定式化する。
軽量なトークン配置選択法であるTeachability-Aware OPDを提案する。
論文 参考訳(メタデータ) (2026-05-26T10:56:46Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z) - Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes [31.95045602299568]
オンライン蒸留(OPD)は,教師の学習履歴ではなく,学生が生み出すロールアウトに対するフィードバックを評価するため,大規模言語モデル(LLM)のポストトレーニングにアピールしている。
推定器と実装側からOPDを再検討する。
不均衡な1-token信号、学生が生成した接頭辞に対する教師の信頼できない指導、トークン化器や特殊-tokenミスマッチによる歪みの3つの失敗モードを同定する。
論文 参考訳(メタデータ) (2026-03-26T15:35:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。