論文の概要: Not Every Token Is Worth Distilling: Selective Supervision for Direct-OPD
- arxiv url: http://arxiv.org/abs/2609.29142v1
- Date: Thu, 24 Sep 2026 07:19:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.767543
- Title: Not Every Token Is Worth Distilling: Selective Supervision for Direct-OPD
- Title(参考訳): 直接のOPDのための選択的なスーパービジョン
- Abstract要約: ダイレクト・オン・ポリシィ蒸留(Direct-OPD)は、強化学習による政策改善を小さなモデルからより大きな学生に伝達する。
我々は,Jensen-Shannon divergence (JSD) とチェックポイント間のKL方向の両方が,この質量で消滅する一方,Direct-OPD報酬とその更新は変化しないことを示す。
そこで我々は,教師参照型JSDとマスクによる学生選抜型直接OPD (S$2$D-OPD) の選抜スーパービジョンを提案する。
- 参考スコア(独自算出の注目度): 16.118426268651685
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Direct On-Policy Distillation (Direct-OPD) transfers reinforcement-learning-induced policy improvements from a small model to a larger student by using the token-level log-ratio between post-RL and pre-RL checkpoints as dense supervision on the student's own rollouts. This transfer rewards the policy shift at every state, yet the log-ratio measures only relative change: it can stay fixed even as the probability mass that both checkpoints assign to the student's candidate tokens vanishes. Through an exact construction, we show that the Direct-OPD reward and its update can remain unchanged while the Jensen-Shannon divergence (JSD) and both KL directions between the checkpoints vanish with this mass, and we note that a small JSD bounds how much the teacher's behavior changed. Motivated by this analysis, we propose Selective Supervision for Direct-OPD (S$^2$D-OPD), which ranks student-sampled states by their teacher-reference JSD and masks Direct-OPD supervision at low-divergence states, retaining only the top 10% of states per response. Across two teacher pairs and four student models ranging from 1.7B to 8B parameters, S$^2$D-OPD improves held-out accuracy over dense Direct-OPD on AIME and HMMT benchmarks in seven of eight settings and matches it in the eighth, without extra forward passes. Our code is available at https://anonymous.4open.science/r/S2D-OPD-8868.
- Abstract(参考訳): ダイレクト・オン・ポリシィ蒸留(Direct-OPD)は、学生自身のロールアウトの厳密な監督として、ポストRLとプレRLチェックポイントのトークンレベル対数比を用いて、強化学習による政策改善を小さなモデルからより大きな学生に転送する。
この転送は、全ての状態におけるポリシーシフトに報酬を与えるが、対数比は相対的な変化のみを測る: 両方のチェックポイントが学生の候補トークンに割り当てる確率の質量が消えても、固定される。
厳密な構成により,Jensen-Shannon divergence (JSD) とチェックポイント間のKL方向の両方が消失する一方で,Direct-OPD報酬とその更新が変化しないことを示す。
そこで本研究では,教師によるJSDとマスクによる学生用サンプル状態のランク付けを行うS$2$D-OPD(Selective Supervision for Direct-OPD)を提案する。
2つの教師ペアと1.7Bから8Bパラメータの4つの学生モデルにまたがって、S$^2$D-OPDは8つの設定のうち7つのAIMEおよびHMMTベンチマークにおいて、高密度なDirect-OPDよりもホールドアウト精度を改善し、余分なフォワードパスなしで8番目の設定で一致させる。
私たちのコードはhttps://anonymous.4open.science/r/S2D-OPD-8868で公開されています。
関連論文リスト
- Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation [37.73879161170101]
オンライン蒸留(OPD)は、学生自身のロールアウトにおいて、凍結した教師から密集したトークンレベルの監督を提供することによって、ポストトレーニングを加速する。
Vanilla OPDは、教師が各プロンプトに対して信頼できるかどうかを確認することなく、この監督をプロンプト全体に均一に適用する。
本稿では,教師の信頼性を高密度監督が認められる前に早期に検証すべきという原則に基づくTGOPD(Teacher-Gated On-Policy Distillation)を紹介する。
論文 参考訳(メタデータ) (2026-09-02T17:54:09Z) - Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher [36.07614733558147]
フローマッチングモデルのための教師なしOPDフレームワークである textbfSelf-OPD を紹介する。
Self-OPDは決定論的次状態予測を$K$SDE候補に分割し、ODEサンプルとロールアウトして、決定論的自己参照ベースラインと比較する。
単品と混合報酬のベンチマーク実験により、セルフOPDはタスク固有の教師を伴わずに、以前のRLとOPDメソッドよりも優れていた。
論文 参考訳(メタデータ) (2026-08-27T09:34:23Z) - DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation [9.897015521661915]
オンライン蒸留(OPD)は、露光バイアスを減らすために学生モデルを自身のロールアウトで訓練する。
既存のカリキュラム学習手法は、学習の進捗に応じてどの程度の教師支援が使われているかを規定するが、いつ必要かは決定できない。
DASH-OPDは,実行者を適応的に双方向に切り替える新しいエージェントOPD法である。
論文 参考訳(メタデータ) (2026-07-31T06:57:17Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - Reward-Gated On-Policy Distillation [58.187458236302575]
オンライン蒸留は、強い教師から小さな学生に推論能力を伝達する強力な方法である。
RG-OPD: Reward-Gated On-Policy Distillationは、検証者フィードバックを用いて、教師のログがいつ信頼できるかを決定する。
RG-OPDは、推論とコーディングのベンチマークを通じて、より強い蒸留学生を生み出し、バニラ逆KL蒸留と最近のTLD-KDベースラインの両方を上回ります。
論文 参考訳(メタデータ) (2026-07-04T21:51:22Z) - DemoPSD: Disagreement-Modulated Policy Self-Distillation [49.30809363804017]
大規模言語モデルを訓練するための実践的な方法として、オンデマンド自己蒸留が登場している。
DemoPSDは、教師と生徒の分布の重み付けされた幾何学的組み合わせに向けて学生を操縦する。
論文 参考訳(メタデータ) (2026-07-02T17:58:29Z) - Blockwise Policy-Drift Gating for On-Policy Distillation [14.61751557296924]
オンライン蒸留(OPD)は、学生自身によってサンプリングされた軌跡に基づいて計算された教師信号を用いて生徒の政策を訓練する。
本稿では,OPDをロールアウト再利用するための軽量な学生専用ドリフトコントローラであるブロックワイド・ポリシー・ドリフト・ゲーティングを紹介する。
論文 参考訳(メタデータ) (2026-06-23T02:58:16Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。