論文の概要: Reward-Gated On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2607.04037v1
- Date: Sat, 04 Jul 2026 21:51:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.803529
- Title: Reward-Gated On-Policy Distillation
- Title(参考訳): Reward-Gated On-Policy 蒸留
- Abstract要約: オンライン蒸留は、強い教師から小さな学生に推論能力を伝達する強力な方法である。
RG-OPD: Reward-Gated On-Policy Distillationは、検証者フィードバックを用いて、教師のログがいつ信頼できるかを決定する。
RG-OPDは、推論とコーディングのベンチマークを通じて、より強い蒸留学生を生み出し、バニラ逆KL蒸留と最近のTLD-KDベースラインの両方を上回ります。
- 参考スコア(独自算出の注目度): 58.187458236302575
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation is a powerful way to transfer reasoning ability from a strong teacher to a smaller student: the student samples trajectories from its own policy, and the teacher provides dense token-level supervision on the states the student actually visits. However, this supervision is not always reliable: a teacher can assign high likelihood to plausible but incorrect solutions, or low likelihood to correct student solutions that follow different reasoning paths. Unconditionally distilling the teacher can therefore reinforce bad modes or erase useful student behavior. To address these limitations, we introduce RG-OPD: Reward-Gated On-Policy Distillation that uses verifier feedback to decide when teacher logits should be trusted. RG-OPD bridges sparse verifier rewards and dense teacher logits, preserving token-level supervision while filtering misleading teacher signals. Across reasoning and coding benchmarks, RG-OPD produces stronger distilled students, outperforming both vanilla reverse-KL distillation and the recent TSD-KD baseline. At 1K generation length, RG-OPD improves over reverse-KL by 2.9 points and over TSD-KD by 4.9 points; in the long-generation setting, it improves over the untuned student by 8.2 points. Our code is available at https://github.com/UoC-tail/RG-OPD.
- Abstract(参考訳): オンライン蒸留は、強力な教師からより小さな学生に推論能力を伝達する強力な方法であり、生徒は自身の方針から軌道をサンプリングし、教師は学生が実際に訪れている州について密集したトークンレベルの監督を行う。
しかし、この監督は必ずしも信頼できない:教師は、妥当だが誤った解に高い確率を割り当てたり、異なる推論経路に従う生徒の解を補正する確率を低くすることができる。
教師を無条件で蒸留すると、悪いモードが強化されるか、有用な生徒の行動が消去される。
Reward-Gated On-Policy Distillation では,教師のロジットをいつ信頼すべきかを検証器のフィードバックで判断する。
RG-OPDブリッジはスパース検証器の報酬と密集した教師のロジットを渡し、誤解を招く教師の信号をフィルタリングしながらトークンレベルの監視を保持する。
RG-OPDは、推論とコーディングのベンチマークを通じて、より強い蒸留学生を生み出し、バニラ逆KL蒸留と最近のTLD-KDベースラインの両方を上回ります。
1K生成長では、RG-OPDは逆KLを2.9ポイント、TSD-KDを4.9ポイント改善する。
私たちのコードはhttps://github.com/UoC-tail/RG-OPD.comで公開されています。
関連論文リスト
- Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation [37.73879161170101]
オンライン蒸留(OPD)は、学生自身のロールアウトにおいて、凍結した教師から密集したトークンレベルの監督を提供することによって、ポストトレーニングを加速する。
Vanilla OPDは、教師が各プロンプトに対して信頼できるかどうかを確認することなく、この監督をプロンプト全体に均一に適用する。
本稿では,教師の信頼性を高密度監督が認められる前に早期に検証すべきという原則に基づくTGOPD(Teacher-Gated On-Policy Distillation)を紹介する。
論文 参考訳(メタデータ) (2026-09-02T17:54:09Z) - Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation [18.893534946567218]
オンライン蒸留(On-policy distillation、OPD)は、学生が訪れた州を教師が監督する制度である。
本稿では,教師の短い橋渡しを行うFutureBridge-OPD(FTB)を提案する。
Qwen3-32Bの主教師がQwen3-1.7Bの学生設定で、FTBはバニラOPDとTCODを平均16.6点、7.6点で上回っている。
論文 参考訳(メタデータ) (2026-08-03T09:25:42Z) - Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation [81.10000755917712]
オンライン蒸留は,教師からのトークンレベルのフィードバックを用いて,学生モデルを自作の軌道上で訓練することにより,推論能力を伝達する。
生徒が生成した接頭辞が長くなるにつれて、教師の次点の分布は自信を減らし、差別性が低下する。
SFDを緩和するため, textbfLookahead Group Reward (ours) を導入する。
論文 参考訳(メタデータ) (2026-05-29T04:39:20Z) - Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation [28.572361799234784]
生のKL不一致が学習価値の粗いプロキシであることを示す。
我々はこの局所的な互換性をトークンの教育可能性として定式化する。
軽量なトークン配置選択法であるTeachability-Aware OPDを提案する。
論文 参考訳(メタデータ) (2026-05-26T10:56:46Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。