論文の概要: On-Policy Distillation with Negative-Policy Rollouts
- arxiv url: http://arxiv.org/abs/2610.07874v1
- Date: Tue, 06 Oct 2026 07:25:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.866662
- Title: On-Policy Distillation with Negative-Policy Rollouts
- Title(参考訳): 負極性ロールアウトによるオンポリシィ蒸留
- Abstract要約: オンライン蒸留(英: On-policy distillation、OPD)は、学生モデルが自身のロールアウトでより強い教師からトークンレベルの監督を取得するポストトレーニング手法である。
我々は,教師の監督と低パフォーマンスで低能力なネガティブポリシーのロールアウトを補完するNegative-Policy OPD(NP-OPD)を導入する。
NP-OPDは、OPDで使用される正の教師監督を保ちながら、負の政治的ロールアウトを通じて明確な負のシグナルを提供する。
- 参考スコア(独自算出の注目度): 61.76889440384448
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy distillation (OPD) has been widely studied as a post-training method in which a student model obtains token-level supervision from a stronger teacher on its own rollouts. Recent studies have improved OPD through alternative distillation reward formulations and teacher configurations, while the objective of distillation remains centered on mimicking the teacher. However, when a stronger teacher has limited distributional overlap with the student, such positive guidance can provide insufficient learning signals. In this work, we introduce Negative-Policy OPD (NP-OPD), which complements teacher supervision with rollouts from a lower-performing, lower-capability negative policy that serves as a negative reference for the student. Rather than modifying the distillation reward formulation, NP-OPD introduces the negative policy at the rollout stage, continuously supplying tokens preferred by the negative policy over the teacher so that they remain exposed to teacher supervision throughout training. This provides an explicit negative signal through negative-policy rollouts while preserving the positive teacher supervision used in OPD. Through extensive experiments, we show that NP-OPD improves OPD across model scales, generation modes, reasoning domains, and different OPD variants. Furthermore, our analyses show that NP-OPD effectively suppresses tokens preferred by the negative policy over the teacher and moves the student away from the negative policy. These results support our design of introducing negative signals through negative-policy rollouts and provide new insight into the role of the rollout policy in OPD. Code will be available at https://github.com/naver-ai/np-opd.
- Abstract(参考訳): オンライン蒸留(OPD)は、学生モデルがより強い教師から自身のロールアウトでトークンレベルの監督を受けるポストトレーニング手法として広く研究されている。
近年の研究では、代替蒸留報酬の定式化や教師構成によるPDの改善が試みられているが、蒸留の目的は、教師の模倣に焦点を絞ったままである。
しかし、強い教師が生徒と分布の重なりが限られている場合、そのような肯定的な指導は、不十分な学習信号を与えることができる。
本研究では,教師の指導を補完するネガティブ・ポリシィOPD(NP-OPD)を導入し,低パフォーマンスで低能力なネガティブ・ポリシーを学生のネガティブ・レファレンスとして採用する。
NP-OPDは、蒸留報酬の定式化を変更するのではなく、ロールアウト段階で負の政策を導入し、教師に対して負の政策が好まれるトークンを継続的に供給し、教師の指導に晒されるようにした。
これは、OPDで使用される正の教師監督を保ちながら、負の政治的ロールアウトを通じて明確な負のシグナルを提供する。
実験により、NP-OPDはモデルスケール、生成モード、推論領域、異なるOPD変異をまたいだOPDを改善することを示す。
さらに, NP-OPDは, 教師に対する負の政策に好まれるトークンを効果的に抑制し, 学生を負の政策から遠ざけることを示した。
これらの結果は、負のポリティクスのロールアウトを通じて負のシグナルを導入する設計を支持し、OPDにおけるロールアウトポリシーの役割に関する新たな洞察を提供する。
コードはhttps://github.com/naver-ai/np-opd.comから入手できる。
関連論文リスト
- Is Better Teacher Supervision Enough? Unlocking Student-side Learning in Multimodal On-Policy Distillation [38.496745535296945]
オンライン蒸留(OPD)は、学生自身の軌道上の教師からトークンレベルの監督を提供することにより、推論を改善する。
S-OPDは,学生の知覚学習を明示的に強化するシンプルなマルチモーダルオンライン蒸留フレームワークである。
我々のメソッドは既存のOPDフレームワークにシームレスにプラグインすることができ、追加のデータアノテーション、モデルパラメータ、推論操作を必要としない。
論文 参考訳(メタデータ) (2026-09-30T06:55:48Z) - On the Off-Policy Teacher in On-Policy Distillation [18.925850684279197]
SCOUT(Student-Conditioned Updates of the Teacher)は、教師を学生が作成したプレフィックスに適応させる学習フレームワークである。
SCOUTは,学生が生成した接頭辞から継続する教師の能力を向上し,学生条件の教師適応の意図したメカニズムを支持する。
論文 参考訳(メタデータ) (2026-09-29T18:22:05Z) - Teacher Should Think Ahead: Adaptive Continuations for Reliable On-Policy Distillation [29.726128117466956]
不完全または低品質の学生接頭辞を条件にした場合,教師の指導は信頼できないことを示す。
本稿では,教師の継続を伴って学生のロールアウトに伴う情報伝達状態を増強する適応継続オン・ポリティ蒸留(AC-OPD)を提案する。
論文 参考訳(メタデータ) (2026-09-06T07:08:41Z) - SAGE-OPD: Selective Agent-Guided Intervention for Multi-Turn On-Policy Distillation [25.25989941933095]
マルチターンOPD用に設計された検証不要な選択的介入フレームワークであるSAGE-OPDを提案する。
SAGE-OPDは、教師の監督を全ターンで均一に行うのではなく、まず環境フィードバックを観察し、各生徒の反応をスキップするか介入するかを決定するために教師の判断を使用する。
エージェントタスクの実験では、SAGE-OPDはベースラインよりも一貫して改善され、ALFWorldの13.3%の相対的な改善を実現している。
論文 参考訳(メタデータ) (2026-06-17T23:58:14Z) - Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients [89.89504265663057]
近親政策最適化ゾーン(ZPPO)は、ヴィゴツキーの近親開発ゾーンに触発されたものである。
ZPPOは1つの正しい教師の反応と1つの間違った学生の反応を、生徒が識別しなければならない匿名候補としてペアリングする。
プロンプト再生バッファは、生徒の平均ロールアウト精度が半分に達するか、FIFOが削除されるまで、各難問を再循環する。
論文 参考訳(メタデータ) (2026-06-16T17:46:02Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - Teacher-Guided Policy Optimization for LLM Distillation [90.49982387646861]
Teacher-Guided Policy Optimization (TGPO) は、生徒のロールアウトに条件付き教師予測を活用することで、高密度な方向性誘導を取り入れたオンラインアルゴリズムである。
複雑な推論ベンチマークの実験では、TGPOは標準ベースラインを著しく上回り、異なる教師にとって堅牢であることが示されている。
論文 参考訳(メタデータ) (2026-05-13T09:20:03Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。