論文の概要: DualOPSD: Adaptive Privileged Teachers for On-Policy Self-Distillation
- arxiv url: http://arxiv.org/abs/2608.26019v1
- Date: Wed, 26 Aug 2026 17:01:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.924461
- Title: DualOPSD: Adaptive Privileged Teachers for On-Policy Self-Distillation
- Title(参考訳): DualOPSD:オン・ポリケーション・セルフ蒸留のための適応型プライヴィジェント・教師
- Authors: Yutong Chen, Guangfu Guo, Zhichao Xu, Kunpeng Liu,
- Abstract要約: On-policy Self-distillation (OPSD) は、学生モデルの特権的なコピーを使用して、外部教師がいなくても、厳密な監督を提供する。
両ポリシーを適応する非対称交互化フレームワークであるDualOPSDを提案する。
- 参考スコア(独自算出の注目度): 11.771522030770228
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy self-distillation (OPSD) uses a privileged copy of the student model to provide dense supervision without an external teacher. OPSD keeps this privileged teacher fixed, even though the student distribution and output style change during training. We propose DualOPSD, an asymmetric alternating framework that adapts both policies. The student first learns from the privileged teacher. The teacher then moves toward the updated student distribution on the same student trajectory. This update makes later supervision responsive to the learner and does not require another rollout. On Qwen3-8B in non-thinking mode, DualOPSD improves avg@12 over OPSD by 23.61, 13.89, and 10.00 points on AIME 2024, AIME 2025, and HMMT 2025. Results at 1.7B and 4B show that the accuracy gain depends on model scale. Across all three scales, DualOPSD reduces truncation. The 4B diagnostic also shows lower KL in both directions between the teacher and student.
- Abstract(参考訳): On-policy Self-distillation (OPSD) は、学生モデルの特権的なコピーを使用して、外部教師がいなくても、厳密な監督を提供する。
OPSDは、訓練中に生徒の分布や出力スタイルが変化しても、この特権教師を固定し続ける。
両ポリシーを適応する非対称交互化フレームワークであるDualOPSDを提案する。
その生徒はまず特権のある先生から学ぶ。
教師はその後、同じ学生軌道上の更新された学生分布に向かって進む。
このアップデートにより、後続の監視が学習者に応答し、追加のロールアウトを必要としない。
非思考モードのQwen3-8Bでは、DualOPSDはAIME 2024、AIME 2025、HMMT 2025上の23.61、13.89、および10.00ポイントでAvg@12を改善する。
1.7Bと4Bの結果、精度の上昇はモデルスケールに依存することが示された。
3つのスケールにまたがって、DualOPSDはトランケーションを低減する。
また,4B診断では,教師と学生の両方向のKLが低値であった。
関連論文リスト
- PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation [1.1440940588722308]
On-policy Self-distillation (OPSD) は、特権教師を用いて、自身のロールアウトからサンプリングされたプレフィックスの推論モデルを監督する。
PAST(Privleged Adaptation from Students Trajectories)を紹介する。
PASTは、学生の蒸留プレフィックスをそのまま残しながら、各学生軌跡をOPSD教師に追加の特権情報として扱う。
論文 参考訳(メタデータ) (2026-08-09T14:20:12Z) - Visual Contrastive Self-Distillation [61.298159957622886]
本稿では,視覚的コントラスト自己蒸留法を提案する。
これと対照的に,本研究では,教師の具体的イメージ分布の明確化を図り,その結果のフルディストリビューション目標を学生に蒸留する。
論文 参考訳(メタデータ) (2026-07-23T17:37:37Z) - OPOD: On-Policy Omni Distillation [55.440058537827134]
プール化されたマルチモーダルデータ上で単一のモデルをトレーニングすることは、個々のモダリティに特化したモデルにマッチしないことが多い。
本報告では,オムニ蒸留法(Omni Distillation,OPD)について述べる。
OPDは各スケールで最高のスコアを獲得し、70.8、51.7、46.2に達した。
論文 参考訳(メタデータ) (2026-07-23T04:55:04Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning [45.79647925282674]
On-policy Self-distillation (OPSD) は、特権教師を使って生徒を自身のロールアウトで訓練する。
既存のエントロピーに基づくPD手法は、教師エントロピーによるトークンレベルの監督を調節することで、この一様性を緩和する。
そこで我々は,PW-OPSD(Pight-Weighted On-Policy Self-Distillation)を提案する。
論文 参考訳(メタデータ) (2026-05-20T18:14:03Z) - Adaptive Teacher Exposure for Self-Distillation in LLM Reasoning [2.9029480541171107]
そこで我々は, 自己蒸留を推論するための効果的な新しい軸として, 適応型教師曝露を提案する。
適応型自己蒸留(ATESD)は, 競争力のある自己蒸留とRLベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-05-12T03:15:58Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。