論文の概要: DOPD: Dual On-policy Distillation
- arxiv url: http://arxiv.org/abs/2606.30626v1
- Date: Mon, 29 Jun 2026 17:55:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.371737
- Title: DOPD: Dual On-policy Distillation
- Title(参考訳): DOPD:デュアルオン政治蒸留
- Authors: Xinlei Yu, Gen Li, Qingyi Si, Guibin Zhang, Yuqi Xu, Congcong Wang, Shuai Dong, Kaiwen Tuo, Xiangyu Zeng, Kaituo Feng, Qunzhong Wang, Yang Shi, Xiaobin Hu, Xiangyu Yue, Jiaqi Wang, Shuicheng Yan,
- Abstract要約: オンライン蒸留は、高密度のトークンレベルの信号で学生サンプルの軌跡を監督することで、優れた容量転送を提供する。
特権教師と特権学生の政策の間のトークンレベルの監督を動的にルーティングするアドバンテージ・アウェアな二重蒸留パラダイムであるDOPDを提案する。
大きな言語モデル(LLM)と視覚言語モデル(VLM)の両方の実験は、DOPDがバニラPDを一貫して上回っていることを示している。
- 参考スコア(独自算出の注目度): 59.65986569617147
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation (OPD) offers superior capacity transfer by supervising student-sampled trajectories with dense token-level signals. To furnish high-quality supervision sources and thereby elevate the performance frontier of distillation, an intuitive direction is to infuse privileged information to either teacher or student itself. However, this additional input induces a potential failure mode we dub privilege illusion: a pattern that conflates the transferable capability gap that students are meant to close, and the information asymmetry gap that can only be mimicked but never replicated. This issue is further amplified by the inherent non-uniformity of token-level supervision, where only a small subset of tokens carries pivotal capability-bearing signals. To this end, we propose DOPD, an advantage-aware dual distillation paradigm that dynamically routes token-level supervision between privileged teacher and privileged student policies based on their advantage gap and relative probabilities. Each token receives supervision of different strength, objective, and strategy from either teacher or student itself, which transfers credible capability while simultaneously receiving auxiliary signals, to alleviate privilege illusion. Extensive experiments on both large language model (LLM) and vision-language model (VLM) settings demonstrate that DOPD consistently outperforms Vanilla OPD and other counterparts. Further results on stability, robustness, continual learning, and out-of-distribution tasks validate its superiority.
- Abstract(参考訳): オンライン蒸留(OPD)は、高密度のトークンレベルの信号で学生サンプルの軌跡を監督することにより、優れた容量転送を提供する。
高品質な監督源を設けて蒸留の性能フロンティアを高めるためには、教師または学生自身に特権情報を注入する直感的な方向が求められる。
しかし、この追加入力は、学生が閉じることを意図した伝達可能な能力ギャップと、模倣できるが複製されない情報非対称性ギャップを融合させるパターンという、特権錯覚を隠蔽する潜在的な失敗モードを誘発する。
この問題は、トークンレベルの監督の固有の非一様性によってさらに増幅され、トークンの小さなサブセットだけが重要な能力を持つ信号を運ぶ。
この目的のために,特権教師と特権学生の政策間のトークンレベルの監督を,その優位性と相対的確率に基づいて動的にルーティングする,アドバンテージ・アウェアな二重蒸留パラダイムであるDOPDを提案する。
各トークンは、教師または生徒自身から異なる強度、目的、戦略の監督を受け、同時に補助的な信号を受けながら信用能力の伝達を行い、特権的錯覚を和らげる。
大きな言語モデル(LLM)と視覚言語モデル(VLM)の両方に関する大規模な実験は、DOPDがVanilla OPDや他のモデルよりも一貫して優れていることを示している。
安定性、堅牢性、継続的な学習、アウト・オブ・ディストリビューションタスクのさらなる結果は、その優位性を検証する。
関連論文リスト
- OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing [62.62736813348113]
大規模言語モデルの強化学習は、複雑な推論タスクにおいて深刻な報酬の分散によって妨げられることが多い。
我々は,フロンティア生成論理を教師側の特権的証拠として利用するフレームワークであるOmniOPSDを提案する。
MER-UniBenchの実験では、OmniOPSDは平均スコアが84.19ドルで最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2026-06-14T16:51:22Z) - Beyond Absolute Imitation: Anchored Residual Guidance for Privileged On-Policy Distillation [9.745547158215905]
我々は、特権的監督を阻害するデュアルビューフレームワークであるAnchored Residual On-Policy Distillation (AR-OPD)を紹介する。
AR-OPDはフル特権のPDを2.3ポイント、SFTを7.9ポイント上回る。
論文 参考訳(メタデータ) (2026-06-09T03:51:41Z) - EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation [5.310892696470208]
On-Policy Distillation (OPD)はLLMポストトレーニングパラダイムとして広く注目を集めている。
このアプローチの課題は、特権情報によって、意図よりもモデル行動を変えることができることだ。
EviDence GuidEd On-Policy Distillation (EDGE-OPD)を提案する。
論文 参考訳(メタデータ) (2026-05-22T10:55:15Z) - Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe [53.40076304466524]
LLM(Large Language Models)とMLLM(Multimodal Large Language Models)をまたいで一般化する統一OPDフレームワークであるUni-OPDを提案する。
具体的には、学生の立場から、学習中の情報発信状態の探索を促進するために、2つのデータバランス戦略を採用する。
我々は,正しい軌道と間違った軌道の順序の整合性を取り戻すために,結果誘導マージンキャリブレーション機構を開発した。
論文 参考訳(メタデータ) (2026-05-05T12:15:21Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z) - "The Whole Is Greater Than the Sum of Its Parts": A Compatibility-Aware Multi-Teacher CoT Distillation Framework [16.96094045628127]
CoT(Chain-of-Thought)推論は、大きな言語モデル(LLM)に優れた能力を与えるが、通常は禁止的なパラメータスケールを必要とする。
CoT蒸留は、推論技術をコンパクトな学生モデル(SLM)に伝達するための有望なパラダイムとして登場した。
我々は,教師の勾配を動的に重み付けすることで,教師の指導を適応的に融合させるフレームワークCompactを紹介する。
論文 参考訳(メタデータ) (2026-01-20T14:05:19Z) - AdaSwitch: Adaptive Switching Generation for Knowledge Distillation [58.647880811071495]
スモール言語モデル(SLM)は、厳密な待ち時間と計算制約のあるアプリケーションには不可欠である。
トークンレベルでのオン・ポリティクスとオフ・ポリティクス・ジェネレーションを組み合わせた新しいアプローチであるAdaSwitchを提案する。
AdaSwitchは一貫して精度を向上し、SLMを蒸留するための実用的で効果的な方法を提供し、追加のオーバーヘッドを許容する。
論文 参考訳(メタデータ) (2025-10-09T06:38:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。