論文の概要: On-Policy Delta Distillation
- arxiv url: http://arxiv.org/abs/2607.15161v1
- Date: Thu, 16 Jul 2026 16:07:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.171897
- Title: On-Policy Delta Distillation
- Title(参考訳): On-Policy Delta 蒸留
- Authors: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han,
- Abstract要約: オンライン蒸留は強化学習における代替のポストトレーニング手法である。
我々は,教師の出力分布を直接模倣するのではなく,デルタ信号と呼ばれる新しい蒸留報酬を導入する。
デルタ信号はオンライン蒸留を著しく改善し、新しい蒸留法をオンポリシィデルタ蒸留(OPD$2$)と呼ぶ。
- 参考スコア(独自算出の注目度): 61.76889440384448
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy distillation is an alternative post-training method in reinforcement learning that alleviates the constraints imposed by reward models by providing token-level supervision from a teacher model. Although on-policy distillation has been studied and applied across various settings, its fundamental design remains underexplored. In this paper, we introduce a new distillation reward, termed the delta signal, instead of directly imitating the teacher's output distribution. The delta signal is defined as the difference between the teacher model and its base model prior to instruction tuning for reasoning capability. It therefore captures the changes induced by reasoning tuning and provides a more direct signal for transferring reasoning capabilities. Using extensive empirical evidence, we show that the delta signal substantially improves on-policy distillation and refer to the new distillation method as On-Policy Delta Distillation (OPD$^2$). Experiments across mathematics, science, and code-reasoning benchmarks demonstrate that OPD$^2$ consistently outperforms conventional on-policy distillation, enabling reasoning LLMs to achieve strong performance with only a short post-training period. Code will be available at https://github.com/naver-ai/opd2
- Abstract(参考訳): オンライン蒸留は、教師モデルからトークンレベルの監督を提供することで、報酬モデルによって課される制約を緩和する強化学習における代替のポストトレーニング手法である。
オンライン蒸留は様々な場面で研究・適用されてきたが、基本設計は未検討のままである。
本稿では,教師の出力分布を直接模倣するのではなく,デルタ信号と呼ばれる新しい蒸留報酬を導入する。
デルタ信号は、推論能力の指導チューニングの前に教師モデルと基本モデルとの差として定義される。
そのため、推論チューニングによって引き起こされる変化を捉え、推論能力を伝達するためのより直接的な信号を提供する。
大規模実証実験により, デルタ信号はオンライン蒸留を著しく改善し, 新たな蒸留法をオン・ポリシィデルタ蒸留(OPD$^2$)と呼ぶことを示した。
数学、科学、コード推論のベンチマークによる実験では、PD$^2$は従来のオン・ポリケート蒸留よりも一貫して優れており、LCMは短い訓練期間でのみ強力な性能を達成できることを示した。
コードはhttps://github.com/naver-ai/opd2で公開される。
関連論文リスト
- DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation [49.98710755440242]
蒸留により、コンパクトなビジョンランゲージモデル(VLM)が強力な推論能力を得ることができる。
標準チャート/文書推論データセットにおけるプロンプトの最大69%は、事実上ゼロデルタである。
既存のデータセットをシードとして再利用し、学生の障害モードを積極的にターゲットとして、より良いプロンプトを生成するためのステージド合成パイプラインを提案する。
論文 参考訳(メタデータ) (2026-05-15T02:04:12Z) - Validity-Calibrated Reasoning Distillation [4.277471273303775]
推論蒸留は、大規模言語モデルからより小さく、より効率的なものへの多段階推論能力を伝達することを目的としている。
近年の手法は静的教師の階層化と軌道模倣としてのフレーム蒸留に依存している。
本稿では, 局所的な学習信号割り当ての問題として, 推論蒸留を取り扱う枠組みである妥当性校正推論蒸留を提案する。
論文 参考訳(メタデータ) (2026-04-14T12:32:12Z) - PACED: Distillation and Self-Distillation at the Frontier of Student Competence [17.384089089363382]
Pacedは、近縁開発ゾーンに蒸留を集中させるフレームワークである。
逆KLを持つ命令調整モデルでは、ゲインはベースラインを超える。
フォワードKL-then-reverse-KLスケジュールは、我々の設定において最強の結果をもたらす。
論文 参考訳(メタデータ) (2026-03-11T18:00:05Z) - Towards Training One-Step Diffusion Models Without Distillation [72.80423908458772]
我々は,教師のスコア管理を完全に禁止する,新しい研修方法のファミリーを紹介する。
教師の重みによる学生モデルの初期化は依然として重要な課題である。
論文 参考訳(メタデータ) (2025-02-11T23:02:14Z) - Knowledge Distillation with Refined Logits [31.205248790623703]
本稿では,現在のロジット蒸留法の限界に対処するため,Refined Logit Distillation (RLD)を導入する。
我々のアプローチは、高性能な教師モデルでさえ誤った予測をすることができるという観察に動機づけられている。
本手法は,教師からの誤解を招く情報を,重要なクラス相関を保ちながら効果的に排除することができる。
論文 参考訳(メタデータ) (2024-08-14T17:59:32Z) - Unbiased Knowledge Distillation for Recommendation [66.82575287129728]
知識蒸留(KD)は推論遅延を低減するためにレコメンダシステム(RS)に応用されている。
従来のソリューションは、まずトレーニングデータから完全な教師モデルを訓練し、その後、その知識を変換して、コンパクトな学生モデルの学習を監督する。
このような標準的な蒸留パラダイムは深刻なバイアス問題を引き起こし、蒸留後に人気アイテムがより強く推奨されることになる。
論文 参考訳(メタデータ) (2022-11-27T05:14:03Z) - Knowledge distillation via adaptive instance normalization [52.91164959767517]
本稿では,教師から生徒への特徴統計の伝達に基づく新しい知識蒸留法を提案する。
本手法は,教師に類似する生徒の平均と分散を強制する標準的な方法を超えている。
以上の結果から, 蒸留法は他の蒸留法よりも高い性能を示した。
論文 参考訳(メタデータ) (2020-03-09T17:50:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。