論文の概要: Learning Beyond Full Imitation: Task-Preserving Knowledge Distillation
- arxiv url: http://arxiv.org/abs/2609.39338v1
- Date: Wed, 30 Sep 2026 09:06:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.482655
- Title: Learning Beyond Full Imitation: Task-Preserving Knowledge Distillation
- Title(参考訳): 完全な模倣を超えて学ぶ:タスク保存知識蒸留
- Abstract要約: 知識蒸留は、教師の予測クラス確率に適合するように学生に促すことによって知識を伝達する。
生徒は、既に教師よりもより鋭い正しいクラスを区別している可能性があるので、さらに模倣するためには、取得した差別を返さなければならない。
私たちの主な成果は、完全な模倣と条件学習の正確な分離です。
- 参考スコア(独自算出の注目度): 25.566171845063483
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Knowledge distillation transfers knowledge by encouraging a student to match a teacher's predicted class probabilities. These probabilities express not only confidence in the correct class, but also relations among incorrect alternatives. Yet closer imitation does not necessarily yield a better student. A student may already distinguish the correct class more sharply than its teacher, so further imitation can require giving back discrimination it has acquired. Our main result is an exact separation between full imitation and conditional learning. When the correct class's score advantage over each alternative must be preserved, full teacher-to-student KL minimization is blocked exactly when the student assigns no more probability than the teacher to every incorrect class. Crucially, the teacher's relative probabilities among incorrect classes remain fully learnable. We characterize the exact price of this transfer: a minimum increase in correct-class log-odds that compensates for the largest conditional-probability mismatch. Label fitting and conditional matching can therefore be completed even as full teacher KL diverges. This separation motivates task-preserving knowledge distillation (TPKD), which keeps the label gradient intact and minimally corrects the conditional gradient so that its output update preserves the label step's gains against every incorrect alternative. The corrected conditional direction retains more than half of the original first-order conditional descent at the same step size, with a tight bound. For a fixed positive conditional target and sufficiently small constant output steps, label and conditional errors vanish together. Experiments trace this learning from exact head updates to ordinary network training. TPKD reaches 88.05% accuracy on CIFAR-100 and 93.81% on CLINC150, improving over standard distillation by 0.47 and 0.35 percentage points across three seeds.
- Abstract(参考訳): 知識蒸留は、教師の予測クラス確率に適合するように学生に促すことによって知識を伝達する。
これらの確率は、正しいクラスに対する信頼だけでなく、誤った代替品間の関係も表す。
しかし、より近い模倣は必ずしも良い学生を生み出すとは限らない。
生徒は、既に教師よりもより鋭い正しいクラスを区別している可能性があるため、さらに模倣するためには、取得した差別を返却する必要がある。
私たちの主な成果は、完全な模倣と条件学習の正確な分離です。
それぞれの選択肢に対して正しいクラスのスコアの優位性を保持する必要がある場合、学生が教師以上の確率をすべての不正なクラスに割り当てない場合に、教師から学生までのKL最小化を正確にブロックする。
重大なこととして、教師の授業間での相対的確率は依然として完全に学習可能である。
この転送の正確な価格の特徴は、最大の条件-確率ミスマッチを補う正クラスログオードの最小値増加である。
したがって、完全な教師KLが分岐しても、ラベルフィッティングと条件マッチングが完了する。
この分離はタスク保存知識蒸留(TPKD)を動機付け、ラベルの勾配を一定に保ち、その出力更新がラベルのステップの利得を不正な代替品に対して保持するように条件の勾配を最小限に補正する。
補正された条件方向は、元の1階条件降下の半分以上を同じステップサイズで保持し、厳密なバウンドを有する。
固定された正条件目標と十分に小さな定値出力ステップに対して、ラベルと条件誤差は共に消滅する。
実験では、この学習を正確なヘッドアップデートから通常のネットワークトレーニングまで追跡する。
TPKDはCIFAR-100で88.05%、CLINC150で93.81%に達し、3つの種子で0.47と0.35ポイントの標準的な蒸留よりも改善されている。
関連論文リスト
- Unknown-Traffic Detection, Calibration and Shortcut Reliance in Distilled Encrypted-Traffic Classifiers over One Year [0.3384279376065155]
私たちは、他の生徒が教師から受け継いだものについて尋ねる。
私たちはCESNET-TLS-Year22で10の仮説をテストしました。
論文 参考訳(メタデータ) (2026-09-25T11:32:00Z) - Coupled Calibration and Learning: Mitigating Teacher Bias in LLM Distillation without Target-Domain Reward Feedback [24.756084698191568]
大きな言語モデル(LLM)蒸留は、強力な教師の能力をより小さな学生に伝達することを目的としている。
しかし、直接の模倣は教師の体系的な偏見や誤りを伝達することもある。
本稿では,教師の校正と生徒の更新を結びつけるアルゴリズムであるCoupled and Learning (CCL)を提案する。
論文 参考訳(メタデータ) (2026-09-15T17:15:40Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - ADS-C: Antidistillation Sampling for Classification [1.1458853556386797]
大規模言語モデルでは, 消毒サンプリングが提案されている。
我々は,その行動が教師一人当たりの信頼率の分布によって支配されていることを示す。
ADS-C法は, 実用コストが全くゼロな分類法としては, 初めての抗蒸留防御法である。
論文 参考訳(メタデータ) (2026-07-16T21:33:37Z) - Logit Standardization in Knowledge Distillation [83.31794439964033]
教師と学生の共用温度の仮定は、ロジット範囲と分散の点で、ロジット間の厳密な一致を暗示している。
温度をロジットの重み付け標準偏差として設定し、ロジット標準化のプラグアンドプレイZスコア前処理を実行することを提案する。
我々の前処理により、学生はマグニチュードマッチを必要とせず、教師の本質的なロジット関係に集中することができ、既存のロジットベースの蒸留法の性能を向上させることができる。
論文 参考訳(メタデータ) (2024-03-03T07:54:03Z) - Shrinking Class Space for Enhanced Certainty in Semi-Supervised Learning [59.44422468242455]
そこで我々はShrinkMatchと呼ばれる新しい手法を提案し、不確実なサンプルを学習する。
それぞれの不確実なサンプルに対して、元の Top-1 クラスを単に含むスランク類空間を適応的に求める。
次に、スランク空間における強と弱に強化された2つのサンプル間の整合正則化を課し、識別的表現を試みます。
論文 参考訳(メタデータ) (2023-08-13T14:05:24Z) - Asymmetric Temperature Scaling Makes Larger Networks Teach Well Again [27.560005691668223]
知識蒸留(KD)は、ニューラルネットワークの知識をより弱いものに伝達することを目的としている。
非対称温度スケーリング(ATS)は、正しい/強いクラスに高い/低い温度を別々に適用する。
理論的解析と広範囲な実験により,ATSの有効性が示された。
論文 参考訳(メタデータ) (2022-10-10T04:18:33Z) - Switchable Online Knowledge Distillation [68.2673580932132]
オンライン知識蒸留(OKD)は、教師と学生の違いを相互に活用することで、関係するモデルを改善する。
そこで我々は,これらの疑問に答えるために,スイッチブルオンライン知識蒸留(SwitOKD)を提案する。
論文 参考訳(メタデータ) (2022-09-12T03:03:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。