論文の概要: Rethinking the Role of Temperature in Large Language Model Distillation
- arxiv url: http://arxiv.org/abs/2606.00306v1
- Date: Fri, 29 May 2026 19:32:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.27107
- Title: Rethinking the Role of Temperature in Large Language Model Distillation
- Title(参考訳): 大規模言語モデル蒸留における温度の役割の再考
- Abstract要約: Reverse Kullback-Leibler (RKL) の拡散は, 大規模言語モデル (LLM) の蒸留において, 前方KL (FKL) よりも広く支持されている。
本研究では,FKLとRKLの比較を根本的に変えることを示す。
温度はFKLを非支配的なトークン信号で実質的に濃縮するが、RKL勾配を主に再スケールする。
- 参考スコア(独自算出の注目度): 5.957171492626586
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reverse Kullback-Leibler (RKL) divergence is widely favored over forward KL (FKL) in large language models (LLM) distillation, yet this preference is largely based on comparisons that omit the temperature $τ$, overlooking its central role in softening teacher distributions and improving knowledge transfer. In this work, we revisit temperature in LLM distillation and show that it fundamentally changes the comparison between FKL and RKL. Our analysis reveals an asymmetric effect: temperature substantially enriches FKL with non-dominant token signals, whereas it mainly rescales RKL gradients, causing FKL to benefit much more from $τ$ scaling than RKL. This asymmetry overturns the standard empirical conclusion: although RKL outperforms FKL at $τ=1$, FKL consistently surpasses RKL at higher temperatures across instruction-following benchmarks. Moreover, the impact of temperature is not limited to FKL; it improves a broader family of distillation objectives, enabling simple KL-based methods to achieve competitive performance against recent state-of-the-art LLM distillation approaches.
- Abstract(参考訳): Reverse Kullback-Leibler (RKL) の発散は, 大規模言語モデル (LLM) の蒸留において, KL (FKL) よりも広く好まれている。
本研究では, LLM蒸留における温度を再検討し, FKLとRKLの比較を根本的に変えることを示す。
温度は非支配的なトークン信号でFKLを実質的に濃縮するのに対し、主にRKL勾配を再スケールするので、FKLはRKLよりも$τ$のスケーリングの恩恵を受ける。
この非対称性は標準的な経験的結論を覆す: RKL は FKL を$τ=1$ で上回っているが、FKL は命令追従ベンチマークのより高い温度で常に RKL を上回っている。
さらに, 温度の影響はFKLに限らず, 蒸留目的の幅広いファミリーを改良し, 従来のLLM蒸留法と比較して, 簡易なKL法により競争性能が向上した。
関連論文リスト
- ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation [5.7913606195390885]
知識蒸留(KD)は大規模言語モデル(LLM)を圧縮する鍵となる技術である
理論的および経験的視点から分布アライメントにおける前方および後方KL分散(FKL/RKL)の相補的役割を解析した。
本稿では,教師の分散特性に基づいて,政策ネットワークがFKLとRKLに動的に重みを割り当てる,強化学習に基づく適応KL重み蒸留フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-29T07:05:56Z) - Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation [15.564152482735652]
本研究は, プレフィックスソースとトークンレベルKL方向の2つの選択肢を暗黙的に分けた, 代表的なパラダイム, オフ・ポリケーション蒸留, オン・ポリケーション蒸留について述べる。
KL混合とエントロピーゲート長のカリキュラムを提案する。
論文 参考訳(メタデータ) (2026-05-16T06:05:27Z) - Diversity-Aware Reverse Kullback-Leibler Divergence for Large Language Model Distillation [6.256286464835529]
本稿では、この勾配効果を除去し、RKLの最適化の利点を保ちつつ、非目標監視を強化するダイバーシティ対応RKL(DRKL)を提案する。
DRKLは、FKL、RKL、その他の最先端の蒸留目標を一貫して上回り、優れた性能と多様性のトレードオフを達成している。
論文 参考訳(メタデータ) (2026-03-31T20:39:47Z) - Reinforcement-aware Knowledge Distillation for LLM Reasoning [63.53679456364683]
強化学習(Reinforcement Learning, RL)ポストトレーニングは、最近、大型言語モデル(LLM)の長いチェーン・オブ・プリーティングにおいて、進歩をもたらした。
既存の知識蒸留法の多くは、教師による微調整(SFT)のために設計されており、固定された教師のトレースや教師の学生であるKulback-Leibler(KL)の発散に基づく正規化に依存している。
本稿では,RLにおける選択的な模倣を行うRL-aware distillation (RLAD)を提案する。
論文 参考訳(メタデータ) (2026-02-26T00:20:39Z) - A Comedy of Estimators: On KL Regularization in RL Training of LLMs [81.7906270099878]
強化学習(RL)は,大規模言語モデル(LLM)の推論性能を大幅に向上させる
LLMトレーニングのRLの目的は、トレーニングされたポリシーと参照ポリシーの間の逆のKL(Kullback-Leibler)分岐である正規化項を含む。
近年の研究では、KL正則化の実施が目的の正しい勾配を与えていないことが示されており、目的と実施の相違が生じている。
いくつかの推定器構成の勾配について検討し、設計選択が勾配バイアスをどう形成するかを明らかにする。
論文 参考訳(メタデータ) (2025-12-26T04:20:58Z) - A Theoretical Lens for RL-Tuned Language Models via Energy-Based Models [9.324642081509756]
KL正規化強化学習によって訓練された大規模言語モデル(LLM)は、強い指示、自己補正、推論能力を示す。
我々は、最適KL規則化ポリシの閉形式エネルギーベースモデル(EBM)構造を利用して、LLMの統一的変分解析を行う。
論文 参考訳(メタデータ) (2025-12-21T13:28:58Z) - Better Estimation of the Kullback--Leibler Divergence Between Language Models [62.09293217844222]
Kullback-Leibler (KL) の言語モデル間のばらつきを推定することは、多くの応用がある。
本稿では, 標準モンテカルロ推定器の偏差が, 標準モンテカルロ推定器の偏差以下であるようなラオ-ブラックウェル化推定器を提案する。
論文 参考訳(メタデータ) (2025-04-14T18:40:02Z) - Generalized Kullback-Leibler Divergence Loss [105.66549870868971]
我々は、クルバック・リブラー(KL)の除算損失がデカップリングカルバック・リブラー(DKL)の除算損失と等価であることを証明した。
DKL損失の非結合構造により,我々は改善すべき2つの領域を特定した。
論文 参考訳(メタデータ) (2025-03-11T04:43:33Z) - KL Penalty Control via Perturbation for Direct Preference Optimization [55.24971559149686]
我々は、KLのペナルティ強度を各選好ペアに対して適応的に制御できる$varepsilon$-Direct Preference Optimization (varepsilon$-DPO)を提案する。
KLペナルティ緩和のための$varepsilon$-DPOの簡単な基準は、既存の直接アライメントアルゴリズムと比較して、DPOを大幅に改善することを示す。
論文 参考訳(メタデータ) (2025-02-18T06:44:10Z) - Rethinking Kullback-Leibler Divergence in Knowledge Distillation for Large Language Models [18.870276152694245]
Kullback-Leiber分散は、Large Language Models (LLM) の圧縮に知識蒸留 (KD) で広く使われている。
以前のアサーションとは対照的に、逆クルバック・リブラー(英語版)(RKL)の発散はモード探索であり、したがって平均シーキング前方クルバック・リブラー(英語版)(FKL)の発散よりも好ましい。
本稿では,FKLとRKLを組み合わせるために重みを適応的に割り当てる,単純で効果的な適応型Kulback-Leiber(AKL)分散法を提案する。
論文 参考訳(メタデータ) (2024-04-03T11:40:17Z) - Decoupled Kullback-Leibler Divergence Loss [90.54331083430597]
我々は、クルバック・リブラー(KL)の除算損失がデカップリングカルバック・リブラー(DKL)の除算損失と等価であることを証明した。
我々はKL/DKLにクラスワイドなグローバル情報を導入し、個々のサンプルからバイアスを取ります。
提案手法は,新たな最先端の対人ロバスト性を公衆のリーダーボード上で実現する。
論文 参考訳(メタデータ) (2023-05-23T11:17:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。