論文の概要: The Bridge-Garden Dilemma in LLM Distillation: Why Mixing Hard and Soft Labels Works
- arxiv url: http://arxiv.org/abs/2605.26246v1
- Date: Mon, 25 May 2026 18:12:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:41.309879
- Title: The Bridge-Garden Dilemma in LLM Distillation: Why Mixing Hard and Soft Labels Works
- Title(参考訳): LLM蒸留におけるブリッジ-ガーデンジレンマ : 硬質と軟質の混合がなぜ機能するか
- Authors: Guanghui Wang, Kaiwen Lv Kacuila, Zhiyong Yang, Zitai Wang, Jin-Wen Wu, Longtao Huang, Qianqian Xu, Qingming Huang,
- Abstract要約: 硬質ラベルと軟質ラベルの混在が常により良い結果をもたらすことを示す。
これは露光バイアスの低減、トレーニングと推論の分布のミスマッチに起因する。
我々はブリッジ-ガーデンハイブリッド監視手法のファミリーを開発する。
- 参考スコア(独自算出の注目度): 84.74671323132492
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Knowledge distillation (KD) transfers knowledge from a large teacher model to a smaller student. In language modeling, the student is trained either on tokens sampled from the teacher (hard labels) or the teacher's full next-token distribution (soft labels). Despite soft labels appear strictly richer, we find that mixing hard and soft labels consistently yields better results. Crucially, we show that this gain cannot be explained by closer teacher matching during training. Instead, it comes from reduced exposure bias, the mismatch between training and inference distributions. To explain this phenomenon, we introduce the Bridge-Garden Decomposition theory, which categorizes generation steps into two types: Bridges, where the next token must be exact, and Gardens, where it can be flexible. We show that hard-only KD excels in Bridges by avoiding risky deviations, while soft-only KD preserves diversity in Gardens. A hybrid strategy handles both cases and, as a result, reduces exposure bias across the sequence. Guided by this theory, we develop a family of Bridge-Garden hybrid supervision methods that adaptively balance hard and soft labels. Across a primary suite of seven teacher-student pairs (including Qwen, Llama, Gemma, and DeepSeek) and benchmarks in reasoning and coding, our approach outperforms divergence-based and on-policy KD baselines while reducing training cost by 9.7x, enabling efficient model compression. Code is available at https://github.com/ghwang-s/bridge_garden_hybrid_kd_release.
- Abstract(参考訳): 知識蒸留(KD)は、大きな教師モデルから小さな学生に知識を伝達する。
言語モデリングでは、学生は教師(硬いラベル)からサンプリングされたトークン、または教師のフル次世代分布(ソフトラベル)に基づいて訓練される。
ソフトラベルは厳密にリッチに見えるが、ハードラベルとソフトラベルの混合は、常により良い結果をもたらす。
重要なことは、この効果は、訓練中の教師マッチングにより説明できないことを示しています。
代わりに、露光バイアスの低減、トレーニングと推論の分布のミスマッチが原因である。
この現象を説明するために、Bridge-Garden分解理論(Bridge-Garden Decomposition theory)を導入し、生成ステップを次のトークンが正確になければならないブリッジと柔軟性のあるガーデンの2つのタイプに分類する。
硬質のKDは危険偏差を回避し, 硬質のKDは橋梁で優れており, 軟質のKDは庭園の多様性を保っている。
ハイブリッド戦略は両方のケースを処理し、結果としてシーケンス全体の露出バイアスを低減する。
この理論に導かれ、ハードラベルとソフトラベルを適応的にバランスをとるブリッジ・ガーデンハイブリッド監視手法のファミリーを開発する。
Qwen、Llama、Gemma、DeepSeekを含む7つの教師と学生のペアのプライマリスイートと推論とコーディングのベンチマークによって、我々のアプローチは、学習コストを9.7倍に削減し、効率の良いモデル圧縮を実現するとともに、分散ベースのオンラインKDベースラインよりも優れています。
コードはhttps://github.com/ghwang-s/bridge_garden_hybrid_kd_releaseで公開されている。
関連論文リスト
- X-Token: Projection-Guided Cross-Tokenizer Knowledge Distillation [19.064775527374618]
クロストケナイザーの知識蒸留により、学生モデルは語彙を持つ教師から学ぶことができる。
ログベースの手法は正しい確率のみを使用し、教師の分布に完全な「暗黒の知識」を欠いている。
本稿では,これらの問題を対象とした2つの相補的損失定式化手法であるX-Tokenを提案する。
論文 参考訳(メタデータ) (2026-05-20T19:59:31Z) - Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training [20.04756350098974]
ラベル付き検証可能なトレーニングデータがバインディング制約である場合、各チェックされた例は、最も情報のあるモデルと報酬密度に割り当てるべきである。
スパース・シークエンス・レベルの報酬は、より良い振る舞いを探索し発見できるモデルにおいて最も有用であるが、より密集したトークンレベルの教師監督は、その振る舞いをより小さなデプロイメントモデルに圧縮するのにより適している。
論文 参考訳(メタデータ) (2026-05-12T17:57:48Z) - ABKD: Pursuing a Proper Allocation of the Probability Mass in Knowledge Distillation via $α$-$β$-Divergence [89.630486749083]
知識蒸留(KD)は、大きな教師モデルからより小さな学生モデルに知識を伝達する。
KDの中核的な課題は、2つのモード集中効果のバランスにある。
我々は$alpha$$beta$-divergenceを持つ汎用フレームワークであるABKDを提案する。
論文 参考訳(メタデータ) (2025-05-07T16:48:49Z) - Unbiased Knowledge Distillation for Recommendation [66.82575287129728]
知識蒸留(KD)は推論遅延を低減するためにレコメンダシステム(RS)に応用されている。
従来のソリューションは、まずトレーニングデータから完全な教師モデルを訓練し、その後、その知識を変換して、コンパクトな学生モデルの学習を監督する。
このような標準的な蒸留パラダイムは深刻なバイアス問題を引き起こし、蒸留後に人気アイテムがより強く推奨されることになる。
論文 参考訳(メタデータ) (2022-11-27T05:14:03Z) - Continuous Soft Pseudo-Labeling in ASR [32.19655911858698]
連続擬似ラベル(PL)アルゴリズムは,音声認識における半教師あり学習の強力な戦略として登場した。
ソフトラベルのターゲットは、フレーム毎に縮退したトークン分布にモデルを崩壊させることで、トレーニングのばらつきにつながる可能性がある。
論文 参考訳(メタデータ) (2022-11-11T05:16:18Z) - ALM-KD: Knowledge Distillation with noisy labels via adaptive loss
mixing [25.49637460661711]
知識蒸留は、教師付き環境で学生モデルを訓練するために、事前訓練されたモデルの出力を使用する技術である。
KD中の適応損失混合方式を用いてこの問題に対処する。
提案手法は, 標準KD設定, マルチ教師, 自己蒸留設定において, 提案手法を用いて得られた性能向上を示す。
論文 参考訳(メタデータ) (2022-02-07T14:53:22Z) - Comparing Kullback-Leibler Divergence and Mean Squared Error Loss in
Knowledge Distillation [9.157410884444312]
知識蒸留(KD)は,効率的なニューラルアーキテクチャを設計するために研究されている。
KL分散損失は,タウ増加時のロジットマッチングと,タウが0。
特にKL分散損失を小さいタウで用いた場合, ラベルノイズが軽減される。
論文 参考訳(メタデータ) (2021-05-19T04:40:53Z) - Distilling Double Descent [65.85258126760502]
蒸留とは、別の「教師」モデルでラベル付けされた例に基づいた「学生」モデルを訓練する技法である。
教師モデルが非常にパラメータ化されすぎている場合であっても、非常に大きな保持されていないラベル付きデータセットを使用することで、より"伝統的な"アプローチを上回るモデルが生まれます。
論文 参考訳(メタデータ) (2021-02-13T02:26:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。