論文の概要: When Does Knowledge Distillation Hurt? Reliability-Aware Distillation for Low-Resource Language Summarization
- arxiv url: http://arxiv.org/abs/2607.19956v1
- Date: Wed, 22 Jul 2026 09:32:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.048588
- Title: When Does Knowledge Distillation Hurt? Reliability-Aware Distillation for Low-Resource Language Summarization
- Title(参考訳): 知識蒸留はいつ終わるか : 低リソース言語要約のための信頼性を考慮した蒸留
- Abstract要約: 知識蒸留(KD)は、シーケンス・ツー・シーケンスモデルを圧縮するための標準的な手法である。
標準KDはROUGE-Lをクロスエントロピーベースライン上で0.0003だけ改善する。
トレーニングサンプルの約51.3%は、標準KDの学生の検証損失に積極的に影響すると見積もられている。
本稿では,2つの相補的信頼性を考慮した蒸留法を提案する。
- 参考スコア(独自算出の注目度): 0.270366062356502
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Knowledge distillation (KD) is a standard approach for compressing sequence-to-sequence models, but its per-sample effects are rarely examined. On the BanSum Bangla summarization benchmark, we find that standard KD improves ROUGE-L by only +0.0003 over a cross-entropy baseline, and that approximately 51.3% of training samples are estimated to actively harm student validation loss under standard KD. We propose two complementary reliability-aware distillation methods. CHAD (Counterfactual Harm-Aware Distillation) measures per-sample KD usefulness via gradient alignment with the validation loss direction and trains a lightweight gate that generalizes this counterfactual judgment to the full training set. EWAD+CPDP combines token-level entropy-weighted adaptive distillation with a capacity-proportional geometric constraint from a second, vocabulary-incompatible teacher. On BanSum, both methods substantially outperform standard KD: CHAD by +0.0173 ROUGE-L and EWAD+CPDP by +0.0219 ROUGE-L, where standard KD itself improves ROUGE-L by only +0.0003; despite using only 60M parameters, both outperform a fine-tuned Qwen 2.5-3B model (50x larger). We further evaluate the stronger method, EWAD+CPDP, across 15 typologically diverse XL-Sum languages organised into three sets, beating the CE-only baseline on 10/15 languages; gains are most reliable where the two teachers contribute complementary signal, and weakest where they have saturated or jointly weak target-language coverage. We release code and trained models to support reproducibility and further research on selective distillation.
- Abstract(参考訳): 知識蒸留(KD)はシーケンス・ツー・シーケンスのモデルを圧縮するための標準的な手法であるが、サンプルごとの効果はまれである。
BanSum Bangla の要約ベンチマークでは、標準 KD はクロスエントロピーベースライン上で ROUGE-L をわずか +0.0003 改善し、トレーニングサンプルの約51.3% は標準 KD 下での学生の検証損失を積極的に損なうと見積もられている。
本稿では,2つの相補的信頼性を考慮した蒸留法を提案する。
CHAD(Counterfactual Harm-Aware Distillation)は、サンプル毎のKDの有用性を、検証損失方向との勾配アライメントを通じて測定し、この偽判定をフルトレーニングセットに一般化する軽量ゲートを訓練する。
EWAD+CPDPは、トークンレベルのエントロピー重み付き適応蒸留と、第2の語彙非互換教師の容量的幾何学的制約を組み合わせる。
CHAD by +0.0173 ROUGE-L and EWAD+CPDP by +0.0219 ROUGE-L ここでは標準KD自体がROUGE-Lをわずか0.0003で改善している。
EWAD+CPDPは,10/15言語でCEのみのベースラインを圧倒し,タイポロジー的に多様性のあるXL-Sum言語15言語にまたがって,より強力な手法であるEWAD+CPDP(EWAD+CPDP)を評価した。
我々は、再現性をサポートするためのコードと訓練されたモデルをリリースし、選択蒸留についてさらなる研究を行う。
関連論文リスト
- SelFusion: Self-distillation for Diffusion Language Models [11.370229362941267]
拡散言語モデル(DLM)は、自己回帰(AR)大規模言語モデル(LLM)の固有の遅延ボトルネックを軽減する。
本稿では, DLM のための新しい自己蒸留フレームワーク, SelFusion を提案する。
論文 参考訳(メタデータ) (2026-08-24T07:26:35Z) - CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield [1.2203679037551938]
計算効率のよい言語モデルを学習するための3つの手法について検討する。
SGTはセマンティックペイロードを持つ出力トークンの15%を監督する。
リカレントリカバリによる 深度圧縮
韓国の基盤モデルであるCHERRY-1.8Bでこれらの手法を検証する。
論文 参考訳(メタデータ) (2026-06-30T15:14:38Z) - LIFT and PLACE: A Simple, Stable, and Effective Knowledge Distillation Framework for Lightweight Diffusion Models [9.025382179940767]
Linear Fitting based distillation (LIFT)とPiecewise Local Adaptive Coefficient Estimation (PLACE)による粗粒蒸留の枠組み
実験の結果、LIFTとPLACEは拡散空間(イメージ/ラテント)、バックボーン(U-Net/DiT)、タスク(条件/条件)、データセット、さらにはMMDiT(SD3)のようなフローベースモデルにまで拡張できることが示された。
論文 参考訳(メタデータ) (2026-05-19T12:03:53Z) - Distillation Traps and Guards: A Calibration Knob for LLM Distillability [54.90137955363471]
そこで本研究では,教師の蒸留性を制御するためのポストホック校正法を提案する。
我々の目標は、タスクユーティリティ、KLアンカー、およびクロストケナイザーキャリブレーション報酬を組み合わせることである。
実験により、蒸留可能な教師から蒸留した学生は、SFTおよびKDベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-04-21T01:22:35Z) - Why Alignment Must Precede Distillation: A Minimal Working Explanation [50.784080714897776]
標準のKD -> Alignワークフローは、稀だが望ましい振る舞いを整列するためにモデルの能力を低下させる。
蒸留に先立って,まず高リコール基準でアライメントを行わなければならないことを示す。
論文 参考訳(メタデータ) (2025-09-28T06:12:19Z) - Adversarial Distribution Matching for Diffusion Distillation Towards Efficient Image and Video Synthesis [65.77083310980896]
本稿では, 実測値と偽測値の間に潜時予測を整列させる適応分布マッチング (ADM) を提案する。
提案手法は,DMD2と比較してSDXLの1ステップ性能に優れ,GPU時間が少ない。
SD3-Medium, SD3.5-Large, CogVideoX に多段階の ADM 蒸留を適用した実験では, 画像と映像の効率的な合成に向けた新しいベンチマークが設定された。
論文 参考訳(メタデータ) (2025-07-24T16:45:05Z) - Biased Teacher, Balanced Student [0.0]
Long-Tailed Knowledge Distillation (LTKD)は、クラス不均衡シナリオに適した新しいフレームワークである。
CIFAR-100-LT、TinyImageNet-LT、ImageNet-LTの実験は、LTKDが既存のKDメソッドより一貫して優れていることを示している。
論文 参考訳(メタデータ) (2025-06-23T10:46:44Z) - PLD: A Choice-Theoretic List-Wise Knowledge Distillation [12.52282972328311]
リストのランク付けを重み付けした "Plackett-Luce Distillation (PLD)" を導入する。
PLDは多様なアーキテクチャや蒸留目標に対して一貫した利益を達成する。
論文 参考訳(メタデータ) (2025-06-14T15:31:54Z) - Direct Preference Knowledge Distillation for Large Language Models [73.50849692633953]
大規模言語モデル(LLM)のためのDPKD(Direct Preference Knowledge Distillation)を提案する。
我々はLLMのKDを、暗黙の報酬と逆のKL分岐からなる最適化と目的の2段階に再構成する。
実験と理論的解析により,KDにおける暗黙の報酬と出力選好の価値と効果を証明した。
論文 参考訳(メタデータ) (2024-06-28T09:23:40Z) - Sinkhorn Distance Minimization for Knowledge Distillation [97.64216712016571]
知識蒸留(KD)は大規模言語モデル(LLM)の圧縮に広く採用されている。
本稿では,上述のKL,RKL,JSの発散が,それぞれモード緩和,モード崩壊,モード下推定といった問題に悩まされていることを示す。
本研究では,Sinkhorn 距離を利用した Sinkhorn Knowledge Distillation (SinKD) を提案する。
論文 参考訳(メタデータ) (2024-02-27T01:13:58Z) - Two-Step Knowledge Distillation for Tiny Speech Enhancement [3.6115850941111964]
小型音声強調モデル蒸留のための新しい2段階手法を提案する。
加重混合蒸留と教師付き損失の標準的なアプローチとは対照的に,我々は知識蒸留の目的のみを用いて,学生を事前訓練する。
また,学生の運動内グラム行列を教師のものと一致させることを目的とした,詳細な類似性保存KD損失を新たに提案する。
論文 参考訳(メタデータ) (2023-09-15T04:19:38Z) - Unbiased Knowledge Distillation for Recommendation [66.82575287129728]
知識蒸留(KD)は推論遅延を低減するためにレコメンダシステム(RS)に応用されている。
従来のソリューションは、まずトレーニングデータから完全な教師モデルを訓練し、その後、その知識を変換して、コンパクトな学生モデルの学習を監督する。
このような標準的な蒸留パラダイムは深刻なバイアス問題を引き起こし、蒸留後に人気アイテムがより強く推奨されることになる。
論文 参考訳(メタデータ) (2022-11-27T05:14:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。