論文の概要: A Study on Hidden Layer Distillation for Large Language Model Pre-Training
- arxiv url: http://arxiv.org/abs/2605.11513v1
- Date: Tue, 12 May 2026 04:31:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.579211
- Title: A Study on Hidden Layer Distillation for Large Language Model Pre-Training
- Title(参考訳): 大規模言語モデル事前学習のための隠れ層蒸留に関する研究
- Abstract要約: 知識蒸留(KD)は、大規模言語モデル(LLM)を訓練するための重要なツールである
Hidden Layer Distillation (HLD) はエンコーダアーキテクチャの可能性を示したが、デコーダのみの大規模事前学習への応用は未解明のままである。
- 参考スコア(独自算出の注目度): 6.1302227392301
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Knowledge Distillation (KD) is a critical tool for training Large Language Models (LLMs), yet the majority of research focuses on approaches that rely solely on output logits, neglecting semantic information in the teacher's intermediate representations. While Hidden Layer Distillation (HLD) showed potential for encoder architectures, its application to decoder-only pre-training at scale remains largely unexplored. Through compute-controlled experiments, we benchmark HLD against logit-based KD and self-supervised baselines with Gemma3 3.4B as teacher and 123M and 735M students trained on up to 168B tokens from the C4 dataset. Our experiments show that HLD does not consistently outperform standard KD on downstream evaluation tasks. Nevertheless, we show that HLD can yield a systematic perplexity gain over KD across all shared-hyperparameter configurations, suggesting that a latent signal can be extracted, but a breakthrough may be needed for it to play a more significant role in LLM pre-training.
- Abstract(参考訳): 知識蒸留(KD)は、大規模言語モデル(LLM)を訓練するための重要なツールであるが、ほとんどの研究は出力ロジットのみに依存し、教師の中間表現における意味情報を無視するアプローチに焦点を当てている。
Hidden Layer Distillation (HLD) はエンコーダアーキテクチャの可能性を示したが、デコーダのみの大規模事前学習への応用はほとんど未検討のままである。
C4データセットから最大168BトークンをトレーニングしたGemma3 3.4Bと,123Mおよび735Mの学生を対象に,計算制御による実験により,HLDをロジットベースのKDと自己教師ベースラインに対してベンチマークした。
実験の結果,HLD は下流評価タスクにおいて標準 KD を常に上回っているわけではないことがわかった。
いずれにせよ,HLDは,すべての共有ハイパーパラメータ構成において,KDよりも体系的なパープレキシティ向上を達成でき,遅延信号が抽出可能であることを示唆するが,LDM事前学習においてより重要な役割を果たすためには,ブレークスルーが必要である。
関連論文リスト
- Understanding Knowledge Distillation in Post-Training: When It Helps and When It Fails [16.73080036450313]
大規模言語モデル(LLM)は多くのタスクにおいて高いパフォーマンスを達成するが、その高い計算コストはリソース制約のある環境への展開を制限する。
知識蒸留(KD)は、より大規模な教師モデルからより小さな学生モデルに知識を移すことによって、実践的なソリューションを提供する。
論文 参考訳(メタデータ) (2026-06-22T07:19:43Z) - RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training [59.493415006017635]
事前訓練されたマルチモーダル大言語モデル(MLLM)は、ポストトレーニングのための知識豊富な基盤を提供する。
現在の評価は、厳格な追加トレーニングと自己回帰的復号コストを導入する、教師付き微調整後のテストに依存している。
MLLM pRe トレーニングにおける非対称性向上のための効率的な能力中心評価フレームワーク RADAR を提案する。
論文 参考訳(メタデータ) (2026-02-13T12:56:31Z) - Training-Free Out-Of-Distribution Segmentation With Foundation Models [38.00668980035719]
大規模な視覚基盤モデル、例えば、DINOv2、InternImage、CLIPは、多様なタスクをうまく一般化する豊富な機能を提供することで、高度な視覚表現学習を提供する。
我々は、InternImageのバックボーンの機能を活用し、生デコーダログの信頼しきい値とK-Meansクラスタリングを適用して、OoDクラスタを識別する、トレーニング不要なアプローチを提案する。
Intern Image-L を用いた ADE-OoD のベンチマークでは, 平均50.02 精度と48.77 精度を達成し, 教師付きベースラインと教師なしベースラインを超越した。
論文 参考訳(メタデータ) (2025-10-03T11:27:40Z) - Dataset Distillation via Knowledge Distillation: Towards Efficient Self-Supervised Pre-Training of Deep Networks [10.932880269282014]
SSL事前トレーニングのための最初の有効なDD法を提案する。
具体的には、SSLでトレーニングされたより大きな教師モデルの表現に合わせるために、小さな学生モデルを訓練する。
KDの目的はSSLよりもかなり分散度が低いため、我々の手法は、高品質エンコーダの事前訓練に成功できる合成データセットを生成することができる。
論文 参考訳(メタデータ) (2024-10-03T00:39:25Z) - Direct Preference Knowledge Distillation for Large Language Models [73.50849692633953]
大規模言語モデル(LLM)のためのDPKD(Direct Preference Knowledge Distillation)を提案する。
我々はLLMのKDを、暗黙の報酬と逆のKL分岐からなる最適化と目的の2段階に再構成する。
実験と理論的解析により,KDにおける暗黙の報酬と出力選好の価値と効果を証明した。
論文 参考訳(メタデータ) (2024-06-28T09:23:40Z) - CodingTeachLLM: Empowering LLM's Coding Ability via AST Prior Knowledge [0.0]
我々は,コーディング学習用に設計された大規模言語モデル(LLM)であるCodingTeachLLMを紹介する。
本モデルは,学習知識の構造的分解と漸進的指導によるアウトプットを実現する。
当社のモデルは,オープンソースモデルと比較して,コード能力の最先端性も達成している。
論文 参考訳(メタデータ) (2024-03-13T05:38:39Z) - MiniLLM: Knowledge Distillation of Large Language Models [112.93051247165089]
知識蒸留(KD)は,大規模言語モデル(LLM)の高い計算要求を低減させる,有望な手法である。
より小さな言語モデルにLPMを蒸留するKD手法を提案する。
提案手法は,120Mから13Bのパラメータを持つ異なるモデルファミリに対してスケーラブルである。
論文 参考訳(メタデータ) (2023-06-14T14:44:03Z) - Cross-Modal Fine-Tuning: Align then Refine [83.37294254884446]
ORCAはクロスモーダルな微調整フレームワークであり、単一の大規模事前訓練モデルの適用範囲を様々に拡張する。
ORCAは12のモダリティから60以上のデータセットを含む3つのベンチマークで最先端の結果を得る。
論文 参考訳(メタデータ) (2023-02-11T16:32:28Z) - Revisiting Intermediate Layer Distillation for Compressing Language
Models: An Overfitting Perspective [7.481220126953329]
中間層蒸留(ILD)は事実上の標準KD法であり,NLPフィールドの性能向上に寄与している。
本稿では,既存のILD手法はトレーニングデータセットに過度に適合する傾向があるが,これらの手法は元のKDよりも多くの情報を伝達する。
我々は,学生モデルがトレーニングデータセットを過度に適合させるのを防ぐ,シンプルで効果的な一貫性規則化IDDを提案する。
論文 参考訳(メタデータ) (2023-02-03T04:09:22Z) - DETRs with Collaborative Hybrid Assignments Training [11.563949886871713]
本稿では,新しい協調型ハイブリット・アサイン・トレーニング・スキームである$mathcalC$o-DETRを提案する。
このトレーニングスキームは、エンド・ツー・エンド検出器におけるエンコーダの学習能力を容易に向上させることができる。
提案手法の有効性を評価するため, 広範囲な実験を行った。
論文 参考訳(メタデータ) (2022-11-22T16:19:52Z) - How and When Adversarial Robustness Transfers in Knowledge Distillation? [137.11016173468457]
本稿では,教師モデルから学生モデルへの知識蒸留(KD)における対向ロバスト性の移行について検討する。
我々は,標準的なKDトレーニングが対向的堅牢性を維持するのに失敗することを示すとともに,KDIGA(入力勾配アライメント)を併用したKDを提案する。
特定の前提の下では、提案したKDIGAを用いた学生モデルは、少なくとも教師モデルと同じ確証された堅牢性を達成することができることを証明している。
論文 参考訳(メタデータ) (2021-10-22T21:30:53Z) - LGD: Label-guided Self-distillation for Object Detection [59.9972914042281]
我々はLGD(Label-Guided Self-Distillation)と呼ばれる汎用物体検出のための最初の自己蒸留フレームワークを提案する。
本フレームワークは, 学習知識を得るために, スパースラベル-外観符号化, オブジェクト間関係適応, オブジェクト内知識マッピングを含む。
従来の教師ベースのFGFIと比較すると、LGDは予習された教師を必要とせず、本質的な学生学習よりも51%低い訓練コストで性能が向上する。
論文 参考訳(メタデータ) (2021-09-23T16:55:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。