論文の概要: Too much of a good thing -- when knowledge distillation promotes overfitting, and how to avoid it
- arxiv url: http://arxiv.org/abs/2608.23752v1
- Date: Mon, 24 Aug 2026 18:40:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.53935
- Title: Too much of a good thing -- when knowledge distillation promotes overfitting, and how to avoid it
- Title(参考訳): 知識蒸留が過度な適合を促進し、それを避けるにはどうすればいいのか?
- Abstract要約: 知識蒸留(KD)は、大きなネットワーク(教師)から小さなネットワーク(学生)へ知識を伝達する
本研究は,教師の指導を反映した,単純で均質なブロックに基づく学生設計を提案する。
古典的なデータセットでは、最後のブロックのみを蒸留するだけで十分であり、多くの場合ベストである。
- 参考スコア(独自算出の注目度): 2.915890028770192
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: The growing size of Convolutional Neural Networks has led to increasingly large and costly models. Knowledge Distillation (KD) addresses this by transferring knowledge from a large network (teacher) to a small one (student), also reducing the training data required. KD is traditionally applied only at the network's final output. However, its behaviour when applied at intermediate network layers has received little attention. This raises the question of whether intermediate block-wise KD, which provides supervision throughout the network, could offer an advantage under specific conditions, such as few instances per class, which is common in fine-grained datasets. This work proposes a student design based on simple, homogeneous blocks mirroring those of the teacher, distilling knowledge between corresponding blocks. Across eleven datasets, we show that on classic datasets, distilling only the last block is sufficient -- and often best--, whereas fine-grained, data-scarce settings benefit substantially from intermediate supervision, with even a single additional distillation point narrowing the gap considerably. We further study how this supervision should be guided, exploring configurations of varying granularity and informed by an explainability analysis based on attention maps, Centered Kernel Alignment, and Grad-CAM, alongside the impact of teacher and student fine-tuning strategies. This work shows that intermediate block-wise distillation, guided appropriately, is key to building compact data-efficient models without sacrificing accuracy.
- Abstract(参考訳): 畳み込みニューラルネットワークの規模が大きくなるにつれ、ますます大規模でコストのかかるモデルが生まれてきた。
知識蒸留(KD)は、大きなネットワーク(教師)から小さなネットワーク(学生)に知識を伝達することでこの問題に対処し、必要なトレーニングデータを削減する。
KDは伝統的にネットワークの最終出力にのみ適用される。
しかし,中間層に適用した場合の挙動はほとんど注目されていない。
これにより、ネットワーク全体の監視を提供する中間ブロックワイズKDが、粒度の細かいデータセットに共通するクラス毎のインスタンス数など、特定の条件下で有利になるかどうかという疑問が持ち上がる。
本研究は,教師の知識を抽出し,教師の知識を反映した,単純で均質なブロックに基づく学生設計を提案する。
11のデータセットにわたって、古典的なデータセットでは、最後のブロックのみを蒸留するだけで十分であり、多くの場合は最良である。
さらに,教師や学生の微調整方略の影響とともに,注意図,集中カーネルアライメント,グラッドCAMに基づく説明可能性分析によって,様々な粒度の構成を探索し,その指導方法について考察する。
この研究は、適切に導出された中間ブロックワイド蒸留が、精度を犠牲にすることなく、コンパクトなデータ効率モデルを構築するための鍵であることを示している。
関連論文リスト
- WeCKD: Weakly-supervised Chained Distillation Network for Efficient Multimodal Medical Imaging [1.9316515057518757]
Weakly-supervised Chain-based KD network that correctefines knowledge transfer through a structured sequence of connecteded model。
チェーン内の各モデルはデータセットのごく一部でトレーニングされ、最小限の監視で効果的な学習が達成できることを示す。
提案した蒸留鎖は、同じ限られたデータで訓練された単一のバックボーンに対して、累積精度が最大で23%向上した。
論文 参考訳(メタデータ) (2025-10-16T13:22:51Z) - Preserving Angles Improves Feature Distillation of Foundation Models [8.572967695281054]
圧縮空間ネットワークと学生画像モデルとの類似性を保存する。
様々なCossNetデータセットが、検出ベンチマークでより堅牢な精度で精度良く生成されることが示されている。
これにより、一般的な検出ベンチマークでのトレーニングの競合パスが提供される。
論文 参考訳(メタデータ) (2024-11-22T01:48:44Z) - Attention-guided Feature Distillation for Semantic Segmentation [8.344263189293578]
本稿では,改良された特徴写像を用いて注目を伝達するための簡易かつ強力な手法の有効性を示す。
CBAM(Convolutional Block Attention Module)を用いたAttnFD(AttnFD)法の提案
これはPascalVoc 2012、Cityscapes、COCO、CamVidデータセット上の学生ネットワークの平均的相互接続(mIoU)を改善するという観点から、最先端の結果を達成する。
論文 参考訳(メタデータ) (2024-03-08T16:57:47Z) - Improving Knowledge Distillation via Regularizing Feature Norm and
Direction [16.98806338782858]
知識蒸留(KD)は、大きな訓練されたモデル(例えば教師)を利用して、同じタスクのために同じデータセット上で小さな学生モデルを訓練する。
教師の特徴を知識として扱うこと、知識蒸留訓練の学生は、その特徴を教師の特徴と整合させることによって、例えば、ロジット間のKL偏差を最小化し、中間特徴間のL2距離を最小化する。
教師に対する生徒の特徴の整合性の向上は教師の知識をよりよく蒸留すると考えるのは自然なことだが、単にこの整合性を強制することは生徒のパフォーマンスに直接寄与しない。
論文 参考訳(メタデータ) (2023-05-26T15:05:19Z) - BD-KD: Balancing the Divergences for Online Knowledge Distillation [11.874952582465601]
我々は、ロジットベースのオンラインKDのためのフレームワークであるBD-KD(Balanced Divergence Knowledge Distillation)を紹介する。
BD-KDは精度とモデルのキャリブレーションを同時に強化し、ポストホックリカレーション技術の必要性を排除している。
本手法は,従来のオンライン蒸留の損失を学生と教員の両方の損失に適応させることで,学生中心のトレーニングを促進する。
論文 参考訳(メタデータ) (2022-12-25T22:27:32Z) - CES-KD: Curriculum-based Expert Selection for Guided Knowledge
Distillation [4.182345120164705]
本稿では,知識蒸留のためのカリキュラムエキスパート選択法(CES-KD)を提案する。
CES-KDは、階層化された教育カリキュラムを使用して学生ネットワークを徐々にガイドすべきという仮説に基づいている。
具体的には、画像の分類の難しさに起因したカリキュラムに基づいて、入力画像ごとに1人の教師を選択する段階的なTAベースのKD手法を提案する。
論文 参考訳(メタデータ) (2022-09-15T21:02:57Z) - On-Device Domain Generalization [93.79736882489982]
ドメインの一般化はデバイス上の機械学習アプリケーションにとって重要である。
知識蒸留がこの問題の解決の有力な候補であることがわかった。
本研究では,教師が配布外データをどのように扱えるかを学生に教えることを目的とした,配布外知識蒸留(OKD)という簡単なアイデアを提案する。
論文 参考訳(メタデータ) (2022-09-15T17:59:31Z) - InDistill: Information flow-preserving knowledge distillation for model compression [20.88709060450944]
本稿では,知識蒸留(KD)の有効性のウォームアップ段階として機能するInDistillを紹介する。
InDistillは、重厚な教師から軽量な学生に重要な情報の流れの経路を移すことに重点を置いている。
提案手法は, CIFAR-10, CIFAR-100, ImageNetデータセット上で, 教師/学生の多様なアーキテクチャを用いて広範に評価されている。
論文 参考訳(メタデータ) (2022-05-20T07:40:09Z) - Knowledge Distillation Meets Open-Set Semi-Supervised Learning [69.21139647218456]
本研究では,事前学習した教師から対象学生へ,表現的知識を意味的に蒸留する新しいモデル名(bfem shortname)を提案する。
問題レベルでは、これは知識蒸留とオープンセット半教師付き学習(SSL)との興味深い関係を確立する。
我々のショートネームは、粗い物体分類と微妙な顔認識タスクの両方において、最先端の知識蒸留法よりもかなり優れている。
論文 参考訳(メタデータ) (2022-05-13T15:15:27Z) - Mosaicking to Distill: Knowledge Distillation from Out-of-Domain Data [56.29595334715237]
知識蒸留(KD)は,対象領域における教師の行動を模倣する,コンパクトな学生モデルを構築することを目的としている。
私たちは、astextitMosaicKDと呼ばれる便利だが驚くほど効果的なアプローチを導入しました。
モザイクKDでは、ジェネレータ、識別器、学生ネットワークを対角的に総合的に訓練する4人プレイのmin-maxゲームによってこれを達成している。
論文 参考訳(メタデータ) (2021-10-27T13:01:10Z) - Distilling Knowledge via Knowledge Review [69.15050871776552]
教師と学生のネットワーク間の接続経路のクロスレベル要因を研究し、その大きな重要性を明らかにします。
知識蒸留において初めて, クロスステージ接続経路が提案されている。
最終的に設計されたネストでコンパクトなフレームワークは、無視できるオーバーヘッドを必要とし、さまざまなタスクで他のメソッドよりも優れています。
論文 参考訳(メタデータ) (2021-04-19T04:36:24Z) - Wasserstein Contrastive Representation Distillation [114.24609306495456]
We propose Wasserstein Contrastive Representation Distillation (WCoRD) which leverages both primal and dual form of Wasserstein distance for knowledge distillation。
二重形式はグローバルな知識伝達に使用され、教師と学生のネットワーク間の相互情報の低い境界を最大化する対照的な学習目標をもたらします。
実験では、提案されたWCoRD法が特権情報蒸留、モデル圧縮およびクロスモーダル転送における最先端のアプローチを上回ることを実証した。
論文 参考訳(メタデータ) (2020-12-15T23:43:28Z) - Efficient Crowd Counting via Structured Knowledge Transfer [122.30417437707759]
クラウドカウントはアプリケーション指向のタスクであり、その推論効率は現実世界のアプリケーションにとって不可欠である。
本稿では,学生ネットワークを軽量かつ高効率に構築する構造的知識伝達フレームワークを提案する。
我々のモデルはNvidia 1080 GPUで最低6.5$times$のスピードアップを取得し、最先端のパフォーマンスも達成しています。
論文 参考訳(メタデータ) (2020-03-23T08:05:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。