論文の概要: Student Capacity Moderates Knowledge Distillation Effectiveness: A Systematic Study Across ResNet Teacher-Student Pairs on CIFAR-10
- arxiv url: http://arxiv.org/abs/2605.31191v1
- Date: Fri, 29 May 2026 11:57:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.584376
- Title: Student Capacity Moderates Knowledge Distillation Effectiveness: A Systematic Study Across ResNet Teacher-Student Pairs on CIFAR-10
- Title(参考訳): 学生の学習能力が知識蒸留効果をモデレートする:CIFAR-10におけるResNet教師と学生のペア間の体系的研究
- Abstract要約: CIFAR-10上のResNet画像分類において,教師と学生の能力関係が知識蒸留(KD)の有効性をどう調節するかを検討する。
R34の学生は、教師と学生の精度のギャップが同等であっても、R18の学生よりもKDの恩恵が大きい。
インプットレゾリューション対応アーキテクチャでは、32x32入力に対してResNetステムを補正すると、教師の精度が5pp以上上昇する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We investigate how teacher-student capacity relationships modulate knowledge distillation (KD) effectiveness in ResNet-based image classification on CIFAR-10. Across three teacher-student pairs -- R50->R18, R34->R18, and R50->R34 -- we compare Logit-KD and Feature-KD under controlled, reproducible conditions (3 seeds, mean+/-std reported throughout). We report three main findings. First, student capacity is a key moderating factor in distillation gain: R34 students benefit substantially more from KD than R18 students even when teacher-student accuracy gaps are comparable, with the strongest gain of +0.30pp observed for R50->R34 Feature-KD versus +0.18pp for R34->R18 Feature-KD and +0.00pp for R34->R18 Logit-KD. Second, implementation correctness critically affects Feature-KD: a gradient clipping bug that excluded projection layers suppressed Feature-KD performance and produced misleading comparisons with Logit-KD. After correction, Feature-KD matches or outperforms Logit-KD in two of three pairs, reaching 95.55% on R50->R34 against a baseline of 95.25%. Third, input-resolution-aware architecture is a prerequisite for effective distillation: correcting the ResNet stem for 32x32 inputs raises teacher accuracy by over 5pp -- an order of magnitude larger than any KD gain. All code and results are available at github.com/umutonuryasar/kd-capacity-gap.
- Abstract(参考訳): CIFAR-10上のResNet画像分類において,教師と学生の能力関係が知識蒸留(KD)の有効性をどう調節するかを検討する。
R50->R18, R34->R18, R50->R34の3つの教師学生ペアを, 制御された再現可能な条件下でのLogit-KDとFeature-KDを比較した。
主な3つの所見を報告する。
まず,R34学生は,R50->R34の特徴量KDに対して+0.18pp,R34->R18特徴量KDでは+0.00pp,R34->R18ロジットKDでは+0.30ppであった。
第二に、実装の正しさがFeature-KDに重大な影響を及ぼす: プロジェクション層を除外した勾配クリッピングバグはFeature-KDのパフォーマンスを抑え、Logit-KDと誤って比較した。
修正後、Feature-KDは3組のうち2組でLogit-KDと対戦し、95.25%のベースラインに対してR50->R34で95.55%に達した。
32x32入力に対してResNetステムを補正すると、教師の精度は5pp以上上がります。
すべてのコードと結果はgithub.com/umutonuryasar/kd-capacity-gapで入手できる。
関連論文リスト
- When Does Knowledge Distillation Hurt? Reliability-Aware Distillation for Low-Resource Language Summarization [0.270366062356502]
知識蒸留(KD)は、シーケンス・ツー・シーケンスモデルを圧縮するための標準的な手法である。
標準KDはROUGE-Lをクロスエントロピーベースライン上で0.0003だけ改善する。
トレーニングサンプルの約51.3%は、標準KDの学生の検証損失に積極的に影響すると見積もられている。
本稿では,2つの相補的信頼性を考慮した蒸留法を提案する。
論文 参考訳(メタデータ) (2026-07-22T09:32:28Z) - Fuse Before Transfer: Knowledge Fusion for Heterogeneous Distillation [52.0297393822012]
異質な教師と学生間の機能的知識の伝達を容易にするために,橋梁としてアシスタントモデルを導入する。
提案した設計原理の中では, クロスアーキテクチャ帰納バイアスとモジュール関数の利点を組み合わせたアシスタントモデルが提案されている。
提案手法は, CNN, ViT, 空間KDの同種モデルペアと任意の異種組み合わせを用いて評価する。
論文 参考訳(メタデータ) (2024-10-16T08:02:49Z) - Efficient and Robust Knowledge Distillation from A Stronger Teacher Based on Correlation Matching [0.09999629695552192]
相関マッチング知識蒸留 (CMKD) 法は, ピアソンとスピアマンの相関係数に基づくKD損失を組み合わせ, より効率的で堅牢な蒸留を実現している。
CMKDはシンプルだが実用的であり、CIRAR-100とImageNetの最先端性能を継続的に達成できることを広範な実験で実証している。
論文 参考訳(メタデータ) (2024-10-09T05:42:47Z) - Revisiting Knowledge Distillation for Autoregressive Language Models [88.80146574509195]
知識蒸留(KD)を改善するための簡易かつ効果的な適応型教育法(ATKD)を提案する。
ATKDの中核は、ロート学習を減らし、教育をより多様で柔軟なものにすることだ。
8つのLMタスクの実験は、ATKDの助けを借りて、様々なベースラインのKD手法が一貫した、重要なパフォーマンス向上を達成することを示した。
論文 参考訳(メタデータ) (2024-02-19T07:01:10Z) - One-for-All: Bridge the Gap Between Heterogeneous Architectures in
Knowledge Distillation [69.65734716679925]
知識蒸留は,教師が指導する学習手法を通じて,モデル性能を向上させる上で,極めて効果的な手法であることが証明されている。
既存の蒸留法のほとんどは、教師と生徒のモデルが同じモデルファミリーに属するという前提で設計されている。
我々は, ヘテロジニアスアーキテクチャ間の蒸留性能を大幅に向上させる, OFA-KDという, 単純で効果的な一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元
論文 参考訳(メタデータ) (2023-10-30T11:13:02Z) - Representation Disparity-aware Distillation for 3D Object Detection [44.17712259352281]
本稿では,表現格差問題に対処する新しい表現格差対応蒸留法を提案する。
RDD は CP-Voxel-S の mAP を nuScenes データセット上で57.1% に引き上げる。
論文 参考訳(メタデータ) (2023-08-20T16:06:42Z) - CLIP-KD: An Empirical Study of CLIP Model Distillation [24.52910358842176]
本稿では,大規模教師CLIPモデルによって指導される小型CLIPモデルを蒸留することを目的とする。
Mean Squared Error損失による単純な機能模倣が驚くほどうまく機能することを示す。
教師と生徒のエンコーダ間の対話的コントラスト学習は、性能向上にも有効である。
論文 参考訳(メタデータ) (2023-07-24T12:24:07Z) - CrossKD: Cross-Head Knowledge Distillation for Object Detection [69.16346256926842]
知識蒸留(KD)は、コンパクト物体検出器の学習に有効なモデル圧縮技術として検証されている。
そこで本研究では,学生の検知ヘッドの中間的特徴を教師の検知ヘッドに伝達する,CrossKDと呼ばれる蒸留方式を模倣する予測手法を提案する。
われわれのCrossKDはGFL ResNet-50の平均精度を40.2から43.7に向上させ、既存のKD手法を上回ります。
論文 参考訳(メタデータ) (2023-06-20T08:19:51Z) - Grouped Knowledge Distillation for Deep Face Recognition [53.57402723008569]
軽量の学生ネットワークは、モデル容量が低いため、ターゲットロジットの適合が困難である。
一次KDと二元KDを保持するが、最終的なKD損失計算では二次KDを省略するグループ知識蒸留(GKD)を提案する。
論文 参考訳(メタデータ) (2023-04-10T09:04:38Z) - PKD: General Distillation Framework for Object Detectors via Pearson
Correlation Coefficient [18.782520279344553]
この論文は、異種教師検出器によるFPNの優れた特徴が学生の助けとなることを実証的に見出した。
そこで本研究では,教師の関連情報に焦点を合わせるために,ピアソン相関係数を用いた特徴の模倣を提案する。
提案手法は,既存の検出KD法より常に優れており,同質・異質な学生・教師のペアに対しても有効である。
論文 参考訳(メタデータ) (2022-07-05T13:37:34Z) - How and When Adversarial Robustness Transfers in Knowledge Distillation? [137.11016173468457]
本稿では,教師モデルから学生モデルへの知識蒸留(KD)における対向ロバスト性の移行について検討する。
我々は,標準的なKDトレーニングが対向的堅牢性を維持するのに失敗することを示すとともに,KDIGA(入力勾配アライメント)を併用したKDを提案する。
特定の前提の下では、提案したKDIGAを用いた学生モデルは、少なくとも教師モデルと同じ確証された堅牢性を達成することができることを証明している。
論文 参考訳(メタデータ) (2021-10-22T21:30:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。