論文の概要: Single-Teacher View Augmentation: Enhancing Knowledge Distillation with Student-Guided Perturbations
- arxiv url: http://arxiv.org/abs/2607.11557v2
- Date: Wed, 22 Jul 2026 08:11:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 16:42:31.351573
- Title: Single-Teacher View Augmentation: Enhancing Knowledge Distillation with Student-Guided Perturbations
- Title(参考訳): 単教師の視点強化:学生指導による摂動による知識蒸留の強化
- Abstract要約: シフト強化知識蒸留(SAKD)は、生徒の進化する特徴を摂動生成の動的条件として活用する、シンプルで効果的なフレームワークである。
SAKDはランダム摂動法を一貫して上回り、2段階のアプローチと同等の精度を達成している。
- 参考スコア(独自算出の注目度): 6.992477865573147
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Knowledge distillation (KD) typically relies on the fixed perspective of a single teacher, limiting the diversity of supervisory signals. While multi-teacher distillation addresses this by aggregating knowledge from multiple models, it incurs prohibitive computational and storage costs. To balance efficiency and diversity, recent research has focused on generating virtual views from a single teacher. However, existing methods face a trade-off: random perturbation approaches offer efficiency but lack controlled diversity, while structured augmentation methods require multi-stage training and incur linear parameter growth. We observe that this trade-off stems from a common design choice: using the teacher's strong but static features to generate views. Instead, we propose Shift-Augmented Knowledge Distillation (SAKD), a simple yet effective framework that leverages the student's evolving features as a dynamic condition for perturbation generation. This shift in perspective enables single-stage training while producing adaptive, diverse views through a parameter-free cyclic shift. Extensive experiments on CIFAR-100 and ImageNet demonstrate that SAKD consistently outperforms random perturbation methods and achieves accuracy on par with two-stage approaches, while using significantly fewer parameters and eliminating pre-training requirements.
- Abstract(参考訳): 知識蒸留(KD)は通常、1人の教師の固定的な視点に依存し、監督的な信号の多様性を制限する。
マルチティーチンガー蒸留は、複数のモデルからの知識を集約することでこの問題に対処するが、計算と記憶のコストは禁じられている。
効率性と多様性のバランスをとるために、最近の研究では、1人の教師から仮想ビューを生成することに焦点を当てている。
しかし、既存の手法はトレードオフに直面しており、ランダム摂動アプローチは効率性を提供するが、制御された多様性を欠いている。
このトレードオフは、教師の強いが静的な特徴を使ってビューを生成するという、共通の設計選択に起因していると考えています。
代わりに、学生の進化する特徴を摂動生成の動的条件として活用する、シンプルで効果的なフレームワークであるシフト強化知識蒸留(SAKD)を提案する。
この視点のシフトは、パラメータフリーのサイクリックシフトを通じて適応的で多様なビューを生成しながら、シングルステージのトレーニングを可能にする。
CIFAR-100とImageNetの大規模な実験では、SAKDはランダムな摂動法を一貫して上回り、2段階のアプローチと同等の精度で精度を達成し、パラメータを著しく少なくし、事前学習要求を排除している。
関連論文リスト
- Multi-Teacher Knowledge Distillation via Teacher-Informed Mixture Priors [6.218677961564673]
我々は,バイーシアン・フレームワーク内の複数の教師から蒸留した学生モデルを学習するMT-BKDについて紹介する。
エントロピーに基づく重み付け機構は、各教師の影響を適応的に調整し、生徒が複数の専門知識を効果的に組み合わせられるようにする。
MT-BKDは,タンパク質の細胞内位置予測や画像分類など,合成タスクと実世界のタスクの両方で有効である。
論文 参考訳(メタデータ) (2026-05-27T05:03:24Z) - DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models [55.01951088768769]
DiffusionOPDはオンライン政策蒸留(OPD)に基づく拡散モデルのための新しいマルチタスクトレーニングパラダイムである
本研究では,DiffusionOPDがトレーニング効率と最終性能において,マルチリワードRLとカスケードRLのベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-14T16:49:09Z) - Single-Teacher View Augmentation: Boosting Knowledge Distillation via Angular Diversity [20.479130509494272]
知識蒸留(KD)は、大容量の高能力教師から知識を伝達することで、軽量な学生モデルを訓練することを目的としている。
近年の研究では,多様な教師の視点を活用することで,蒸留性能が著しく向上することが示されている。
そこで本研究では,教師1人に複数のブランチをアタッチすることで,多様なマルチビューを生成するKDのための,コスト効率の高い知識向上手法を提案する。
論文 参考訳(メタデータ) (2025-10-26T01:41:08Z) - AdaSwitch: Adaptive Switching Generation for Knowledge Distillation [58.647880811071495]
スモール言語モデル(SLM)は、厳密な待ち時間と計算制約のあるアプリケーションには不可欠である。
トークンレベルでのオン・ポリティクスとオフ・ポリティクス・ジェネレーションを組み合わせた新しいアプローチであるAdaSwitchを提案する。
AdaSwitchは一貫して精度を向上し、SLMを蒸留するための実用的で効果的な方法を提供し、追加のオーバーヘッドを許容する。
論文 参考訳(メタデータ) (2025-10-09T06:38:37Z) - Intra-class Patch Swap for Self-Distillation [3.282914142012984]
単一学生ネットワークに基づく無教師蒸留フレームワークを提案する。
我々のアプローチは、クラス内パッチスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワップスワ
提案手法は,既存の自己蒸留ベースラインと従来の教師ベースのKDアプローチを一貫して上回る。
論文 参考訳(メタデータ) (2025-05-20T09:30:19Z) - Learning from Stochastic Teacher Representations Using Student-Guided Knowledge Distillation [64.15918654558816]
教師表現のフィルタリングと重み付けのための自己蒸留(SSD)訓練戦略を導入し,タスク関連表現のみから抽出する。
UCR Archiveのウェアラブル/バイオサインデータセット、HARデータセット、画像分類データセットなどの実世界の感情コンピューティングに関する実験結果は、提案したSSD手法が最先端の手法より優れていることを示している。
論文 参考訳(メタデータ) (2025-04-19T14:08:56Z) - Hybrid Distillation: Connecting Masked Autoencoders with Contrastive
Learners [102.20090188997301]
コントラスト学習(CL)とマスクド画像モデリング(MIM)の強みを組み合わせたモデルを得る方法について検討する。
識別と多様性の両立を図るため, 単純かつ効果的なハイブリッド蒸留戦略を提案する。
実験の結果、Hybrid Distillは異なるベンチマークで優れた性能が得られることが証明された。
論文 参考訳(メタデータ) (2023-06-28T02:19:35Z) - Class-Balanced Distillation for Long-Tailed Visual Recognition [100.10293372607222]
実世界のイメージはしばしばクラスごとの画像数の著しい不均衡によって特徴づけられ、ロングテール分布に繋がる。
本研究では、インスタンスサンプリングで学習した特徴表現が長尾設定では最適とは程遠いという重要な観察を行うことで、新しいフレームワークを提案する。
我々の主な貢献は、知識蒸留を利用して特徴表現を強化する新しい訓練方法である。
論文 参考訳(メタデータ) (2021-04-12T08:21:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。