論文の概要: Distill on a Diet: Efficient Knowledge Distillation via Learnable Data Pruning
- arxiv url: http://arxiv.org/abs/2606.25488v1
- Date: Wed, 24 Jun 2026 07:17:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.256741
- Title: Distill on a Diet: Efficient Knowledge Distillation via Learnable Data Pruning
- Title(参考訳): 食事の蒸留:学習可能なデータ・プルーニングによる効率的な知識蒸留
- Abstract要約: 知識蒸留(KD)は資源制約環境における効率的な推論のためのコンパクトなモデルを得るために広く用いられている。
本稿では,影響関数と学習可能なサンプリングポリシを組み合わせた効率的なデータ解析フレームワークIF-Betaを提案する。
CIFAR-10/100 と ImageNet の実験では、IF-Beta は他のベースラインよりも幅広いプルーニング比で一貫して優れていた。
- 参考スコア(独自算出の注目度): 39.145926634579105
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Knowledge Distillation (KD) is widely used to obtain compact models for efficient inference in resource-constrained environments. Yet the computational overhead of the distillation process itself is often overlooked, raising the question of whether a better student model can be obtained with less data and less compute via data pruning. However, existing data pruning methods are not designed for KD: some introduce substantial overhead, such as obtaining training dynamics through retraining, while others rely on heuristic selection rules that fail to capture what KD actually requires, often resulting in suboptimal subsets. To address these issues, we propose IF-Beta, an efficient data pruning framework that combines influence functions with a learnable sampling policy. Empirically, we first demonstrate that influence functions can serve as an effective and efficient estimator of sample impact in KD settings, where only a pretrained teacher is available. Building on this, our sampling policy is specifically parameterized by a Beta distribution, whose highly flexible two-parameter family allows the policy to adapt to diverse pruning regimes rather than being tied to fixed heuristic forms. Next, we formulate KD pruning as optimizing this policy through a bilevel objective, where the inner loop operates in the teacher feature space with a KD-aligned objective, enabling fast proxy training, while the outer loop updates the policy parameters to maximize distillation performance. This design ensures that IF-Beta is both computationally efficient and inherently aligned with the goals of KD. Extensive experiments on CIFAR-10/100 and ImageNet show that IF-Beta consistently outperforms other baselines across a wide range of pruning ratios. Remarkably, IF-Beta enables students trained on less data and less compute to surpass the performance of students distilled on the full dataset.
- Abstract(参考訳): 知識蒸留(KD)は資源制約環境における効率的な推論のためのコンパクトなモデルを得るために広く用いられている。
しかし、蒸留プロセス自体の計算オーバーヘッドは見過ごされがちであり、より少ないデータと少ないデータプルーニングによる計算でより良い学生モデルが得られるかどうかという疑問が提起される。
しかし、既存のデータプルーニング手法はKDのために設計されておらず、リトレーニングによるトレーニングダイナミクスの獲得など、かなりのオーバーヘッドを伴っているものもあれば、KDが実際に必要とするものをキャプチャできないヒューリスティックな選択規則に依存しているものもある。
これらの問題に対処するために,インフルエンス関数と学習可能なサンプリングポリシを組み合わせた効率的なデータ解析フレームワークIF-Betaを提案する。
実験により, 教師が事前学習を受けられるKD設定において, 影響関数が有効かつ効率的にサンプルの影響を推定できることを示す。
これに基づいて,我々のサンプリングポリシは,高度にフレキシブルな2パラメータファミリーを持つベータ分布によってパラメータ化され,固定ヒューリスティックな形式に縛られるのではなく,多様なプルーニングレシシシズに適応することができる。
次に、KDプルーニングを、このポリシーを双方向の目的によって最適化するものとして定式化し、内部ループが教師特徴空間内でKDアラインな目的で動作し、高速なプロキシトレーニングを可能にし、外部ループがポリシーパラメータを更新して蒸留性能を最大化する。
この設計により、IF-Betaは計算効率が良く、KDの目標と本質的に一致していることが保証される。
CIFAR-10/100 と ImageNet の大規模な実験により、IF-Beta は他のベースラインよりも幅広いプルーニング比を一貫して上回っていることが示された。
注目すべきは、IF-Betaを使用することで、トレーニングを受けた学生がデータが少なくなり、計算能力も低下し、全データセットで蒸留された学生のパフォーマンスを上回ることができることだ。
関連論文リスト
- OrderDP: A Theoretically Guaranteed Lossless Dynamic Data Pruning Framework [30.771327347534996]
OrderDPは、理論的な保証とともに、安定的で、偏りがなく、ほぼロスレスなトレーニングアクセラレーションを得ることを目的としている。
CIFAR-10, CIFAR-100, ImageNet-1K の総合ベースラインに対する OrderDP の評価を行った。
論文 参考訳(メタデータ) (2026-06-07T11:11:51Z) - Data-Efficient RLVR via Off-Policy Influence Guidance [84.60336960383867]
本研究は,学習目標に対する各データポイントの寄与を推定するために,影響関数を用いた理論的基礎的アプローチを提案する。
textbfCurriculum textbfRL with textbfOff-textbfPolicy textInfluence Guide (textbfCROPI) は多段階のRLフレームワークで、現在のポリシーにおいて最も影響力のあるデータを反復的に選択する。
論文 参考訳(メタデータ) (2025-10-30T13:40:52Z) - Less is More: Selective Reflection for Compatible and Efficient Knowledge Distillation in Large Language Models [0.0]
知識蒸留(KD)は、大規模言語モデル(LLM)をコンパクトで効率的な学生モデルに圧縮する技術である。
本稿では,新しいデータキュレーションフレームワークである選択反射蒸留(SRD)を提案する。
プラグ・アンド・プレイの強化として、SRDは様々なホワイトボックスKDアプローチで蒸留結果を改善する。
論文 参考訳(メタデータ) (2025-08-08T08:55:53Z) - Online Knowledge Distillation with Reward Guidance [3.9160947065896803]
本研究は,大規模言語モデル(LLM)に対する知識蒸留(KD)を優先最適化により研究する。
本稿では,学生と教師の政策間のパフォーマンスギャップを最小限に抑えるために,政策と報酬モデル(RM)間のmin-max最適化問題を定式化した,シーケンシャルKDのための報酬誘導型模倣学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-25T02:56:18Z) - Active Data Curation Effectively Distills Large-Scale Multimodal Models [66.23057263509027]
知識蒸留(KD)は、大規模モデルをより小さなものに圧縮するデファクトスタンダードである。
本研究では, 対照的なマルチモーダル事前学習のための効果的な蒸留法として, 能動的データキュレーションの代替として, 簡単なアプローチを探求する。
我々の単純なオンラインバッチ選択方法であるACIDは、さまざまなモデル、データ、計算構成において、強力なKDベースラインよりも優れています。
論文 参考訳(メタデータ) (2024-11-27T18:50:15Z) - Condensed Data Expansion Using Model Inversion for Knowledge Distillation [39.800536851433776]
本稿では,モデルインバージョンを用いた縮合データセットの拡張手法を提案する。
凝縮したサンプルを補完する合成データを作成することにより、トレーニングセットを充実させ、基礎となるデータ分布をよりよく近似する。
本手法は, 凝縮データセットのみを用いた場合と比較して, KD精度が著しく向上したことを示す。
論文 参考訳(メタデータ) (2024-08-25T14:43:27Z) - Direct Preference Knowledge Distillation for Large Language Models [73.50849692633953]
大規模言語モデル(LLM)のためのDPKD(Direct Preference Knowledge Distillation)を提案する。
我々はLLMのKDを、暗黙の報酬と逆のKL分岐からなる最適化と目的の2段階に再構成する。
実験と理論的解析により,KDにおける暗黙の報酬と出力選好の価値と効果を証明した。
論文 参考訳(メタデータ) (2024-06-28T09:23:40Z) - Robustness-Reinforced Knowledge Distillation with Correlation Distance and Network Pruning [3.1423836318272773]
知識蒸留(KD)は、効率的で軽量なモデルの性能を向上させる。
既存のKD技術のほとんどは、Kulback-Leibler(KL)の発散に依存している。
相関距離とネットワークプルーニングを利用したロバストネス強化知識蒸留(R2KD)を提案する。
論文 参考訳(メタデータ) (2023-11-23T11:34:48Z) - Efficient training of lightweight neural networks using Online
Self-Acquired Knowledge Distillation [51.66271681532262]
オンライン自己獲得知識蒸留(OSAKD)は、ディープニューラルネットワークの性能をオンライン的に向上することを目的としている。
出力特徴空間におけるデータサンプルの未知確率分布を推定するために、k-nnノンパラメトリック密度推定手法を用いる。
論文 参考訳(メタデータ) (2021-08-26T14:01:04Z) - MixKD: Towards Efficient Distillation of Large-scale Language Models [129.73786264834894]
データに依存しない蒸留フレームワークであるMixKDを提案する。
妥当な条件下では、MixKDは誤差と経験的誤差の間のギャップを小さくする。
限定的なデータ設定とアブレーションによる実験は、提案手法の利点をさらに証明している。
論文 参考訳(メタデータ) (2020-11-01T18:47:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。