論文の概要: SPRKD: Effective Knowledge Distillation for Deep Neural Networks via Saddle Region Approximation
- arxiv url: http://arxiv.org/abs/2607.23346v1
- Date: Sat, 25 Jul 2026 19:53:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.069475
- Title: SPRKD: Effective Knowledge Distillation for Deep Neural Networks via Saddle Region Approximation
- Title(参考訳): SPRKD:サドル領域近似によるディープニューラルネットワークの効果的な知識蒸留
- Abstract要約: SPRKD(Saddle Point Recruitment for Knowledge Distillation)を提案する。
SPRKDは、教師を最適化曲率とドメインプロキシとして採用し、サドルポイントを強力な後発ポテンシャルの領域として特徴づけている。
マラリアの血液スミア分類では、SPRKDは94.8%の精度で反応KDを24.70ポイント上回っている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern deep neural networks are potent catalysts for scientific and industrial impact, yet excessive parameter counts impede deployment in low-compute settings such as hospital equipment and energy infrastructure. Predominant knowledge distillation (KD) methods favor replication: smaller students mimic teacher output logits, yet empirically yield low task performance, hamper convergence, and act merely as regularization rather than substantive knowledge transfer. We propose Saddle Point Recruitment for Knowledge Distillation (SPRKD), reframing distillation from replication to employing teachers as optimization-curvature and domain proxies, characterizing saddle points as regions of strong further-descent potential via embedding and basin-fractal properties. Using Hessian eigenvalue spectral density (ESD), SPRKD identifies low-loss saddle regions for student re-exploration; weak-teacher ensembles are aggregated into an Approximated Saddle Region (ASR), re-parameterized into the student via Transfer Learning by Injection, and approached with exponentially decaying Euclidean transformations, Negative Hessian Eigensteps, and Gaussian perturbations. On malaria blood smear classification with a 6,430-parameter CNN distilled from a weak 25,546-parameter teacher, SPRKD reaches 94.8% validation accuracy, outperforming Response KD by 24.70 percentage points (McNemar p = 6.3e-87) and matching scratch-trained baselines of the same architecture to statistical equivalence (p = 1.0). Across MNIST, CIFAR-100, and TinyImageNet, SPRKD exceeds scratch-trained baselines by up to 8 percentage points on preliminary benchmarks. Hessian ESD and 2-D loss landscape analysis show convergence to wider minima with substantially smaller Hessian trace and spectral radius than Response KD and control students, indicating smoother descent and greater noise robustness.
- Abstract(参考訳): 現代のディープニューラルネットワークは、科学的および工業的影響の強力な触媒であるが、過度なパラメータは、病院設備やエネルギーインフラなどの低計算量環境への展開を妨げる。
小規模の学生は教師の出力ロジットを模倣するが、経験的に低いタスク性能を示し、収束を妨げ、実質的な知識伝達よりも単に正規化として振る舞う。
そこで我々は,SPRKD (Saddle Point Recruitment for Knowledge Distillation) を提案する。このSaddle Point Recruitment for Knowledge Distillation (SPRKD) は,教師を最適化曲率やドメインプロキシとして利用するための複製から蒸留への再フレーミングであり,サドルポイントを埋設と流域フラクタル特性を通じて,強力なさらなる潜在ポテンシャルの領域として特徴づけるものである。
ヘッセン固有値スペクトル密度(ESD)を用いて、SPRKDは学生の再探索のための低損失サドル領域を同定し、弱い教師のアンサンブルを近似サドル領域(ASR)に集約し、トランスファーラーニング・バイ・インジェクション(Transfer Learning by Injection)を通して学生にパラメータ化し、指数関数的に崩壊するユークリッド変換、負のヘッセン固有ステップ、ガウス摂動にアプローチする。
弱い25,546パラメーターの教師から蒸留した6,430パラメートルのCNNを用いたマラリアの血液スミア分類では、SPRKDは94.8%の精度に達し、応答KDを24.70パーセンテージポイント(McNemar p = 6.3e-87)で上回り、同じアーキテクチャのスクラッチトレーニングされたベースラインを統計的等価性(p = 1.0)に適合させる。
MNIST、CIFAR-100、TinyImageNetの他、SPRKDは、事前ベンチマークにおいて、スクラッチトレーニングされたベースラインを最大8ポイント越えている。
ヘッセン系ESDと2次元ロスランドスケープ解析は,反応KDと制御学生よりもヘッセン系トレースとスペクトル半径がかなり小さく,よりスムーズな降下とより大きなノイズロバスト性を示す。
関連論文リスト
- Criticality-Constrained Iterative Pruning for Energy-Efficient Spiking Neural Networks via Combined Importance Scoring [0.6345523830122167]
ニューロモルフィックハードウェアにスパイキングニューラルネットワーク(SNN)をデプロイするには、積極的なシナプス的プルーニングが必要である。
既存の戦略は、神経の無視的臨界性、または本質的に刈り取られる問題の凸緩和に依存する。
本稿では,PyTorchのパイプラインであるCriticality-Constrained Quadratic Pruning (CQP)について述べる。
論文 参考訳(メタデータ) (2026-06-26T08:48:01Z) - Distillation Traps and Guards: A Calibration Knob for LLM Distillability [54.90137955363471]
そこで本研究では,教師の蒸留性を制御するためのポストホック校正法を提案する。
我々の目標は、タスクユーティリティ、KLアンカー、およびクロストケナイザーキャリブレーション報酬を組み合わせることである。
実験により、蒸留可能な教師から蒸留した学生は、SFTおよびKDベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-04-21T01:22:35Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - REDistill: Robust Estimator Distillation for Balancing Robustness and Efficiency [0.0]
本稿では、ロバスト統計に基づく原則化されたフレームワークであるREDistillを紹介する。
レディスティルは標準のKD目標をKL分散の一般化であるパワー分散損失に置き換える。
CIFAR-100 と ImageNet-1k の実験では、REDistill は多様な教師/学生アーキテクチャにおける生徒の精度を一貫して向上することを示した。
論文 参考訳(メタデータ) (2026-02-04T15:50:53Z) - Path-Coordinated Continual Learning with Neural Tangent Kernel-Justified Plasticity: A Theoretical Framework with Near State-of-the-Art Performance [0.618778092044887]
破滅的な忘れは継続的学習の根本的問題の一つである。
提案した枠組みは、原理的可塑性境界のニューラル・タンジェント・カーネル(NTK)理論を統一する。
このフレームワークは、厳密な統計的保証で発見されたパスの80%を検証する。
論文 参考訳(メタデータ) (2025-11-03T19:55:59Z) - XD-RCDepth: Lightweight Radar-Camera Depth Estimation with Explainability-Aligned and Distribution-Aware Distillation [9.693623829515131]
我々は、最先端の軽量ベースラインと比較してパラメータを29.7%削減する軽量アーキテクチャであるXD-RCDepthを提案する。
本稿では,教師のサリエンシ構造を学生に伝達する説明可能性に整合した蒸留法と,識別されたビンに対する深度回帰をソフトな分類として再放送する深度分布蒸留法について紹介する。
論文 参考訳(メタデータ) (2025-10-15T14:05:33Z) - Low Tensor-Rank Adaptation of Kolmogorov--Arnold Networks [70.06682043272377]
コルモゴロフ-アルノルドネットワーク(KAN)は、様々な領域における多層知覚(MLP)の代替としての可能性を示した。
微調整カンのためのローテンソルランク適応(LoTRA)を開発した。
微調整カンによる様々な偏微分方程式(PDE)を効率的に解くためのLoTRAの適用について検討する。
論文 参考訳(メタデータ) (2025-02-10T04:57:07Z) - Knowledge Distillation Performs Partial Variance Reduction [93.6365393721122]
知識蒸留は'学生'モデルの性能を高めるための一般的な手法である。
知識蒸留(KD)の背後にある力学は、まだ完全には理解されていない。
我々は,KDを新しいタイプの分散還元機構として解釈できることを示す。
論文 参考訳(メタデータ) (2023-05-27T21:25:55Z) - Can pruning improve certified robustness of neural networks? [106.03070538582222]
ニューラルネット・プルーニングはディープ・ニューラル・ネットワーク(NN)の実証的ロバスト性を向上させることができることを示す。
実験の結果,NNを適切に刈り取ることで,その精度を8.2%まで向上させることができることがわかった。
さらに,認証された宝くじの存在が,従来の密集モデルの標準および認証された堅牢な精度に一致することを観察する。
論文 参考訳(メタデータ) (2022-06-15T05:48:51Z) - Orderly Dual-Teacher Knowledge Distillation for Lightweight Human Pose
Estimation [1.0323063834827415]
そこで我々は,異なる能力を持つ2人の教師からなる,秩序ある二重教師知識蒸留(ODKD)フレームワークを提案する。
両教師をまとめて、知識の吸収性を促進するための秩序ある学習戦略を提案する。
提案するodkdは異なる軽量モデルの性能を大きなマージンで向上させ,hrnet-w16は軽量なポーズ推定のための最先端の性能を実現する。
論文 参考訳(メタデータ) (2021-04-21T08:50:36Z) - RIFLE: Backpropagation in Depth for Deep Transfer Learning through
Re-Initializing the Fully-connected LayEr [60.07531696857743]
事前訓練されたモデルを用いたディープ畳み込みニューラルネットワーク(CNN)の微調整は、より大きなデータセットから学習した知識をターゲットタスクに転送するのに役立つ。
転送学習環境におけるバックプロパゲーションを深める戦略であるRIFLEを提案する。
RIFLEは、深いCNN層の重み付けに意味のあるアップデートをもたらし、低レベルの機能学習を改善する。
論文 参考訳(メタデータ) (2020-07-07T11:27:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。