論文の概要: Cross-Architecture Knowledge Distillation from a Vision Foundation Model to a Lightweight Visual State Space Model for Tea Leaf Disease Classification
- arxiv url: http://arxiv.org/abs/2608.26771v1
- Date: Thu, 27 Aug 2026 08:02:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.300337
- Title: Cross-Architecture Knowledge Distillation from a Vision Foundation Model to a Lightweight Visual State Space Model for Tea Leaf Disease Classification
- Title(参考訳): 視覚基礎モデルから茶葉病分類のための軽量視覚状態空間モデルへのクロスアーキテクチャ知識蒸留
- Authors: Zibo Zhou, Zongsen Qiu, Rui Chen, Yujie Yao, Yue Zhou, Jianjun Wang,
- Abstract要約: DINOv2のような自己監督型ビジョンファウンデーションモデルは強力な機能を提供するが、フィールド展開には大きすぎる。
微調整DINOv2教師からコンパクトな双方向視覚空間モデルへのクロスアーキテクチャ知識の蒸留について検討した。
我々は,SSM学生が限られたデータで学習することを防ぐ2つのトレーニング安定問題を同定し,修正する。
- 参考スコア(独自算出の注目度): 10.122947222129108
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automated tea leaf disease classification supports precision agriculture, yet deploying accurate models on edge devices remains challenging under tight compute budgets. Self-supervised vision foundation models such as DINOv2 provide strong features but are too large for field deployment, while lightweight models trained from scratch on small agricultural datasets often underfit. We study cross-architecture knowledge distillation (KD) from a fine-tuned DINOv2 teacher (Vision Transformer) to a compact bidirectional Visual State Space Model (LVSSM) student, an underexplored direction because the architectures use fundamentally different token-mixing mechanisms. We identify and fix two training-stability problems that prevent the from-scratch SSM student from learning on limited data: a single large patch-embedding convolution and a fusion layer that severs the residual path. With a progressive convolutional stem and gated bidirectional selective-scan block, the 4.45M-parameter student trains stably. Across three seeds, temperature-scaled logit distillation raises test accuracy from 92.32+/-2.14% to 95.41+/-1.17% (best single run: 96.20%; macro-F1: 94.45%), a +3.09 percentage-point mean gain. The student uses 5.0 times fewer parameters than the 22M-parameter teacher while retaining 98.3% of its accuracy. Ablations show that intermediate feature-alignment losses reduce accuracy, making simple logit-level KD the strongest configuration. A fair from-scratch comparison shows the gain is specific to students that start below the teacher. We report per-class metrics, confusion matrices, bootstrap confidence intervals, and FLOPs/latency measurements, and discuss limitations including the single-dataset scope and simplified non-official SSM implementation.
- Abstract(参考訳): 茶葉病の自動分類は、精密農業を支援するが、厳密な計算予算の下では、エッジデバイスに正確なモデルをデプロイすることは困難である。
DINOv2のような自己監督型視覚基盤モデルは強力な機能を提供するが、フィールド展開には大きすぎる。
本研究では,DINOv2教師(視覚変換器)からLVSSM学生へのクロスアーキテクチャ知識蒸留(KD)について検討した。
我々は,SSM学生が限られたデータで学習することを阻止する2つの訓練安定問題,すなわち1つの大きなパッチ埋め込み畳み込み畳み込みと,残路を分離する融合層を同定し,解決する。
プログレッシブ・コンボリューション・ステムと2方向選択走査ブロックにより、4.45Mパラメーターの学生列車は安定して運転された。
温度スケールのロージット蒸留は、テスト精度を92.32+/-2.14%から95.41+/-1.17%に引き上げる(最も高い単走率:96.20%、マクロF1:94.45%、+3.09ポイントの平均ゲイン)。
生徒は22Mパラメーターの教師の5.0倍のパラメータを使用し、精度は98.3%を維持している。
アブレーションにより、中間的な特徴調整損失は精度を低下させ、単純なロジットレベルのKDが最強の構成となる。
公平なアウト・スクラッチ比較は、教師の下から始める生徒に特有な利得を示している。
本稿では,クラス単位のメトリクス,混乱行列,ブートストラップの信頼区間,FLOP/レイテンシの測定について報告する。
関連論文リスト
- Towards Compact Unified Multimodal Tracking: Synergizing Knowledge Distillation with Structural Pruning [80.73561460934809]
多モード物体追跡は 相補的なセンサーデータを活用することで 目覚ましい堅牢性を達成した
我々は予測ヘッドを重要ではあるが、しばしば見過ごされる効率ボトルネックとみなしている。
デコーダアーキテクチャを戦略的に合理化することで、リアルタイム推論の可能性を解き放ちます。
論文 参考訳(メタデータ) (2026-08-02T20:41:33Z) - LIFT and PLACE: A Simple, Stable, and Effective Knowledge Distillation Framework for Lightweight Diffusion Models [9.025382179940767]
Linear Fitting based distillation (LIFT)とPiecewise Local Adaptive Coefficient Estimation (PLACE)による粗粒蒸留の枠組み
実験の結果、LIFTとPLACEは拡散空間(イメージ/ラテント)、バックボーン(U-Net/DiT)、タスク(条件/条件)、データセット、さらにはMMDiT(SD3)のようなフローベースモデルにまで拡張できることが示された。
論文 参考訳(メタデータ) (2026-05-19T12:03:53Z) - Cognitive-Uncertainty Guided Knowledge Distillation for Accurate Classification of Student Misconceptions [11.509375725817195]
既存のデータから高価値サンプルをマイニングする2段階の知識蒸留フレームワークを提案する。
フィルタされたサンプルのわずか10.30%で強化トレーニングを行うことで、MAP-Chartingデータセットで0.9585 (+17.8%)のMAP@3を達成する。
4Bパラメータモデルのみを用いて、中学代数学の誤概念ベンチマークのクロストピックテストにおいて84.38%の精度が得られる。
論文 参考訳(メタデータ) (2026-05-14T12:17:38Z) - Distillation Traps and Guards: A Calibration Knob for LLM Distillability [54.90137955363471]
そこで本研究では,教師の蒸留性を制御するためのポストホック校正法を提案する。
我々の目標は、タスクユーティリティ、KLアンカー、およびクロストケナイザーキャリブレーション報酬を組み合わせることである。
実験により、蒸留可能な教師から蒸留した学生は、SFTおよびKDベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-04-21T01:22:35Z) - DKD-KAN: A Lightweight knowledge-distilled KAN intrusion detection framework, based on MLP and KAN [0.0]
Kolmogorov-Arnold Network (KAN) を用いて, データの複雑な特徴を捉える軽量な侵入検出フレームワークを提案する。
テストベッド上で実行される攻撃を検出するために、まず高容量のkanネットワークを訓練する。
このモデルは教師として機能し、DKDを介してより小さな多層パーセプトロン(MLP)の学生モデルを導く。
得られたDKD-MLPモデルは、WADIおよびSWaTデータセットのパラメータが2,522と1,622しかない。
論文 参考訳(メタデータ) (2026-03-03T20:02:11Z) - Post-Training Probability Manifold Correction via Structured SVD Pruning and Self-Referential Distillation [0.0]
Sparse Knowledge Distillation (SparseKD) は、構造化SVDプルーニングと自己参照知識蒸留を組み合わせることでトランスフォーマーモデルを圧縮する手法である。
SparseKDは、外部のスーパー教師、アーキテクチャの変更、カスタム推論カーネルを必要としないため、既存のインフラで即座にデプロイできる。
論文 参考訳(メタデータ) (2026-01-30T22:42:02Z) - Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free [81.65559031466452]
我々は、ゲーティング強化ソフトマックスアテンションの変種を調べる実験を行った。
SDPA(Scaled Dot-Product Attention)後の頭部特異的シグモイドゲートを簡易に修正することで,性能が向上することがわかった。
論文 参考訳(メタデータ) (2025-05-10T17:15:49Z) - Unleashing the Power of One-Step Diffusion based Image Super-Resolution via a Large-Scale Diffusion Discriminator [81.81748032199813]
拡散モデルは実世界の超解像(Real-ISR)に優れた性能を示した
SRのための大規模textbfDiscriminator を用いた One-Step textbfDiffusion モデルを提案する。
我々の判別器は、潜伏空間における拡散モデルの任意の時間ステップからノイズのある特徴を抽出することができる。
論文 参考訳(メタデータ) (2024-10-05T16:41:36Z) - One-for-All: Bridge the Gap Between Heterogeneous Architectures in
Knowledge Distillation [69.65734716679925]
知識蒸留は,教師が指導する学習手法を通じて,モデル性能を向上させる上で,極めて効果的な手法であることが証明されている。
既存の蒸留法のほとんどは、教師と生徒のモデルが同じモデルファミリーに属するという前提で設計されている。
我々は, ヘテロジニアスアーキテクチャ間の蒸留性能を大幅に向上させる, OFA-KDという, 単純で効果的な一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元一元
論文 参考訳(メタデータ) (2023-10-30T11:13:02Z) - Alexa Teacher Model: Pretraining and Distilling Multi-Billion-Parameter
Encoders for Natural Language Understanding Systems [63.713297451300086]
本研究では,700Mから9.3Bまでの非埋め込みパラメータ数を持つ事前学習エンコーダの大規模実験結果について述べる。
その後、17M-170Mパラメータからより小さなモデルに蒸留し、仮想アシスタントシステムの自然言語理解(NLU)コンポーネントに応用した。
論文 参考訳(メタデータ) (2022-06-15T20:44:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。