論文の概要: Training a Student Expert via Semi-Supervised Foundation Model Distillation
- arxiv url: http://arxiv.org/abs/2604.03841v1
- Date: Sat, 04 Apr 2026 19:45:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:18.792824
- Title: Training a Student Expert via Semi-Supervised Foundation Model Distillation
- Title(参考訳): 半監督基礎モデル蒸留による学生専門家の育成
- Authors: Pardis Taghavi, Tian Liu, Renjie Li, Reza Langari, Zhengzhong Tu,
- Abstract要約: 我々は、事前学習された視覚基盤モデルをコンパクトな専門家に圧縮する半教師付き知識蒸留フレームワークを導入する。
この枠組みは,(1)対照校正による自己学習によるVFM(s)のドメイン適応,(2)統合された多目的損失による知識伝達,(3)残留する疑似ラベルバイアスを軽減するための学生の洗練,の3段階に展開する。
- 参考スコア(独自算出の注目度): 14.605642634292655
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Foundation models deliver strong perception but are often too computationally heavy to deploy, and adapting them typically requires costly annotations. We introduce a semi-supervised knowledge distillation (SSKD) framework that compresses pre-trained vision foundation models (VFMs) into compact experts using limited labeled and abundant unlabeled data, and instantiate it for instance segmentation where per-pixel labels are particularly expensive. The framework unfolds in three stages: (1) domain adaptation of the VFM(s) via self-training with contrastive calibration, (2) knowledge transfer through a unified multi-objective loss, and (3) student refinement to mitigate residual pseudo-label bias. Central to our approach is an instance-aware pixel-wise contrastive loss that fuses mask and class scores to extract informative negatives and enforce clear inter-instance margins. By maintaining this contrastive signal across both adaptation and distillation, we align teacher and student embeddings and more effectively leverage unlabeled images. On Cityscapes and ADE20K, our $\approx 11\times$ smaller student improves over its zero-shot VFM teacher(s) by +11.9 and +8.6 AP, surpasses adapted teacher(s) by +3.4 and +1.5 AP, and outperforms state-of-the-art SSKD methods on benchmarks.
- Abstract(参考訳): ファンデーションモデルは、強い認識を提供するが、デプロイするには計算的に重すぎることが多い。
本稿では,限定ラベル付き,豊富なラベル付きデータを用いて,事前学習された視覚基盤モデル(VFM)をコンパクトな専門家に圧縮する半教師付き知識蒸留(SSKD)フレームワークを導入し,特にピクセル単位のラベルが高価である場合のセグメンテーションをインスタンス化する。
この枠組みは,(1)対照校正による自己学習によるVFM(s)のドメイン適応,(2)統合された多目的損失による知識伝達,(3)残留する疑似ラベルバイアスを軽減するための学生の洗練,の3段階に展開する。
当社のアプローチの中心は、マスクとクラススコアを融合させ、情報的ネガティブを抽出し、明確なインスタンス間マージンを強制する、インスタンス対応のコントラスト損失である。
適応と蒸留の両方のコントラスト信号を維持することで、教師と生徒の埋め込みを整列させ、ラベルのないイメージをより効果的に活用する。
Cityscapes と ADE20K では、私たちの$\approx 11\times$ small students は、ゼロショットの VFM 教師を +11.9 と +8.6 AP で上回り、適応された教師を +3.4 と +1.5 AP で上回り、ベンチマークで最先端の SSKD メソッドを上回ります。
関連論文リスト
- Rethinking Long-tailed Dataset Distillation: A Uni-Level Framework with Unbiased Recovery and Relabeling [105.8570596633629]
トラジェクトリに基づく手法の限界を再考することにより,長い尾のデータセット蒸留を再考する。
統計的アライメントの観点からバイアスをモデル化し、公正な監督を復元する。
提案手法は,CIFAR-100-LTで15.6%,Tiny-ImageNet-LTで11.8%向上する。
論文 参考訳(メタデータ) (2025-11-24T07:57:01Z) - CAST: Contrastive Adaptation and Distillation for Semi-Supervised Instance Segmentation [14.605642634292655]
我々は,限定ラベル付きおよび豊富なラベル付きデータを用いて,事前学習された視覚基盤モデル(VFM)をコンパクトな専門家に圧縮する,半教師付き知識蒸留(SSKD)フレームワークであるCASTを紹介する。
1) 比較校正による自己訓練によるVFM(s)のドメイン適応,(2) 統合された多目的損失による知識伝達,(3) 残留する疑似ラベルバイアスを軽減するための学生の洗練,の3段階に展開する。
論文 参考訳(メタデータ) (2025-05-28T02:45:42Z) - Fine-grained Image-to-LiDAR Contrastive Distillation with Visual Foundation Models [55.99654128127689]
Visual Foundation Models (VFM) は、弱い教師付きピクセル対ポイントのコントラスト蒸留のためのセマンティックラベルを生成するために使用される。
我々は,空間分布とカテゴリー周波数の不均衡に対応するために,点のサンプリング確率を適応させる。
我々の手法は、下流タスクにおける既存の画像からLiDARへのコントラスト蒸留法を一貫して超越している。
論文 参考訳(メタデータ) (2024-05-23T07:48:19Z) - 2D Feature Distillation for Weakly- and Semi-Supervised 3D Semantic
Segmentation [92.17700318483745]
合成訓練された2Dセマンティックセマンティックセグメンテーションネットワークから高レベル特徴情報を蒸留するアイデアに基づく画像誘導ネットワーク(IGNet)を提案する。
IGNetは、ScribbleKITTI上の弱い教師付きLiDARセマンティックセマンティックセグメンテーションの最先端の結果を達成し、8%のラベル付きポイントしか持たない完全な教師付きトレーニングに対して最大98%のパフォーマンスを誇っている。
論文 参考訳(メタデータ) (2023-11-27T07:57:29Z) - Deep Semi-supervised Knowledge Distillation for Overlapping Cervical
Cell Instance Segmentation [54.49894381464853]
本稿では, ラベル付きデータとラベルなしデータの両方を, 知識蒸留による精度向上に活用することを提案する。
摂動に敏感なサンプルマイニングを用いたマスク誘導型平均教師フレームワークを提案する。
実験の結果,ラベル付きデータのみから学習した教師付き手法と比較して,提案手法は性能を著しく向上することがわかった。
論文 参考訳(メタデータ) (2020-07-21T13:27:09Z) - Distilling Object Detectors with Task Adaptive Regularization [97.52935611385179]
現在の最先端のオブジェクト検出器は高い計算コストを犠牲にしており、ローエンドデバイスへのデプロイが困難である。
より大規模な教師モデルから知識を伝達することで、より小さな学生ネットワークを訓練することを目的とした知識蒸留は、モデル小型化のための有望な解決策の1つである。
論文 参考訳(メタデータ) (2020-06-23T15:58:22Z) - Un-Mix: Rethinking Image Mixtures for Unsupervised Visual Representation
Learning [108.999497144296]
近年の先進的な教師なし学習手法では,同じ画像から2つの「ビュー」を学習表現として比較するために,サイムズ様の枠組みを用いている。
この研究は、教師なし学習においてラベル空間上の距離の概念を巻き込み、正対と負対のソフトな類似度をモデルに認識させることを目的としている。
その概念的単純さにもかかわらず、この解 -- 教師なし画像混合(Un-Mix)により、変換された入力と対応する新しいラベル空間からより微妙でより堅牢で一般化された表現を学習できることを実証的に示す。
論文 参考訳(メタデータ) (2020-03-11T17:59:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。