論文の概要: Multi-Teacher Contrastive Distillation for Edge-Efficient Pathology Foundation Models
- arxiv url: http://arxiv.org/abs/2607.05533v1
- Date: Mon, 06 Jul 2026 18:14:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.298267
- Title: Multi-Teacher Contrastive Distillation for Edge-Efficient Pathology Foundation Models
- Title(参考訳): エッジ効率のよい病理基盤モデルのためのマルチ教師コントラスト蒸留法
- Abstract要約: 複数のPFMから小型エッジ指向エンコーダに冷凍タイル埋め込みを蒸留する事前学習フレームワーク MuCoDi を提案する。
11.8KのWSIから14.3MのTCGAタイルをプレトレーニングし、23の下流分類タスクで凍結エンコーダの評価を行った。
- 参考スコア(独自算出の注目度): 1.9573380763700714
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computational pathology foundation models (PFMs) have advanced whole-slide image analysis. However, their size and inference cost hinder local deployment in pathology departments. We propose MuCoDi, a pretraining framework that distills frozen tile embeddings from multiple PFMs into compact edge-oriented encoders. Instead of regressing individual teacher features, MuCoDi trains lightweight MobileOne and RepViT students with a contrastive distillation objective adapted from MoCo v3, where cached Virchow2, UNI2, and H-Optimus-1 embeddings replace momentum-encoder keys. We pretrain students on 14.3M TCGA tiles from only 11.8K WSIs and evaluate frozen encoders on 23 clinically curated downstream classification tasks. RepViT-based MuCoEdge students retain near-teacher performance while reducing model size by orders of magnitude: MuCoEdge-R2.3 and MuCoEdge-R1.5 reach 71.0% external AUROC, within 0.8 percentage points of the best teacher (Virchow2, 71.8%), while MuCoEdge-R2.3 obtains the best external F1 and the second-best AUPRC (51.8% and 53.3%). MuCoEdge-R1.0 reaches 70.9% AUROC with only 6.4M parameters and 1.12 GFLOPs. On a Raspberry Pi 5, sub-million-parameter MobileOne students achieve up to 605-fold single-tile speedup over Virchow2 while retaining 66.5% to 66.9% external AUROC, demonstrating that PFM-quality pathology representations can be moved toward practical edge deployment. Code is available at https://anonymous.4open.science/r/mucodi-6243.
- Abstract(参考訳): PFM(Computational pathology foundation model)は、画像解析の進歩である。
しかし、それらのサイズと推論コストは、病理学の分野における局所的な展開を妨げる。
複数のPFMから小型エッジ指向エンコーダに冷凍タイル埋め込みを蒸留する事前学習フレームワーク MuCoDi を提案する。
MuCoDiは、個々の教師の特徴を抑える代わりに、MoCo v3から適応した対照的な蒸留目標であるMobileOneとRepViTの生徒を訓練する。
11.8KのWSIから14.3MのTCGAタイルをプレトレーニングし、23の下流分類タスクで凍結エンコーダの評価を行った。
MuCoEdge-R2.3とMuCoEdge-R1.5は、最高の教師(Virchow2, 71.8%)の0.8ポイント以内のAUROCに到達し、MuCoEdge-R2.3は最高の外部F1と第2のAUPRC(51.8%と53.3%)を得る。
MuCoEdge-R1.0は70.9%のAUROCに達し、6.4Mパラメータと1.12 GFLOPしか持たない。
Raspberry Pi 5では、サブミリオンパラメーターのMobileOneの学生がVirchow2上で最大605倍のシングルタイルスピードアップを達成し、66.5%から66.9%の外部AUROCを維持した。
コードはhttps://anonymous.4open.science/r/mucodi-6243で公開されている。
関連論文リスト
- Distilling Foundation Models for Agentic What-If Reasoning:Cost, Latency, and Governance in a Hybrid LLM+SLM Architecture [4.205733518246009]
タブラル基礎モデルは、コンテキスト内学習を通じて強いゼロトレーニング予測性能を提供するが、その高い推論遅延は、インタラクティブなエージェントループにおけるホットパス決定バックエンドとして実用的ではない。
UCIアダルトとOpenMLの5つのベンチマークに基づいて,TabPFNの教師を小型のフィードフォワードの学生に蒸留する。
学生は95.4-100.5%の精度と96.8-100.0%のAUCを維持しており、クレジットgの保持率が最も低い95.4%である。
論文 参考訳(メタデータ) (2026-09-14T11:26:21Z) - Cross-Architecture Knowledge Distillation from a Vision Foundation Model to a Lightweight Visual State Space Model for Tea Leaf Disease Classification [10.122947222129108]
DINOv2のような自己監督型ビジョンファウンデーションモデルは強力な機能を提供するが、フィールド展開には大きすぎる。
微調整DINOv2教師からコンパクトな双方向視覚空間モデルへのクロスアーキテクチャ知識の蒸留について検討した。
我々は,SSM学生が限られたデータで学習することを防ぐ2つのトレーニング安定問題を同定し,修正する。
論文 参考訳(メタデータ) (2026-08-27T08:02:05Z) - Eddy-VL 1.9B: Structural Pruning and Layered Distillation for Edge-Deployable Multimodal Embedding [1.2132884030603328]
我々は,Qwen3-VL-Embedding-2B上に構築された圧縮マルチモーダル埋め込みモデルであるEddy-VL 1.9Bを紹介した。
Eddy-VLは、クラウドAPIが利用できない、低レイテンシが不可欠である、空輸の法医学的および調査的な設定をターゲットにしている。
リリースされたモデルは1,926,188,032 のパラメータ (3.85 GB bf16) を含み、2.13B の教師モデルよりも約9.5%少ないパラメータを表現している。
論文 参考訳(メタデータ) (2026-07-15T04:36:19Z) - Benchmarking Federated Learning and Knowledge Distillation for Point Cloud Classification [5.584060970507507]
本稿では,3次元点雲分類のための連成学習(FL)と知識蒸留(KD)を併用して評価する。
13のFLアルゴリズムと10のKD目標(130対のクロスプロダクト)を504のトレーニング実行に当てはめ、ModelNet40と臨床クラニオシノスタシスデータセットで評価されている。
論文 参考訳(メタデータ) (2026-06-30T20:12:27Z) - Single-Channel Tissue Segmentation via Cross-Modal Distillation from Foundation Models [0.0]
多重蛍光顕微鏡は、核(DAPI)と膜(E-カドヘリン)を含む相補的なチャネルを提供することで組織セグメンテーションを改善する
本研究では,核チャネルのみで動作する軽量の学生に,凍結基礎モデル教師による多重入力処理から意味情報を伝達するクロスモーダルな知識蒸留フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-30T23:34:49Z) - Less is More in Semantic Space: Intrinsic Decoupling via Clifford-M for Fundus Image Classification [13.23226865033351]
フィードフォワード展開と周波数分割モジュールを疎幾何学的相互作用で置き換える軽量バックボーンであるClifford-Mを提案する。
プリトレーニングなしでは、Clifford-M は平均 AUC-ROC が 0.8142 で、平均マクロF1 が 0.5481 で、ODIR-5K は 0.85M のパラメータしか持たない。
論文 参考訳(メタデータ) (2026-03-21T13:00:05Z) - STEP3-VL-10B Technical Report [115.89015065130127]
STEP3-VL-10Bは、コンパクト効率とフロンティアレベルのマルチモーダルインテリジェンスとのトレードオフを再定義する軽量基盤モデルである。
そこで我々はPallel Coordinated Reasoning(PaCoRe)を実装して,テスト時間計算をスケールし,リソースをスケーラブルな知覚推論に割り当てる。
MMBenchでは92.2%、MMMUでは80.11%、AIME2025では94.43%、MathVisionでは75.95%である。
論文 参考訳(メタデータ) (2026-01-14T17:58:24Z) - MI-to-Mid Distilled Compression (M2M-DC): An Hybrid-Information-Guided-Block Pruning with Progressive Inner Slicing Approach to Model Compression [2.351601888896043]
そこで我々は,MI-to-Mid Distilled Compression (M2M-DC) について紹介する。
M2M-DCは、ラベル対応の相互情報信号によって残留ブロックをランク付けする。
その後、短いKD相をステージコヒーレントで残留安全なチャネルスライシングと交換する。
論文 参考訳(メタデータ) (2025-11-10T08:36:29Z) - CoMAD: A Multiple-Teacher Self-Supervised Distillation Framework [1.2172320168050466]
CoMAD (Consensus-oriented Masked Distillation) について紹介する。
自己監督型ビジョントランスフォーマーからの知識を、コンパクトな学生ネットワークに統合する。
ImageNet-1Kでは、CoMADのViT-Tinyが75.4%のTop-1を達成した。
論文 参考訳(メタデータ) (2025-08-06T18:55:14Z) - CoMP: Continual Multimodal Pre-training for Vision Foundation Models [72.3323674291719]
我々は、VFM(Vision Foundation Models)をマルチモーダルな方法で継続的に事前訓練する。
我々は、慎重に設計されたマルチモーダル事前学習パイプラインであるCoMPを紹介する。
DINOv2、SigLIP、AIMv2のような主要なVFMは、マルチモーダル理解タスクにおいて著しく改善されている。
論文 参考訳(メタデータ) (2025-03-24T17:52:47Z) - TinyCLIP: CLIP Distillation via Affinity Mimicking and Weight
Inheritance [97.01406871579525]
大規模言語画像事前学習モデルのための新しいクロスモーダル蒸留法TinyCLIPを提案する。
また、TinyCLIPは、トレーニング済みのCLIP ViT-B/32のサイズを50%削減し、ゼロショット性能を同等に維持できることを示した。
YFCC-15MでトレーニングしたTinyCLIP ViT-8M/16は、ImageNetで41.1%という印象的なゼロショットトップ1の精度を達成した。
論文 参考訳(メタデータ) (2023-09-21T17:59:53Z) - EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm [111.17100512647619]
本稿では、実証された実用的な進化的アルゴリズム(EA)と類似したビジョントランスフォーマーの合理性を説明する。
本稿では,EA ベースのトランス (EAT) ブロックのみを含む新しいピラミッド EATFormer バックボーンを提案する。
画像分類,下流タスク,説明実験に関する大規模かつ定量的な実験は,我々のアプローチの有効性と優位性を示すものである。
論文 参考訳(メタデータ) (2022-06-19T04:49:35Z) - Alexa Teacher Model: Pretraining and Distilling Multi-Billion-Parameter
Encoders for Natural Language Understanding Systems [63.713297451300086]
本研究では,700Mから9.3Bまでの非埋め込みパラメータ数を持つ事前学習エンコーダの大規模実験結果について述べる。
その後、17M-170Mパラメータからより小さなモデルに蒸留し、仮想アシスタントシステムの自然言語理解(NLU)コンポーネントに応用した。
論文 参考訳(メタデータ) (2022-06-15T20:44:23Z) - UniFormer: Unifying Convolution and Self-attention for Visual
Recognition [69.68907941116127]
畳み込みニューラルネットワーク(CNN)とビジョントランスフォーマー(ViT)は、ここ数年で主要なフレームワークである。
コンボリューションと自己注意の利点を簡潔なトランスフォーマー形式にシームレスに統合する新しいUnified TransFormer(UniFormer)を提案する。
我々のUniFormerはImageNet-1K分類において86.3トップ1の精度を実現している。
論文 参考訳(メタデータ) (2022-01-24T04:39:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。