論文の概要: LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models
- arxiv url: http://arxiv.org/abs/2607.11257v1
- Date: Mon, 13 Jul 2026 08:38:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.399096
- Title: LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models
- Title(参考訳): LaGuadia: 言語ガイドによる病理基盤モデルからの適応蒸留
- Abstract要約: 臨床言語指導下で複数のPFMの専門知識を動的に統合することにより,コンパクトな病理画像エンコーダを開発するフレームワークであるLaGuadiaを提案する。
まず、病理報告から視覚的に観察可能な臨床的キーワードを抽出し、第2に、視覚言語メタ教師(MedSigLIP)を通して視覚的特徴をこれらのキーワードと整合させて、密集した意味的ガイダンスを提供する。
WSIキャプション、視覚的質問応答、スライドレベルの分類タスクの実験は、87MパラメータのLaGuadia学生モデルがGigaPathやUNIといった基礎的なスケールモデルと一致しているか、あるいは超えていることを示している。
- 参考スコア(独自算出の注目度): 4.741100658955037
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pathology Foundation Models (PFMs) offer powerful Whole Slide Image (WSI) representations but suffer from massive computational costs. While Knowledge Distillation (KD) can create efficient student models, existing multi-teacher methods often use suboptimal uniform weighting that ignores tissue heterogeneity. We propose LaGuadia (Language-Guided Adaptive DistillAtion), a framework that develops a compact pathology image encoder by dynamically integrating expertise from multiple PFMs under clinical linguistic guidance. Our approach utilizes a multi-stage pipeline: first, extracting visually observable clinical keywords from pathology reports; second, aligning visual features with these keywords via a Vision-Language meta-teacher (MedSigLIP) to provide dense semantic guidance; and finally, performing adaptive KD where teacher contributions are weighted based on their semantic alignment with the clinical narrative. Experiments on WSI captioning, visual question answering, and slide-level classification tasks demonstrate that an 87M parameter LaGuadia student model matches or exceeds foundation-scale models such as GigaPath and UNI, achieving strong factual consistency and robust generalization. These results highlight clinical language as an effective semantic anchor for building efficient and reliable digital pathology systems. Code is available at https://github.com/hvcl/LaGuadia.
- Abstract(参考訳): Pathology Foundation Models (PFM) は強力なWSI(Whole Slide Image)表現を提供するが、膨大な計算コストに悩まされている。
知識蒸留(KD)は効率的な学生モデルを作成することができるが、既存のマルチテラー手法では組織の不均一性を無視した準最適均一重み付けを用いることが多い。
ラグアディア(LaGuadia、Language-Guided Adaptive DistillAtion)は、複数のPFMの専門知識を臨床言語指導下で動的に統合することにより、コンパクトな病理画像エンコーダを開発するフレームワークである。
提案手法は多段階のパイプラインを利用する。まず,病理報告から視覚的に観察可能な臨床用キーワードを抽出し,第2に,視覚・言語メタ教育者(MedSigLIP)を通じて視覚的特徴をこれらのキーワードと整合させることにより,総合的な意味指導を提供し,さらに,臨床物語とのセマンティックアライメントに基づいて教師のコントリビューションを重み付けする適応的KDを実行する。
WSIキャプション、視覚的質問応答、スライドレベルの分類タスクの実験は、87MパラメータのLaGuadiaの学生モデルがGigaPathやUNIといった基礎的なスケールモデルと一致しているか、あるいは超え、強力な事実整合性と堅牢な一般化を実現していることを示している。
これらの結果は, 効果的で信頼性の高いデジタル病理システム構築に有効なセマンティックアンカーとして臨床言語を強調した。
コードはhttps://github.com/hvcl/LaGuadiaで入手できる。
関連論文リスト
- EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment [15.371433625713232]
EndoVLMは348K以上の内視鏡検査で事前訓練された新しい視覚言語FMである。
Anatomy-Guided Sparse Poolingメカニズムは、テキスト記述をクエリとして利用してスパース注意を喚起する。
プログレッシブ・セマンティック・アウェア・アライメント・ストラテジー(Progressive Semantic-Aware Alignment Strategy)は、構造化されたソフトターゲットを介して臨床分類(解剖学と病理学)をモデル化する。
Semantic-Concentrated Masked Autoencoderは、これらのセマンティックリッチなフレームにのみ適用され、低レベルの視覚的精度と堅牢な高レベルのセマンティック表現を統合する。
論文 参考訳(メタデータ) (2026-08-05T05:56:41Z) - Gated Multi-Graph Fusion via Graph Attention Networks for Alzheimer's Disease Detection [52.36198268369384]
自然発声はアルツハイマー病(AD)にとって重要な非侵襲的バイオマーカーである
本稿では,音声を自動音声認識(ASR)で書き起こし,セマンティック,依存性,共起グラフを構築するマルチビューGated Graph Attention Networkを提案する。
論文 参考訳(メタデータ) (2026-06-30T06:15:59Z) - Multi-View Synergistic Learning with Vision-Language Adaption for Low-Resource Biomedical Image Classification [59.24009931000134]
MVSL(Multi-View Synergistic Learning)は、適応パラダイム、表現の粒度、疾患の意味的関係に対処する統合フレームワークである。
MVSLは、視覚的およびテキスト的エンコーダの適応を分離し、それぞれの表現特性を尊重する。
さらに、グローバルなイメージセマンティクスと局所的な病変レベルの証拠の両方を明示的にモデル化するために、多粒性コントラスト学習を導入する。
MVSLは、いくつかのショットとゼロショットの分類設定において、最先端のメソッドを一貫して上回る。
論文 参考訳(メタデータ) (2026-04-27T02:41:27Z) - PathFLIP: Fine-grained Language-Image Pretraining for Versatile Computational Pathology [6.821738567680833]
PathFLIP(Pathology Fine-fine Language-Image Pretraining)は,WSI(全体的全スライド画像)解釈のための新しいフレームワークである。
PathFLIPは、スライドレベルのキャプションを領域レベルのサブキャプションに分解し、テキスト条件付き領域埋め込みを生成して、正確な視覚的な接地を容易にする。
論文 参考訳(メタデータ) (2025-12-19T14:26:50Z) - PathSegDiff: Pathology Segmentation using Diffusion model representations [63.20694440934692]
そこで我々は,Latent Diffusion Models (LDMs) を事前学習した特徴抽出器として活用する,病理組織像分割の新しい手法であるPathSegDiffを提案する。
本手法は,H&E染色組織像から多彩な意味情報を抽出するために,自己教師型エンコーダによって誘導される病理特異的LCMを用いる。
本実験は,BCSSおよびGlaSデータセットにおける従来の手法よりも大幅に改善されたことを示す。
論文 参考訳(メタデータ) (2025-04-09T14:58:21Z) - MGPATH: Vision-Language Model with Multi-Granular Prompt Learning for Few-Shot WSI Classification [36.59100450109841]
全スライド画像分類は、ギガピクセル画像サイズと限定アノテーションラベルによる課題を提示する。
本稿では,数ショットの病理分類に大規模な視覚言語モデルを適用するための素早い学習手法を提案する。
論文 参考訳(メタデータ) (2025-02-11T09:42:13Z) - ExGra-Med: Extended Context Graph Alignment for Medical Vision-Language Models [95.47808515575382]
ExGra-Medは、医療AIのビジョン言語統合のための新しいフレームワークである。
画像、命令応答、拡張キャプションを潜在空間にアライメントし、セマンティックグラウンドとクロスモーダルコヒーレンスを前進させる。
プレトレーニングデータの10%しか使用せず、VQA-RADで20.13%向上し、フルデータパフォーマンスに近づいた。
論文 参考訳(メタデータ) (2024-10-03T15:52:03Z) - Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning [64.1316997189396]
病理組織像のための新しい言語型自己教師学習フレームワーク,階層型言語型自己監督(HLSS)を提案する。
その結果,OpenSRH と TCGA の2つの医用画像ベンチマークにおいて,最先端の性能が得られた。
論文 参考訳(メタデータ) (2024-03-21T17:58:56Z) - Towards a Visual-Language Foundation Model for Computational Pathology [5.72536252929528]
病理組織学(CONCH)におけるコントラスト学習について紹介する。
CONCHは、様々な組織像、生医学的テキスト、タスクに依存しない事前トレーニングのソースを用いて開発された視覚言語基盤モデルである。
13種類の多様なベンチマークで評価され, 画像分類, セグメンテーション, キャプション, テキスト・ツー・イメージ検索, 画像・テキスト検索における最先端のパフォーマンスを達成している。
論文 参考訳(メタデータ) (2023-07-24T16:13:43Z) - Customizing General-Purpose Foundation Models for Medical Report
Generation [64.31265734687182]
ラベル付き医用画像-レポートペアの不足は、ディープニューラルネットワークや大規模ニューラルネットワークの開発において大きな課題となっている。
本稿では,コンピュータビジョンと自然言語処理の基盤モデル (FM) として,市販の汎用大規模事前学習モデルのカスタマイズを提案する。
論文 参考訳(メタデータ) (2023-06-09T03:02:36Z) - Learning to Exploit Temporal Structure for Biomedical Vision-Language
Processing [53.89917396428747]
視覚言語処理における自己教師あり学習は、画像とテキストのモダリティのセマンティックアライメントを利用する。
トレーニングと微調整の両方で利用できる場合、事前のイメージとレポートを明示的に説明します。
我々のアプローチはBioViL-Tと呼ばれ、テキストモデルと共同で訓練されたCNN-Transformerハイブリッドマルチイメージエンコーダを使用する。
論文 参考訳(メタデータ) (2023-01-11T16:35:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。