論文の概要: EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment
- arxiv url: http://arxiv.org/abs/2608.04472v1
- Date: Wed, 05 Aug 2026 05:56:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.732807
- Title: EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment
- Title(参考訳): EndoVLM: 解剖学的ガイド下スパーシリティと進行性アライメントによる内視鏡視線前訓練モデル
- Authors: Zhenyu Yi, Jianwei Xu, Yue Hu, Zhongwei Qiu, Sijing Li, Liang Huang, Bin Lv, Ling Zhang, Yingda Xia,
- Abstract要約: EndoVLMは348K以上の内視鏡検査で事前訓練された新しい視覚言語FMである。
Anatomy-Guided Sparse Poolingメカニズムは、テキスト記述をクエリとして利用してスパース注意を喚起する。
プログレッシブ・セマンティック・アウェア・アライメント・ストラテジー(Progressive Semantic-Aware Alignment Strategy)は、構造化されたソフトターゲットを介して臨床分類(解剖学と病理学)をモデル化する。
Semantic-Concentrated Masked Autoencoderは、これらのセマンティックリッチなフレームにのみ適用され、低レベルの視覚的精度と堅牢な高レベルのセマンティック表現を統合する。
- 参考スコア(独自算出の注目度): 15.371433625713232
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The development of foundation models (FMs) is crucial for advancing endoscopic image analysis. However, existing endoscopy FMs mainly rely on self-supervised learning from uni-modal images or videos, overlooking the rich semantic knowledge contained in clinical reports. Furthermore, effectively leveraging these records is hindered by a fundamental modality gap: structured anatomical descriptions are not naturally mapped to specific frames within the high-redundancy, uncurated visual streams. In this paper, we present EndoVLM, a novel vision-language FM pre-trained on over 348K endoscopic examinations, each pairing a clinical report with its corresponding image collection. An Anatomy-Guided Sparse Pooling mechanism utilizes textual descriptions as queries to drive sparse attention, efficiently aggregating semantically salient frames into anatomy-specific visual representations across redundant image-sets. Next, a Progressive Semantic-Aware Alignment strategy models clinical taxonomy (anatomy and pathological status) via structured soft targets, bridging the gap from global patient-level matching to fine-grained localized alignment. Finally, a Semantic-Concentrated Masked Autoencoder is applied exclusively to these semantic-rich frames, integrating low-level visual precision with robust high-level semantic representation. Extensive experiments across various downstream tasks demonstrate that EndoVLM outperforms existing foundation models and remains competitive with task-specific methods. Remarkably, EndoVLM also exhibits robust zero-shot generalization capabilities, highlighting its potential for broader clinical application.
- Abstract(参考訳): 基礎モデル(FM)の開発は内視鏡画像解析の進歩に不可欠である。
しかし、既存の内視鏡FMは、主に、臨床報告に含まれる豊富な意味知識を見越して、ユニモーダル画像やビデオからの自己教師付き学習に依存している。
さらに、これらのレコードを効果的に活用することは、基本的なモダリティギャップによって妨げられる: 構造化された解剖学的記述は、高冗長で未修正のビジュアルストリーム内の特定のフレームに自然にマッピングされない。
本稿では,348K以上の内視鏡検査で事前訓練した新しい視覚言語FMであるEndoVLMについて報告する。
Anatomy-Guided Sparse Poolingメカニズムは、テキスト記述をクエリとして利用し、スパースアテンションを駆動し、冗長なイメージセットをまたいだ解剖特異的な視覚表現に効率的にセマンティック・サリエントなフレームを集約する。
次に、プログレッシブ・セマンティック・アライメント・アライメント(Progressive Semantic-Aware Alignment)戦略は、構造化されたソフトターゲットを介して臨床分類(解剖学的および病理学的状態)をモデル化し、グローバルな患者レベルのマッチングから微粒な局所的なアライメントへのギャップを埋める。
最後に、セマンティック集中型マスケドオートエンコーダをこれらのセマンティックリッチフレームにのみ適用し、低レベルの視覚的精度と堅牢な高レベルのセマンティック表現を統合する。
様々な下流タスクにわたる大規模な実験は、EndoVLMが既存の基礎モデルより優れており、タスク固有の手法と競合していることを示している。
注目すべきは、EndoVLMは強力なゼロショットの一般化能力を示し、より広範な臨床応用の可能性を強調していることだ。
関連論文リスト
- MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models [83.50100003741628]
ビジョンと言語モデル(VLM)は、バイオメディカルイメージングを変革する大きな可能性を秘めている。
本稿では,MMBU(Massive Multimodal Biomedical Understanding)ベンチマークを紹介する。
今までで最大のビジョンと言語ベンチマークで、35のサブモダリティと豊富な構造化メタデータをカバーしている。
論文 参考訳(メタデータ) (2026-06-04T20:24:47Z) - Multi-View Synergistic Learning with Vision-Language Adaption for Low-Resource Biomedical Image Classification [59.24009931000134]
MVSL(Multi-View Synergistic Learning)は、適応パラダイム、表現の粒度、疾患の意味的関係に対処する統合フレームワークである。
MVSLは、視覚的およびテキスト的エンコーダの適応を分離し、それぞれの表現特性を尊重する。
さらに、グローバルなイメージセマンティクスと局所的な病変レベルの証拠の両方を明示的にモデル化するために、多粒性コントラスト学習を導入する。
MVSLは、いくつかのショットとゼロショットの分類設定において、最先端のメソッドを一貫して上回る。
論文 参考訳(メタデータ) (2026-04-27T02:41:27Z) - MetaDent: Labeling Clinical Images for Vision-Language Models in Dentistry [32.93319761809706]
VLM(Vision-Language Models)は、医用画像解析において重要な可能性を示している。
口内撮影におけるそれらの応用は、細粒度で注釈付きデータセットと包括的なベンチマークが欠如していることから、いまだほとんど探索されていない。
本稿では, 臨床, 公衆およびWebソースから収集した, 新規で大規模な歯科画像データセットを含む包括的リソースであるMetaDentについて紹介する。
論文 参考訳(メタデータ) (2026-04-16T10:56:54Z) - Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - RAU: Reference-based Anatomical Understanding with Vision Language Models [26.06602931463068]
視覚言語モデル(VLM)を用いた参照型解剖学的理解のためのフレームワークであるRAUを紹介する。
まず,VLMが参照画像と対象画像の相対的空間的推論により解剖学的領域の同定を学習することを示す。
次に, VLM由来の空間的手がかりをSAM2の細粒度セグメンテーション能力とシームレスに統合できることを実証した。
論文 参考訳(メタデータ) (2025-09-26T14:32:03Z) - Multimodal Causal-Driven Representation Learning for Generalizable Medical Image Segmentation [56.52520416420957]
医用画像セグメンテーションにおける領域一般化に取り組むために, MCDRL(Multimodal Causal-Driven Representation Learning)を提案する。
MCDRLは競合する手法より一貫して優れ、セグメンテーション精度が優れ、堅牢な一般化性を示す。
論文 参考訳(メタデータ) (2025-08-07T03:41:41Z) - RL4Med-DDPO: Reinforcement Learning for Controlled Guidance Towards Diverse Medical Image Generation using Vision-Language Foundation Models [0.7165255458140439]
VLFM(Vision-Language Foundation Models)は、高解像度でフォトリアリスティックな自然画像を生成するという点で、大幅な性能向上を示している。
本稿では,事前学習したVLFMがカーソリー意味理解を提供するマルチステージアーキテクチャを提案する。
報酬信号は、テキストの意味情報を合成画像と整合させるように設計されている。
論文 参考訳(メタデータ) (2025-03-20T01:51:05Z) - Leveraging Vision-Language Embeddings for Zero-Shot Learning in Histopathology Images [7.048241543461529]
ゼロショット組織像分類におけるこれらの課題に対処するため, MR-PHE(Multi-Resolution Prompt-Guided Hybrid Embedding)と呼ばれる新しいフレームワークを提案する。
我々は,グローバルな画像埋め込みと重み付けされたパッチ埋め込みを統合したハイブリッドな埋め込み戦略を導入する。
類似性に基づくパッチ重み付け機構は、クラス埋め込みとの関連性に基づいて、アテンションのような重み付けをパッチに割り当てる。
論文 参考訳(メタデータ) (2025-03-13T12:18:37Z) - MLIP: Enhancing Medical Visual Representation with Divergence Encoder
and Knowledge-guided Contrastive Learning [48.97640824497327]
本稿では、画像テキストのコントラスト学習を通じて、言語情報を視覚領域に統合するための案内信号として、ドメイン固有の医療知識を活用する新しいフレームワークを提案する。
我々のモデルには、設計した分散エンコーダによるグローバルコントラスト学習、局所トークン・知識・パッチアライメントコントラスト学習、知識誘導型カテゴリレベルのコントラスト学習、エキスパートナレッジによるコントラスト学習が含まれる。
特に、MLIPは、限られた注釈付きデータであっても最先端の手法を超越し、医療表現学習の進歩におけるマルチモーダル事前学習の可能性を強調している。
論文 参考訳(メタデータ) (2024-02-03T05:48:50Z) - A Foundation Language-Image Model of the Retina (FLAIR): Encoding Expert Knowledge in Text Supervision [17.875098424936542]
広義網膜基底画像理解のための学習済み視覚言語モデルFLAIRについて述べる。
各種ソースから38個のオープンアクセスデータセットを収集した。
我々は、事前学習とゼロショット推論の両方において、専門家のドメイン知識を記述的テキストプロンプトの形で統合する。
論文 参考訳(メタデータ) (2023-08-15T17:39:52Z) - Few-shot Medical Image Segmentation using a Global Correlation Network
with Discriminative Embedding [60.89561661441736]
医療画像分割のための新しい手法を提案する。
深層畳み込みネットワークを用いた数ショット画像セグメンタを構築します。
深層埋め込みの識別性を高め,同一クラスの特徴領域のクラスタリングを促進する。
論文 参考訳(メタデータ) (2020-12-10T04:01:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。