FuguReport

Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography

著者 Bowen Shi, Weiwei Cao, Ruifeng Yuan, Wanxing Chang, Wenrui Dai, Hongkai Xiong, Ling Zhang, Jianpeng Zhang
所属 Alibaba / Hupan Lab / Shanghai Jiao Tong University / Zhejiang University / Fudan University
カテゴリ Method / Vision-Language Pretraining / Hybrid encoding for 3D CT, Application / Medical Imaging / Disease-focused diagnostic AI, Method / Prompt Engineering / Clinical term-based prompt strategy
ライセンス CC BY 4.0

Abstractの概要

本論文は、従来の3D胸部CTにおけるボリューム視覚エンコーディングや粗い画像テキストアライメントの限界を背景として設計された、視覚と言語の事前学習フレームワークであるCT-DiagVLMを提案しています。この手法は、効率的なマルチスケール3D表現のためのCNN-ViTハイブリッドエンコーダ、学習可能なクエリトークンを通じてレポートから疾患固有のセマンティクスを抽出する疾患レベルの対照学習、そして実際の臨床フレーズと集約された疾患プロトタイプに基づく診断対応プロンプト戦略を組み合わせています。標準的な16の疾患ベンチマーク、LLM生成の疑似ラベルを用いて構築されたより大規模な60疾患の設定、および放射線レポート生成におけるゼロショット診断で本フレームワークを評価しています。これらの設定全体を通じて、診断の識別、外部への汎化、および下流のレポート生成への転移能力の向上が示されています。

新規性

主な新規性は、画像全体や臓器レベルのアライメントを超えて、臓器内の明確な疾患レベルのアライメントへと移行する、3D CTのための疾患中心の視覚・言語事前学習の設計です。また、局所的なボリューム解剖学的構造を捉えつつ、事前学習済みの視覚・言語の事前分布との互換性を保つハイブリッド3D CNN-ViTエンコーダや、手作りのテンプレートを実際の臨床レポートの記述から派生したプロトタイプに置き換えるプロンプト戦略も導入しています。

成果

ゼロショット診断において、CT-DiagVLMはCT-RATEで84.4%、外部のRad-ChestCTデータセットで75.4%のAUCを達成し、従来の手法や強化されたベースモデルからの改善を報告しています。60疾患の疑似ラベル設定では、ベースモデルの75.8%に対して85.6%のAUCに達しますが、特異度が高くなる一方で感度の低下が見られると述べられています。また、事前学習済みの表現はレポート生成タスクにも転移でき、CT-RATEで45.5%、Rad-ChestCTで37.3%のF1スコアが報告されています。

論文の注目点

  1. 提案されたCNN-ViTハイブリッドエンコーダは、事前学習済みのTransformerの事前知識との互換性を保ちながら局所的な解剖学的詳細を保持することを目指し、標準的なViTのパッチ埋め込みを3D CNNとマルチスケール融合に置き換えている。
  2. 疾患レベルの対照学習では、学習可能な条件クエリを使用して元の放射線レポートから疾患固有のセマンティクスを抽出し、それらを臓器レベルの視覚特徴と結びつけることで、同一臓器内における複数の病変の混同に対処している。
  3. 診断対応のプロンプト戦略は、固定テンプレートではなく多数の実際のレポート記述から疾患プロトタイプを構築しており、ゼロショット診断、60疾患へのスケールアップ、および下流のレポート生成における向上が実験で示されている。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。