論文の概要: Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography
- arxiv url: http://arxiv.org/abs/2606.25546v1
- Date: Wed, 24 Jun 2026 08:24:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.277251
- Title: Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography
- Title(参考訳): ハイブリット・ビジュアル・エンコーディングによる3次元CTのための疾患中心視覚領域の事前訓練
- Authors: Bowen Shi, Weiwei Cao, Ruifeng Yuan, Wanxing Chang, Wenrui Dai, Hongkai Xiong, Ling Zhang, Jianpeng Zhang,
- Abstract要約: ビジョン言語による事前トレーニングは、汎用医療AIにとって大きな可能性を秘めている。
3つの主要なコンポーネントを特徴とするフレームワークを提案する。
診断対応プロンプト戦略では、トレーニング前の推論ギャップを埋めるために、実際の臨床用語と集約された疾患プロトタイプを用いている。
- 参考スコア(独自算出の注目度): 75.7789001619107
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language pre-training (VLP) holds great promise for general-purpose medical AI by leveraging radiology reports as rich textual supervision, yet existing methods struggle with 3D CT imaging due to inefficient visual backbones and coarse semantic alignment. To address these issues, we propose a tailored VLP framework featuring three key components: (1) a CNN-ViT hybrid encoder that replaces ViT's patch embedding with a 3D CNN backbone to efficiently capture local anatomical details while preserving global attention and compatibility with pre-trained cross-modal priors; (2) a disease-level contrastive learning mechanism using learnable query tokens to dynamically extract disease-specific semantics from full reports and align them with corresponding visual features, thereby disentangling distinct diseases within the same anatomical region; and (3) a diagnosis-aware prompt strategy that employs real clinical phrases and aggregated disease prototypes to bridge the pre-training-inference gap and enhance zero-shot diagnostic reliability. Our model achieves state-of-the-art performance on CT-RATE (84.4% AUC, +5.1%) and Rad-ChestCT (75.4% AUC, +5.4%), with even larger gains (+9.8% AUC) on a challenging 60-disease benchmark, and demonstrates strong transferability to radiology report generation, underscoring the generality and clinical utility of our approach.
- Abstract(参考訳): 視覚言語事前訓練(VLP)は、放射線診断レポートをリッチテキスト管理として活用することで、汎用医療用AIに大いに期待できるが、既存の手法では、非効率な視覚バックボーンと粗いセマンティックアライメントのために、3D CTイメージングに苦慮している。
これらの課題に対処するために,(1)ViTのパッチを3D CNNバックボーンに置き換えたCNN-ViTハイブリットエンコーダによる局所解剖学的詳細の効率の確保,(2)学習可能なクエリトークンを用いて全報告から疾患特異的な意味を動的に抽出し,対応する視覚的特徴と整合させることにより,同一解剖学的領域内で異なる疾患を解消し,(3)実際の臨床症状と集約された疾患プロトタイプを併用し,トレーニング前のギャップを埋め,ゼロショットの信頼性を高めるための診断・認識促進戦略を提案する。
提案手法はCT-RATE (84.4% AUC, +5.1%) と Rad-ChestCT (75.4% AUC, +5.4%) に対して,60-diseaseベンチマークにおいてさらに大きな利得 (+9.8% AUC) を達成し, 放射線学報告生成への強い伝達性を示す。
関連論文リスト
- Med3D-R1: Incentivizing Clinical Reasoning in 3D Medical Vision-Language Models for Abnormality Diagnosis [20.302134776419955]
我々は,2段階の学習プロセスを持つ強化学習フレームワークを提案する: 教師付きファインチューニング(SFT)と強化学習(RL)。
RLの段階では、整合性報酬を再定義し、整合性、ステップバイステップの診断推論を明示的に促進する。
本モデルではCT-RATEでは41.92%,RAD-ChestCTでは44.99%の精度が得られた。
論文 参考訳(メタデータ) (2026-02-01T12:43:11Z) - Text-to-CT Generation via 3D Latent Diffusion Model with Contrastive Vision-Language Pretraining [1.447808799346751]
本稿では,3次元コントラッシブな視覚-言語事前学習方式と潜在拡散モデルを組み合わせたテキスト-CT生成のための新しいアーキテクチャを提案する。
本手法は,テキストから臨床的に有意なCTボリュームを合成するための,スケーラブルで制御可能なソリューションを提供する。
論文 参考訳(メタデータ) (2025-05-31T16:41:55Z) - Advancing Chronic Tuberculosis Diagnostics Using Vision-Language Models: A Multi modal Framework for Precision Analysis [0.0]
本研究では,自動結核検診(TB)を強化するビジョン・ランゲージ・モデル(VLM)を提案する。
胸部X線画像と臨床データを統合することにより,手動による解釈の課題に対処する。
このモデルでは、重要な慢性TBの病態を検出するための高精度(44%)とリコール(44%)が示された。
論文 参考訳(メタデータ) (2025-03-17T13:49:29Z) - CT-GLIP: 3D Grounded Language-Image Pretraining with CT Scans and Radiology Reports for Full-Body Scenarios [53.94122089629544]
我々は,CT-GLIP(Grounded Language- Image Pretraining with CT scans)を導入する。
本手法は,104臓器にわたる17,702症例を対象に,44,011例の臓器レベルの視覚テキストペアからなるマルチモーダルCTデータセットを用いて訓練し,自然言語を用いて臓器と異常をゼロショットで識別できることを実証した。
論文 参考訳(メタデータ) (2024-04-23T17:59:01Z) - Enhancing Weakly Supervised 3D Medical Image Segmentation through Probabilistic-aware Learning [47.700298779672366]
3次元医用画像のセグメンテーションは、疾患の診断と治療計画に重要な意味を持つ課題である。
近年の深層学習の進歩は、完全に教師付き医療画像のセグメンテーションを著しく強化している。
本稿では,3次元医用画像に特化して設計された,確率的適応型弱教師付き学習パイプラインを提案する。
論文 参考訳(メタデータ) (2024-03-05T00:46:53Z) - Cross-modal Clinical Graph Transformer for Ophthalmic Report Generation [116.87918100031153]
眼科報告生成(ORG)のためのクロスモーダルな臨床グラフ変換器(CGT)を提案する。
CGTは、デコード手順を駆動する事前知識として、臨床関係を視覚特徴に注入する。
大規模FFA-IRベンチマークの実験は、提案したCGTが従来のベンチマーク手法より優れていることを示した。
論文 参考訳(メタデータ) (2022-06-04T13:16:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。