論文の概要: Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography
- arxiv url: http://arxiv.org/abs/2606.25546v1
- Date: Wed, 24 Jun 2026 08:24:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.277251
- Title: Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography
- Title(参考訳): ハイブリット・ビジュアル・エンコーディングによる3次元CTのための疾患中心視覚領域の事前訓練
- Abstract要約: ビジョン言語による事前トレーニングは、汎用医療AIにとって大きな可能性を秘めている。
3つの主要なコンポーネントを特徴とするフレームワークを提案する。
診断対応プロンプト戦略では、トレーニング前の推論ギャップを埋めるために、実際の臨床用語と集約された疾患プロトタイプを用いている。
- 参考スコア(独自算出の注目度): 75.7789001619107
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language pre-training (VLP) holds great promise for general-purpose medical AI by leveraging radiology reports as rich textual supervision, yet existing methods struggle with 3D CT imaging due to inefficient visual backbones and coarse semantic alignment. To address these issues, we propose a tailored VLP framework featuring three key components: (1) a CNN-ViT hybrid encoder that replaces ViT's patch embedding with a 3D CNN backbone to efficiently capture local anatomical details while preserving global attention and compatibility with pre-trained cross-modal priors; (2) a disease-level contrastive learning mechanism using learnable query tokens to dynamically extract disease-specific semantics from full reports and align them with corresponding visual features, thereby disentangling distinct diseases within the same anatomical region; and (3) a diagnosis-aware prompt strategy that employs real clinical phrases and aggregated disease prototypes to bridge the pre-training-inference gap and enhance zero-shot diagnostic reliability. Our model achieves state-of-the-art performance on CT-RATE (84.4% AUC, +5.1%) and Rad-ChestCT (75.4% AUC, +5.4%), with even larger gains (+9.8% AUC) on a challenging 60-disease benchmark, and demonstrates strong transferability to radiology report generation, underscoring the generality and clinical utility of our approach.
- Abstract(参考訳): 視覚言語事前訓練(VLP)は、放射線診断レポートをリッチテキスト管理として活用することで、汎用医療用AIに大いに期待できるが、既存の手法では、非効率な視覚バックボーンと粗いセマンティックアライメントのために、3D CTイメージングに苦慮している。
これらの課題に対処するために,(1)ViTのパッチを3D CNNバックボーンに置き換えたCNN-ViTハイブリットエンコーダによる局所解剖学的詳細の効率の確保,(2)学習可能なクエリトークンを用いて全報告から疾患特異的な意味を動的に抽出し,対応する視覚的特徴と整合させることにより,同一解剖学的領域内で異なる疾患を解消し,(3)実際の臨床症状と集約された疾患プロトタイプを併用し,トレーニング前のギャップを埋め,ゼロショットの信頼性を高めるための診断・認識促進戦略を提案する。
提案手法はCT-RATE (84.4% AUC, +5.1%) と Rad-ChestCT (75.4% AUC, +5.4%) に対して,60-diseaseベンチマークにおいてさらに大きな利得 (+9.8% AUC) を達成し, 放射線学報告生成への強い伝達性を示す。
関連論文リスト
- ProCA: Progressive Contrastive Alignment for Robust EEG Visual Decoding [47.35612571473169]
EEGビジュアルデコーディングは、非侵襲的な神経時系列信号から視覚的セマンティクスを回復することを目的としている。
既存の手法は固定された視覚的あるいはテキスト的アンカーに依存しており、その意味的関係は、試行錯誤、主題、学習段階によって異なる脳波表現と一致している可能性がある。
本稿では,適応型ニューラル・セマンティックアライメントのための統一的でモデルに依存しないフレームワークであるProgressive Contrastive Alignment(ProCA)を提案する。
論文 参考訳(メタデータ) (2026-09-04T12:48:25Z) - Brain-Adapter: A Dual-Stream Vision-Language MIL Framework for Comprehensive 3D CT Diagnosis of Acute Intracranial Pathologies [8.984636910625886]
Brain-Adapterは、新しいデュアルストリームマルチインスタンス学習フレームワークである。
提案手法は,最先端の3Dモデルと標準MIL手法を大幅に上回っている。
論文 参考訳(メタデータ) (2026-06-22T15:41:16Z) - Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models [3.6659638651482536]
近年の3次元医用視覚言語モデルの進歩により、ボリューム画像やテキストに対する共同推論が可能になった。
これらのモデルが3次元ボリュームから空間的基底解剖学を学習したのか、あるいは主に学習前と言語相関に頼っているのかは、まだ不明である。
我々は3次元CTデータにおける意味空間的推論を評価するためのベンチマークであるCT-SpatialVQAを紹介する。
論文 参考訳(メタデータ) (2026-05-09T08:16:00Z) - Med3D-R1: Incentivizing Clinical Reasoning in 3D Medical Vision-Language Models for Abnormality Diagnosis [20.302134776419955]
我々は,2段階の学習プロセスを持つ強化学習フレームワークを提案する: 教師付きファインチューニング(SFT)と強化学習(RL)。
RLの段階では、整合性報酬を再定義し、整合性、ステップバイステップの診断推論を明示的に促進する。
本モデルではCT-RATEでは41.92%,RAD-ChestCTでは44.99%の精度が得られた。
論文 参考訳(メタデータ) (2026-02-01T12:43:11Z) - Text-to-CT Generation via 3D Latent Diffusion Model with Contrastive Vision-Language Pretraining [1.447808799346751]
本稿では,3次元コントラッシブな視覚-言語事前学習方式と潜在拡散モデルを組み合わせたテキスト-CT生成のための新しいアーキテクチャを提案する。
本手法は,テキストから臨床的に有意なCTボリュームを合成するための,スケーラブルで制御可能なソリューションを提供する。
論文 参考訳(メタデータ) (2025-05-31T16:41:55Z) - From Gaze to Insight: Bridging Human Visual Attention and Vision Language Model Explanation for Weakly-Supervised Medical Image Segmentation [48.45209969191245]
視覚言語モデル(VLM)は、テキスト記述を通して意味的コンテキストを提供するが、説明精度は欠如している。
本稿では,その補完的強みを活かし,視線と言語指導を統合した教師教育フレームワークを提案する。
本手法は,8.78%,80.53%,84.22%のDiceスコアをそれぞれ達成し,アノテーション負担を増大させることなく視線ベースラインよりも3.5%向上した。
論文 参考訳(メタデータ) (2025-04-15T16:32:15Z) - Advancing Chronic Tuberculosis Diagnostics Using Vision-Language Models: A Multi modal Framework for Precision Analysis [0.0]
本研究では,自動結核検診(TB)を強化するビジョン・ランゲージ・モデル(VLM)を提案する。
胸部X線画像と臨床データを統合することにより,手動による解釈の課題に対処する。
このモデルでは、重要な慢性TBの病態を検出するための高精度(44%)とリコール(44%)が示された。
論文 参考訳(メタデータ) (2025-03-17T13:49:29Z) - CT-GLIP: 3D Grounded Language-Image Pretraining with CT Scans and Radiology Reports for Full-Body Scenarios [53.94122089629544]
我々は,CT-GLIP(Grounded Language- Image Pretraining with CT scans)を導入する。
本手法は,104臓器にわたる17,702症例を対象に,44,011例の臓器レベルの視覚テキストペアからなるマルチモーダルCTデータセットを用いて訓練し,自然言語を用いて臓器と異常をゼロショットで識別できることを実証した。
論文 参考訳(メタデータ) (2024-04-23T17:59:01Z) - Enhancing Weakly Supervised 3D Medical Image Segmentation through Probabilistic-aware Learning [47.700298779672366]
3次元医用画像のセグメンテーションは、疾患の診断と治療計画に重要な意味を持つ課題である。
近年の深層学習の進歩は、完全に教師付き医療画像のセグメンテーションを著しく強化している。
本稿では,3次元医用画像に特化して設計された,確率的適応型弱教師付き学習パイプラインを提案する。
論文 参考訳(メタデータ) (2024-03-05T00:46:53Z) - Cross-modal Clinical Graph Transformer for Ophthalmic Report Generation [116.87918100031153]
眼科報告生成(ORG)のためのクロスモーダルな臨床グラフ変換器(CGT)を提案する。
CGTは、デコード手順を駆動する事前知識として、臨床関係を視覚特徴に注入する。
大規模FFA-IRベンチマークの実験は、提案したCGTが従来のベンチマーク手法より優れていることを示した。
論文 参考訳(メタデータ) (2022-06-04T13:16:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。