論文の概要: Learning Robust Visual Features in Computed Tomography Enables Efficient Transfer Learning for Clinical Tasks
- arxiv url: http://arxiv.org/abs/2604.04133v1
- Date: Sun, 05 Apr 2026 14:29:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:18.937191
- Title: Learning Robust Visual Features in Computed Tomography Enables Efficient Transfer Learning for Clinical Tasks
- Title(参考訳): コンピュータ断層撮影におけるロバストな視覚特徴の学習
- Authors: Rubén Moreno-Aguado, Alba Magallón, Victor Moreno, Yingying Fang, Guang Yang,
- Abstract要約: 本稿では,DINOフレームワークを用いた自己蒸留で訓練した3次元CT基礎モデルであるVoxelFMを提案する。
軽度プローブを用いた凍結バックボーン表現を用いて,VoxelFMを臨床的に関係のある下流タスクの7つのカテゴリで評価した。
- 参考スコア(独自算出の注目度): 6.299805867949439
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: There is substantial interest in developing artificial intelligence systems to support radiologists across tasks ranging from segmentation to report generation. Existing computed tomography (CT) foundation models have largely focused on building generalist vision-language systems capable of tasks such as question answering and report generation. However, training reliable vision-language systems requires paired image-text data at a scale that remains unavailable in CT. Moreover, adapting the underlying visual representations to downstream tasks typically requires partial or full backbone fine-tuning, a computationally demanding process inaccessible to many research groups. Instead, foundation models should prioritise learning robust visual representations that enable efficient transfer to new tasks with minimal labelled data and without backbone fine-tuning. We present VoxelFM, a 3D CT foundation model trained with self-distillation using the DINO framework, which learns semantically rich features without language supervision. We evaluated VoxelFM across seven categories of clinically relevant downstream tasks using frozen backbone representations with lightweight probes: classification, regression, survival analysis, instance retrieval, localisation, segmentation, and report generation. VoxelFM matched or outperformed four existing CT foundation models across all task categories. Despite receiving no language supervision during pre-training, VoxelFM surpassed models explicitly trained with language-alignment objectives, including on report generation. Our results indicate that current CT foundation models perform significantly better as feature extractors for lightweight probes rather than as vision encoders for vision-language models. Model weights and training code are publicly available.
- Abstract(参考訳): セグメンテーションからレポート生成に至るまで、放射線学者を支援する人工知能システムの開発には、かなりの関心がある。
既存のCT基盤モデルは、質問応答やレポート生成といったタスクを扱える汎用的な視覚言語システムの構築に重点を置いている。
しかし、信頼性の高い視覚言語システムのトレーニングには、CTでは利用できないスケールでのペア画像テキストデータが必要である。
さらに、下位の視覚表現を下流のタスクに適応させるには、通常、多くの研究グループでは利用できない計算要求のプロセスである、部分的または完全なバックボーンの微調整が必要である。
代わりに、基礎モデルは、バックボーンの微調整なしでラベル付けされた最小限のデータで、新しいタスクへの効率的な転送を可能にする、堅牢な視覚表現の学習を優先すべきである。
本稿では,DINOフレームワークを用いて自己蒸留で訓練した3次元CT基礎モデルであるVoxelFMについて述べる。
我々は,VoxelFMを,分類,回帰,生存分析,インスタンス検索,局所化,セグメンテーション,レポート生成といった軽量プローブを用いた凍結バックボーン表現を用いて,臨床的に関連のある下流タスクの7つのカテゴリで評価した。
VoxelFMは、すべてのタスクカテゴリで既存の4つのCT基盤モデルに適合または性能を向上した。
事前訓練中に言語監督を受けなかったにもかかわらず、VoxelFMは、レポート生成を含む言語調整目標で明示的に訓練されたモデルを上回った。
その結果,現在のCT基盤モデルは視覚言語モデルでは視覚エンコーダよりも,軽量プローブでは特徴抽出器として優れていた。
モデルウェイトとトレーニングコードは公開されています。
関連論文リスト
- Evaluating Vision Language Models (VLMs) for Radiology: A Comprehensive Analysis [4.803310914375717]
本研究では,3つの視覚言語基盤モデル(RAD-DINO,CheXagent,BiomedCLIP)を,放射線学タスクの微細な画像特徴を捉える能力について評価した。
胸部X線写真上, 気胸, 心肥大に対する分類, セグメンテーション, 回帰作業で評価した。
論文 参考訳(メタデータ) (2025-04-22T17:20:34Z) - Towards Universal Text-driven CT Image Segmentation [4.76971404389011]
汎用テキスト駆動セグメンテーションのための大規模3次元CT画像を対象とした視覚言語モデルOpenVocabCTを提案する。
診断報告を,多粒性コントラスト学習のための大規模言語モデルを用いて,微細な臓器レベルの記述に分解する。
論文 参考訳(メタデータ) (2025-03-08T03:02:57Z) - Medical Vision-Language Pre-Training for Brain Abnormalities [96.1408455065347]
本稿では,PubMedなどの公共リソースから,医用画像・テキスト・アライメントデータを自動的に収集する方法を示す。
特に,まず大きな脳画像テキストデータセットを収集することにより,事前学習プロセスの合理化を図るパイプラインを提案する。
また,医療領域におけるサブフィギュアをサブキャプションにマッピングするというユニークな課題についても検討した。
論文 参考訳(メタデータ) (2024-04-27T05:03:42Z) - See Through Their Minds: Learning Transferable Neural Representation from Cross-Subject fMRI [32.40827290083577]
機能的磁気共鳴イメージング(fMRI)からの視覚内容の解読は、人間の視覚系を照らすのに役立つ。
従来のアプローチは主に、トレーニングサンプルサイズに敏感な、主題固有のモデルを採用していた。
本稿では,fMRIデータを統合表現にマッピングするための,サブジェクト固有の浅層アダプタを提案する。
トレーニング中,マルチモーダル脳復号における視覚的・テキスト的監督の両面を活用する。
論文 参考訳(メタデータ) (2024-03-11T01:18:49Z) - Data-efficient Large Vision Models through Sequential Autoregression [58.26179273091461]
限られたデータセットに基づいて,効率的な自己回帰に基づく視覚モデルを構築する。
このモデルは,高レベル・低レベルのセマンティック理解の両方にまたがる視覚的タスクにおいて,その習熟度をいかに達成するかを実証する。
我々の経験的評価は、モデルが様々なタスクに適応する際の機敏さを強調し、パラメータフットプリントの大幅な削減を図った。
論文 参考訳(メタデータ) (2024-02-07T13:41:53Z) - Visual Grounding Helps Learn Word Meanings in Low-Data Regimes [47.7950860342515]
現代のニューラル言語モデル(LM)は、人間の文の生成と理解をモデル化するための強力なツールである。
しかし、これらの結果を得るためには、LMは明らかに非人間的な方法で訓練されなければならない。
より自然主義的に訓練されたモデルは、より人間らしい言語学習を示すのか?
本稿では,言語習得における重要なサブタスクである単語学習の文脈において,この問題を考察する。
論文 参考訳(メタデータ) (2023-10-20T03:33:36Z) - Vision-Language Modelling For Radiological Imaging and Reports In The
Low Data Regime [70.04389979779195]
本稿では,視覚および言語入力を共通空間に埋め込んだ医用視覚言語モデル(VLM)について検討する。
本稿では,新しい画像領域やテキスト領域への汎用事前学習モデルの適用など,低データ性能向上のためのいくつかの候補手法について検討する。
テキスト・ツー・イメージ検索をベンチマークとして,2つの胸部X線および放射線学的報告を用いた可変サイズのトレーニングデータセットを用いて,これらの手法の性能評価を行った。
論文 参考訳(メタデータ) (2023-03-30T18:20:00Z) - Revisiting Classifier: Transferring Vision-Language Models for Video
Recognition [102.93524173258487]
ダウンストリームタスクのためのタスク非依存の深層モデルから知識を伝達することは、コンピュータビジョン研究において重要なトピックである。
本研究では,映像分類作業における知識の伝達に着目した。
予測された言語モデルを用いて、効率的な翻訳学習のための適切なセマンティックターゲットを生成する。
論文 参考訳(メタデータ) (2022-07-04T10:00:47Z) - X-Learner: Learning Cross Sources and Tasks for Universal Visual
Representation [71.51719469058666]
本稿では,X-Learnerという表現学習フレームワークを提案する。
X-Learnerは、様々なソースによって管理される複数の視覚タスクの普遍的な特徴を学習する。
X-Learnerは、追加のアノテーションやモダリティ、計算コストを使わずに、様々なタスクで強力なパフォーマンスを達成する。
論文 参考訳(メタデータ) (2022-03-16T17:23:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。