論文の概要: Specialty-Oriented Generalist Medical AI for Chest CT Screening
- arxiv url: http://arxiv.org/abs/2304.02649v4
- Date: Wed, 24 Apr 2024 17:10:34 GMT
- ステータス: 処理完了
- システム内更新日: 2024-04-27 00:27:30.842053
- Title: Specialty-Oriented Generalist Medical AI for Chest CT Screening
- Title(参考訳): 胸部CT検診における汎用医用AI
- Authors: Chuang Niu, Qing Lyu, Christopher D. Carothers, Parisa Kaviani, Josh Tan, Pingkun Yan, Mannudeep K. Kalra, Christopher T. Whitlow, Ge Wang,
- Abstract要約: 本稿では,肺がん検診および関連する課題に応用したM3FM(Maltimodal-multitask foundation model)を提案する。
M3FMは、最先端のシングルモーダルタスク特化モデルより一貫して優れている。
専門的な汎用的な医療AIモデルとして、M3FMは、他の医療分野における同様のブレークスルーの道を開く。
- 参考スコア(独自算出の注目度): 14.31187762890342
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern medical records include a vast amount of multimodal free text clinical data and imaging data from radiology, cardiology, and digital pathology. Fully mining such big data requires multitasking; otherwise, occult but important aspects may be overlooked, adversely affecting clinical management and population healthcare. Despite remarkable successes of AI in individual tasks with single-modal data, the progress in developing generalist medical AI remains relatively slow to combine multimodal data for multitasks because of the dual challenges of data curation and model architecture. The data challenge involves querying and curating multimodal structured and unstructured text, alphanumeric, and especially 3D tomographic scans on an individual patient level for real-time decisions and on a scale to estimate population health statistics. The model challenge demands a scalable and adaptable network architecture to integrate multimodal datasets for diverse clinical tasks. Here we propose the first-of-its-kind medical multimodal-multitask foundation model (M3FM) with application in lung cancer screening and related tasks. After we curated a comprehensive multimodal multitask dataset consisting of 49 clinical data types including 163,725 chest CT series and 17 medical tasks involved in LCS, we develop a multimodal question-answering framework as a unified training and inference strategy to synergize multimodal information and perform multiple tasks via free-text prompting. M3FM consistently outperforms the state-of-the-art single-modal task-specific models, identifies multimodal data elements informative for clinical tasks and flexibly adapts to new tasks with a small out-of-distribution dataset. As a specialty-oriented generalist medical AI model, M3FM paves the way for similar breakthroughs in other areas of medicine, closing the gap between specialists and the generalist.
- Abstract(参考訳): 現代の医療記録には、膨大な量のマルチモーダル・フリーテキスト臨床データと、放射線学、心臓学、デジタル病理学からの画像データが含まれている。
このようなビッグデータを完全にマイニングするにはマルチタスクが必要である。そうでなければ、オカルトだが重要な側面は見過ごされ、臨床管理や人口医療に悪影響を及ぼす可能性がある。
単一モーダルデータを用いた個々のタスクにおけるAIの顕著な成功にもかかわらず、データキュレーションとモデルアーキテクチャの2つの課題のために、マルチタスクのためのマルチモーダルデータを組み合わせるための一般の医療AIの開発の進歩は、比較的遅いままである。
データ課題は、マルチモーダルな構造化および非構造化のテキスト、アルファ数値、特にリアルタイム決定のための患者レベルでの3Dトモグラフィースキャンを、人口健康統計を推定するためのスケールでクエリし、キュレートすることである。
このモデル課題は、多様な臨床タスクのためのマルチモーダルデータセットを統合するために、スケーラブルで適応可能なネットワークアーキテクチャを必要とする。
本稿では,肺がん検診および関連する課題に応用したM3FMの基礎モデルを提案する。
163,725個の胸部CTシリーズを含む49種類の臨床データとLCSに関わる17の医療タスクからなる総合マルチモーダルマルチタスクデータセットをキュレートした後,我々は多モーダル情報の相乗化と自由テキストプロンプトによる複数タスク実行のための統一的なトレーニングおよび推論戦略として,多モーダル質問応答フレームワークを開発した。
M3FMは、最先端の単一モーダルタスク固有のモデルより一貫して優れており、臨床タスクに有用なマルチモーダルデータ要素を特定し、小さなアウト・オブ・ディストリビューションデータセットで新しいタスクに柔軟に適応する。
専門的な汎用的な医療AIモデルとして、M3FMは、専門医とジェネラリストのギャップを埋め、他の分野における同様のブレークスルーの道を開く。
関連論文リスト
- Training Small Multimodal Models to Bridge Biomedical Competency Gap: A
Case Study in Radiology Imaging [114.43429928419755]
バイオメディカル・コンピテンシー・ギャップを橋渡しするオープンソース小型マルチモーダル・モデル(SMM)の訓練について検討する。
LLaVA-Radは高速で、単一のV100 GPU上でプライベート設定で実行できる。
論文 参考訳(メタデータ) (2024-03-12T18:12:02Z) - MedXChat: Bridging CXR Modalities with a Unified Multimodal Large Model [31.47561815601663]
MedXChatは医療アシスタントとユーザ間のシームレスなインタラクションを目的とした,統合型マルチモーダル大規模モデルである。
MedXChatには、CXR(Chest X-ray)-to-Report Generation、CXRベースのビジュアル質問応答(VQA)、Text-to-CXR合成という3つの重要な機能が含まれている。
論文 参考訳(メタデータ) (2023-12-04T06:40:12Z) - HEALNet -- Hybrid Multi-Modal Fusion for Heterogeneous Biomedical Data [12.109041184519281]
本稿では, フレキシブルなマルチモーダル融合アーキテクチャであるHybrid Early-fusion Attention Learning Network (HEALNet)を提案する。
The Cancer Genome Atlas (TCGA) の4つの癌コホートにおける全スライド画像と多モードデータの多モード生存解析を行った。
HEALNetは最先端のパフォーマンスを実現し、ユニモーダルベースラインと最近のマルチモーダルベースラインの両方を大幅に改善した。
論文 参考訳(メタデータ) (2023-11-15T17:06:26Z) - Learning A Multi-Task Transformer Via Unified And Customized Instruction
Tuning For Chest Radiograph Interpretation [35.87795950781491]
本稿では,マルチモーダルな臨床タスクに特化して設計された統一型トランスフォーマーモデルについて述べる。
まず,134万の命令と接地真実対からなるマルチタスク学習データセットを構成する。
また,同種モデル入力とアウトプットを併用して,視力集約的なタスクを単一学習フレームワークに統合することで,1回の読解において臨床解釈可能性を高めることができる。
論文 参考訳(メタデータ) (2023-11-02T08:55:48Z) - Towards Generalist Foundation Model for Radiology by Leveraging
Web-scale 2D&3D Medical Data [66.9359934608229]
この研究はRadFMと呼ばれるRadlogy Foundation Modelの開発を開始することを目的としている。
われわれの知る限りでは、これは2Dスキャンと3Dスキャンによる、最初の大規模で高品質な医療用ビジュアル言語データセットである。
本稿では,モダリティ認識,疾患診断,視覚的質問応答,レポート生成,合理的診断の5つのタスクからなる新しい評価ベンチマークRadBenchを提案する。
論文 参考訳(メタデータ) (2023-08-04T17:00:38Z) - Towards Medical Artificial General Intelligence via Knowledge-Enhanced
Multimodal Pretraining [121.89793208683625]
医療人工知能(MAGI)は、1つの基礎モデルで異なる医療課題を解くことができる。
我々は、Micical-knedge-enhanced mulTimOdal pretRaining (motoR)と呼ばれる新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2023-04-26T01:26:19Z) - Competence-based Multimodal Curriculum Learning for Medical Report
Generation [98.10763792453925]
本稿では,コンピテンスベースのマルチモーダルカリキュラム学習フレームワーク(CMCL)を提案する。
具体的には、CMCLは放射線学者の学習過程をシミュレートし、段階的にモデルを最適化する。
パブリックIU-XrayとMIMIC-CXRデータセットの実験は、CMCLを既存のモデルに組み込んでパフォーマンスを向上させることができることを示している。
論文 参考訳(メタデータ) (2022-06-24T08:16:01Z) - Two heads are better than one: Enhancing medical representations by
pre-training over structured and unstructured electronic health records [23.379185792773875]
マルチモーダル EHR から代表的特徴を自動学習するために,UMM-PLM という,深層学習に基づく医用事前訓練言語モデルを提案する。
まず,各データソースから一助表現を別々に学習する一助情報表現モジュールを開発した。
異なるモジュラリティ間の相互作用をモデル化するために、クロスモーダルモジュールが導入された。
論文 参考訳(メタデータ) (2022-01-25T06:14:49Z) - Cross-Modal Information Maximization for Medical Imaging: CMIM [62.28852442561818]
病院では、同じ情報を異なるモダリティの下で利用できるようにする特定の情報システムにデータがサイロ化される。
これは、テスト時に常に利用できないかもしれない同じ情報の複数のビューを列車で取得し、使用するためのユニークな機会を提供する。
テスト時にモダリティの低下に耐性を持つマルチモーダル入力の優れた表現を学習することで、利用可能なデータを最大限活用する革新的なフレームワークを提案する。
論文 参考訳(メタデータ) (2020-10-20T20:05:35Z) - M2Net: Multi-modal Multi-channel Network for Overall Survival Time
Prediction of Brain Tumor Patients [151.4352001822956]
生存時間(OS)の早期かつ正確な予測は、脳腫瘍患者に対するより良い治療計画を得るのに役立つ。
既存の予測手法は、磁気共鳴(MR)ボリュームの局所的な病変領域における放射能特性に依存している。
我々は,マルチモーダルマルチチャネルネットワーク(M2Net)のエンドツーエンドOS時間予測モデルを提案する。
論文 参考訳(メタデータ) (2020-06-01T05:21:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。