論文の概要: Large Language Models as Unified Multimodal Learners for Clinical Prediction
- arxiv url: http://arxiv.org/abs/2607.15380v1
- Date: Thu, 16 Jul 2026 18:28:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.680799
- Title: Large Language Models as Unified Multimodal Learners for Clinical Prediction
- Title(参考訳): 臨床予測のための統合型マルチモーダル学習者としての大規模言語モデル
- Authors: Ajay Madhavan Ravichandran, Bilgin Osmandoja, Klemens Budde, Klaus Netter, Tobias Strapatsas, Aljoscha Burchardt, Sebastian Möller, Roland Roller,
- Abstract要約: 我々は,すべての患者データをモダリティに関わらず,単一の自然言語シーケンスに変換し,事前訓練された言語モデルをエンドツーエンドに微調整する。
本手法は,MIMIC-IIIの院内死亡率,ドイツ移植センターの経時的データを用いた移植不全予測,救急医療記録からの緊急トリアージ分類の3つにまたがって評価した。
- 参考スコア(独自算出の注目度): 5.035455671983185
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Electronic health records combine free-text clinical narratives with structured measurements such as vital signs, laboratory values, and comorbidities. Yet most clinical prediction systems still rely on task-specific fusion architectures, pairing dedicated encoders for each modality with learned combination mechanisms that must be re-engineered for every new task and clinical setting. We propose a simpler alternative: convert all patient data, regardless of modality, into a single natural language sequence and fine-tune a pretrained language model end-to-end, with no architectural modification for fusion. We evaluate this approach across three clinically distinct prediction tasks: in-hospital mortality on MIMIC-III, graft failure prediction using longitudinal data from a German transplant center, and emergency triage classification from ambulance records - comparing encoder-based (ModernBERT) and decoder-based (Llama 3.1, Gemma, DeepSeek-R1-Qwen, Qwen3) fine-tuning against established multimodal baselines and, for graft failure, a gradient boosting model currently used in clinical practice for post-transplant patient management. Across all three tasks, unified textual serialization matches or exceeds task-specific multimodal baselines, and outperforms the clinically deployed gradient boosting system on graft failure prediction. These results indicate that a single serialization-based paradigm, without bespoke fusion architectures, is sufficient for multimodal clinical prediction - substantially reducing system complexity while matching or exceeding specialized designs.
- Abstract(参考訳): 電子的な健康記録は、自由テキストの臨床物語と、バイタルサイン、実験室の値、コオービディティなどの構造化された測定結果を組み合わせたものである。
しかし、ほとんどの臨床予測システムはタスク固有の融合アーキテクチャに依存しており、各モードに専用のエンコーダをペアリングし、新しいタスクと臨床設定ごとに再設計する必要がある学習された組み合わせメカニズムを組み込む。
そこで我々は,すべての患者データを,モダリティに関係なく単一の自然言語シーケンスに変換し,事前訓練された言語モデルをエンドツーエンドに微調整し,融合のアーキテクチャ的な変更を伴わない,より単純な方法を提案する。
本研究は,MIMIC-IIIの院内死亡率,ドイツ移植センターの縦断的データを用いたグラフト故障予測,救急医療記録からの緊急トリアージ分類,エンコーダベース(ModernBERT)とデコーダベース(Llama 3.1, Gemma, DeepSeek-R1-Qwen, Qwen3)を比較した。
これら3つのタスク全体にわたって、統一されたテキストシリアライゼーションはタスク固有のマルチモーダルベースラインを超え、グラフト故障予測において臨床に配備された勾配促進システムより優れる。
これらの結果から,単直列化に基づくパラダイムは,マルチモーダルな臨床予測には十分であることが示唆された。
関連論文リスト
- Primary ICD Category Prediction using LLM-based Probing [7.948368617192842]
ICD-10符号10個のうち13,645個のMIMIC-IVコホートを構築した。
我々は,5つの変圧器層から隠れた状態を抽出し,非構造的,非構造的,複合的な入力に対して線形プローブを訓練した。
組み合わせたプローブはMIMIC-IV(87.69%の厳格さ、91.45%の医療的精度)で最高性能を達成し、単一モードのプローブとベースラインを上回った。
論文 参考訳(メタデータ) (2026-06-27T08:10:05Z) - ClinicalEncoder26AM: A Multlilingual Diagnosable ColBERT Model; Evidences from the MultiClinNER Shared Task [1.6904475483445454]
ClinicalEncoder26AMは、臨床およびバイオメディカルテキストのための多言語診断可能なColBERTである。
患者症状, 障害, 手術スパンに対するBIOタグを微調整し, マルチClinNER共有タスクにおけるモデルの評価を行った。
論文 参考訳(メタデータ) (2026-05-27T14:20:45Z) - MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models [59.180043227905294]
MedPrunerは、3次元医用画像の効率的な理解のためのトレーニング不要でモデルに依存しない階層的トークンプレーニングフレームワークである。
我々は、MedPrunerによって、MedGemmaのようなモデルが元の性能を維持したり、超えたりすることが可能であり、ビジュアルトークンの5%以下を維持していることを示す。
論文 参考訳(メタデータ) (2026-03-12T07:37:00Z) - MedSeqFT: Sequential Fine-tuning Foundation Models for 3D Medical Image Segmentation [55.37355146924576]
MedSeqFTは、医用画像解析のためのシーケンシャルな微調整フレームワークである。
事前訓練されたモデルを新しいタスクに適応させ、表現能力を改善する。
最先端の微調整戦略を一貫して上回ります。
論文 参考訳(メタデータ) (2025-09-07T15:22:53Z) - Clinical NLP with Attention-Based Deep Learning for Multi-Disease Prediction [44.0876796031468]
本稿では,電子健康記録テキストの非構造的性質と高次元意味論的複雑さがもたらす課題について論じる。
情報抽出と多ラベル病予測のための統合モデリングを実現するために,注意機構に基づく深層学習手法を提案する。
論文 参考訳(メタデータ) (2025-07-02T07:45:22Z) - METHOD: Modular Efficient Transformer for Health Outcome Discovery [0.25112747242081457]
本稿では,電子カルテにおける臨床シーケンスモデリングの課題に対処するために,新しいトランスフォーマーアーキテクチャである Method を紹介する。
1)効率的なバッチ処理を可能にしながら情報漏洩を防止する患者対応アテンション機構,(2)マルチスケールの時間的依存関係をキャプチャする適応型スライディングウィンドウアテンションスキーム,(3)動的スキップ接続を備えたU-Netインスピレーションアーキテクチャ。
MIMIC-IVデータベースにおける評価は、手法が最先端のETHOSモデルより一貫して優れていることを示した。
論文 参考訳(メタデータ) (2025-05-16T15:52:56Z) - Continually Evolved Multimodal Foundation Models for Cancer Prognosis [50.43145292874533]
がん予後は、患者の予後と生存率を予測する重要なタスクである。
これまでの研究では、臨床ノート、医療画像、ゲノムデータなどの多様なデータモダリティを統合し、補完的な情報を活用している。
既存のアプローチには2つの大きな制限がある。まず、各病院の患者記録など、各種のトレーニングに新しく到着したデータを組み込むことに苦慮する。
第二に、ほとんどのマルチモーダル統合手法は単純化された結合やタスク固有のパイプラインに依存しており、モダリティ間の複雑な相互依存を捉えることができない。
論文 参考訳(メタデータ) (2025-01-30T06:49:57Z) - EMERGE: Enhancing Multimodal Electronic Health Records Predictive Modeling with Retrieval-Augmented Generation [22.94521527609479]
EMERGEはRetrieval-Augmented Generation(RAG)駆動のフレームワークであり、マルチモーダルEHR予測モデリングを強化する。
時系列データと臨床ノートからエンティティを抽出し,LLM(Large Language Models)を誘導し,プロのPrimeKGと整合させる。
抽出した知識は、患者の健康状態のタスク関連サマリーを生成するために使用される。
論文 参考訳(メタデータ) (2024-05-27T10:53:15Z) - XAI for In-hospital Mortality Prediction via Multimodal ICU Data [57.73357047856416]
マルチモーダルICUデータを用いて病院内死亡率を予測するための,効率的で説明可能なAIソリューションを提案する。
我々は,臨床データから異種入力を受信し,意思決定を行うマルチモーダル・ラーニングを我々のフレームワークに導入する。
我々の枠組みは、医療研究において重要な要素の発見を容易にする他の臨床課題に容易に移行することができる。
論文 参考訳(メタデータ) (2023-12-29T14:28:04Z) - Self-supervised Answer Retrieval on Clinical Notes [68.87777592015402]
本稿では,ドメイン固有パスマッチングのためのトランスフォーマー言語モデルをトレーニングするためのルールベースのセルフスーパービジョンであるCAPRを紹介する。
目的をトランスフォーマーベースの4つのアーキテクチャ、コンテキスト文書ベクトル、ビ-、ポリエンコーダ、クロスエンコーダに適用する。
本稿では,ドメイン固有パスの検索において,CAPRが強いベースラインを上回り,ルールベースおよび人間ラベル付きパスを効果的に一般化することを示す。
論文 参考訳(メタデータ) (2021-08-02T10:42:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。