論文の概要: Autoregressive EHR Foundation Models with Multimodal Inputs
- arxiv url: http://arxiv.org/abs/2607.22264v1
- Date: Fri, 24 Jul 2026 12:59:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.128652
- Title: Autoregressive EHR Foundation Models with Multimodal Inputs
- Title(参考訳): マルチモーダル入力を用いた自己回帰型EHRファンデーションモデル
- Abstract要約: トークン化された電子健康記録に基づいてトレーニングされた自己回帰基盤モデルは、ゼロショット臨床予測をサポートすることができる。
本稿では,心電図波形,胸部X線画像,臨床ノートなどの補助的臨床モダリティに基づいて,そのようなモデルを条件付けするための枠組みを提案する。
- 参考スコア(独自算出の注目度): 14.402677557506367
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autoregressive foundation models trained on tokenized electronic health records (EHRs) can support zero-shot clinical prediction, yet most operate on structured event codes alone, and do not incorporate multiple modalities in a principled way. We present a framework for conditioning such models on auxiliary clinical modalities, including ECG waveforms, chest X-ray images, and clinical notes, using modality-specific latent compression and gated cross-attention with temporal alignment. We investigate two key design choices: (1) how to compress long per-modality sequences (e.g., ECG time series) before they enter the multi-modal cross-attention. This feature may be essential to reduce compute overheads and may be beneficial for generalization; (2) how the choice of pretrained encoder for each modality impacts downstream performance. Through controlled ablations on MIMIC-IV, we show that the best latent-compression configurations outperforms both uncompressed cross-attention and mean pooling. Encoder choice has a clear within-modality effect, with stronger pretrained encoders consistently outperforming weaker alternatives. We further show that merely adding auxiliary modalities does not guarantee improvement on ICU mortality prediction over an EHR-only baseline. This implies that careful design of the fusion architecture and an appropriate evaluation in the clinical context are required.
- Abstract(参考訳): トークン化された電子健康記録(EHR)に基づいてトレーニングされた自己回帰基盤モデルは、ゼロショット臨床予測をサポートすることができるが、ほとんどの場合、構造化されたイベントコードだけで動作し、原則化された方法で複数のモダリティを組み込まない。
本稿では,心電図波形,胸部X線画像,臨床ノートなどの補助的臨床的モダリティを,時間的アライメントを付加したモード特異的潜伏圧縮とゲートクロスアテンションを用いて条件付けするための枠組みを提案する。
提案手法は, 複数モードのクロスアテンションに入る前に, 長いモードごとのシーケンス(例えば, ECG 時系列)を圧縮する方法である。
この機能は計算オーバーヘッドを減らすために必須であり、一般化に有用かもしれない; (2) それぞれのモードに対する事前訓練エンコーダの選択が下流のパフォーマンスにどのように影響するか。
制御されたMIMIC-IVのアブレーションにより、最良遅延圧縮構成は非圧縮的クロスアテンションと平均プーリングの両方に優れることを示した。
エンコーダの選択は、明確な内部モダリティ効果を持ち、より強い事前訓練されたエンコーダは、より弱い代替品よりも一貫して優れている。
さらに,補助モダリティの追加だけでは,ERHのみのベースライン上でのICU死亡予測の改善が保証されないことを示す。
このことは、核融合アーキテクチャの慎重な設計と臨床現場での適切な評価が必要であることを示唆している。
関連論文リスト
- Reading the Whole Heart: Latent-Attention Masked Autoencoders for Multimodal Cardiac Representation Learning [16.941311033409626]
マルチモーダル・構造対応マスク付きオートエンコーダであるLatent-Attention Masked Autoencoders (LAMAE)を紹介する。
LAMAEは、学習視点の階層上で動作する共有潜伏モジュールを介して、潜伏空間で情報を直接交換する。
LAMAEは、マルチモーダル病院ステイタスクにおいて、モダリティ固有の事前訓練と強いコントラスト、および視覚言語ベースラインを上回ります。
論文 参考訳(メタデータ) (2026-09-10T17:49:44Z) - Physics-Informed Deep Learning for False Ventricular Tachycardia Alarm Reduction in the ICU [44.313512671851306]
軽度心室頻拍(VT)アラームは集中治療単位のアラーム疲労の原因となる。
本稿では,1D SE-ResNetと ICU-realistic Data Augmentation を組み合わせたディープラーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-09-08T16:33:07Z) - ProCA: Progressive Contrastive Alignment for Robust EEG Visual Decoding [47.35612571473169]
EEGビジュアルデコーディングは、非侵襲的な神経時系列信号から視覚的セマンティクスを回復することを目的としている。
既存の手法は固定された視覚的あるいはテキスト的アンカーに依存しており、その意味的関係は、試行錯誤、主題、学習段階によって異なる脳波表現と一致している可能性がある。
本稿では,適応型ニューラル・セマンティックアライメントのための統一的でモデルに依存しないフレームワークであるProgressive Contrastive Alignment(ProCA)を提案する。
論文 参考訳(メタデータ) (2026-09-04T12:48:25Z) - Foundation Model for Cardiac Time Series via Masked Latent Attention [19.265319330946465]
心電図(ECG)は最も広く用いられる臨床信号であり、心臓血管診断において中心的な役割を果たす。
我々は,自己教師付き事前学習中に,この構造を直接活用する潜時注意マスク付きオートエンコーダ (LAMAE) FMを導入する。
提案手法は, 鉛間の高次相互作用を潜在的注意を通してモデル化し, 置換不変凝集と鉛固有表現の適応重み付けを可能にする。
論文 参考訳(メタデータ) (2026-03-27T14:41:44Z) - MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models [59.180043227905294]
MedPrunerは、3次元医用画像の効率的な理解のためのトレーニング不要でモデルに依存しない階層的トークンプレーニングフレームワークである。
我々は、MedPrunerによって、MedGemmaのようなモデルが元の性能を維持したり、超えたりすることが可能であり、ビジュアルトークンの5%以下を維持していることを示す。
論文 参考訳(メタデータ) (2026-03-12T07:37:00Z) - MedAD-R1: Eliciting Consistent Reasoning in Interpretible Medical Anomaly Detection via Consistency-Reinforced Policy Optimization [46.65200216642429]
我々はMedADの最初の大規模マルチモーダル・マルチセンタベンチマークであるMedAD-38Kを紹介し、構造化された視覚質問応答(VQA)ペアとともに、CoT(Chain-of-Thought)アノテーションを特徴付ける。
提案するモデルであるMedAD-R1は、MedAD-38Kベンチマーク上での最先端(SOTA)性能を実現し、強いベースラインを10%以上上回った。
論文 参考訳(メタデータ) (2026-02-01T07:56:10Z) - Leveraging Foundational Models and Simple Fusion for Multi-modal Physiological Signal Analysis [0.0]
我々はCBraModエンコーダを大規模自己監督型ECGプリトレーニングに適用する。
我々は、事前訓練されたCBraModエンコーダをEEGに利用し、対称ECGエンコーダを事前訓練する。
提案手法は, 簡単な融合であっても, 慎重に設計された生理的エンコーダが下流性能を大幅に向上することを示した。
論文 参考訳(メタデータ) (2025-12-17T09:49:06Z) - EnECG: Efficient Ensemble Learning for Electrocardiogram Multi-task Foundation Model [46.84040404474695]
EnECGは、複数の特別な基礎モデルを統合するアンサンブルベースのフレームワークであり、それぞれECG解釈の異なる側面で優れている。
本稿では,基礎モデルの強力な表現力を維持しつつ,計算・メモリコストの削減に寄与することを示す。
このフレームワークは特徴抽出と予測性能を向上するだけでなく、実際の臨床応用に実用的な効率性も確保する。
論文 参考訳(メタデータ) (2025-11-28T07:22:33Z) - PULSE-ICU: A Pretrained Unified Long-Sequence Encoder for Multi-task Prediction in Intensive Care Units [0.3277163122167433]
大規模EHRシーケンスからイベントレベルICU表現を学習する自己教師型基礎モデルであるPULSE-ICUを提案する。
統合埋め込みモジュールはイベントアイデンティティ、連続値、ユニット、時間属性をエンコードし、ロングフォーマーベースのエンコーダは長い軌道の効率的なモデリングを可能にする。
論文 参考訳(メタデータ) (2025-11-27T08:10:52Z) - Cross-Representation Benchmarking in Time-Series Electronic Health Records for Clinical Outcome Prediction [44.23284500920266]
このベンチマークは、2つの異なる臨床環境におけるデータキュレーションと評価を標準化する。
実験によると、イベントストリームモデルは、常に最強のパフォーマンスを提供する。
特徴選択戦略は臨床環境に適応する必要がある。
論文 参考訳(メタデータ) (2025-10-10T09:03:47Z) - Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech [51.14752758616364]
音声による抑うつ検出 (SDD) は、従来の臨床評価に代わる有望で非侵襲的な代替手段である。
HAREN-CTCは,マルチタスク学習フレームワーク内でのクロスアテンションを用いて,多層SSL機能を統合した新しいアーキテクチャである。
このモデルはDAIC-WOZで0.81、MODMAで0.82の最先端マクロF1スコアを達成し、両方の評価シナリオで先行手法より優れている。
論文 参考訳(メタデータ) (2025-10-05T09:32:12Z) - CardiacCLIP: Video-based CLIP Adaptation for LVEF Prediction in a Few-shot Manner [14.429336783145644]
左室放出分画(LVEF)は心臓機能の指標となる。
既存のLVEF推定手法は、大規模な注釈付きビデオデータセットに依存する。
我々は、注目ベースのフレームアグリゲーションとマルチレゾリューション・インプット・スケーリングによるLVEF予測を強化する、ビデオベースのフレームワークであるCardiacCLIPを提案する。
論文 参考訳(メタデータ) (2025-09-21T12:52:08Z) - Sensing Cardiac Health Across Scenarios and Devices: A Multi-Modal Foundation Model Pretrained on Heterogeneous Data from 1.7 Million Individuals [36.08910150609342]
広大で異質な健康記録から統一された表現を学習する心センシング基礎モデル(CSFM)を提案する。
我々のモデルは、複数の大規模データセットからのデータの革新的なマルチモーダル統合に基づいて事前訓練されている。
CSFMは従来のワンモーダル・ワン・タスク・アプローチより一貫して優れている。
論文 参考訳(メタデータ) (2025-06-23T20:58:12Z) - Boosting Masked ECG-Text Auto-Encoders as Discriminative Learners [10.088785685439134]
本稿では,コントラッシブマスクを用いた自動エンコーダアーキテクチャを用いて,ECGとテキストデータを事前学習するフレームワークD-BETAを提案する。
D-BETAは、生成性の強さと差別能力の強化を一意に組み合わせて、堅牢なクロスモーダル表現を実現する。
論文 参考訳(メタデータ) (2024-10-03T01:24:09Z) - MEDPSeg: Hierarchical polymorphic multitask learning for the segmentation of ground-glass opacities, consolidation, and pulmonary structures on computed tomography [37.119000111386924]
MEDPSegは階層型多形マルチタスク学習(HPML)を通して異種胸部CTターゲットから学習する
本稿では,GGOと統合セグメンテーションタスクの最先端性能を実現するPMLについて述べる。
さらに、MEDPSegは肺発作、気道、肺動脈、肺病変の分節を同時に行う。
論文 参考訳(メタデータ) (2023-12-04T21:46:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。