論文の概要: Enhancing Explainable Cardiac Diagnosis with Guide-Grounded Multimodal LLMs
- arxiv url: http://arxiv.org/abs/2607.20814v1
- Date: Thu, 23 Jul 2026 01:00:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.254633
- Title: Enhancing Explainable Cardiac Diagnosis with Guide-Grounded Multimodal LLMs
- Title(参考訳): ガイド付きマルチモーダルLCMによる説明可能な心臓診断の強化
- Authors: Hai-Nam Duy Vuong, Duy-Anh Bui, Trong-Nghia Nguyen, Kim-Ngan Thi Nguyen, Trang Mai Xuan, Tien-Cuong Nguyen, Van-Dem Pham, Thien Van Luong,
- Abstract要約: 本稿では,臨床診断における報告生成を定着させるガイド付きマルチモーダルフレームワークを提案する。
畳み込みニューラルネットワーク(CNN)とGrad-CAMは、まず12リードのECG画像からクラス確率とクラス固有のヒートマップを生成する。
並行して、権威のあるECG教科書とガイドライン資料をオフラインで、構造化ECG解釈ガイドに蒸留する。
- 参考スコア(独自算出の注目度): 4.449622404641125
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The electrocardiogram (ECG) is a cornerstone of cardiac as- sessment, yet clinical deployment of deep learning models remains con- strained by limited interpretability and the hallucination risk of large language models (LLMs). Existing CNN+Grad-CAM+multimodal LLM frameworks can generate ECG reports, but their explanations are often only weakly grounded in established diagnostic criteria, reducing trust- worthiness and reproducibility. We propose a guide-grounded multimodal framework that explicitly anchors report generation in curated clinical knowledge. A convolutional neural network (CNN) and Grad-CAM first produce class probabilities and class-specific heatmaps from 12-lead ECG images. In parallel, authoritative ECG textbooks and guideline materials are distilled offline into a structured ECG Interpretation Guide, which is injected as a fixed knowledge block for every sample. Conditioned on the ECG image, Grad-CAM overlay, CNN-derived fact pack, and the in- jected guide, a multimodal LLM generates structured diagnostic reports with guideline-consistent terminology and criteria usage. Experiments on the full PTB-XL test set demonstrate that guide grounding improves se- mantic quality and perceived consistency of generated reports while pre- serving competitive classification performance. In particular, our method increases the average BERTScore of generated impressions from 0.818 to 0.953 relative to a strong CNN+Grad-CAM+MLLM baseline, indicat- ing closer alignment with reference reports. These findings suggest that injecting a distilled interpretation guide into the multimodal prompting pipeline offers a practical pathway to reduce hallucinations and enhance the clinical plausibility of LLM-based ECG explanations, bringing ex- plainable cardiac diagnosis closer to real-world deployment.
- Abstract(参考訳): 心電図 (ECG) は心房中隔欠損の基盤となっているが, 深層学習モデルの臨床的展開は, 限定的な解釈可能性と大型言語モデル (LLMs) の幻覚リスクが相反するままである。
既存のCNN+Grad-CAM+Multimodal LLMフレームワークは、ECGレポートを生成することができるが、それらの説明は確立された診断基準に弱く、信頼性と再現性を低下させる。
本稿では,臨床知識の蓄積を明示するガイド・グラウンド・マルチモーダル・フレームワークを提案する。
畳み込みニューラルネットワーク(CNN)とGrad-CAMは、まず12リードのECG画像からクラス確率とクラス固有のヒートマップを生成する。
並行して、権威のあるECG教科書とガイドライン資料をオフラインで蒸留して構造化ECG解釈ガイドを作成し、各サンプルに対して固定知識ブロックとして注入する。
ECG画像、Grad-CAMオーバーレイ、CNN由来のファクトパック、およびインジェクトガイドに基づいて、マルチモーダルLCMは、ガイドラインに一貫性のある用語と基準を用いた構造化診断レポートを生成する。
PTB-XLテストセットの完全な実験により、ガイドグラウンド化は、予測されたレポートのセマンティックな品質と一貫性を向上し、事前の競争的分類性能が向上することを示した。
特に,提案手法は,CNN+Grad-CAM+MLLMベースラインに対して,出力された印象の平均BERTScoreを0.818から0.953に増加させる。
以上の結果から,マルチモーダル・プロンプトパイプラインに蒸留液を注入することにより,幻覚を減少させ,LCMによる心電図説明の臨床的有用性を高めることができることが示唆された。
関連論文リスト
- Information-theoretic Multimodal Representation Learning for Electrocardiogram Signals [34.28801923123035]
心電図(ECG)は、心臓活動の非侵襲的測定として広く用いられ、臨床診断において中心的な役割を果たす。
近年,心電図の信号と診断的意味論を取り入れた臨床報告とが一致しているが,臨床報告は心電図波形の豊富な生理的構造を保たないことが多い。
我々は、情報理論の観点からECG表現学習を定式化し、信号構造を共同で保存し、臨床的意味論を統合する、抽出可能な目的を導出する。
論文 参考訳(メタデータ) (2026-05-26T18:52:57Z) - Simulator and Experience Enhanced Diffusion Model for Comprehensive ECG Generation [52.19347532840774]
本稿では,心電図生成のための新しい生理シミュレータSE-Diffを提案する。
SE-Diffは、軽量常微分方程式(ODE)ベースのECGシミュレータをビートデコーダを介して拡散過程に統合する。
実世界のECGデータセットに対する大規模な実験により、SE-Diffは信号の忠実度とテキスト-ECGセマンティックアライメントの両方を改善している。
論文 参考訳(メタデータ) (2025-11-13T02:57:10Z) - GEM: Empowering MLLM for Grounded ECG Understanding with Time Series and Images [44.50428701650495]
GEMは,第1回MLLM統合ECG時系列,第12回リードECG画像,地上および臨床のECG解釈のためのテキストである。
GEMは、3つのコアイノベーションを通じて機能的解析、エビデンス駆動推論、および臨床医のような診断プロセスを可能にする。
基礎心電図理解におけるMLLMの能力を評価するために,臨床動機付けのベンチマークであるグラウンドドECGタスクを提案する。
論文 参考訳(メタデータ) (2025-03-08T05:48:53Z) - MEIT: Multimodal Electrocardiogram Instruction Tuning on Large Language Models for Report Generation [28.35107188450758]
心電図(Electrocardiogram、ECG)は、心臓の状態をモニタリングするための主要な非侵襲的診断ツールである。
最近の研究は心電図データを用いた心臓状態の分類に集中しているが、心電図レポートの生成は見落としている。
LLMとマルチモーダル命令を用いてECGレポート生成に取り組む最初の試みであるMultimodal ECG Instruction Tuning (MEIT) フレームワークを提案する。
論文 参考訳(メタデータ) (2024-03-07T23:20:56Z) - Cross-modal Clinical Graph Transformer for Ophthalmic Report Generation [116.87918100031153]
眼科報告生成(ORG)のためのクロスモーダルな臨床グラフ変換器(CGT)を提案する。
CGTは、デコード手順を駆動する事前知識として、臨床関係を視覚特徴に注入する。
大規模FFA-IRベンチマークの実験は、提案したCGTが従来のベンチマーク手法より優れていることを示した。
論文 参考訳(メタデータ) (2022-06-04T13:16:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。