論文の概要: ECGQuest: Benchmarking and Fine-Tuning Language Models for Electrocardiography
- arxiv url: http://arxiv.org/abs/2608.30893v1
- Date: Mon, 31 Aug 2026 14:45:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.452836
- Title: ECGQuest: Benchmarking and Fine-Tuning Language Models for Electrocardiography
- Title(参考訳): ECGQuest:心電図のベンチマークと微調整言語モデル
- Abstract要約: ECGQuestは、ECG固有の言語モデルの評価と微調整のための文学的なリソースである。
ゼロショット環境でのホールドアウトテストセットにおいて,3つの商用および20のオープンソース言語モデルを評価した。
汎用モデルは医学的に専門化されたモデルより優れ、いくつかのモデルは強いTrue/Falseバイアスを示し、エンコーダのベースラインは偶然に実行された。
- 参考スコア(独自算出の注目度): 1.3488919270143456
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Electrocardiogram (ECG) interpretation requires knowledge of cardiology, electrophysiology, clinical diagnosis, ECG waveforms, signal acquisition, and instrumentation. Existing language-model benchmarks, however, primarily assess broad medical knowledge or interpretation of individual ECG signals and images rather than the broader contextual knowledge required for ECG interpretation. We developed ECGQuest, a literature-grounded resource for evaluating and fine-tuning ECG-specific language models. A GPT-4o-based pipeline generated questions from 23 ECG references and Computing in Cardiology proceedings from 2003-2025. The final dataset contains 10,904 unique True/False questions paired with their negated forms (21,808 Q&A pairs). We evaluated three commercial and 20 open-source language models on a held-out test set in a zero-shot setting. Five open-source models with 7-14B parameters were fine-tuned using Low-Rank Adaptation, with BERT and BiomedBERT included as supervised encoder baselines. Generalization was assessed on ECG-related subsets of MedMCQA and MedQA converted to binary True/False questions using official answer keys. Zero-shot accuracy on ECGQuest ranged from 49.5% to 74.4%, with GPT-5 performing best. General-purpose models outperformed medically specialized models, several models showed strong True/False bias, and encoder baselines performed near chance. Fine-tuning improved all open-source models by 6.5-14.1%. Fine-tuned DeepSeek-R1-Distill-Qwen-14B reached 76.3% accuracy, while a five-model voting ensemble reached 78.5%. On MedMCQA and MedQA, fine-tuning mainly benefited weaker or class-biased models and did not consistently improve strong base models. ECGQuest provides a reproducible benchmark for contextual ECG knowledge and shows that parameter-efficient fine-tuning can make smaller language models competitive with substantially larger commercial models.
- Abstract(参考訳): 心電図(ECG)の解釈には、心臓学、電気生理学、臨床診断、心電図波形、信号取得、計測の知識が必要である。
しかし、既存の言語モデルベンチマークでは、ECGの解釈に必要なコンテキスト知識よりも、主に個々のECG信号や画像の幅広い医学的知識や解釈を評価している。
我々は,ECG固有の言語モデルの評価と微調整を行うための文献的資源であるECGQuestを開発した。
GPT-4oベースのパイプラインは、2003年から2025年にかけて23の心電図参照と心電図の計算手順から質問を発生させた。
最終データセットには、10,904のTrue/Falseの質問と、その否定されたフォーム(21,808のQ&Aペア)が含まれている。
ゼロショット環境でのホールドアウトテストセットにおいて,3つの商用および20のオープンソース言語モデルを評価した。
7-14Bパラメータを持つ5つのオープンソースモデルは低ランク適応を用いて微調整され、BERTとBiomedBERTは教師付きエンコーダベースラインとして含まれた。
MedMCQA と MedQA の ECG 関連サブセットを公式の回答キーを用いて2つの True/False 質問に変換した。
ECGQuestのゼロショット精度は49.5%から74.4%まで変化し、GPT-5は最高だった。
汎用モデルは医学的に専門化されたモデルより優れ、いくつかのモデルは強いTrue/Falseバイアスを示し、エンコーダのベースラインは偶然に実行された。
微調整により、すべてのオープンソースモデルを6.5-14.1%改善した。
微調整されたDeepSeek-R1-Distill-Qwen-14Bは76.3%の精度で、5モデル投票アンサンブルは78.5%に達した。
MedMCQAとMedQAでは、微調整は主に弱いモデルやクラスバイアスのモデルに恩恵を与え、強力なベースモデルを一貫して改善しなかった。
ECGQuestは、文脈的ECG知識の再現可能なベンチマークを提供し、パラメータ効率のよい微調整により、より小さな言語モデルをより大規模な商用モデルと競合させることができることを示した。
関連論文リスト
- ECG-LLM: Foundation Model for ECG-Based Cardiac Reasoning [50.82313761980655]
ECG-LLMは186,409人を対象にした4つのコホート679,112のECG研究で訓練されたECG条件付き大言語モデルである。
ECG信号、臨床コンテキスト、CMR、ECHOから導かれる、臨床的に構造化された質問応答対をトレーニングする。
心拍数などの従来の心電図測定を成功させ、複雑なCMR由来の表現型を強く予測する。
論文 参考訳(メタデータ) (2026-07-15T11:06:35Z) - Physiology-Aware CNN and Zero-Shot Multimodal LLMs for ECG Image Classification: A Comparative Study [1.6918354618189373]
マルチモーダルな大言語モデル(LLM)は、12リードのECG画像の解釈にますます採用されている。
本研究は, ゼロショット多モードLCMが正常心電図像と異常心電図像とを確実に識別できるかどうかを検討した。
論文 参考訳(メタデータ) (2026-06-22T05:59:10Z) - ECG-Lens: Benchmarking ML & DL Models on PTB-XL Dataset [0.06363400715351396]
本研究では,従来の3つの機械学習アルゴリズムと,ECG信号の分類のための3つのディープラーニングモデルを比較した。
ECGLensモデルは、80%の分類精度と90%のROC-AUCで最高性能を達成した。
論文 参考訳(メタデータ) (2026-04-17T08:20:44Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - CAMEL: An ECG Language Model for Forecasting Cardiac Events [17.69153622989266]
本稿では,CAMELを提案する。CAMELは,より長い信号時間で推測できる最初のECG言語モデルである。
我々の重要な洞察は、テキストによるECG信号の相互理解を可能にする専用のECGエンコーダである。
確立したLLM学習手順を用いてCAMELを訓練し、LoRA適応とカリキュラム学習パイプラインを組み合わせた。
論文 参考訳(メタデータ) (2026-02-17T16:02:52Z) - EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models [82.43729208063468]
医療用LVLM(Large Vision-Language Models)の最近のベンチマークでは、信頼性と安全性を見越して、リーダボードの精度を強調している。
ユーザが提供した情報を非批判的に反響させる傾向のモデルについて検討する。
医療用LVLMの梅毒を系統的に評価するベンチマークであるEchoBenchを紹介する。
論文 参考訳(メタデータ) (2025-09-24T14:09:55Z) - Finetuning and Quantization of EEG-Based Foundational BioSignal Models on ECG and PPG Data for Blood Pressure Estimation [46.36100528165335]
光胸腺撮影と心電図は、連続血圧モニタリング(BP)を可能にする可能性がある。
しかし、データ品質と患者固有の要因の変化のため、正確で堅牢な機械学習(ML)モデルは依然として困難である。
本研究では,1つのモータリティで事前学習したモデルを効果的に利用して,異なる信号タイプの精度を向上させる方法について検討する。
本手法は, 拡張期BPの最先端精度を約1.5倍に向上し, 拡張期BPの精度を1.5倍に向上させる。
論文 参考訳(メタデータ) (2025-02-10T13:33:12Z) - Automated Medical Report Generation for ECG Data: Bridging Medical Text and Signal Processing with Deep Learning [0.0]
本稿では,自由テキストレポートを用いてECGエピソードの詳細な記述を生成するエンコーダ・デコーダ方式を提案する。
これは、ゼロショット分類と自動臨床決定支援の潜在的な応用として、ECG分析自動化の大幅な進歩を示している。
論文 参考訳(メタデータ) (2024-12-05T11:05:12Z) - An Electrocardiogram Foundation Model Built on over 10 Million Recordings with External Evaluation across Multiple Domains [17.809094003643523]
ECG Foundation Model (ECGFounder)は、Harvard-Emory ECG Databaseから150のラベルカテゴリを持つ1000万以上のECGをトレーニングしている。
ECGFounderは内部検証セットのエキスパートレベルのパフォーマンスを達成し、AUROCは80の診断で0.95を超えている。
微調整されたECGFounderは、人口統計分析、臨床イベント検出、心拍数横断診断においてベースラインモデルを上回っている。
論文 参考訳(メタデータ) (2024-10-05T12:12:02Z) - Generalizing electrocardiogram delineation: training convolutional
neural networks with synthetic data augmentation [63.51064808536065]
ECGのデライン化のための既存のデータベースは小さく、サイズやそれらが表す病態の配列に不足している。
まず、原データベースから抽出した基本セグメントのプールを与えられたECGトレースを確率的に合成し、その整合性のある合成トレースに配置するための一連のルールを考案した。
第二に、2つの新しいセグメンテーションに基づく損失関数が開発され、これは、正確な数の独立構造の予測を強制し、サンプル数の削減に焦点をあてて、より密接なセグメンテーション境界を創出することを目的としている。
論文 参考訳(メタデータ) (2021-11-25T10:11:41Z) - Multilabel 12-Lead Electrocardiogram Classification Using Gradient
Boosting Tree Ensemble [64.29529357862955]
我々は,心電図の診断を分類するために,形態や信号処理機能に適合した勾配強化木のアンサンブルを用いたアルゴリズムを構築した。
各リードについて、心拍変動、PQRSTテンプレート形状、全信号波形から特徴を導出する。
各クラスに属するECGインスタンスの確率を予測するため、全12項目の特徴と合わせて、勾配を増す決定ツリーの集合に適合する。
論文 参考訳(メタデータ) (2020-10-21T18:11:36Z) - ECG-DelNet: Delineation of Ambulatory Electrocardiograms with Mixed
Quality Labeling Using Neural Networks [69.25956542388653]
ディープラーニング(DL)アルゴリズムは、学術的、産業的にも重くなっている。
セグメンテーションフレームワークにECGの検出とデライン化を組み込むことにより、低解釈タスクにDLをうまく適用できることを実証する。
このモデルは、PhyloNetのQTデータベースを使用して、105個の増幅ECG記録から訓練された。
論文 参考訳(メタデータ) (2020-05-11T16:29:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。