論文の概要: Evaluating Large Language Models for Automated Clinical Abstraction in Pulmonary Embolism Registries: Performance Across Model Sizes, Versions, and Parameters
- arxiv url: http://arxiv.org/abs/2503.21004v1
- Date: Wed, 26 Mar 2025 21:38:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-03-28 18:49:11.3244
- Title: Evaluating Large Language Models for Automated Clinical Abstraction in Pulmonary Embolism Registries: Performance Across Model Sizes, Versions, and Parameters
- Title(参考訳): 肺塞栓症登録における臨床抽象化の自動化のための大規模言語モデルの評価:モデルサイズ,バージョン,パラメータ間のパフォーマンス
- Authors: Mahmoud Alwakeel, Emory Buck, Jonathan G. Martin, Imran Aslam, Sudarshan Rajagopal, Jian Pei, Mihai V. Podgoreanu, Christopher J. Lindsell, An-Kwok Ian Wong,
- Abstract要約: 肺塞栓症は心臓血管死の主要な原因である。
PERT ConsortiumレジストリはPE管理データを標準化するが、リソース集約的な手動抽象化に依存している。
LLMは、CTPE(Computed tomography PE)レポートから概念抽出を自動化するためのスケーラブルな代替手段を提供する。
- 参考スコア(独自算出の注目度): 16.74673750576054
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Pulmonary embolism (PE) is a leading cause of cardiovascular mortality, yet our understanding of optimal management remains limited due to heterogeneous and inaccessible radiology documentation. The PERT Consortium registry standardizes PE management data but depends on resource-intensive manual abstraction. Large language models (LLMs) offer a scalable alternative for automating concept extraction from computed tomography PE (CTPE) reports. This study evaluated the accuracy of LLMs in extracting PE-related concepts compared to a human-curated criterion standard. We retrospectively analyzed MIMIC-IV and Duke Health CTPE reports using multiple LLaMA models. Larger models (70B) outperformed smaller ones (8B), achieving kappa values of 0.98 (PE detection), 0.65-0.75 (PE location), 0.48-0.51 (right heart strain), and 0.65-0.70 (image artifacts). Moderate temperature tuning (0.2-0.5) improved accuracy, while excessive in-context examples reduced performance. A dual-model review framework achieved >80-90% precision. LLMs demonstrate strong potential for automating PE registry abstraction, minimizing manual workload while preserving accuracy.
- Abstract(参考訳): 肺塞栓症 (PE) は心血管死の主要な原因であるが, 異種性, アクセス不能な放射線診断資料により, 最適管理の理解は限られている。
PERT ConsortiumのレジストリはPE管理データを標準化しているが、リソース集約的な手動抽象化に依存している。
大規模言語モデル(LLM)は、CTPE(Computerd tomography PE)レポートから概念抽出を自動化するためのスケーラブルな代替手段を提供する。
本研究では,PE関連概念の抽出におけるLLMの精度を,人為的基準と比較した。
複数のLLaMAモデルを用いてMIMIC-IVおよびDuke Health CTPEの報告を振り返って分析した。
より大きなモデル (70B) はより小さなモデル (8B) より優れており、カッパ値は0.98 (PE検出)、0.65-0.75 (PE位置)、0.48-0.51 (右心歪)、0.65-0.70 (画像アーティファクト) を達成している。
適度な温度調整(0.2-0.5)では精度が向上し、コンテキスト内の過剰な例では性能が低下した。
デュアルモデルレビューフレームワークは80-90%の精度を達成した。
LLMはPEレジストリの抽象化を自動化し、正確性を保ちながら手作業の負荷を最小限にする強力な可能性を示している。
関連論文リスト
- A Multi-Phase Analysis of Blood Culture Stewardship: Machine Learning Prediction, Expert Recommendation Assessment, and LLM Automation [2.25639842999394]
血の文化は、しばしば明確な正当化なしに過度に秩序づけられる。
135483 救急部門 (ED) の血液培養命令について検討し,細菌性貧血のリスクを予測する機械学習モデルを開発した。
論文 参考訳(メタデータ) (2025-04-09T21:12:29Z) - Finetuning and Quantization of EEG-Based Foundational BioSignal Models on ECG and PPG Data for Blood Pressure Estimation [53.2981100111204]
光胸腺撮影と心電図は、連続血圧モニタリング(BP)を可能にする可能性がある。
しかし、データ品質と患者固有の要因の変化のため、正確で堅牢な機械学習(ML)モデルは依然として困難である。
本研究では,1つのモータリティで事前学習したモデルを効果的に利用して,異なる信号タイプの精度を向上させる方法について検討する。
本手法は, 拡張期BPの最先端精度を約1.5倍に向上し, 拡張期BPの精度を1.5倍に向上させる。
論文 参考訳(メタデータ) (2025-02-10T13:33:12Z) - Leveraging Large Language Models to Enhance Machine Learning Interpretability and Predictive Performance: A Case Study on Emergency Department Returns for Mental Health Patients [2.3769374446083735]
救急部門(ED)は精神状態の回復が大きな医療負担となり、患者の24-27%が30日以内に帰国する。
大規模言語モデル(LLM)と機械学習を統合することにより、EDメンタルヘルスリターンリスクモデルの予測精度と臨床的解釈性が向上するか否かを評価する。
論文 参考訳(メタデータ) (2025-01-21T15:41:20Z) - Language Models and Retrieval Augmented Generation for Automated Structured Data Extraction from Diagnostic Reports [2.932283627137903]
この研究は、2つのデータセットを利用していた:7,294の放射線診断報告は、BT-RADS(Brain tumor Reporting and Data System)スコアに注釈付けされ、2,154の病理診断報告は、isocitrate dehydrogenase(IDH)変異のステータスに注釈付けされた。
論文 参考訳(メタデータ) (2024-09-15T15:21:45Z) - Phikon-v2, A large and public feature extractor for biomarker prediction [42.52549987351643]
我々は、DINOv2を用いて視覚変換器を訓練し、このモデルの1つのイテレーションを公開して、Phikon-v2と呼ばれるさらなる実験を行う。
Phikon-v2は、公開されている組織学のスライドをトレーニングしながら、以前リリースしたモデル(Phikon)を上回り、プロプライエタリなデータでトレーニングされた他の病理学基盤モデル(FM)と同等に動作します。
論文 参考訳(メタデータ) (2024-09-13T20:12:29Z) - Machine Learning for ALSFRS-R Score Prediction: Making Sense of the Sensor Data [44.99833362998488]
筋萎縮性側索硬化症(Amyotrophic Lateral Sclerosis、ALS)は、急速に進行する神経変性疾患である。
iDPP@CLEF 2024チャレンジを先導した今回の調査は,アプリから得られるセンサデータを活用することに焦点を当てている。
論文 参考訳(メタデータ) (2024-07-10T19:17:23Z) - Improving Diffusion Models for ECG Imputation with an Augmented Template
Prior [43.6099225257178]
ノイズと品質の悪い録音は、モバイルヘルスシステムを使って収集された信号にとって大きな問題である。
近年の研究では、確率的時系列モデルによるECGの欠落値の計算が検討されている。
本稿では,様々な健康状態の事前情報として,テンプレート誘導型拡散確率モデル(DDPM)PulseDiffを提案する。
論文 参考訳(メタデータ) (2023-10-24T11:34:15Z) - Clinical Deterioration Prediction in Brazilian Hospitals Based on
Artificial Neural Networks and Tree Decision Models [56.93322937189087]
超強化ニューラルネットワーク(XBNet)は臨床劣化(CD)を予測するために用いられる
XGBoostモデルはブラジルの病院のデータからCDを予測する最良の結果を得た。
論文 参考訳(メタデータ) (2022-12-17T23:29:14Z) - Application of the nnU-Net for automatic segmentation of lung lesion on
CT images, and implication on radiomic models [1.8231394717039833]
非小細胞肺癌患者のCT画像にディープラーニング自動分画法を適用した。
生存放射線モデルの性能評価において,手動と自動セグメンテーションの併用も検討した。
論文 参考訳(メタデータ) (2022-09-24T15:04:23Z) - Exploring the Limits of Domain-Adaptive Training for Detoxifying
Large-Scale Language Models [84.30718841659531]
言語モデルの毒性を低減するために,ドメイン適応型学習について検討する。
トレーニングコーパスでは, LMの生成能力を活用することを提案する。
次に,126Mから530Bまでのパラメータサイズを持つLMを包括的に研究した。
論文 参考訳(メタデータ) (2022-02-08T22:10:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。