論文の概要: CardioBench: A Real-World Data Benchmark for Evaluating Large Language Models in Clinically Authentic Cardiovascular Care Scenarios
- arxiv url: http://arxiv.org/abs/2607.25186v2
- Date: Wed, 05 Aug 2026 13:34:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 17:51:08.53961
- Title: CardioBench: A Real-World Data Benchmark for Evaluating Large Language Models in Clinically Authentic Cardiovascular Care Scenarios
- Title(参考訳): CardioBench: 重症心血管疾患における大規模言語モデルの評価のためのリアルタイムデータベンチマーク
- Authors: Xiao Li, Mouxiao Bian, Zhaodi Wu, Sijie Ren, Juechen Chen, Lu Lu, Jingru Ding, Yun Zhong, Jie Xu, Yixiu Liang, Junbo Ge,
- Abstract要約: ほとんどの医学的な大規模言語モデル(LLM)ベンチマークは、試験知識や独立したタスクに焦点を当てている。
CardioBenchは、心臓血管ケア連続体にまたがる現実世界のベンチマークである。
- 参考スコア(独自算出の注目度): 8.549430731768847
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Background: Most medical large language model (LLM) benchmarks focus on examination knowledge or isolated tasks and may not reflect the longitudinal, multimodal, and safety-critical workflow of cardiovascular care. Objective: To develop CardioBench, a real-world benchmark spanning the cardiovascular care continuum, and assess LLM performance across clinical dimensions and specialist tasks. Methods: CardioBench includes 2,263 items from 13 task-specific datasets derived from de-identified cardiovascular records and examination data. Sixteen cardiology physicians conducted annotation and reference construction, followed by cross-review from two senior cardiologists. Seven LLMs generated 15,841 outputs under standardized zero-shot settings. Open-ended tasks were evaluated using key-point coverage and holistic clinical quality, while CardioEthics was scored by accuracy. Results: GPT-5.4 achieved the highest macro-average (62.55) and item-weighted mean (62.19), followed by Gemini 3.1 Pro (59.95) and Qwen 3.6 27B (59.72). GPT-5.4 ranked first in all three dimensions. CardioAuxReport performed best (86.38), whereas CardioECGRead (17.25) and CardioEthics (17.34) were lowest. The largest gaps between holistic clinical quality and key-point coverage occurred in CardioComm (52.71), CardioEmergRescue (52.05), and CardioTreatPlan (48.80). Conclusions: To our knowledge, CardioBench is the largest real-world, multi-task benchmark for LLM evaluation across the cardiovascular care continuum and offers the broadest coverage of clinically authentic cardiology scenarios reported to date. It provides a rigorous framework for identifying model strengths, clinically important omissions, and priorities for future development.
- Abstract(参考訳): 背景:ほとんどの医学的大規模言語モデル(LLM)ベンチマークは、検査知識や孤立したタスクに焦点を当てており、心臓血管ケアの経時的、多モーダル、安全クリティカルなワークフローを反映していない可能性がある。
目的:CardioBenchは,心臓血管ケア連続体にまたがる実世界のベンチマークであり,臨床次元や専門的課題にまたがるLCMのパフォーマンスを評価する。
方法: CardioBenchは、未同定の心臓血管記録と検査データから得られた13のタスク固有のデータセットから2,263項目を含む。
16人の心臓科医が注釈と基準構築を行い、続いて2人のシニア心臓科医の相互レビューを行った。
7つのLCMは標準のゼロショット設定で15,841の出力を生成した。
オープンエンドタスクは、キーポイントカバレッジと全体的臨床品質を用いて評価され、CardioEthicsは精度で評価された。
結果: GPT-5.4 は最高マクロ平均 (62.55) とアイテム重み付き平均 (62.19) を達成し、続いて Gemini 3.1 Pro (59.95) と Qwen 3.6 27B (59.72) を達成した。
GPT-5.4は全3次元で1位となった。
CardioAuxReportは86.38、CardioECGReadは17.25、CardioEthicsは17.34だった。
CardioComm (52.71)、CardioEmergRescue (52.05)、CardioTreatPlan (48.80)において、総合的な臨床的品質とキーポイントカバレッジの最大のギャップが生じた。
結論: CardioBench は LLM 評価において, 心臓血管ケア連続体全体で最大かつ多タスクなベンチマークであり, これまでに報告された臨床診断のシナリオを網羅的に網羅している。
モデル長所、臨床的に重要な省略点、将来の開発のための優先順位を特定するための厳格なフレームワークを提供する。
関連論文リスト
- Towards Precision Therapy in Hepatocellular Carcinoma: A Clinical-Reasoning LLM for Risk Stratification and Treatment Guidance [69.07885031885303]
HCC-STAR (肝細胞癌ステージング, 治療, pRognosis) は, 臨床的に一致した大言語モデルである。
リスクスコアベースのステージングを出力し、エビデンスベースの理論的根拠によるガイドライン一貫性のある治療と、個別化された生存推定を出力する。
中国12病院の6,668人の多施設のコホートにおいて、HCC-STARは治療勧告とリスク階層化において最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2026-07-09T15:33:08Z) - A rubric-based controlled comparison of frontier language models on expert-authored clinical reasoning tasks [0.0]
本研究は,4つの専門分野にまたがる5つの臨床シナリオについて,小規模かつ意図的な評価データセットを提示する。
GPT 5.4、Claude Opus 4.7、Gemini 3.1 Proの3つのフロンティアモデルを評価した。
中心的な発見は臨床上の優先事項の逆転であり、最高級(重量5, 臨界)の基準はわずか32.4-41.7%、低級の重量1の基準は80-90%である。
論文 参考訳(メタデータ) (2026-07-02T13:46:24Z) - A Signal-Language Foundation Model for Broad-Spectrum Cardiovascular Assessment from Routine Electrocardiography [11.95199497112656]
我々はECGコントラスト言語画像事前学習(ECGCLIP)を開発した。
ECGCLIPは信号言語によるコントラスト学習フレームワークであり、ECG波形と専門診断報告を整合させる。
1,324,856人の心電図2,837,962例を対象にECGCLIPを評価した。
論文 参考訳(メタデータ) (2026-05-25T05:51:44Z) - CardioSAM: Topology-Aware Decoder Design for High-Precision Cardiac MRI Segmentation [0.0]
凍結したSAMエンコーダと軽量でトレーニング可能な心特異的デコーダの一般特徴抽出機能を組み合わせたハイブリッドアーキテクチャであるCardioSAMを提案する。
ACDCのベンチマークでの実験では、CardioSAMのDice係数は93.39%、IoUは87.61%、ピクセル精度は99.20%、HD95は4.2mmであることが示されている。
論文 参考訳(メタデータ) (2026-03-31T22:20:33Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks [47.486705282473984]
大規模言語モデル(LLM)は、医学試験においてほぼ完璧なスコアを得る。
これらの評価は、実際の臨床実践の複雑さと多様性を不十分に反映している。
MedHELMは,医療業務におけるLCMの性能を評価するための評価フレームワークである。
論文 参考訳(メタデータ) (2025-05-26T22:55:49Z) - An Improved Approach for Cardiac MRI Segmentation based on 3D UNet Combined with Papillary Muscle Exclusion [0.0]
異なるフェーズにおいて、心臓構造を正確にセグメンテーションするための堅牢なアルゴリズムを開発することが重要である。
本研究では,乳頭筋を除いた心筋とLVのセグメンテーションに改良された3次元UNetモデルを導入する。
提案フレームワークの実用試験では, 合計8,400枚の心MRI画像を収集し, 解析した。
論文 参考訳(メタデータ) (2024-10-09T12:19:58Z) - Estimation of atrial fibrillation from lead-I ECGs: Comparison with
cardiologists and machine learning model (CurAlive), a clinical validation
study [0.0]
本研究では,人工知能を用いた心房細動検出法を提案する。
本研究の目的は, 心臓科医と人工知能の診断精度をリードI心電図と比較することである。
論文 参考訳(メタデータ) (2021-04-15T12:50:16Z) - Segmentation of the Myocardium on Late-Gadolinium Enhanced MRI based on
2.5 D Residual Squeeze and Excitation Deep Learning Model [55.09533240649176]
本研究の目的は,LGE-MRIを用いた心筋境界領域の深部学習モデルに基づく正確な自動セグメンテーション法を開発することである。
合計320回の試験(平均6回の試験)と28回の試験が行われた。
ベーススライスとミドルスライスにおけるアンサンブルモデルの性能解析は, サーバ内調査と同等であり, アトピーススライスではわずかに低かった。
論文 参考訳(メタデータ) (2020-05-27T20:44:38Z) - A Global Benchmark of Algorithms for Segmenting Late Gadolinium-Enhanced
Cardiac Magnetic Resonance Imaging [90.29017019187282]
現在世界最大の心臓LGE-MRIデータセットである154個の3D LGE-MRIを用いた「2018 left Atrium Challenge」。
技術および生物学的指標を用いた提案アルゴリズムの解析を行った。
その結果, 最上部法は93.2%, 平均表面は0.7mmであった。
論文 参考訳(メタデータ) (2020-04-26T08:49:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。