論文の概要: An ambiguity taxonomy for evaluating large language model performance on clinical registry abstraction: a multi-site prospective study
- arxiv url: http://arxiv.org/abs/2608.20373v2
- Date: Tue, 25 Aug 2026 15:57:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.287985
- Title: An ambiguity taxonomy for evaluating large language model performance on clinical registry abstraction: a multi-site prospective study
- Title(参考訳): 臨床レジストリ抽象化に基づく大規模言語モデルの性能評価のための曖昧性分類法-多地点前向き研究
- Abstract要約: 臨床レジストリ抽象化のための非処理電子医療記録(EMR)データに対して,大言語モデル(LLM)の性能を評価する。
LLMの精度はあいまいさとともに着実に低下し,必要な臨床推論のレベルが上昇した。
- 参考スコア(独自算出の注目度): 0.09332987715848712
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Objective: To evaluate large language model (LLM) performance on unprocessed electronic medical record (EMR) data for clinical registry abstraction. Methods: We evaluated LLM performance answering registry questions for the American College of Cardiology National Cardiovascular Data Registry (ACC NCDR). In a pilot study at an academic medical center, the model identified candidate data sources for each registry question and experienced abstractors used these results to define question-specific document sets. In a validation study at a second center with a second ACC NCDR registry, the LLM answered questions using the question-specific document sets. Before reviewing any output, two abstractors independently established the ground truth and assigned each question to one of six categories, ordered by the ambiguity and clinical reasoning required to resolve it: Medication/Event Flag, Binary Clinical Presence, Administrative, Quantitative Laboratory/Physiologic, Clinical Interpretation, and Event Timing. Results: The analytical sample comprised 9,430 abstractor answers reconciled to 4,715 consensus answers (501 pilot; 4,214 validation). In the pilot, candidate data sources per question averaged between 14.6 (SD 13.9) for demographics and 89.2 (SD 56.1) for history and risk factors. In validation, human inter-rater agreement was approximately 98\% while 87\% of LLM answers exactly matched consensus, 2\% partially, and 9\% did not. Mean question-level accuracy was 91.5\% (SD 13.4\%) across 157 questions with at least 20 answers, and declined as ambiguity increased, from 96\% for Medication/Event Flag to 62\% for Event Timing questions. Conclusions: LLMs answering clinical registry questions on unprocessed EMR data achieved far lower accuracy than human abstractors. LLM accuracy fell steadily as ambiguity and the level of required clinical reasoning increased.
- Abstract(参考訳): 目的: 臨床レジストリ抽象化のための非処理電子医療記録(EMR)データ上での大規模言語モデル(LLM)の性能を評価する。
方法】米国心臓科学大学心血管データレジストリ(ACC NCDR)の登録質問に対するLCMの性能評価を行った。
学術医療センターでのパイロットスタディでは、モデルが各レジストリ質問の候補データソースを特定し、経験豊富な抽象化者がこれらの結果を用いて質問特化文書セットを定義した。
第2のACC NCDRレジストリを持つ第2のセンターでの検証研究において、LLMは質問特化文書セットを使用して質問に答えた。
アウトプットをレビューする前に、2つの抽象論者が個別に根拠を定め、それぞれの疑問を6つのカテゴリのうちの1つに割り当てた: 医学/イベントフラッグ、バイナリクリニカルプレゼンス、管理、定量的検査/物理、臨床解釈、イベントタイピング。
結果: 分析試料は, コンセンサス回答4,715名(パイロット501名, 検証4,214名)の抽象的回答9,430名であった。
パイロットでは、質問毎の候補データソースは、人口統計では14.6(SD 13.9)、歴史やリスク要因では89.2(SD 56.1)だった。
検証では,LLM回答の87 %が一致したコンセンサス,2 %が部分的に一致し,9 %が一致しなかった。
質問レベルの正確さは157問中91.5\% (SD 13.4\%) で、少なくとも20問が答えられ、曖昧さが増すにつれて96\%から62\%に低下した。
結論:未処理のEMRデータに対する臨床登録質問に対するLCMの回答は,ヒトの抽象的データよりもはるかに低い精度で得られた。
LLMの精度はあいまいさとともに着実に低下し,必要な臨床推論のレベルが上昇した。
関連論文リスト
- Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports [49.5225801722164]
既存のメトリクスは、医学的に根拠のないスカラーにレポートの品質を低下させることによって、この要件を曖昧にしている。
テストベッドとしてReEvalMedベンチマークを用いて,この境界について検討し,計量レベルの臨床的意義を評価する。
論文 参考訳(メタデータ) (2026-06-17T08:10:30Z) - Automating Clinical Information Retrieval from Finnish Electronic Health Records Using Large Language Models [0.0]
ローカルにデプロイ可能なフレームワークは、外部データ転送なしでEHRから直接臨床質問に答える。
オープンソースの大規模言語モデル(LLM)は、4Bから70Bまでのパラメータを完全にオフラインでベンチマークした。
論文 参考訳(メタデータ) (2026-03-27T14:03:51Z) - The Validity Gap in Health AI Evaluation: A Cross-Sectional Analysis of Benchmark Composition [0.19599274203282302]
6つの公開ベンチマークで18,707のコンシューマヘルスクエリを分析した。
発見: 臨床組成は、現実世界のニーズと相容れないままである。
フィールドは、臨床実践の完全複雑さと評価を整合させるために、標準化されたクエリプロファイリングを採用しなければならない。
論文 参考訳(メタデータ) (2026-03-18T21:31:19Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z) - MedCaseReasoning: Evaluating and learning diagnostic reasoning from clinical case reports [49.00805568780791]
MedCaseReasoningはLarge Language Models(LLM)を評価するための最初のオープンアクセスデータセットである。
データセットには14,489の診断的質問・回答ケースが含まれており、それぞれに詳細な推論文がペアリングされている。
我々は,MedCaseReasoning上での最先端の推論LPMを評価し,診断と推論に重大な欠点を見出した。
論文 参考訳(メタデータ) (2025-05-16T22:34:36Z) - Quantifying the Reasoning Abilities of LLMs on Real-world Clinical Cases [48.87360916431396]
MedR-Benchは1,453例の構造化患者のベンチマークデータセットで、推論基準を付した注釈付きである。
本稿では,3つの批判的診察勧告,診断決定,治療計画を含む枠組みを提案し,患者のケアジャーニー全体をシミュレートする。
このベンチマークを用いて、DeepSeek-R1、OpenAI-o3-mini、Gemini-2.0-Flash Thinkingなど、最先端の5つのLCMを評価した。
論文 参考訳(メタデータ) (2025-03-06T18:35:39Z) - EHRNoteQA: An LLM Benchmark for Real-World Clinical Practice Using Discharge Summaries [9.031182965159976]
大規模言語モデル(LLM)は、大規模で複雑なデータを効率的に分析する可能性を示している。
我々は,MIMIC-IV EHR上に構築された新しいベンチマークであるEHRNoteQAを紹介した。
EHRNoteQAには、複数の放電サマリーにまたがる情報を必要とし、実際の臨床検査の複雑さと多様性を反映した8つの多様なトピックをカバーする質問が含まれている。
論文 参考訳(メタデータ) (2024-02-25T09:41:50Z) - LongHealth: A Question Answering Benchmark with Long Clinical Documents [36.05587855811346]
各種疾患20例を対象とし,LongHealthベンチマークを報告する。
このベンチマークは、情報抽出、否定、ソートという3つのカテゴリで400の多重選択の質問でLSMに挑戦する。
また,OpenAIのプロプライエタリかつコスト効率のよいGPT-3.5 Turboも比較検討した。
論文 参考訳(メタデータ) (2024-01-25T19:57:00Z) - MedAlign: A Clinician-Generated Dataset for Instruction Following with
Electronic Medical Records [60.35217378132709]
大型言語モデル(LLM)は、人間レベルの流布で自然言語の指示に従うことができる。
医療のための現実的なテキスト生成タスクにおけるLCMの評価は依然として困難である。
我々は、EHRデータのための983の自然言語命令のベンチマークデータセットであるMedAlignを紹介する。
論文 参考訳(メタデータ) (2023-08-27T12:24:39Z) - Natural Language Processing in Electronic Health Records in Relation to
Healthcare Decision-making: A Systematic Review [2.555168694997103]
自然言語処理は電子健康記録から臨床知見を抽出するために広く用いられている。
注釈付きデータや自動化ツール、その他の課題の欠如は、EHRに対するNLPのフル活用を妨げる。
機械学習(ML)、ディープラーニング(DL)、NLP技術を研究し、この分野の限界と機会を包括的に理解するために比較した。
論文 参考訳(メタデータ) (2023-06-22T12:10:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。