論文の概要: VeriFact: Verifying Facts in LLM-Generated Clinical Text with Electronic Health Records
- arxiv url: http://arxiv.org/abs/2501.16672v1
- Date: Tue, 28 Jan 2025 03:13:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-01-29 22:09:11.042397
- Title: VeriFact: Verifying Facts in LLM-Generated Clinical Text with Electronic Health Records
- Title(参考訳): VeriFact: 電子カルテを用いたLCM生成臨床テキストにおける欠陥の検証
- Abstract要約: VeriFact(ヴェリファクト)は、臨床医学における大規模言語モデル(LLM)のファクトチェックのための人工知能システムである。
略式病院講座の物語を、患者の EHR 臨床ノートによってそれぞれの声明が支持されているかどうかに関する臨床注釈付き簡易な記述に分解する。
平均的なヒト臨床臨床の基礎的事実に対して、最大92.7%の合意を達成している。
- 参考スコア(独自算出の注目度): 2.8078482678056527
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Methods to ensure factual accuracy of text generated by large language models (LLM) in clinical medicine are lacking. VeriFact is an artificial intelligence system that combines retrieval-augmented generation and LLM-as-a-Judge to verify whether LLM-generated text is factually supported by a patient's medical history based on their electronic health record (EHR). To evaluate this system, we introduce VeriFact-BHC, a new dataset that decomposes Brief Hospital Course narratives from discharge summaries into a set of simple statements with clinician annotations for whether each statement is supported by the patient's EHR clinical notes. Whereas highest agreement between clinicians was 88.5%, VeriFact achieves up to 92.7% agreement when compared to a denoised and adjudicated average human clinican ground truth, suggesting that VeriFact exceeds the average clinician's ability to fact-check text against a patient's medical record. VeriFact may accelerate the development of LLM-based EHR applications by removing current evaluation bottlenecks.
- Abstract(参考訳): 臨床医学における大規模言語モデル(LLM)によるテキストの事実的正確性を保証する方法が欠落している。
VeriFactは、検索強化世代とLLM-as-a-Judgeを組み合わせた人工知能システムで、患者の電子健康記録(EHR)に基づいて、LLM生成テキストが実際に患者の医療履歴によってサポートされているかどうかを検証する。
本システムを評価するために,本システムでは,患者のERH臨床ノートで各論文が支持されているかどうかを記した簡易な注釈付きステートメントのセットに,ブリーフ病院講座の物語を要約から分解する新たなデータセットであるVeriFact-BHCを導入する。
臨床医間の合意が88.5%であるのに対して、VeriFactは平均的なヒト臨床医の真実を否定し、偏見を定めている場合と比較して92.7%の合意を達成しており、VeriFactは患者の医療記録に対して、平均的な臨床医のテキストをファクトチェックする能力を上回ることを示唆している。
VeriFact は現在の評価ボトルネックを取り除くことで LLM ベースの EHR アプリケーションの開発を加速させることができる。
関連論文リスト
- LLMs for Cardiovascular Risk Prediction from Structured Clinical Data [0.0]
冠状動脈疾患(CAD)は、世界中で死因の1つとなっている。
我々はCAD予測のための構造化された臨床データと自然言語表現を橋渡しするハイブリッドフレームワークを開発する。
論文 参考訳(メタデータ) (2026-04-21T00:16:05Z) - LLM-Bootstrapped Targeted Finding Guidance for Factual MLLM-based Medical Report Generation [23.74179903717012]
Fact-Flowは,視覚的事実認識のプロセスとレポートの生成を分離する,革新的なフレームワークである。
これは、まず画像から臨床所見を予測し、その後、MLLMに事実的正確性のあるレポートを作成するよう指示することで達成される。
我々のアプローチの重要な進歩は、大規模言語モデル(LLM)を活用してラベル付き医療所見のデータセットを自律的に作成するパイプラインである。
論文 参考訳(メタデータ) (2026-02-28T02:50:20Z) - A Federated and Parameter-Efficient Framework for Large Language Model Training in Medicine [59.78991974851707]
大規模言語モデル(LLM)は、質問応答や診断など、医療ベンチマークにおいて強力なパフォーマンスを示している。
ほとんどの医療用LDMは、異種システムの一般化性と安全性の制限に直面している単一の機関のデータに基づいて訓練されている。
本稿では, LLMを医療応用に適用するためのモデルに依存しない, パラメータ効率のよいフェデレーション学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T18:48:21Z) - Improving Reliability and Explainability of Medical Question Answering through Atomic Fact Checking in Retrieval-Augmented LLMs [4.003209132872364]
大型言語モデル (LLM) は医学的知識が豊富であるが、幻覚や不正確な引用の傾向にある。
Retrieval Augmented Generationのような現在の手法は、ソース文書の回答を根拠にすることで、これらの問題に部分的に対処する。
我々は,LLMの信頼性と説明可能性を高めるために,新しい原子ファクトチェックフレームワークを導入する。
論文 参考訳(メタデータ) (2025-05-30T17:33:07Z) - MeDiSumQA: Patient-Oriented Question-Answer Generation from Discharge Letters [1.6135243915480502]
大規模言語モデル(LLM)は、医療情報を単純化してソリューションを提供する。
安全で患者に優しいテキスト生成のためのLCMの評価は、標準化された評価リソースが欠如しているため困難である。
MeDiSumQAはMIMIC-IV放電サマリーから自動パイプラインを通じて生成されたデータセットである。
論文 参考訳(メタデータ) (2025-02-05T15:56:37Z) - Performant ASR Models for Medical Entities in Accented Speech [0.9346027495459037]
我々は、93のアフリカアクセントの英語臨床データセットを用いて、複数のASRモデルを厳格に評価した。
分析の結果, 単語誤り率 (WER) が低いモデルではあるものの, 臨床的実体の誤差は高く, 患者の安全性に重大なリスクが生じる可能性が示唆された。
論文 参考訳(メタデータ) (2024-06-18T08:19:48Z) - Zero-Shot Clinical Trial Patient Matching with LLMs [40.31971412825736]
大規模言語モデル(LLM)は、自動スクリーニングの有望なソリューションを提供する。
我々は,患者の診療歴を非構造的臨床テキストとして考慮し,その患者が包括的基準を満たしているかどうかを評価するLCMベースのシステムを構築した。
提案システムは,n2c2 2018コホート選択ベンチマークにおいて,最先端のスコアを達成している。
論文 参考訳(メタデータ) (2024-02-05T00:06:08Z) - Enhancing Health Data Interoperability with Large Language Models: A
FHIR Study [8.918194175207702]
本研究では,医療データの相互運用性を高めるための大規模言語モデル(LLM)の能力について検討した。
臨床テキストの3,671個のスニペットを用いて, LLMは多段階の自然言語処理と人間のキャリブレーション処理を合理化するだけでなく, 人間のアノテーションと比較した場合の精度を90%以上向上することを示した。
論文 参考訳(メタデータ) (2023-09-19T20:09:35Z) - Adapted Large Language Models Can Outperform Medical Experts in Clinical Text Summarization [8.456700096020601]
大規模言語モデル (LLM) は自然言語処理 (NLP) において有望であるが, 様々な臨床要約タスクにおける有効性は証明されていない。
本研究では,4つの臨床要約課題にまたがる8つのLCMに適応法を適用した。
10名の医師による臨床読影者を対象に, 要約, 完全性, 正当性, 簡潔性を評価した。ほとんどの場合, ベスト適応LSMの要約は, 医用専門家の要約と比べ, 同等(45%), 上等(36%)である。
論文 参考訳(メタデータ) (2023-09-14T05:15:01Z) - Don't Ignore Dual Logic Ability of LLMs while Privatizing: A
Data-Intensive Analysis in Medical Domain [19.46334739319516]
本研究では, LLMの二重論理能力が, 医療領域の民営化過程における影響について検討した。
以上の結果から,LLMに汎用ドメイン二重論理データを組み込むことによって,LLMの二重論理能力が向上するだけでなく,精度も向上することが示唆された。
論文 参考訳(メタデータ) (2023-09-08T08:20:46Z) - MedAlign: A Clinician-Generated Dataset for Instruction Following with
Electronic Medical Records [60.35217378132709]
大型言語モデル(LLM)は、人間レベルの流布で自然言語の指示に従うことができる。
医療のための現実的なテキスト生成タスクにおけるLCMの評価は依然として困難である。
我々は、EHRデータのための983の自然言語命令のベンチマークデータセットであるMedAlignを紹介する。
論文 参考訳(メタデータ) (2023-08-27T12:24:39Z) - Self-Verification Improves Few-Shot Clinical Information Extraction [73.6905567014859]
大規模言語モデル (LLMs) は、数発のテキスト内学習を通じて臨床キュレーションを加速する可能性を示している。
正確性や解釈可能性に関する問題、特に健康のようなミッションクリティカルな領域ではまだ苦戦している。
本稿では,自己検証を用いた汎用的な緩和フレームワークについて検討する。このフレームワークはLLMを利用して,自己抽出のための証明を提供し,その出力をチェックする。
論文 参考訳(メタデータ) (2023-05-30T22:05:11Z) - Large Language Models for Healthcare Data Augmentation: An Example on
Patient-Trial Matching [49.78442796596806]
患者-心電図マッチング(LLM-PTM)のための革新的なプライバシ対応データ拡張手法を提案する。
本実験では, LLM-PTM法を用いて平均性能を7.32%向上させ, 新しいデータへの一般化性を12.12%向上させた。
論文 参考訳(メタデータ) (2023-03-24T03:14:00Z) - SPeC: A Soft Prompt-Based Calibration on Performance Variability of
Large Language Model in Clinical Notes Summarization [50.01382938451978]
本稿では,ソフトプロンプトを用いたモデルに依存しないパイプラインを導入し,確率に基づく要約の利点を保ちながら分散を減少させる。
実験結果から,本手法は性能を向上するだけでなく,様々な言語モデルの分散を効果的に抑制することが明らかとなった。
論文 参考訳(メタデータ) (2023-03-23T04:47:46Z) - Retrieval-Augmented and Knowledge-Grounded Language Models for Faithful Clinical Medicine [68.7814360102644]
本稿では,Re$3$Writer法を提案する。
本手法が患者の退院指示生成に有効であることを示す。
論文 参考訳(メタデータ) (2022-10-23T16:34:39Z) - Benchmarking Automated Clinical Language Simplification: Dataset,
Algorithm, and Evaluation [48.87254340298189]
我々はMedLaneという名の新しいデータセットを構築し、自動化された臨床言語簡易化手法の開発と評価を支援する。
我々は,人間のアノテーションの手順に従い,最先端のパフォーマンスを実現するDECLAREと呼ばれる新しいモデルを提案する。
論文 参考訳(メタデータ) (2020-12-04T06:09:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。