論文の概要: Evaluating AI Generated Summaries for Cancer Patients
- arxiv url: http://arxiv.org/abs/2608.26154v1
- Date: Fri, 03 Jul 2026 19:38:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.366999
- Title: Evaluating AI Generated Summaries for Cancer Patients
- Title(参考訳): がん患者に対するAI生成サマリーの評価
- Abstract要約: 大規模言語モデル(LLM)は、複雑な医療データの要約を生成するために、デジタルヘルスプラットフォームに統合されつつある。
本研究では, がん患者ケアアプリケーションにおけるAI生成サマリーを, 二重評価フレームワークを用いて評価する。
- 参考スコア(独自算出の注目度): 1.1185912123976856
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Large language models (LLMs) are increasingly being integrated into digital health platforms to generate summaries of complex medical data. Although these models can improve patient engagement and communication, these systems also raise concerns about accuracy, faithfulness, and safety in clinical contexts. In this study, we evaluate AI-generated summaries within a cancer patient care application using a dual assessment framework. Human domain experts, including oncology clinicians and patient-facing care staff, provided ground-truth evaluations of summary quality along dimensions of accuracy, clinical relevance, and readability. In parallel, we employed LLMs serving as evaluators (LLM-as-a-judge). Some limitations were identified in the generated summaries e.g., occasional omissions and minor inaccuracies. These were systematically analyzed and used to iteratively improve prompt design, grounding, and safety guardrails.
- Abstract(参考訳): 大規模言語モデル(LLM)は、複雑な医療データの要約を生成するために、デジタルヘルスプラットフォームに統合されつつある。
これらのモデルは患者のエンゲージメントとコミュニケーションを改善することができるが、臨床コンテキストにおける正確性、忠実性、安全性に関する懸念も持ち上がる。
本研究では, がん患者ケアアプリケーションにおけるAI生成サマリーを, 二重評価フレームワークを用いて評価する。
オンコロジー臨床医や患者を対象とする医療スタッフを含むヒト領域の専門家は、正確性、臨床関連性、可読性といった側面に沿って、要約品質の根本的な評価を行った。
同時に,LLM-as-a-judge(LLM-as-a-judge)としてLLMを用いた。
いくつかの制限は、生成された要約eg、たまに省略、小さな不正確さで特定された。
これらは体系的に分析され、迅速な設計、接地、安全ガードレールを反復的に改善するために使用された。
関連論文リスト
- Comparative Analysis of Large Language Models in Healthcare [1.9704270315085601]
大規模言語モデル(LLM)は、医療における人工知能の応用を変革している。
高度な臨床環境への展開は、正確性、信頼性、患者の安全性に関する重要な懸念を提起する。
本研究は,医療現場におけるLCMの標準化された比較評価の必要性に対処するものである。
論文 参考訳(メタデータ) (2026-04-11T18:47:54Z) - MedDialogRubrics: A Comprehensive Benchmark and Evaluation Framework for Multi-turn Medical Consultations in Large Language Models [15.91764739198419]
5,200件の患者と6万件以上のきめ細粒度評価ルーブリックからなる新規なベンチマークであるMedDialogRubricsについて紹介する。
本フレームワークでは,実世界の電子的健康記録にアクセスすることなく,現実的な患者記録と主訴を合成するマルチエージェントシステムを採用している。
論文 参考訳(メタデータ) (2026-01-06T13:56:33Z) - MedKGEval: A Knowledge Graph-Based Multi-Turn Evaluation Framework for Open-Ended Patient Interactions with Clinical LLMs [19.12790150016383]
MedKGEvalは、臨床用大規模言語モデルのための新しいマルチターン評価フレームワークである。
知識グラフ駆動患者シミュレーション機構は、キュレートされた知識グラフから関連する医療事実を検索する。
ターンレベル評価フレームワークは、各モデル応答を臨床的適切性、事実的正当性、安全性について評価する。
論文 参考訳(メタデータ) (2025-10-14T07:22:26Z) - Med-CoDE: Medical Critique based Disagreement Evaluation Framework [72.42301910238861]
医学的文脈における大きな言語モデル(LLM)の信頼性と精度は依然として重要な懸念点である。
現在の評価手法はロバスト性に欠けることが多く、LLMの性能を総合的に評価することができない。
我々は,これらの課題に対処するために,医療用LCMの特別設計評価フレームワークであるMed-CoDEを提案する。
論文 参考訳(メタデータ) (2025-04-21T16:51:11Z) - Conversation AI Dialog for Medicare powered by Finetuning and Retrieval Augmented Generation [0.0]
大きな言語モデル(LLM)は、対話生成を含む自然言語処理タスクにおいて印象的な機能を示している。
本研究の目的は、LoRAによる微調整とRetrieval-Augmented Generationフレームワークという、2つの重要な技術の比較分析を行うことである。
論文 参考訳(メタデータ) (2025-02-04T11:50:40Z) - Comprehensive and Practical Evaluation of Retrieval-Augmented Generation Systems for Medical Question Answering [70.44269982045415]
Retrieval-augmented Generation (RAG) は,大規模言語モデル (LLM) の性能向上のための有望なアプローチとして登場した。
医療用QAデータセットに様々な補助的要素を提供するMedRGB(MedRGB)を導入する。
実験結果から,検索した文書のノイズや誤情報の処理能力に限界があることが判明した。
論文 参考訳(メタデータ) (2024-11-14T06:19:18Z) - AI Hospital: Benchmarking Large Language Models in a Multi-agent Medical Interaction Simulator [69.51568871044454]
我々は,emphDoctorをプレイヤとして,NPC間の動的医療相互作用をシミュレーションするフレームワークであるtextbfAI Hospitalを紹介した。
この設定は臨床シナリオにおけるLCMの現実的な評価を可能にする。
高品質な中国の医療記録とNPCを利用したマルチビュー医療評価ベンチマークを開発した。
論文 参考訳(メタデータ) (2024-02-15T06:46:48Z) - Informing clinical assessment by contextualizing post-hoc explanations
of risk prediction models in type-2 diabetes [50.8044927215346]
本研究は, 合併症リスク予測のシナリオを考察し, 患者の臨床状態に関する文脈に焦点を当てる。
我々は、リスク予測モデル推論に関する文脈を提示し、その受容性を評価するために、最先端のLLMをいくつか採用する。
本論文は,実世界における臨床症例における文脈説明の有効性と有用性を明らかにする最初のエンドツーエンド分析の1つである。
論文 参考訳(メタデータ) (2023-02-11T18:07:11Z) - Human Evaluation and Correlation with Automatic Metrics in Consultation
Note Generation [56.25869366777579]
近年,機械学習モデルによる臨床相談ノートの作成が急速に進んでいる。
5人の臨床医が57件のモック・コンサルテーションを聴き、自作のノートを書き、自動的に生成されたノートを編集し、全てのエラーを抽出する、広範囲にわたる人的評価研究を行った。
単純な文字ベースのLevenshtein距離測定は、BertScoreのような一般的なモデルベースの測定値に比較して、同等に動作します。
論文 参考訳(メタデータ) (2022-04-01T14:04:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。