論文の概要: Blinded Multi-Rater Comparative Evaluation of a Large Language Model and Clinician-Authored Responses in CGM-Informed Diabetes Counseling
- arxiv url: http://arxiv.org/abs/2604.15124v1
- Date: Thu, 16 Apr 2026 15:11:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-17 21:29:31.97532
- Title: Blinded Multi-Rater Comparative Evaluation of a Large Language Model and Clinician-Authored Responses in CGM-Informed Diabetes Counseling
- Title(参考訳): CGM-Informed Diabetes Counselingにおける大規模言語モデルのブラインドマルチレータ比較評価
- Authors: Zhijun Guo, Alvina Lai, Emmanouil Korakas, Aristeidis Vagenas, Irshad Ahamed, Christo Albor, Hengrui Zhang, Justin Healy, Kezhi Li,
- Abstract要約: 連続血糖モニタリング(Continuous glucose monitoring, CGM)は糖尿病治療の中心であるが、CGMのパターンを明確に説明し、共感的に時間を要する。
CGMの解釈と糖尿病カウンセリング支援のための検索地上大言語モデル(LLM)を開発した。
このシステムは、個別化された治療アドバイスを避けながら、平易な応答を生成した。
- 参考スコア(独自算出の注目度): 9.716840300626417
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Continuous glucose monitoring (CGM) is central to diabetes care, but explaining CGM patterns clearly and empathetically remains time-intensive. Evidence for retrieval-grounded large language model (LLM) systems in CGM-informed counseling remains limited. To evaluate whether a retrieval-grounded LLM-based conversational agent (CA) could support patient understanding of CGM data and preparation for routine diabetes consultations. We developed a retrieval-grounded LLM-based CA for CGM interpretation and diabetes counseling support. The system generated plain-language responses while avoiding individualized therapeutic advice. Twelve CGM-informed cases were constructed from publicly available datasets. Between Oct 2025 and Feb 2026, 6 senior UK diabetes clinicians each reviewed 2 assigned cases and answered 24 questions. In a blinded multi-rater evaluation, each CA-generated and clinician-authored response was independently rated by 3 clinicians on 6 quality dimensions. Safety flags and perceived source labels were also recorded. Primary analyses used linear mixed-effects models. A total of 288 unique responses (144 CA and 144 clinician) generated 864 ratings. The CA received higher quality scores than clinician responses (mean 4.37 vs 3.58), with an estimated mean difference of 0.782 points (95% CI 0.692-0.872; P<.001). The largest differences were for empathy (1.062, 95% CI 0.948-1.177) and actionability (0.992, 95% CI 0.877-1.106). Safety flag distributions were similar, with major concerns rare in both groups (3/432, 0.7% each). Retrieval-grounded LLM systems may have value as adjunct tools for CGM review, patient education, and preconsultation preparation. However, these findings do not support autonomous therapeutic decision-making or unsupervised real-world use.
- Abstract(参考訳): 連続血糖モニタリング(Continuous glucose monitoring, CGM)は糖尿病治療の中心であるが、CGMのパターンを明確に説明し、共感的に時間を要する。
CGMインフォームドカウンセリングにおける検索接地型大規模言語モデル(LLM)システムのエビデンスはまだ限られている。
LLMベースの会話エージェント(CA)がCGMデータの患者理解と定期的な糖尿病相談の準備を支援することができるかどうかを評価する。
我々は,CGMの解釈と糖尿病カウンセリング支援のためのLLMベースのCAを開発した。
このシステムは、個別化された治療アドバイスを避けながら、平易な応答を生成した。
12のCGMインフォームドケースが公開データセットから構築された。
2025年10月から2026年2月にかけて、英国の6人の糖尿病臨床医がそれぞれ2件の患者を診察し、24の質問に答えた。
ブラインドマルチレータ評価では, 各々のCA産生, 臨床医による反応は, 6つの品質次元について, 3人の臨床医が独立に評価した。
安全フラグと認識された発信元ラベルも記録された。
一次解析は線形混合効果モデルを用いた。
合計で288名(CA144名,クリニック144名)が864名であった。
CAは臨床反応よりも高い品質スコア(平均4.37対3.58)を受け、平均差は0.782ポイント(95% CI 0.692-0.872; P<.001)と推定された。
最大の違いは共感(1.062, 95% CI 0.948-1.177)と行動可能性(0.992, 95% CI 0.877-1.106)である。
安全旗の配当は類似しており、両グループとも3/432, 0.7%が主な関心事となっている。
検索型LLMシステムは, CGMレビュー, 患者教育, プレコンサルト準備の補助ツールとして有用である。
しかし、これらの発見は、自律的な治療決定や教師なしの現実世界の使用をサポートしない。
関連論文リスト
- A Decade-Scale Benchmark Evaluating LLMs' Clinical Practice Guidelines Detection and Adherence in Multi-turn Conversations [60.2076951536797]
大規模言語モデル(LLM)は、医療シナリオにますます多くデプロイされている。
LLMが会話中に臨床ガイドラインを特定・遵守できるのかは不明確である。
CPGBenchは、LSMの臨床ガイドラインの検出と付着能力をベンチマークする自動フレームワークである。
論文 参考訳(メタデータ) (2026-03-26T09:00:55Z) - Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment [56.62016795093786]
CerebraはインタラクティブなマルチエージェントAIチームで、ERH、臨床ノート、医療画像分析のための特殊エージェントをコーディネートする。
構造化された表現を操作することで、プライバシ保護デプロイメントをサポートし、モダリティが不完全であれば、堅牢である。
Cerebraは、有識者のパフォーマンスを著しく改善し、前向き認知症リスク推定において精度を17.5ポイント向上させた。
論文 参考訳(メタデータ) (2026-03-23T05:46:45Z) - Deployment and Evaluation of an EHR-integrated, Large Language Model-Powered Tool to Triage Surgical Patients [3.381441580878978]
外科的共同管理(英: surgery co-management, SCM)は、外科チームと共に患者を共同で管理するエビデンスベースのモデルである。
SCMナビゲータは、患者をSCMに適切、不適切、あるいはおそらく適切と分類した。
配備以降、6,193件の患者が入院し、うち1,582件(23%)が入院相談に推薦された。
論文 参考訳(メタデータ) (2026-03-18T00:36:58Z) - From Days to Minutes: An Autonomous AI Agent Achieves Reliable Clinical Triage in Remote Patient Monitoring [2.0918370570198763]
遠隔患者モニタリング(RPM)は膨大なデータを生成するが、データ量が臨床スタッフを圧倒したため、目覚ましい臨床試験(Tele-HF, BEAT-HF)は失敗した。
RPMバイタルのコンテキストトリアージにモデルコンテキストプロトコル(MCP)を用いた自律型AIエージェントSentinelを開発した。
論文 参考訳(メタデータ) (2026-03-10T00:50:54Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - Measuring Stability Beyond Accuracy in Small Open-Source Medical Large Language Models for Pediatric Endocrinology [34.80893325510028]
小さなオープンソース医療用大規模言語モデル(LLM)は、低リソースのデプロイメントとより広範なアクセシビリティのための有望な機会を提供する。
人体評価と臨床検査を併用して,6つの小さなオープンソース医療用LLMを評価した。
論文 参考訳(メタデータ) (2025-12-26T14:30:53Z) - Developing an AI framework to automatically detect shared decision-making in patient-doctor conversations [2.4684978532059128]
患者中心のケアを実現するためには、共有意思決定(SDM)が必要である。
SDMをスケールで自動的に測定する方法論は存在しない。
本研究では,言語モデリングと会話アライメント(CA)スコアを用いて,SDMの自動計測手法を開発することを目的とした。
論文 参考訳(メタデータ) (2025-09-22T21:50:13Z) - An Agentic System for Rare Disease Diagnosis with Traceable Reasoning [69.46279475491164]
大型言語モデル(LLM)を用いた最初のまれな疾患診断エージェントシステムであるDeepRareを紹介する。
DeepRareは、まれな疾患の診断仮説を分類し、それぞれに透明な推論の連鎖が伴う。
このシステムは2,919の疾患に対して異常な診断性能を示し、1013の疾患に対して100%の精度を達成している。
論文 参考訳(メタデータ) (2025-06-25T13:42:26Z) - Detection of subclinical atherosclerosis by image-based deep learning on chest x-ray [86.38767955626179]
460胸部X線で冠状動脈カルシウム(CAC)スコアを予測する深層学習アルゴリズムを開発した。
AICACモデルの診断精度は, 曲線下領域(AUC)で評価された。
論文 参考訳(メタデータ) (2024-03-27T16:56:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。