論文の概要: Scaling Clinical Judgment to Evaluate Medical AI
- arxiv url: http://arxiv.org/abs/2609.12822v1
- Date: Fri, 11 Sep 2026 13:20:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.755385
- Title: Scaling Clinical Judgment to Evaluate Medical AI
- Title(参考訳): 医療AI評価のための臨床判断のスケーリング
- Abstract要約: 大型言語モデル(LLM)における臨床理性評価のための金の基準として、盲検医師の評価が検討されている。
PrecepTron(プレセプトロン)は、医師レベルのオープンエンド応答の評価のために微調整されたLDMである。
Grand-ROUNDSは7つの研究から11人の医師による9,217のスコアの大規模なベンチマークである。
- 参考スコア(独自算出の注目度): 2.8562722236655245
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Blinded physician evaluation has been considered by many to be the gold standard for assessing clinical reasoning in large language models (LLMs). This is difficult to scale; thus, prior studies typically rely on small physician panels, often from a single institution or specialty, which both limits the scientific questions investigated and makes it unclear whether findings would be reproduced with a different set of evaluators. To more rigorously and scalably study clinical reasoning in AI models, here we introduce PrecepTron, an LLM fine-tuned for physician-level evaluation of open-ended responses. PrecepTron was trained using low-rank adaptation (LoRA) of a 32-billion-parameter model on a small number of physician examples. We also release GRAND-ROUNDS, a new large-scale physician-annotated benchmark of 9,217 scores by 11 physicians across seven studies. We show that frontier LLMs in typical "LLM-as-a-judge" approaches often disagree with physicians and with each other, but fine-tuning PrecepTron on a small number of cases enables physician-level consistent scoring across tasks. We use PrecepTron to reproduce headline findings from five influential studies assessing LLMs for clinical care in JAMA, Science, and Nature Medicine without new human grading. Using PrecepTron, we then pose new questions about how LLMs reason in medicine that would have been infeasible with human grading alone, including measuring the diagnostic accuracy of frontier LLMs when clinical cases are provided piecemeal, even token by token. Together, PrecepTron and GRAND-ROUNDS provide a foundation for reproducible, large-scale study of how LLMs reason in medicine. All code, data, and labels are made freely available for researchers.
- Abstract(参考訳): 大規模言語モデル (LLMs) における臨床理性評価の基準として, ブラインドド医師の評価は, 多くが金本位とみなしている。
これはスケールが難しいため、先行研究は通常、単一の機関や専門分野の小さな医師パネルに頼り、調査対象の科学的な質問を制限し、発見が別の評価対象で再現されるかどうかを不透明にする。
ここでは、AIモデルにおける臨床推論をより厳密に研究するために、医師レベルのオープンエンド応答の評価のために微調整されたLLMであるPrecepTronを紹介する。
PrecepTronは32ビリオンパラメータモデルのローランク適応(LoRA)を用いて、少数の医師例で訓練された。
GRAND-ROUNDSは7つの研究で医師11名による計9,217点の大規模医師注記ベンチマークである。
典型的な「LLM-as-a-judge」アプローチのフロンティアLSMは、医師と医師が互いに意見が一致しないことが多いが、少数のケースで微調整したPrecepTronは、医師レベルのタスクを一貫したスコアリングを可能にする。
本研究は,JAMA,Science,Nature MedicineにおけるLLMsを評価対象とする5つの研究の見出しを再現するために,PrecepTronを用いている。
PrecepTronを用いて、臨床ケースが断片的に提供されたときのフロンティアLSMの診断精度の測定やトークンによるトークン化など、ヒトのグレーディング単独では不可能であった医学におけるLCMの理性について、新たな疑問を提起する。
PrecepTron と GRAND-ROUNDS は共に、医学における LLM の理由を再現可能な大規模研究の基礎を提供する。
すべてのコード、データ、ラベルは研究者が自由に利用できる。
関連論文リスト
- LLM-as-a-Judge in Healthcare: A Scoping Analysis of Applications, Methods, and Human Alignment [29.53435959107992]
大規模言語モデル(LLM)は、臨床ドキュメント、診断推論、医学勧告、医学教育など、医療分野にまたがる展開が増えている。
LLMs-as-a-Judgeは、スケーラブルな代替手段を提供し、臨床評価にますます利用されているが、医療におけるその妥当性は依然として過小評価されている。
論文 参考訳(メタデータ) (2026-05-24T21:59:32Z) - MedArena: Comparing LLMs for Medicine-in-the-Wild Clinician Preferences [50.71326426975699]
MedArenaは医療用大規模言語モデル(LLM)のためのインタラクティブな評価プラットフォームである。
MedArenaは、2つのランダムに選択されたモデルからの応答を表示し、ユーザが好みのレスポンスを選択するように要求する。
2025年11月1日までに12台のLLMで収集された1571の選好のうち、ジェミニ2.0フラッシュシンキング、ジェミニ2.5プロ、GPT-4oがブラッドリー・テリーのレーティングで上位3モデルとなった。
論文 参考訳(メタデータ) (2026-03-13T22:30:26Z) - Enabling Doctor-Centric Medical AI with LLMs through Workflow-Aligned Tasks and Benchmarks [72.89088985703748]
大きな言語モデル(LLM)の台頭は、臨床ガイダンスを提供することで医療に変化をもたらしたが、患者への直接の展開は安全性のリスクをもたらす。
我々は,患者と直接対話するのではなく,経験豊富な医師と協力する臨床助手としてLLMを再配置することを提案する。
我々は、22の臨床的タスクと27の専門分野にわたる92,000のQ&Aインスタンスからなる大規模な中国の医療データセットであるDoctorFLANを構築した。
論文 参考訳(メタデータ) (2025-10-13T06:18:27Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z) - LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation [58.25892575437433]
医学における大規模言語モデル (LLMs) の評価は, 医療応用には精度が高く, 誤差の少ないため重要である。
LLMEval-Medは、5つの中核医療領域をカバーする新しいベンチマークであり、現実の電子健康記録から得られた2,996の質問と専門家が設計した臨床シナリオを含む。
論文 参考訳(メタデータ) (2025-06-04T15:43:14Z) - ER-REASON: A Benchmark Dataset for LLM-Based Clinical Reasoning in the Emergency Room [6.910389029249664]
大規模言語モデル (LLMs) は, ライセンス試験に基づく質問応答タスクにおいて, 広範囲に評価されている。
ER-Reason(ER-Reason)は、救急室におけるLSMに基づく臨床推論と意思決定を評価するために設計されたベンチマークである。
論文 参考訳(メタデータ) (2025-05-28T22:43:44Z) - Quantifying the Reasoning Abilities of LLMs on Real-world Clinical Cases [48.87360916431396]
MedR-Benchは1,453例の構造化患者のベンチマークデータセットで、推論基準を付した注釈付きである。
本稿では,3つの批判的診察勧告,診断決定,治療計画を含む枠組みを提案し,患者のケアジャーニー全体をシミュレートする。
このベンチマークを用いて、DeepSeek-R1、OpenAI-o3-mini、Gemini-2.0-Flash Thinkingなど、最先端の5つのLCMを評価した。
論文 参考訳(メタデータ) (2025-03-06T18:35:39Z) - Structured Outputs Enable General-Purpose LLMs to be Medical Experts [50.02627258858336]
大規模言語モデル(LLM)は、しばしばオープンエンドの医学的問題に苦しむ。
本稿では,構造化医療推論を利用した新しいアプローチを提案する。
我々の手法は85.8のファクチュアリティスコアを達成し、微調整されたモデルを上回る。
論文 参考訳(メタデータ) (2025-03-05T05:24:55Z) - Language Models And A Second Opinion Use Case: The Pocket Professional [0.0]
本研究は、専門的な意思決定において、正式な第二意見ツールとして、LLM(Large Language Models)の役割を検証する。
この研究は、20ヶ月にわたるMedscapeからの183の挑戦的な医療事例を分析し、クラウドソースされた医師の反応に対して複数のLSMのパフォーマンスをテストした。
論文 参考訳(メタデータ) (2024-10-27T23:48:47Z) - CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios [50.032101237019205]
CliMedBenchは、14のエキスパートによるコア臨床シナリオを備えた総合的なベンチマークである。
このベンチマークの信頼性はいくつかの点で確認されている。
論文 参考訳(メタデータ) (2024-10-04T15:15:36Z) - Pattern Recognition or Medical Knowledge? The Problem with Multiple-Choice Questions in Medicine [3.471944921180245]
大規模言語モデル(LLM)は、医療領域において大きな可能性を示す。
これらの質問は、USMLEのような試験をモデルとしたMCQ(Multiple-choice Question)を用いて評価されることが多い。
私たちは、想像上のオルガンであるGlianorexを中心とした架空の医療ベンチマークを作成し、記憶された知識と推論能力の分離を可能にしました。
論文 参考訳(メタデータ) (2024-06-04T15:08:56Z) - Matching Patients to Clinical Trials with Large Language Models [29.265158319106604]
本稿では,大規模言語モデルを用いたゼロショット患者間マッチングのためのエンドツーエンドフレームワークTrialGPTを紹介する。
TrialGPTは3つのモジュールから構成されており、まず大規模フィルタリングを行い、候補トライアル(TrialGPT-Retrieval)を検索し、次に基準レベルの患者資格(TrialGPT-Matching)を予測し、最終的にトライアルレベルのスコア(TrialGPT-Ranking)を生成する。
論文 参考訳(メタデータ) (2023-07-27T17:56:56Z) - Large Language Models Encode Clinical Knowledge [21.630872464930587]
大規模言語モデル(LLM)は、自然言語の理解と生成において印象的な能力を示している。
本稿では, 現実性, 正確性, 潜在的害, バイアスを含む複数の軸に沿ったモデル回答の人為的評価のための枠組みを提案する。
本研究は,モデル尺度とインストラクション・インシデント・チューニングにより,理解,知識の想起,医学的推論が向上することを示す。
論文 参考訳(メタデータ) (2022-12-26T14:28:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。