論文の概要: A rubric-based controlled comparison of frontier language models on expert-authored clinical reasoning tasks
- arxiv url: http://arxiv.org/abs/2607.02175v1
- Date: Thu, 02 Jul 2026 13:46:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.86038
- Title: A rubric-based controlled comparison of frontier language models on expert-authored clinical reasoning tasks
- Title(参考訳): 専門知識を有する臨床推論課題におけるフロンティア言語モデルの比較
- Abstract要約: 本研究は,4つの専門分野にまたがる5つの臨床シナリオについて,小規模かつ意図的な評価データセットを提示する。
GPT 5.4、Claude Opus 4.7、Gemini 3.1 Proの3つのフロンティアモデルを評価した。
中心的な発見は臨床上の優先事項の逆転であり、最高級(重量5, 臨界)の基準はわずか32.4-41.7%、低級の重量1の基準は80-90%である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multiple-choice medical benchmarks are increasingly saturated, and recent rubric-based evaluations such as HealthBench have shown that open-ended clinical performance is far from solved - its "Hard" subset top score remains 32%. We present a small, deliberately difficult evaluation dataset of five clinician-authored clinical scenarios spanning four specialties (anaesthesia, internal/family medicine, emergency medicine, and obstetrics), each accompanied by an atomic, weighted, MECE rubric (25-62 criteria per task; 184 criteria total) authored from a clinician-drafted golden answer. We evaluate three frontier models: GPT 5.4, Claude Opus 4.7, and Gemini 3.1 Pro. Mean rubric pass rates were 0.47 (Claude), 0.39 (GPT), and 0.37 (Gemini). The central finding is an inversion of clinical priority: the highest-weighted (weight-5, critical) criteria passed at only 32.4-41.7%, while low-stakes weight-1 criteria passed at 80-90%. 56 of 108 critical (weight-5) criteria (52%) were satisfied by no model. Three LLM autoraters reproduced expert met/not-met labels on 92.8-94.7% of 552 graded criteria. We position this as a methods-and-preliminary-findings contribution: the five tasks demonstrate a scalable, defensible pipeline ready to develop into a large-scale benchmark.
- Abstract(参考訳): 複数選択の医療ベンチマークは飽和度が増しており、HealthBenchのような最近のルーリックベースの評価では、オープンエンドの臨床成績は未解決であり、"ハード"サブセットのスコアは32%である。
本研究は,4つの専門分野(麻酔,内科,救急医療,産婦人科,産婦人科)にまたがる5つの臨床研究シナリオについて,脳卒中,重度,MECEルーブリック(タスク毎25~62基準,総計184基準)を併せ持つ小さな,意図的な評価データセットを提示する。
GPT 5.4、Claude Opus 4.7、Gemini 3.1 Proの3つのフロンティアモデルを評価した。
平均ルーブリックパスレートは0.47(クラウド)、0.39(GPT)、0.37(ジェニーニ)であった。
中心的な発見は臨床上の優先事項の逆転であり、最高級(重量5, 臨界)の基準はわずか32.4-41.7%、低級の重量1の基準は80-90%である。
56,108項目中52%が非モデルで満足であった。
LLMの3つのオートレーダは、552グレードの基準の92.8-94.7%で専門家のmatch/not-metラベルを再現した。
5つのタスクは、大規模ベンチマークを開発する準備ができているスケーラブルで防御可能なパイプラインを示しています。
関連論文リスト
- MamaBench: Benchmarking LLM Robustness in Maternal and Child Health Diagnosis through Counterfactual Clinical Perturbation [0.49454229616760287]
大規模言語モデルは医学ベンチマークで強いスコアを得るが、これらのベンチマークはそれぞれの質問を独立して評価する。
ママベンチ(MamaBench)は、母体と小児のAIに対する最初のカウンターファクトのベンチマークである。
Evidence-Anchored RAGは,アグリゲート類似性をエビデンスカバレッジの目的に置き換える3段階検索手法である。
論文 参考訳(メタデータ) (2026-07-15T21:56:19Z) - Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases [71.12461204050985]
MedSP1000 (MedSP1000) は、SP由来の臨床エージェント評価のための対話型ベンチマークである。
ピアレビューされたSPの授業ケースを、定義されたSPケーススクリプト、臨床環境コンテキスト、人為的な構造化ルーブリックで実行可能なシナリオに変換する。
MedSP1000を多種多様な汎用および医療用LLMに適用すると、静的ベンチマークの性能がそのような教育シナリオに確実に変換されないことが分かる。
論文 参考訳(メタデータ) (2026-06-03T17:17:16Z) - IyàwóBench: A Benchmark for Evaluating Large Language Model Clinical Triage Accuracy on Undifferentiated Febrile Illness in Nigerian Primary Health Settings [0.0]
ナイジェリアでは、未分化の胎児病がプライマリケアの外来訪問の主な原因となっている。
大規模言語モデル(LLM)の臨床トリアージ推論を評価するための検証済みのベンチマークは存在しない。
IywBench v1.0は8つの女性病カテゴリにまたがる200種類の合成臨床ヴィニネットのデータセットである。
論文 参考訳(メタデータ) (2026-05-22T10:25:51Z) - TriALS: Triphasic-Aided Liver Lesion Segmentation Benchmark in Non-Contrast CT [49.93685997940356]
コントラスト制限条件下での肝病変の自動分節に対するTriALSの課題について述べる。
最高性能は平均静脈圧0.754で, NCCTでは0.57に低下した。
アルゴリズムの性能は、トレーニングデータスケールと事前学習戦略によって最も強く予測された。
論文 参考訳(メタデータ) (2026-05-15T19:23:35Z) - Are Multimodal LLMs Ready for Clinical Dermatology? A Real-World Evaluation in Dermatology [6.096816682256677]
MLLM(Multimodal large language model)は、一般に利用可能な皮膚科のベンチマークで約束されている。
オープンウェイトMLLM (InternVL-Chat v1.5, LLaVA-Med v1.5, SkinGPT4, MedGemma-4B-Instruct) と市販MLLM (GPT-4.1) を3つの皮膚科学データセットで比較検討した。
診断性能は公開データセットでは軽度であり、現実世界のコホートでは大幅に低下した。
論文 参考訳(メタデータ) (2026-05-01T02:54:07Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - LiveClin: A Live Clinical Benchmark without Leakage [50.45415584327275]
LiveClinは、実際の臨床実践を近似するために設計されたライブベンチマークである。
本研究は,患者を臨床経過全体にわたる複雑なマルチモーダルな評価シナリオに転換する。
LiveClin上で26のモデルを評価すると、これらの実世界のシナリオの難しさが明らかとなり、最高性能のモデルではケース精度が35.7%に達した。
論文 参考訳(メタデータ) (2026-02-18T03:59:46Z) - MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks [47.486705282473984]
大規模言語モデル(LLM)は、医学試験においてほぼ完璧なスコアを得る。
これらの評価は、実際の臨床実践の複雑さと多様性を不十分に反映している。
MedHELMは,医療業務におけるLCMの性能を評価するための評価フレームワークである。
論文 参考訳(メタデータ) (2025-05-26T22:55:49Z) - AutoTrial: Prompting Language Models for Clinical Trial Design [53.630479619856516]
本稿では,言語モデルを用いた臨床検査基準の設計を支援するAutoTrialという手法を提案する。
70K以上の臨床試験で、AutoTrialが高品質な基準テキストを生成することが確認された。
論文 参考訳(メタデータ) (2023-05-19T01:04:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。