論文の概要: A rubric landscape for evaluating clinical reasoning in large language models: what exists, what is missing, and what needs to be combined
- arxiv url: http://arxiv.org/abs/2610.01938v1
- Date: Thu, 01 Oct 2026 16:07:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.25335
- Title: A rubric landscape for evaluating clinical reasoning in large language models: what exists, what is missing, and what needs to be combined
- Title(参考訳): 大規模言語モデルにおける臨床理性評価のための豪華なランドスケープ:存在するもの、欠落するもの、組み合わせるべきもの
- Abstract要約: エクサムスタイルの精度は、臨床記録よりも大きな言語モデル(LLM)が優れているかどうかを定めていない。
問題表現,時間合成,微分と管理の推論,反事実推論,不確実性の校正,忠実性の推論の6つの側面について検討した。
- 参考スコア(独自算出の注目度): 0.21661551697659734
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Exam-style accuracy does not establish whether large language models (LLMs) reason well over clinical records. We define clinical reasoning as integrating and updating evidence across time and sources to form, revise and justify a patient's problem representation and a defensible plan. This structured narrative review maps three literatures: medical education assessment instruments, clinical LLM benchmarks published from 2023 onwards, and general-domain methods for evaluating long-form generation. We examine six dimensions: problem representation, temporal synthesis, differential and management reasoning, counterfactual reasoning, calibrated uncertainty, and reasoning faithfulness. Preprints are included and flagged. No single instrument covers all six dimensions. Problem representation and differential or management reasoning are reasonably covered, although reliability varies by instrument and setting. TIMER-Eval targets temporal synthesis, and ER-Reason assesses sequential diagnostic belief updating. Dedicated uncertainty and counterfactual evaluations are emerging, but their applicability to longitudinal free-text reasoning remains limited. Factual completeness is well theorised in general-domain evaluation, with early clinical evidence of important omissions. Faithfulness remains the weakest dimension, with one identified clinical causal-ablation study on multiple-choice questions. Existing tools should be combined through binary rubric items, separate completeness and correctness scores, case-specific importance weighting with non-compensable safety caps, temporal order-consistency checks, and chance-corrected reliability reporting. Further design work is needed for calibrated uncertainty, counterfactual reasoning and faithfulness over longitudinal free-text records. This review provides a design rationale, not a validated instrument.
- Abstract(参考訳): エクサムスタイルの精度は、臨床記録よりも大きな言語モデル(LLM)が優れているかどうかを定めていない。
臨床推論は、時間と情報源をまたいだ証拠の統合と更新を、患者の問題表現と修正可能な計画の形成、修正、正当化と定義する。
この構造化された物語レビューは、医学教育評価機器、2023年以降に出版された臨床LCMベンチマーク、および長大な生成を評価するための一般ドメインメソッドの3つの文献をマッピングする。
問題表現,時間合成,微分と管理の推論,反事実推論,不確実性の校正,忠実性の推論の6つの側面について検討した。
プレプリントは含まれ、フラグが付けられている。
6次元全てをカバーする単一の楽器はない。
問題表現と差分的または管理的推論は合理的にカバーされるが、信頼性は機器や設定によって異なる。
TIMER-Evalは時間的合成を目標とし、ER-Reasonはシーケンシャルな診断信念の更新を評価する。
定型的不確実性や反事実評価は現れているが, 長手な自由文推論への適用性は依然として限られている。
完全性は一般領域評価においてよく理論化されており、重要な欠失の早期臨床証拠がある。
信仰は依然として最も弱い次元であり、複数の質問に対する臨床因果関係の研究が1つ確認されている。
既存のツールは、バイナリのルーリックアイテム、別個の完全性と正当性スコア、ケース固有の重み付け、非補償不能な安全キャップ、時間的順序整合性チェック、エラー修正された信頼性レポートを通じて組み合わせるべきである。
経時的自由テキスト記録に対する不確実性, 反実的推論, 忠実性を校正するためには, さらなる設計作業が必要である。
このレビューは、検証済みの楽器ではなく、設計の根拠を提供する。
関連論文リスト
- A Proposed Rubric for Evaluating Expressed Clinical Reasoning in Large Language Model Responses [0.21661551697659734]
本稿では,モデル応答における表現された臨床推論を評価するためのルーブリックを提案する。
一般ドメインフレームワークは、その設計を通知するが、検証された臨床機器として扱われることはない。
このルーブリックはまだ、層間信頼性、構築の妥当性、臨床的有用性について試験されていない。
論文 参考訳(メタデータ) (2026-09-29T15:19:42Z) - Generated Context versus Governed State: Functional Conditions for Accountable Longitudinal Clinical Reasoning [0.0]
本稿では,縦断的臨床推論は部分的可観測性の下での状態推定問題である,と論じる。
説明責任の定義は4つの情報要件に分解されることを示す。
6段階の成熟度フレームワークは、システムが管理可能にしているものを、計算できるものと区別する。
論文 参考訳(メタデータ) (2026-08-14T18:18:31Z) - Toward Automated Detection of Documentation Inconsistencies in Electronic Health Records [16.68744679025527]
一般ドメイン大言語モデル(LLM)は、実世界の放電サマリーから表れる。
LLMは3,460人の候補者の不一致を表面化し、69.7%が入院した。
論文 参考訳(メタデータ) (2026-07-24T23:43:35Z) - AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning [73.50200033931148]
本稿では,放射線科医の協調診断ワークフローをエミュレートしたマルチエージェントストリーム推論フレームワークであるAgensEvalを紹介する。
評価プロセスを基準定義、エビデンス抽出、アライメント、一貫性スコアなどの解釈可能なステップに分割することで、AgensEvalは明確な推論トレースと構造化された臨床フィードバックを提供する。
実験結果から,AgensEvalは,言い換え,意味的,スタイリスティックな摂動の下でも頑健な臨床的整合性,意味的忠実性,解釈可能な評価を提供することが示された。
論文 参考訳(メタデータ) (2026-01-23T11:59:13Z) - Towards Reliable Medical LLMs: Benchmarking and Enhancing Confidence Estimation of Large Language Models in Medical Consultation [97.36081721024728]
本稿では,現実的な医療相談におけるマルチターンインタラクションの信頼性を評価するための最初のベンチマークを提案する。
本ベンチマークでは,3種類の医療データを統合し,診断を行う。
本稿では,エビデンスを基盤とした言語自己評価フレームワークであるMedConfを紹介する。
論文 参考訳(メタデータ) (2026-01-22T04:51:39Z) - Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models [48.95516224614331]
MedGaze-Benchは、臨床医の視線を認知的カーソルとして活用し、手術、緊急シミュレーション、診断解釈における意図的理解を評価する最初のベンチマークである。
本ベンチマークでは,解剖学的構造の視覚的均一性,臨床における時間・因果依存性の厳格化,安全プロトコルへの暗黙の順守という3つの基本的な課題に対処する。
論文 参考訳(メタデータ) (2026-01-11T02:20:40Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z) - Medical Reasoning in LLMs: An In-Depth Analysis of DeepSeek R1 [0.0]
本研究は、100症例のMedQAを用いて、DeepSeek R1の専門的パターンに対する医学的推論を評価する。
このモデルは、診断精度93%を達成し、鑑別診断、ガイドラインに基づく治療選択、患者固有の因子の統合を通じて、体系的な臨床的判断を実証した。
誤り分析では, バイアスのアンカー, 競合するデータの整合性の課題, 代替案の探索不足, 過剰思考, 知識ギャップ, 中間的治療に対する決定的治療の早期優先順位付けなど, 持続的な限界が認められた。
論文 参考訳(メタデータ) (2025-03-27T09:18:08Z) - Towards Reliable Medical Image Segmentation by Modeling Evidential Calibrated Uncertainty [57.023423137202485]
医用画像のセグメンテーションの信頼性に関する懸念が臨床医の間で続いている。
本稿では,医療画像セグメンテーションネットワークにシームレスに統合可能な,実装が容易な基礎モデルであるDEviSを紹介する。
主観的論理理論を活用することで、医用画像分割の確率と不確実性を明示的にモデル化する。
論文 参考訳(メタデータ) (2023-01-01T05:02:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。