論文の概要: KlinikeBench: Evaluating Language Models Beyond Diagnostic Accuracy
- arxiv url: http://arxiv.org/abs/2609.38480v1
- Date: Tue, 29 Sep 2026 20:08:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.699812
- Title: KlinikeBench: Evaluating Language Models Beyond Diagnostic Accuracy
- Title(参考訳): KlinikeBench: 診断精度を超えた言語モデルの評価
- Abstract要約: KlinikeBenchは、臨床医が認可した333のタスクのベンチマークである。
仮想患者、臨床ツール、タスク固有の成功基準を備えた隔離されたサンドボックス環境を提供する。
- 参考スコア(独自算出の注目度): 9.101205438220914
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Most clinical benchmarks evaluate language models (LMs) on diagnosis using complete case descriptions. In clinical practice, however, patients present information in different ways, and clinicians must obtain relevant history and determine which examinations are needed before reaching a diagnosis. Diagnostic accuracy alone therefore cannot establish whether an agent gathered essential information or conducted an appropriate clinical assessment. Furthermore, existing benchmarks lack professional clinicians' verification. To address this gap, we introduce KlinikeBench, a benchmark of 333 clinician-authored tasks, each providing an isolated sandbox environment with a virtual patient, clinical tools, and task-specific success criteria. More than 35 clinicians contributed to case authoring and benchmark evaluation. In an empirical study, clinicians gave simulated dialogues higher mean quality ratings than reference conversations, which is adapted from real conversation. In each task, an LM has a fixed budget of turns to communicate with the patient, ask about relevant history, request examinations, follow action constraints, and record a final diagnosis. We score these steps separately as well as together. Across 31 models and seven model families, the best-performing models (e.g., GPT-6-astra and Claude Opus 5) succeed on less than 30% of tasks, even though their diagnosis accuracy reaches 90.7%. Some models benefit from talking with the patient; others diagnose well from a complete chart but perform much worse in conversation. Overall, KlinikeBench provides a testbed for evaluating the full clinical encounter and reveals a substantial gap between diagnostic accuracy and performance in interactive clinical assessment.
- Abstract(参考訳): ほとんどの臨床ベンチマークでは、完全な症例記述を用いて言語モデル(LM)を診断で評価する。
しかし、臨床実践では、患者は異なる方法で情報を提示し、臨床医は関連する履歴を取得し、診断に達する前にどの検査が必要かを決定する必要がある。
したがって、診断精度だけでは、エージェントが本質的な情報を集め、適切な臨床評価を行ったかどうかを確定できない。
さらに、既存のベンチマークでは専門医の検証が欠如している。
このギャップに対処するために、クリニックが認可した333のタスクのベンチマークであるKlinikeBenchを紹介し、それぞれが仮想患者、臨床ツール、タスク固有の成功基準を備えた隔離されたサンドボックス環境を提供する。
35人以上の臨床医がケースオーサリングとベンチマーク評価に寄与した。
実験的な研究で、臨床医は実際の会話から適応した基準会話よりも平均品質評価をシミュレーションした。
それぞれのタスクにおいて、LMは患者とコミュニケーションし、関連する歴史について尋ね、検査を要求し、行動制約に従い、最終的な診断を記録するためのターンの予算を定めている。
私たちはこれらのステップを別々に、そして一緒に得点します。
31モデルと7つのモデルファミリーで最高の性能のモデル(例えば、GPT-6-astra、Claude Opus 5)は、診断精度が90.7%に達したにもかかわらず、30%未満のタスクで成功している。
患者と話すことの恩恵を受けるモデルもあれば、完全なチャートから十分に診断できるモデルもあるが、会話でははるかに悪化するものもある。
全体として、KlinikeBench氏は、完全な臨床遭遇を評価するためのテストベッドを提供し、インタラクティブな臨床評価において、診断精度とパフォーマンスの間にかなりのギャップがあることを明らかにしている。
関連論文リスト
- Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases [59.5328455571863]
ClinMM-Benchは、これまでで最大のマルチターンマルチモーダル臨床診断評価ベンチマークである。
実際の患者は1,089件、医療画像は3,760件、専門は8件。
プロプライエタリモデルでは診断精度が最も高かったが、正確な診断の割合は限られていた。
論文 参考訳(メタデータ) (2026-07-28T16:19:03Z) - Information-seeking failures of large language models in agentic clinical reasoning [1.0175801260973338]
推論の痕跡は臨床的推論では高い値を示したが、正確性とは無関係であり、局所的コヒーレントな合理性と世界的正しい結論とのギャップが明らかとなった。
これらの結果から, 臨床腫瘍学における現在のモデルの主な限界は, 医療知識の不足ではなく, 不確実性による情報探索の体系的失敗であることが示唆された。
論文 参考訳(メタデータ) (2026-07-11T12:10:33Z) - Active Evidence-Seeking and Diagnostic Reasoning in Large Language Models for Clinical Decision Support [20.0177310948999]
我々はOSCEにインスパイアされた標準化された患者シミュレータと能動的診断のための制御された再現可能なベンチマークを導入する。
本プロトコルでは,468症例と15モデルに対して,診断精度を12.75%低下させ,サポートエビデンス品質を24.36%低下させるマルチターンエビデンスを観察した。
論文 参考訳(メタデータ) (2026-05-21T06:34:50Z) - ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning [58.01333341218153]
ClinDEF(ClinDEF)は, LLMにおける臨床推論をシミュレートされた診断対話を用いて評価する動的フレームワークである。
本手法は, 患者を発症し, LLMをベースとした医師と自動患者エージェントとのマルチターンインタラクションを容易にする。
実験により、ClinDEFは最先端のLSMにおいて重要な臨床推論ギャップを効果的に露呈することが示された。
論文 参考訳(メタデータ) (2025-12-29T12:58:58Z) - Evolving Diagnostic Agents in a Virtual Clinical Environment [75.59389103511559]
本稿では,大規模言語モデル(LLM)を強化学習を用いた診断エージェントとして訓練するためのフレームワークを提案する。
本手法は対話型探索と結果に基づくフィードバックによって診断戦略を取得する。
DiagAgentはDeepSeek-v3やGPT-4oなど、最先端の10のLLMを著しく上回っている。
論文 参考訳(メタデータ) (2025-10-28T17:19:47Z) - Timely Clinical Diagnosis through Active Test Selection [49.091903570068155]
本稿では,現実の診断推論をよりうまくエミュレートするためのACTMED (Adaptive Clinical Test selection via Model-based Experimental Design)を提案する。
LLMは柔軟なシミュレータとして機能し、構造化されたタスク固有のトレーニングデータを必要とせずに、患者状態のもっともらしい分布を生成し、信念の更新をサポートする。
我々は、実世界のデータセット上でACTMEDを評価し、診断精度、解釈可能性、リソース使用量を改善するためにテスト選択を最適化できることを示す。
論文 参考訳(メタデータ) (2025-10-21T18:10:45Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z) - End-To-End Clinical Trial Matching with Large Language Models [0.6151041580858937]
大言語モデル(LLM)を用いた臨床試験のためのエンドツーエンドパイプラインを提案する。
本研究は,93.3%の症例において関連する候補試験を同定し,88.0%の予備的精度を達成している。
私たちの完全なエンドツーエンドパイプラインは、自律的または人間の監督の下で運用することができ、オンコロジーに限定されません。
論文 参考訳(メタデータ) (2024-07-18T12:36:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。