論文の概要: Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases
- arxiv url: http://arxiv.org/abs/2607.25933v1
- Date: Tue, 28 Jul 2026 16:19:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.917122
- Title: Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases
- Title(参考訳): 臨床診断におけるマルチターンマルチモーダル診断の検討
- Abstract要約: ClinMM-Benchは、これまでで最大のマルチターンマルチモーダル臨床診断評価ベンチマークである。
実際の患者は1,089件、医療画像は3,760件、専門は8件。
プロプライエタリモデルでは診断精度が最も高かったが、正確な診断の割合は限られていた。
- 参考スコア(独自算出の注目度): 59.5328455571863
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Clinical diagnostic evaluation should not only assess whether models can provide correct diagnoses, but also reflect the realities of clinical practice, including progressive disclosure of multimodal information, dynamic updating of diagnostic hypotheses, and continuous refinement of clinical reasoning. However, existing evaluations of multimodal large language models (MLLMs) typically rely on single-turn or isolated tasks, making it difficult to fully capture the complexity of real-world clinical diagnosis. To bridge this gap, we developed ClinMM-Bench, the largest multi-turn multimodal clinical diagnostic evaluation benchmark to date. ClinMM-Bench contains 1,089 challenging real-world clinical cases and 3,760 medical images across eight specialties. We systematically evaluated 15 representative MLLMs using a two-level evaluation framework that assessed both diagnostic accuracy and diagnostic reasoning quality. Results showed that proprietary models achieved the highest overall diagnostic accuracy, but the proportion of completely correct diagnoses remained limited across all models. In terms of diagnostic reasoning quality, current models can identify plausible diagnostic directions but still have considerable limitations in generating reliable diagnostic reasoning. Error analysis further identified five representative failure modes: information synthesis failure, knowledge mapping error, perception error, premature closure, and visual hallucination.
- Abstract(参考訳): 臨床診断評価は、モデルが正しい診断を提供できるかどうかを評価するだけでなく、マルチモーダル情報のプログレッシブな開示、診断仮説の動的更新、臨床推論の継続的な洗練など、臨床実践の現実を反映すべきである。
しかし、既存のMLLM(Multimodal large language model)の評価は、1ターンや独立したタスクに依存しており、実際の臨床診断の複雑さを完全に把握することは困難である。
このギャップを埋めるために、我々はClinMM-Benchを開発した。
ClinMM-Benchには8つの専門分野にまたがる1089の課題と3,760の医療画像が含まれている。
診断精度と診断精度を両立する2段階評価フレームワークを用いて15種類の代表MLLMを体系的に評価した。
その結果,プロプライエタリモデルでは診断精度が最も高かったが,完全正しい診断の割合は全モデルに限られていた。
診断推論の品質の面では、現在のモデルは妥当な診断方向を識別できるが、信頼性の高い診断推論を生成するにはかなりの制限がある。
エラー解析により、情報合成失敗、知識マッピングエラー、知覚誤差、早期閉鎖、視覚幻覚の5つの代表的な障害モードが明らかになった。
関連論文リスト
- MTDiag: A Multi-Turn Diagnostic Dataset Towards Clinically Meaningful LLM Evaluation [39.83005700511833]
MTDiagは3つの異種源から構築された大規模マルチターン診断対話データセットである。
我々は,このスキーマ,UserLM-8Bに基づく発話生成パイプライン,および構造化された臨床証拠を自然言語の発話に変換する医師検証データセットをリリースする。
論文 参考訳(メタデータ) (2026-08-25T19:27:10Z) - MedReaMM: Evaluating Large Multimodal Models on Expert-Level Clinical Diagnostic Synthesis [61.266743965495884]
異種臨床証拠を合成するモデルの能力を評価するためのベンチマークであるMedReaMMを紹介する。
MedReaMMは625の専門患者と、平均2.79の医療画像と、ICD-11コードで注釈付けされた1,042の標準診断を含む。
23大マルチモーダルモデル (LMM) を評価し, 診断精度が50%未満であることが確認された。
論文 参考訳(メタデータ) (2026-08-23T09:37:53Z) - MultiDx: A Multi-Source Knowledge Integration Framework towards Diagnostic Reasoning [66.94527468532843]
2段階の診断推論フレームワークであるMultiDxを提案する。
まず Web 検索,SOAP 形式の症例,臨床症例データベースから知識を活用することにより,疑わしい診断と推論経路を生成する。
そして、マッチング、投票、および差分診断を通じて、複数のパースペクティブエビデンスを統合し、最終的な予測を生成する。
論文 参考訳(メタデータ) (2026-04-27T08:46:29Z) - Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs [63.535652574541764]
MLLM(Multimodal Large Language Models)は医用画像解析において顕著な可能性を示した。
消化器内視鏡におけるそれらの応用は、現在、2つの重要な限界によって妨げられている。
本稿では,これらの課題に対処する新しい臨床認知アライメント(CogAlign)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-21T07:47:37Z) - Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning? [31.103598483020857]
大規模視覚言語モデル(LVLM)は皮膚学において強い性能を示す。
稀な疾患に対する診断的推論は ほとんど未発見のままです
このデータセットには26,030のマルチモーダル画像テキストペアと6,354の臨床的に困難な症例が含まれている。
LVLMをリードするベンチマーク22は、診断精度、鑑別診断、臨床推論に重大な欠陥を呈する。
論文 参考訳(メタデータ) (2026-03-19T02:25:36Z) - ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning [58.01333341218153]
ClinDEF(ClinDEF)は, LLMにおける臨床推論をシミュレートされた診断対話を用いて評価する動的フレームワークである。
本手法は, 患者を発症し, LLMをベースとした医師と自動患者エージェントとのマルチターンインタラクションを容易にする。
実験により、ClinDEFは最先端のLSMにおいて重要な臨床推論ギャップを効果的に露呈することが示された。
論文 参考訳(メタデータ) (2025-12-29T12:58:58Z) - Evolving Diagnostic Agents in a Virtual Clinical Environment [75.59389103511559]
本稿では,大規模言語モデル(LLM)を強化学習を用いた診断エージェントとして訓練するためのフレームワークを提案する。
本手法は対話型探索と結果に基づくフィードバックによって診断戦略を取得する。
DiagAgentはDeepSeek-v3やGPT-4oなど、最先端の10のLLMを著しく上回っている。
論文 参考訳(メタデータ) (2025-10-28T17:19:47Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z) - DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models [25.13622249539088]
diagnosisArenaは、専門レベルの診断能力の厳格な評価のために設計されたベンチマークである。
診断アリーナは1,113組のセグメンテーション患者と、28の専門専門医からなる。
我々の研究では、最も先進的な推論モデルであるo3、o1、DeepSeek-R1でさえ、それぞれ51.12%、31.09%、17.79%の精度しか達成していないことが明らかになった。
論文 参考訳(メタデータ) (2025-05-20T09:14:53Z) - MSDiagnosis: A Benchmark for Evaluating Large Language Models in Multi-Step Clinical Diagnosis [8.641421154025211]
われわれはMSDiagnosisと呼ばれる中国の臨床診断基準を提案する。
このベンチマークは12の部門から2,225のケースで構成され、一次診断、鑑別診断、最終診断などのタスクをカバーする。
論文 参考訳(メタデータ) (2024-08-19T14:31:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。