論文の概要: MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation
- arxiv url: http://arxiv.org/abs/2607.09142v3
- Date: Thu, 16 Jul 2026 10:17:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 14:53:42.194619
- Title: MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation
- Title(参考訳): MedRealMM:中国のオンライン医療相談のための実世界のマルチモーダルベンチマーク
- Authors: Runhan Shi, Quan Zhou, Yuqian Xu, Shuai Yang, Xin Wu, Zitong Zhou, Hui Liu, Bin Zha, Zheming Wang, Liya Li, Wei Wei, Jinru Ding, Wenrao Pang, Mouxiao Bian, Haoyuan Hu, Jun Xu, Jie Xu,
- Abstract要約: 大規模言語モデル (LLMs) は、オンライン医療相談においてますます普及しているが、既存のベンチマークは実際の臨床実践と整合性に乏しいままである。
textbfMedRealMMは、特定されていない患者と医師の相互作用から構築されたマルチモーダルオンライン医療相談のための大規模ベンチマークである。
MedRealMMは、Multimodal Clinical Challenge Point (MCCP)抽出フレームワークを使用して、真のコンサルティングトラジェクトリにおける臨床的に要求される瞬間を特定する。
- 参考スコア(独自算出の注目度): 28.25494396319652
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly deployed in online medical consultation, yet existing benchmarks remain poorly aligned with real clinical practice. Many rely on synthetic conversations or patient simulators, omit patient-uploaded medical images, or evaluate open-ended clinical responses using multiple-choice or lexical-overlap metrics that poorly reflect clinical quality. We introduce \textbf{MedRealMM}, a large-scale benchmark for multimodal online medical consultation built from de-identified patient-doctor interactions collected from a nationwide Chinese internet hospital. MedRealMM uses a Multimodal Clinical Challenge Point (MCCP) extraction framework to identify clinically demanding moments in authentic consultation trajectories and converts each into a standardized next-response generation task while preserving the preceding text-image context. Each instance is paired with a case-specific rubric refined by physicians that rewards clinically desirable behaviors and penalizes unsafe, unsupported, or contradictory responses. The current release contains 5,620 real-world multimodal cases spanning 64 clinical departments. We evaluate 19 general-purpose and medical-specialized LLMs, including text-only and multimodal systems. Our results show that image information is critical for reliable clinical performance and that current frontier models remain below the online physician response. Although some frontier models satisfy as many or more positive clinical criteria than physicians, they trigger more negative criteria, indicating that safety-sensitive error avoidance remains a central bottleneck. MedRealMM offers a realistic and reproducible benchmark for evaluating multimodal medical reasoning in real-world online consultation. The dataset will be publicly available on Hugging Face at https://huggingface.co/datasets/jdh-algo/MedRealMM.
- Abstract(参考訳): 大規模言語モデル (LLMs) は、オンライン医療相談においてますます普及しているが、既存のベンチマークは実際の臨床実践と整合性に乏しいままである。
多くは、合成会話や患者シミュレーター、患者がアップロードした医療画像の省略、あるいは臨床品質の低さを反映した多重選択または語彙オーバーラップの指標を用いたオープンエンドの臨床反応の評価に頼っている。
全国のインターネット病院から収集された非特定患者と医師の相互作用から構築したマルチモーダルオンライン医療相談のための大規模ベンチマークである。
MedRealMMは、MCCP(Multimodal Clinical Challenge Point)抽出フレームワークを使用して、信頼できるコンサルティングトラジェクトリにおける臨床要求モーメントを特定し、前回のテキストイメージを保存しながら、それらを標準化された次世代タスクに変換する。
それぞれのインスタンスは、臨床に望ましい振る舞いを報償し、安全でない、サポートされない、あるいは矛盾した反応を罰する、医師によって洗練されたケース固有のルーリックとペアリングされる。
現在のリリースには、64の臨床部門にまたがる5,620の現実世界のマルチモーダルケースが含まれている。
テキスト・オンリー・マルチモーダル・システムを含む19の汎用・医療用LLMの評価を行った。
以上の結果から,画像情報は信頼性の高い臨床成績に欠かせないものであり,現在のフロンティアモデルがオンライン医師の反応より下位にあることが示唆された。
いくつかのフロンティアモデルは、医師よりも多くの陽性臨床基準を満たすが、それらはよりネガティブな基準を引き起こし、安全に敏感なエラー回避が中心的なボトルネックであることを示している。
MedRealMMは、実世界のオンラインコンサルティングにおけるマルチモーダル医療推論を評価するための、現実的で再現可能なベンチマークを提供する。
データセットはHugging Faceでhttps://huggingface.co/datasets/jdh-algo/MedRealMMで公開される。
関連論文リスト
- QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models [8.050059911826338]
LLM(Large Language Models)は、標準化された医療試験に優れるが、高いスコアは、現実世界の医療クエリに対する高品質な応答に変換できないことが多い。
実世界の医療LCM評価に適した生態学的に有効なベンチマークであるQuarkMedBenchを紹介する。
論文 参考訳(メタデータ) (2026-03-14T01:51:43Z) - MedArena: Comparing LLMs for Medicine-in-the-Wild Clinician Preferences [50.71326426975699]
MedArenaは医療用大規模言語モデル(LLM)のためのインタラクティブな評価プラットフォームである。
MedArenaは、2つのランダムに選択されたモデルからの応答を表示し、ユーザが好みのレスポンスを選択するように要求する。
2025年11月1日までに12台のLLMで収集された1571の選好のうち、ジェミニ2.0フラッシュシンキング、ジェミニ2.5プロ、GPT-4oがブラッドリー・テリーのレーティングで上位3モデルとなった。
論文 参考訳(メタデータ) (2026-03-13T22:30:26Z) - MedDialogRubrics: A Comprehensive Benchmark and Evaluation Framework for Multi-turn Medical Consultations in Large Language Models [15.91764739198419]
5,200件の患者と6万件以上のきめ細粒度評価ルーブリックからなる新規なベンチマークであるMedDialogRubricsについて紹介する。
本フレームワークでは,実世界の電子的健康記録にアクセスすることなく,現実的な患者記録と主訴を合成するマルチエージェントシステムを採用している。
論文 参考訳(メタデータ) (2026-01-06T13:56:33Z) - LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation [58.25892575437433]
医学における大規模言語モデル (LLMs) の評価は, 医療応用には精度が高く, 誤差の少ないため重要である。
LLMEval-Medは、5つの中核医療領域をカバーする新しいベンチマークであり、現実の電子健康記録から得られた2,996の質問と専門家が設計した臨床シナリオを含む。
論文 参考訳(メタデータ) (2025-06-04T15:43:14Z) - Medchain: Bridging the Gap Between LLM Agents and Clinical Practice with Interactive Sequence [68.05876437208505]
臨床ワークフローの5つの重要な段階をカバーする12,163の臨床症例のデータセットであるMedChainを提示する。
フィードバック機構とMCase-RAGモジュールを統合したAIシステムであるMedChain-Agentも提案する。
論文 参考訳(メタデータ) (2024-12-02T15:25:02Z) - A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models [57.88111980149541]
Asclepiusは、Med-MLLMの異なる医学的特長と診断能力で評価する、新しいMed-MLLMベンチマークである。
3つの基本原則に基づいて、アスクレピウスは15の医療専門分野を包括的に評価する。
また、6つのMed-MLLMの詳細な分析を行い、3人の専門家と比較した。
論文 参考訳(メタデータ) (2024-02-17T08:04:23Z) - AI Hospital: Benchmarking Large Language Models in a Multi-agent Medical Interaction Simulator [69.51568871044454]
我々は,emphDoctorをプレイヤとして,NPC間の動的医療相互作用をシミュレーションするフレームワークであるtextbfAI Hospitalを紹介した。
この設定は臨床シナリオにおけるLCMの現実的な評価を可能にする。
高品質な中国の医療記録とNPCを利用したマルチビュー医療評価ベンチマークを開発した。
論文 参考訳(メタデータ) (2024-02-15T06:46:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。