論文の概要: Doctorina MedBench: End-to-End Evaluation of Agent-Based Medical AI
- arxiv url: http://arxiv.org/abs/2603.25821v1
- Date: Thu, 26 Mar 2026 18:38:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-30 21:49:48.233017
- Title: Doctorina MedBench: End-to-End Evaluation of Agent-Based Medical AI
- Title(参考訳): Doctorina MedBench氏:エージェントベースの医療AIのエンドツーエンド評価
- Authors: Anna Kozlova, Stanislau Salavei, Pavel Satalkin, Hanna Plotnitskaya, Sergey Parfenyuk,
- Abstract要約: Doctorina MedBenchは、現実的な医師と患者の相互作用のシミュレーションに基づいて、エージェントベースの医療AIの包括的な評価フレームワークである。
このフレームワークは、安全指向のトラップケース、臨床シナリオのカテゴリベースのランダムサンプリング、完全な回帰テストをサポートしている。
評価指標の普遍性は、このフレームワークを医療AIシステムの評価だけでなく、医師を評価し、臨床推論スキルの開発を支援するためにも使用できる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present Doctorina MedBench, a comprehensive evaluation framework for agent-based medical AI based on the simulation of realistic physician-patient interactions. Unlike traditional medical benchmarks that rely on solving standardized test questions, the proposed approach models a multi-step clinical dialogue in which either a physician or an AI system must collect medical history, analyze attached materials (including laboratory reports, images, and medical documents), formulate differential diagnoses, and provide personalized recommendations. System performance is evaluated using the D.O.T.S. metric, which consists of four components: Diagnosis, Observations/Investigations, Treatment, and Step Count, enabling assessment of both clinical correctness and dialogue efficiency. The system also incorporates a multi-level testing and quality monitoring architecture designed to detect model degradation during both development and deployment. The framework supports safety-oriented trap cases, category-based random sampling of clinical scenarios, and full regression testing. The dataset currently contains more than 1,000 clinical cases covering over 750 diagnoses. The universality of the evaluation metrics allows the framework to be used not only to assess medical AI systems, but also to evaluate physicians and support the development of clinical reasoning skills. Our results suggest that simulation of clinical dialogue may provide a more realistic assessment of clinical competence compared to traditional examination-style benchmarks.
- Abstract(参考訳): 本稿では,現実的な医師と患者との相互作用のシミュレーションに基づくエージェントベース医療AIの総合的評価フレームワークであるDoctorina MedBenchを紹介する。
標準化されたテスト問題の解決に依存する従来の医療ベンチマークとは異なり、提案されたアプローチは、医師またはAIシステムが医療履歴を収集し、添付された材料(検査報告、画像、医療文書を含む)を分析し、差分診断を定式化し、パーソナライズされたレコメンデーションを提供する、多段階の臨床対話をモデル化する。
システムパフォーマンスはD.O.T.S.メトリックを用いて評価され、診断、観察/調査、治療、ステップカウントの4つのコンポーネントから構成され、臨床的正確性と対話効率の両方を評価することができる。
システムには、開発とデプロイメントの両方でモデル劣化を検出するように設計されたマルチレベルテストと品質監視アーキテクチャも含まれている。
このフレームワークは、安全指向のトラップケース、臨床シナリオのカテゴリベースのランダムサンプリング、完全な回帰テストをサポートしている。
このデータセットには、750以上の診断をカバーする1000以上の臨床症例が含まれている。
評価指標の普遍性は、このフレームワークを医療AIシステムの評価だけでなく、医師を評価し、臨床推論スキルの開発を支援するためにも使用できる。
本研究は, 臨床対話のシミュレーションにより, 従来の検査スタイルのベンチマークと比較して, 臨床能力のより現実的な評価が可能であることを示唆する。
関連論文リスト
- AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning [73.50200033931148]
本稿では,放射線科医の協調診断ワークフローをエミュレートしたマルチエージェントストリーム推論フレームワークであるAgensEvalを紹介する。
評価プロセスを基準定義、エビデンス抽出、アライメント、一貫性スコアなどの解釈可能なステップに分割することで、AgensEvalは明確な推論トレースと構造化された臨床フィードバックを提供する。
実験結果から,AgensEvalは,言い換え,意味的,スタイリスティックな摂動の下でも頑健な臨床的整合性,意味的忠実性,解釈可能な評価を提供することが示された。
論文 参考訳(メタデータ) (2026-01-23T11:59:13Z) - PulseMind: A Multi-Modal Medical Model for Real-World Clinical Diagnosis [32.30982339390615]
我々はPulseMindを紹介した。PulseMindは、体系的にキュレートされたデータセット、包括的な評価ベンチマーク、カスタマイズされたトレーニングフレームワークを統合した、新しいマルチモーダル診断モデルのファミリーである。
具体的には、まず診断データセット、MediScopeを構築し、98,000件の現実世界のマルチターン・コンサルテーションと601,500件の医療画像で構成され、10の主要な臨床部門と200以上の亜種にまたがる。
そこで,4次元評価プロトコルを用いたマルチターン診断コンサルテーションベンチマークであるPulseMind Benchmarkを開発した。
論文 参考訳(メタデータ) (2026-01-12T09:17:46Z) - MedDialogRubrics: A Comprehensive Benchmark and Evaluation Framework for Multi-turn Medical Consultations in Large Language Models [15.91764739198419]
5,200件の患者と6万件以上のきめ細粒度評価ルーブリックからなる新規なベンチマークであるMedDialogRubricsについて紹介する。
本フレームワークでは,実世界の電子的健康記録にアクセスすることなく,現実的な患者記録と主訴を合成するマルチエージェントシステムを採用している。
論文 参考訳(メタデータ) (2026-01-06T13:56:33Z) - ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning [58.01333341218153]
ClinDEF(ClinDEF)は, LLMにおける臨床推論をシミュレートされた診断対話を用いて評価する動的フレームワークである。
本手法は, 患者を発症し, LLMをベースとした医師と自動患者エージェントとのマルチターンインタラクションを容易にする。
実験により、ClinDEFは最先端のLSMにおいて重要な臨床推論ギャップを効果的に露呈することが示された。
論文 参考訳(メタデータ) (2025-12-29T12:58:58Z) - MedXplain-VQA: Multi-Component Explainable Medical Visual Question Answering [1.4413073343064953]
MedXplain-VQAは、5つの説明可能なAIコンポーネントを統合し、解釈可能な医療画像分析を提供する包括的フレームワークである。
このフレームワークは、細調整されたBLIP-2バックボーン、医療クエリの修正、Grad-CAMの注意の強化、正確な領域抽出、マルチモーダル言語モデルによる構造的連鎖推論を活用する。
論文 参考訳(メタデータ) (2025-10-26T19:23:20Z) - Timely Clinical Diagnosis through Active Test Selection [49.091903570068155]
本稿では,現実の診断推論をよりうまくエミュレートするためのACTMED (Adaptive Clinical Test selection via Model-based Experimental Design)を提案する。
LLMは柔軟なシミュレータとして機能し、構造化されたタスク固有のトレーニングデータを必要とせずに、患者状態のもっともらしい分布を生成し、信念の更新をサポートする。
我々は、実世界のデータセット上でACTMEDを評価し、診断精度、解釈可能性、リソース使用量を改善するためにテスト選択を最適化できることを示す。
論文 参考訳(メタデータ) (2025-10-21T18:10:45Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z) - Medical Reasoning in the Era of LLMs: A Systematic Review of Enhancement Techniques and Applications [59.721265428780946]
医学における大きな言語モデル(LLM)は印象的な能力を実現しているが、体系的で透明で検証可能な推論を行う能力に重大なギャップが残っている。
本稿は、この新興分野に関する最初の体系的なレビューを提供する。
本稿では,学習時間戦略とテスト時間メカニズムに分類した推論強化手法の分類法を提案する。
論文 参考訳(メタデータ) (2025-08-01T14:41:31Z) - Clinical Evaluation of Medical Image Synthesis: A Case Study in Wireless Capsule Endoscopy [63.39037092484374]
人工知能(AI)に基づく合成データ生成は、臨床医学の届け方を変えることができる。
本研究は,無線カプセル内視鏡(WCE)画像を用いた炎症性腸疾患(IBD)の診断における概念実証による医療用SDGの臨床評価に焦点を当てた。
その結果、TIDE-IIは、最先端の生成モデルと比較して品質が向上し、臨床的に可塑性で、非常に現実的なWCE画像を生成することがわかった。
論文 参考訳(メタデータ) (2024-10-31T19:48:50Z) - Emulating Human Cognitive Processes for Expert-Level Medical
Question-Answering with Large Language Models [0.23463422965432823]
BooksMedはLarge Language Model(LLM)に基づいた新しいフレームワークである
人間の認知プロセスをエミュレートして、エビデンスベースの信頼性の高い応答を提供する。
本稿では、専門家レベルのオープンエンドな質問からなるベンチマークであるExpertMedQAを紹介する。
論文 参考訳(メタデータ) (2023-10-17T13:39:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。