論文の概要: MIRA-Ev:A Benchmark for Granular Evidence Detection and Relational Reasoning in Clinical Exams
- arxiv url: http://arxiv.org/abs/2607.19201v1
- Date: Tue, 21 Jul 2026 15:34:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.476939
- Title: MIRA-Ev:A Benchmark for Granular Evidence Detection and Relational Reasoning in Clinical Exams
- Title(参考訳): MIRA-Ev: 臨床検査におけるグラニュラーエビデンス検出と関係推論のためのベンチマーク
- Abstract要約: MIRA-Evは、スペインのMédico Interno Residente (MIR) のライセンス試験をベースとした臨床引数マイニングベンチマークである。
MIR-Evは、評価をエビデンス文検索、議論的成分抽出、関係分類という3階層のタスク階層に分類する。
- 参考スコア(独自算出の注目度): 0.9466581382549785
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Clinical NLP evaluation remains dominated by multiple-choice question answering (MCQA), which scores only final-answer accuracy and cannot detect when a model reaches the correct diagnosis while grounding it in irrelevant, absent, or contradictory evidence. We introduce MIRA-Ev, a clinical argument mining benchmark built on Spanish Médico Interno Residente (MIR) licensing-exam cases, re-annotated by expert clinicians with span-level premises, claims, and directed support/attack relations, and released in parallel Spanish (native), English, and Basque versions, the first clinical argumentation resource in Basque. MIRA-Ev organizes evaluation into a three-tier task hierarchy: evidence sentence retrieval, argumentative component extraction, and relation classification.
- Abstract(参考訳): 臨床NLP評価は、最終回答精度のみをスコアし、無関係、欠落、矛盾する証拠を根拠に、モデルが正しい診断に達することを検出できない多重選択質問応答(MCQA)に支配されている。
MIRA-Evは、スペインのMédico Interno Residente (MIR) ライセンス試験に基づいて構築された臨床引数マイニングベンチマークであり、広範囲の前提、主張、支援・攻撃関係を持つ専門家臨床医によって再注釈され、バスクで最初の臨床議論資源であるスペイン語(ネイティブ)、英語、バスク語版でリリースされている。
MIRA-Evは、評価をエビデンス文検索、議論的成分抽出、関係分類という3階層のタスク階層に分類する。
関連論文リスト
- Clinician-Level Agreement Without Clinical Caution: LLM Evaluator Limits in Medical AI Benchmarking [27.829988205900055]
MedQADEは、ドイツにおける最初の標準的オープンレスポンス臨床ベンチマークである。
最高のパフォーマンス評価モデルであるGemini 3 Flashは、医師の天井と一致している。
この統計的アライメントにもかかわらず、自動評価装置は臨床メタ認知に近づいた。
論文 参考訳(メタデータ) (2026-07-01T15:55:31Z) - BLUEmed: Retrieval-Augmented Multi-Agent Debate for Clinical Error Detection [1.620466780389133]
我々は、ハイブリッド検索強化世代(RAG)を付加したマルチエージェント討論フレームワークBLUEmedを紹介する。
Bluemedは、各臨床ノートを焦点を絞ったサブクエリに分解し、密度、スパース、オンライン検索を通じてソース分割された証拠を検索し、独立した分析を作成するために、2つのドメイン専門家エージェントに異なる知識ベースを割り当てる。
BLUEmed on a clinical terminology substitution detection benchmark under both zero-shot and few-shot prompting with multiple backbone model acrossed proprietary and open-source family。
論文 参考訳(メタデータ) (2026-04-12T00:30:31Z) - To Adapt or not to Adapt, Rethinking the Value of Medical Knowledge-Aware Large Language Models [0.7939766248249879]
近年の研究では、標準医療ベンチマークにおいて、ドメイン適応型大規模言語モデル(LLM)が汎用モデルよりも一貫して優れているわけではないことが示されている。
本研究は,英語とスペイン語の多種多様な臨床質問応答課題に対する総合的および臨床的LLMの比較である。
論文 参考訳(メタデータ) (2026-04-08T09:17:55Z) - AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning [73.50200033931148]
本稿では,放射線科医の協調診断ワークフローをエミュレートしたマルチエージェントストリーム推論フレームワークであるAgensEvalを紹介する。
評価プロセスを基準定義、エビデンス抽出、アライメント、一貫性スコアなどの解釈可能なステップに分割することで、AgensEvalは明確な推論トレースと構造化された臨床フィードバックを提供する。
実験結果から,AgensEvalは,言い換え,意味的,スタイリスティックな摂動の下でも頑健な臨床的整合性,意味的忠実性,解釈可能な評価を提供することが示された。
論文 参考訳(メタデータ) (2026-01-23T11:59:13Z) - ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning [58.01333341218153]
ClinDEF(ClinDEF)は, LLMにおける臨床推論をシミュレートされた診断対話を用いて評価する動的フレームワークである。
本手法は, 患者を発症し, LLMをベースとした医師と自動患者エージェントとのマルチターンインタラクションを容易にする。
実験により、ClinDEFは最先端のLSMにおいて重要な臨床推論ギャップを効果的に露呈することが示された。
論文 参考訳(メタデータ) (2025-12-29T12:58:58Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z) - Clinically Grounded Agent-based Report Evaluation: An Interpretable Metric for Radiology Report Generation [32.410641778559544]
ICARE (Interpretable and Clinicallygrounded Agent-based Report Evaluation) は、解釈可能な評価フレームワークである。
2つのエージェントは、それぞれが基礎的真実または生成されたレポートを持ち、臨床的に有意義な質問を発生し、互いにクイズする。
スコアを質問応答ペアにリンクすることで、ICAREは透明で解釈可能な評価を可能にする。
論文 参考訳(メタデータ) (2025-08-04T18:28:03Z) - Large Language Models in the Clinic: A Comprehensive Benchmark [63.21278434331952]
診療所の大規模言語モデル(LLM)をよりよく理解するためのベンチマークであるClimateBenchを構築した。
まず、さまざまな臨床言語の生成、理解、推論タスクを含む11の既存のデータセットを収集します。
次に,現実の実践において複雑だが一般的である6つの新しいデータセットと臨床タスクを構築した。
ゼロショット設定と少数ショット設定の両方で、20個のLDMを広範囲に評価する。
論文 参考訳(メタデータ) (2024-04-25T15:51:06Z) - EHRNoteQA: An LLM Benchmark for Real-World Clinical Practice Using Discharge Summaries [9.031182965159976]
大規模言語モデル(LLM)は、大規模で複雑なデータを効率的に分析する可能性を示している。
我々は,MIMIC-IV EHR上に構築された新しいベンチマークであるEHRNoteQAを紹介した。
EHRNoteQAには、複数の放電サマリーにまたがる情報を必要とし、実際の臨床検査の複雑さと多様性を反映した8つの多様なトピックをカバーする質問が含まれている。
論文 参考訳(メタデータ) (2024-02-25T09:41:50Z) - AI Hospital: Benchmarking Large Language Models in a Multi-agent Medical Interaction Simulator [69.51568871044454]
我々は,emphDoctorをプレイヤとして,NPC間の動的医療相互作用をシミュレーションするフレームワークであるtextbfAI Hospitalを紹介した。
この設定は臨床シナリオにおけるLCMの現実的な評価を可能にする。
高品質な中国の医療記録とNPCを利用したマルチビュー医療評価ベンチマークを開発した。
論文 参考訳(メタデータ) (2024-02-15T06:46:48Z) - Self-supervised Answer Retrieval on Clinical Notes [68.87777592015402]
本稿では,ドメイン固有パスマッチングのためのトランスフォーマー言語モデルをトレーニングするためのルールベースのセルフスーパービジョンであるCAPRを紹介する。
目的をトランスフォーマーベースの4つのアーキテクチャ、コンテキスト文書ベクトル、ビ-、ポリエンコーダ、クロスエンコーダに適用する。
本稿では,ドメイン固有パスの検索において,CAPRが強いベースラインを上回り,ルールベースおよび人間ラベル付きパスを効果的に一般化することを示す。
論文 参考訳(メタデータ) (2021-08-02T10:42:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。