論文の概要: MamaBench: Benchmarking LLM Robustness in Maternal and Child Health Diagnosis through Counterfactual Clinical Perturbation
- arxiv url: http://arxiv.org/abs/2607.14385v1
- Date: Wed, 15 Jul 2026 21:56:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.919127
- Title: MamaBench: Benchmarking LLM Robustness in Maternal and Child Health Diagnosis through Counterfactual Clinical Perturbation
- Title(参考訳): MamaBench:母子保健診断におけるLCMロバスト性の評価
- Authors: Thanni Adewuyi, Anuoluwa Sotome, Samuel Okoko, Angel Ezendu, Oluwafunke Akinbuwa, Oluwaseun Odunsi, Oluwasegun Oguntuase, Oluwadarasimi Oguntuase, Ifeoma Nwabueze, Abiodun Adereni,
- Abstract要約: 大規模言語モデルは医学ベンチマークで強いスコアを得るが、これらのベンチマークはそれぞれの質問を独立して評価する。
ママベンチ(MamaBench)は、母体と小児のAIに対する最初のカウンターファクトのベンチマークである。
Evidence-Anchored RAGは,アグリゲート類似性をエビデンスカバレッジの目的に置き換える3段階検索手法である。
- 参考スコア(独自算出の注目度): 0.47861717906113715
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models achieve strong scores on medical benchmarks, yet these benchmarks evaluate each question in isolation, providing no measure of whether a system can distinguish clinically similar presentations requiring different interventions. We introduce MamaBench, the first counterfactual benchmark for maternal and paediatric AI: 434 expert-authored clinical narratives in 217 pairs across 371 pathologies, evaluated via the Bias Trap Rate (BTR), the conditional probability that a model fails the counterfactual given success on the base case. We propose Evidence-Anchored RAG (EA-RAG), a three-stage retrieval method that replaces aggregate similarity with an evidence coverage objective through clinical parameter extraction, coverage auditing, and contrastive sub-queries. Across eight configurations of four frontier LLMs, base accuracy overstates robust accuracy by 16-28 percentage points in every model. EA-RAG achieves 20.3% BTR and 65.0% robust accuracy on Claude Sonnet 4.6, a 5.5 percentage point BTR reduction without degrading base accuracy. The residual 20% BTR confirms that counterfactual robustness in clinical AI remains an open challenge. Keywords: counterfactual evaluation, clinical AI, maternal healthcare, retrieval-augmented generation, diagnostic robustness
- Abstract(参考訳): 大規模言語モデルは、医療ベンチマークにおいて強力なスコアを得るが、これらのベンチマークは、それぞれの質問を個別に評価し、異なる介入を必要とする臨床的に類似したプレゼンテーションを区別できるかどうかを計測する手段を与えない。
ママベンチ(MamaBench)は、母体と小児のAIに対する最初の反実的ベンチマークで、371の病態にまたがる217対の専門的な臨床物語を434件紹介し、バイアストラップレート(BTR)を用いて評価した。
Evidence-Anchored RAG (EA-RAG) は, 臨床パラメータ抽出, カバレッジ監査, コントラッシブサブクエリを通じて, 集合類似性をエビデンス対象に置き換える3段階検索手法である。
4つのフロンティアLCMの8つの構成で、ベース精度は各モデルで16-28ポイントの精度で高い。
EA-RAGは、Claude Sonnet 4.6で20.3%のBTRと65.0%の堅牢な精度を達成する。
残りの20%のBTRは、臨床AIの反ファクト的堅牢性は未解決の課題であることを確認した。
キーワード:カウンターファクト評価、臨床AI、母体医療、検索強化世代、診断堅牢性
関連論文リスト
- A rubric-based controlled comparison of frontier language models on expert-authored clinical reasoning tasks [0.0]
本研究は,4つの専門分野にまたがる5つの臨床シナリオについて,小規模かつ意図的な評価データセットを提示する。
GPT 5.4、Claude Opus 4.7、Gemini 3.1 Proの3つのフロンティアモデルを評価した。
中心的な発見は臨床上の優先事項の逆転であり、最高級(重量5, 臨界)の基準はわずか32.4-41.7%、低級の重量1の基準は80-90%である。
論文 参考訳(メタデータ) (2026-07-02T13:46:24Z) - CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning [37.91882261875461]
大規模言語モデル (LLMs) は多くの医学ベンチマークにおいて強い結果が得られたが, 臨床的理由を確実に評価することは困難である。
プログレッシブな情報マスキング下でのLCM臨床推論を評価するための人為的ループ・フレームワークであるCLExEvalを紹介した。
論文 参考訳(メタデータ) (2026-06-30T12:56:42Z) - Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports [49.5225801722164]
既存のメトリクスは、医学的に根拠のないスカラーにレポートの品質を低下させることによって、この要件を曖昧にしている。
テストベッドとしてReEvalMedベンチマークを用いて,この境界について検討し,計量レベルの臨床的意義を評価する。
論文 参考訳(メタデータ) (2026-06-17T08:10:30Z) - IyàwóBench: A Benchmark for Evaluating Large Language Model Clinical Triage Accuracy on Undifferentiated Febrile Illness in Nigerian Primary Health Settings [0.0]
ナイジェリアでは、未分化の胎児病がプライマリケアの外来訪問の主な原因となっている。
大規模言語モデル(LLM)の臨床トリアージ推論を評価するための検証済みのベンチマークは存在しない。
IywBench v1.0は8つの女性病カテゴリにまたがる200種類の合成臨床ヴィニネットのデータセットである。
論文 参考訳(メタデータ) (2026-05-22T10:25:51Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - A Decade-Scale Benchmark Evaluating LLMs' Clinical Practice Guidelines Detection and Adherence in Multi-turn Conversations [60.2076951536797]
大規模言語モデル(LLM)は、医療シナリオにますます多くデプロイされている。
LLMが会話中に臨床ガイドラインを特定・遵守できるのかは不明確である。
CPGBenchは、LSMの臨床ガイドラインの検出と付着能力をベンチマークする自動フレームワークである。
論文 参考訳(メタデータ) (2026-03-26T09:00:55Z) - QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models [8.050059911826338]
LLM(Large Language Models)は、標準化された医療試験に優れるが、高いスコアは、現実世界の医療クエリに対する高品質な応答に変換できないことが多い。
実世界の医療LCM評価に適した生態学的に有効なベンチマークであるQuarkMedBenchを紹介する。
論文 参考訳(メタデータ) (2026-03-14T01:51:43Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - LiveClin: A Live Clinical Benchmark without Leakage [50.45415584327275]
LiveClinは、実際の臨床実践を近似するために設計されたライブベンチマークである。
本研究は,患者を臨床経過全体にわたる複雑なマルチモーダルな評価シナリオに転換する。
LiveClin上で26のモデルを評価すると、これらの実世界のシナリオの難しさが明らかとなり、最高性能のモデルではケース精度が35.7%に達した。
論文 参考訳(メタデータ) (2026-02-18T03:59:46Z) - MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine [69.08855631283829]
我々は,操作的ヒント条件下での安全性能トレードオフの定量化を目的としたベンチマークであるMed Omni-45 Degreesを紹介する。
6つの専門分野にまたがる1,804の推論に焦点を当てた医療質問と3つのタスクタイプが含まれており、その中にはMedMCQAの500が含まれる。
結果は、モデルが対角線を超えることなく、一貫した安全性と性能のトレードオフを示す。
論文 参考訳(メタデータ) (2025-08-22T08:38:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。