論文の概要: mamabench and mamaretrieval: Benchmarks for Evaluating Medical Retrieval-Augmented Generation in Maternal, Neonatal, and Reproductive Health
- arxiv url: http://arxiv.org/abs/2606.29467v2
- Date: Thu, 02 Jul 2026 16:16:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.492152
- Title: mamabench and mamaretrieval: Benchmarks for Evaluating Medical Retrieval-Augmented Generation in Maternal, Neonatal, and Reproductive Health
- Title(参考訳): ママイベッチとママイレトリーバル:母体・新生児・生殖健康における医療レトリーバル増強世代の評価基準
- Abstract要約: mombenchは、既存の7つの専門家ライセンスのソースから集められた25,949のアイテムからなるスコープフィルタリングされたQAセットである。
臨床検査では, 63,650チョンクの母体保健ガイドラインコーパスを用いて, グレード (0-6) の関連ラベルを用いた3,185の検索を行った。
- 参考スコア(独自算出の注目度): 9.0025190634417
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Medical question-answering benchmarks rarely cover the maternal, neonatal, child, and reproductive-health questions a nurse-midwife asks, and, to our knowledge, no public chunk-level relevance benchmark exists for maternal-health guideline retrieval. We release two benchmarks that fill these gaps. mamabench is a scope-filtered QA set of 25,949 items assembled from seven existing expert-authored sources across multiple-choice, short-answer, and rubric-graded tracks; to help users calibrate the LLM judge that scores the rubric track, we re-scope HealthBench's physician-labelled meta-evaluation to the domain. mamaretrieval pairs 3,185 clinical queries with graded (0-6) relevance labels over a 63,650-chunk maternal-health guideline corpus, using a decomposed rubric that distinguishes a chunk that answers a query from one merely on its topic. Three decisions shape both: assemble and filter expert sources rather than author questions, grade relevance rather than binarise it, and measure and disclose the limits of the labels -- scope-classifier agreement, a frontier-judge check, and a pooling-completeness audit -- rather than treat them as an oracle. A companion paper uses the benchmarks to evaluate a deployed on-device assistant; both are released openly for research.
- Abstract(参考訳): 看護婦が質問する母体、新生児、子供、生殖健康に関する質問は、医学的な質問回答ベンチマークではまれにカバーされ、我々の知る限り、母体保健ガイドライン検索のための公開チャンクレベル関連ベンチマークは存在しない。
これらのギャップを埋めるベンチマークを2つリリースします。
mombenchは、複数の選択、ショートアンサー、ルーリックグレードトラックにまたがる、既存の7つの専門家認可ソースから収集された25,949項目からなるスコープフィルター付きQAセットである。
63,650チョークの母体保健ガイドラインコーパス上で、グレード(0-6)の関連ラベルを持つ3,185の臨床的クエリを、クエリに応答するチャンクをそのトピック上で単に1つだけと区別する分解されたルーブリックを用いて検索する。
3つの決定は、著者の質問よりも専門家の情報源を組み立て、フィルターし、二項の質問よりもグレードの関連性を示し、ラベルの限界を測り、開示する。
コンパニオンペーパーは、インストールされたデバイス上のアシスタントを評価するためにベンチマークを使用しており、どちらも研究のために公開されている。
関連論文リスト
- MedSNIP: Building and Benchmarking Snippet-Level Granularity for Medical Fact Verification [50.13873960887466]
我々はスニペットレベルの医療事実検証のベンチマークであるMedSNIP-Benchを紹介する。
また,自動スニペット生成パイプラインであるMedSNIPを導入する。
MedSNIP-Bench、HealthFC、MedHallu全体で、スニペットレベルの検証は偽クラスF1を保存または改善する。
論文 参考訳(メタデータ) (2026-09-11T14:08:44Z) - MamaBench: Benchmarking LLM Robustness in Maternal and Child Health Diagnosis through Counterfactual Clinical Perturbation [0.49454229616760287]
大規模言語モデルは医学ベンチマークで強いスコアを得るが、これらのベンチマークはそれぞれの質問を独立して評価する。
ママベンチ(MamaBench)は、母体と小児のAIに対する最初のカウンターファクトのベンチマークである。
Evidence-Anchored RAGは,アグリゲート類似性をエビデンスカバレッジの目的に置き換える3段階検索手法である。
論文 参考訳(メタデータ) (2026-07-15T21:56:19Z) - MAM-AI: An On-Device Medical Retrieval-Augmented Generation System for Nurses and Midwives in Zanzibar [9.0025190634417]
ザンジバルにおける看護中学生のための質問応答アシスタント「MAM-AI」について紹介する。
質問は埋め込み(EmbeddingGemma, 300M)、87のガイドライン文書のキュレーションされたコーパスにマッチする。
4B int4 ジェネレータ (Gemma 4 E4B) は完全にオフラインで、デバイスを離れるクエリはない。
論文 参考訳(メタデータ) (2026-06-28T19:52:04Z) - QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models [8.050059911826338]
LLM(Large Language Models)は、標準化された医療試験に優れるが、高いスコアは、現実世界の医療クエリに対する高品質な応答に変換できないことが多い。
実世界の医療LCM評価に適した生態学的に有効なベンチマークであるQuarkMedBenchを紹介する。
論文 参考訳(メタデータ) (2026-03-14T01:51:43Z) - Developing and evaluating a chatbot to support maternal health care [20.297280325309924]
本稿では,インドにおける母体保健ロボットについて,学術研究者,医療技術企業,公衆衛生非営利団体,病院との共同研究を通じて紹介する。
本システムは,(1)ステージアウェアトリアージ,(2)専門家テンプレートへのハイリスククエリのルーティング,(2)母子・新生児ガイドラインのハイブリッド検索,(3)LCMからのエビデンス条件付き生成を組み合わせた。
当社のコアコントリビューションは、専門家の限られた監督の下での、ハイテイクデプロイメントの評価ワークフローです。
論文 参考訳(メタデータ) (2026-03-13T17:02:05Z) - MedREK: Retrieval-Based Editing for Medical LLMs with Key-Aware Prompts [70.64143198545031]
本稿では,情報誘導のための注目型プロンプトエンコーダと正確なマッチングのための共有クエリキーモジュールを統合した検索ベースの編集フレームワークであるMedREKを提案する。
各種医用ベンチマークの結果から,MedREKは異なるコアメトリクス間で優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-10-15T12:50:33Z) - Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models [57.73472878679636]
Med-RewardBenchは、医療報酬モデルと審査員を評価するために特別に設計された最初のベンチマークである。
Med-RewardBenchは、13の臓器系と8の臨床部門にまたがるマルチモーダルデータセットを特徴としている。
厳格な3段階のプロセスは、6つの臨床的に重要な次元にわたる高品質な評価データを保証する。
論文 参考訳(メタデータ) (2025-08-29T08:58:39Z) - PediatricsMQA: a Multi-modal Pediatrics Question Answering Benchmark [11.57757126151033]
大規模言語モデル (LLM) と視覚拡張LDM (VLM) は高度な医療情報学、診断、意思決定支援を備えている。
これらのモデルは、特に年齢バイアスという体系的なバイアスを示し、その信頼性と公平さを損なう。
このバイアスは、小児医学研究が資金や表現の少ない医学研究において広範な不均衡を反映している。
論文 参考訳(メタデータ) (2025-08-22T14:50:55Z) - LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation [58.25892575437433]
医学における大規模言語モデル (LLMs) の評価は, 医療応用には精度が高く, 誤差の少ないため重要である。
LLMEval-Medは、5つの中核医療領域をカバーする新しいベンチマークであり、現実の電子健康記録から得られた2,996の質問と専門家が設計した臨床シナリオを含む。
論文 参考訳(メタデータ) (2025-06-04T15:43:14Z) - A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models [57.88111980149541]
Asclepiusは、Med-MLLMの異なる医学的特長と診断能力で評価する、新しいMed-MLLMベンチマークである。
3つの基本原則に基づいて、アスクレピウスは15の医療専門分野を包括的に評価する。
また、6つのMed-MLLMの詳細な分析を行い、3人の専門家と比較した。
論文 参考訳(メタデータ) (2024-02-17T08:04:23Z) - Consultation Checklists: Standardising the Human Evaluation of Medical
Note Generation [58.54483567073125]
本稿では,コンサルテーションチェックリストの評価を基礎として,客観性向上を目的としたプロトコルを提案する。
このプロトコルを用いた最初の評価研究において,アノテータ間合意の良好なレベルを観察した。
論文 参考訳(メタデータ) (2022-11-17T10:54:28Z) - Self-supervised Answer Retrieval on Clinical Notes [68.87777592015402]
本稿では,ドメイン固有パスマッチングのためのトランスフォーマー言語モデルをトレーニングするためのルールベースのセルフスーパービジョンであるCAPRを紹介する。
目的をトランスフォーマーベースの4つのアーキテクチャ、コンテキスト文書ベクトル、ビ-、ポリエンコーダ、クロスエンコーダに適用する。
本稿では,ドメイン固有パスの検索において,CAPRが強いベースラインを上回り,ルールベースおよび人間ラベル付きパスを効果的に一般化することを示す。
論文 参考訳(メタデータ) (2021-08-02T10:42:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。