論文の概要: MAM-AI: An On-Device Medical Retrieval-Augmented Generation System for Nurses and Midwives in Zanzibar
- arxiv url: http://arxiv.org/abs/2606.29580v2
- Date: Thu, 02 Jul 2026 16:15:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.493009
- Title: MAM-AI: An On-Device Medical Retrieval-Augmented Generation System for Nurses and Midwives in Zanzibar
- Title(参考訳): MAM-AI:ザンジバルにおける看護婦と助産婦のためのオンデバイス医療検索システム
- Authors: Yi Ren,
- Abstract要約: ザンジバルにおける看護中学生のための質問応答アシスタント「MAM-AI」について紹介する。
質問は埋め込み(EmbeddingGemma, 300M)、87のガイドライン文書のキュレーションされたコーパスにマッチする。
4B int4 ジェネレータ (Gemma 4 E4B) は完全にオフラインで、デバイスを離れるクエリはない。
- 参考スコア(独自算出の注目度): 9.0025190634417
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Maternal and newborn mortality remain among the highest in sub-Saharan Africa, where midwifery care is often delivered by nurses who lack midwifery training to international standards, and consulting authoritative guidance at the point of care is hard: the guidelines are long and connectivity is intermittent. We present MAM-AI, a medical question-answering assistant for nurse-midwives in Zanzibar that runs entirely on a commodity Android device: a question is embedded (EmbeddingGemma, 300M) and matched against a curated corpus of 87 guideline documents (63,650 passages), then answered with citations by a 4B int4 generator (Gemma 4 E4B), fully offline, with no query leaving the device. We evaluate the exact deployed configuration with a layered methodology -- retriever, generator under oracle context, end-to-end, and latency -- scored by LLM judges validated against physician rubrics. The evaluation relocates the hard problem. On-device retrieval is essentially solved: the 300M embedder ranks third of seven retrievers and rivals cloud systems, so the passages the system needs are usually found. The small generator is what remains in doubt: adding retrieved context does not improve its answers, and at 4B it cannot be both helpful and safe at once -- of two same-size candidates, the more helpful one commits genuine dangerous errors, so we deploy the other, which is about twice as faithful to its sources (as faithful as a frontier model), and recover its helpfulness with a redesigned prompt that cuts deflection from 33% to 3%. Corpus quality is decisive for the same reason: where the corpus holds the right passage the answer is specific and actionable, and where it does not it goes vague. MAM-AI is a thoroughly evaluated, open-source research prototype, not a fielded product; the system, knowledge base, benchmarks, and evaluation harness are released.
- Abstract(参考訳): 母親と新生児の死亡率は、サハラ以南のアフリカでは最も高く、助産師が国際標準への助産師の訓練を欠いている看護師や、介護の点で権威的な指導を指導することが困難であり、ガイドラインは長く、接続性は断続的である。
質問は組み込み(EmbeddingGemma, 300M)、87のガイドライン文書(63,650パス)のキュレーションコーパスと一致し、4Bのint4ジェネレータ(Gemma 4 E4B)からの引用に答える。
われわれは,医療用ルーリックに対して検証されたLSMの審査員によって得られた,階層化された方法論 – 検索,オラクルコンテキスト下でのジェネレータ,エンドツーエンド,レイテンシ – で,正確なデプロイ構成を評価した。
評価は難しい問題を再配置する。
デバイス上での検索は基本的に解決され、システムに必要なパスは通常7つのレトリバーとライバルのクラウドシステムの3分の3に3Mの埋め込みがランク付けされている。
検索されたコンテキストを追加しても、その回答は改善せず、4Bでは、同じサイズの候補が2つあるほど、真に危険なエラーを犯すため、そのソースに忠実な(フロンティアモデルとして忠実な)他のジェネレータをデプロイし、その有用性を33%から3%に削減する再設計されたプロンプトで回復します。
コーパスが正しいパスを保持する場合、答えは具体的で実行可能であり、それが曖昧にならない場合である。
MAM-AIは、完全に評価されたオープンソースの研究プロトタイプであり、フィールド製品ではなく、システム、知識ベース、ベンチマーク、評価ハーネスがリリースされている。
関連論文リスト
- mamabench and mamaretrieval: Benchmarks for Evaluating Medical Retrieval-Augmented Generation in Maternal, Neonatal, and Reproductive Health [9.0025190634417]
mombenchは、既存の7つの専門家ライセンスのソースから集められた25,949のアイテムからなるスコープフィルタリングされたQAセットである。
臨床検査では, 63,650チョンクの母体保健ガイドラインコーパスを用いて, グレード (0-6) の関連ラベルを用いた3,185の検索を行った。
論文 参考訳(メタデータ) (2026-06-28T15:51:53Z) - PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answering [12.717987334814692]
バイオメディカルQA剤PubMed Reasonerについて紹介する。
自己批判的なクエリ改善は、PubMedクエリを強化するために、カバレッジ、アライメント、冗長性に関するMeSH用語を評価する。
十分な証拠が収集されるまで 記事はバッチで処理される
Evidence-grounded response generation(英語版)は明示的な引用を伴う回答を生成する。
論文 参考訳(メタデータ) (2026-03-28T16:41:57Z) - Developing and evaluating a chatbot to support maternal health care [20.297280325309924]
本稿では,インドにおける母体保健ロボットについて,学術研究者,医療技術企業,公衆衛生非営利団体,病院との共同研究を通じて紹介する。
本システムは,(1)ステージアウェアトリアージ,(2)専門家テンプレートへのハイリスククエリのルーティング,(2)母子・新生児ガイドラインのハイブリッド検索,(3)LCMからのエビデンス条件付き生成を組み合わせた。
当社のコアコントリビューションは、専門家の限られた監督の下での、ハイテイクデプロイメントの評価ワークフローです。
論文 参考訳(メタデータ) (2026-03-13T17:02:05Z) - MedForget: Hierarchy-Aware Multimodal Unlearning Testbed for Medical AI [66.0701326117134]
MedForgetは、階層型を意識したマルチモーダルなアンラーニングテストベッドで、準拠する医療AIシステムを構築する。
既存の手法は,診断性能を低下させることなく,完全かつ階層性に配慮した忘れの解決に苦慮していることを示す。
階層レベルのコンテキストをプロンプトに徐々に追加する再構成攻撃を導入する。
論文 参考訳(メタデータ) (2025-12-10T17:55:06Z) - MedTrust-RAG: Evidence Verification and Trust Alignment for Biomedical Question Answering [21.855579328680246]
MedTrust-Guided Iterative RAGは,医療用QAにおける事実整合性と幻覚を高めるためのフレームワークである。
第一に、検索された医療文書に、すべての生成されたコンテンツを明示的に根拠付けることを要求することにより、引用認識推論を強制する。
第2に、検証エージェントが証拠の妥当性を評価する反復的な検索検証プロセスを採用する。
論文 参考訳(メタデータ) (2025-10-16T07:59:11Z) - From RAG to Agentic: Validating Islamic-Medicine Responses with LLM Agents [5.391445566482165]
アヴィチェンナの『医学のカノン』や預言的な『ティブ・エ・ナバウィ』のようなイスラム教のテキストは、予防医療、栄養、全体療法の富を符号化している。
既存の言語モデルベンチマークでは、事実のリコールやユーザの好みに焦点が当てられている。
そこで我々は,30個の予言・医学的質問を人為的な治療と一致させる統合評価パイプラインTibbe-AGを提案する。
論文 参考訳(メタデータ) (2025-06-18T23:14:35Z) - LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation [58.25892575437433]
医学における大規模言語モデル (LLMs) の評価は, 医療応用には精度が高く, 誤差の少ないため重要である。
LLMEval-Medは、5つの中核医療領域をカバーする新しいベンチマークであり、現実の電子健康記録から得られた2,996の質問と専門家が設計した臨床シナリオを含む。
論文 参考訳(メタデータ) (2025-06-04T15:43:14Z) - "Knowing When You Don't Know": A Multilingual Relevance Assessment Dataset for Robust Retrieval-Augmented Generation [90.09260023184932]
Retrieval-Augmented Generation (RAG) は、外部の知識源を活用して、事実の幻覚を減らすことで、Large Language Model (LLM) を出力する。
NoMIRACLは18言語にまたがるRAGにおけるLDM堅牢性を評価するための人為的アノテーション付きデータセットである。
本研究は,<i>Halucination rate</i>,<i>Halucination rate</i>,<i>Halucination rate</i>,<i>Sorucination rate</i>,<i>Sorucination rate</i>,<i>Sorucination rate</i>,<i>Sorucination rate</i>,<i>Sorucination rate</i>,<i>Sorucination rate</i>,<i>Sr。
論文 参考訳(メタデータ) (2023-12-18T17:18:04Z) - MedAlign: A Clinician-Generated Dataset for Instruction Following with
Electronic Medical Records [60.35217378132709]
大型言語モデル(LLM)は、人間レベルの流布で自然言語の指示に従うことができる。
医療のための現実的なテキスト生成タスクにおけるLCMの評価は依然として困難である。
我々は、EHRデータのための983の自然言語命令のベンチマークデータセットであるMedAlignを紹介する。
論文 参考訳(メタデータ) (2023-08-27T12:24:39Z) - Medical Question Understanding and Answering with Knowledge Grounding
and Semantic Self-Supervision [53.692793122749414]
本稿では,知識基盤とセマンティック・セルフスーパービジョンを備えた医療質問理解・回答システムについて紹介する。
我々のシステムは、まず、教師付き要約損失を用いて、長い医学的、ユーザによる質問を要約するパイプラインである。
システムはまず、信頼された医療知識ベースから要約されたユーザ質問とFAQとをマッチングし、対応する回答文書から一定の数の関連文を検索する。
論文 参考訳(メタデータ) (2022-09-30T08:20:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。