論文の概要: Auditable Emergency Triage for Maternal and Newborn Care in India
- arxiv url: http://arxiv.org/abs/2609.09356v1
- Date: Tue, 08 Sep 2026 18:45:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.788733
- Title: Auditable Emergency Triage for Maternal and Newborn Care in India
- Title(参考訳): インドにおける母系・新生児ケアの緊急トライアージ
- Abstract要約: Noora Healthの看護師は、WhatsAppベースのサービスで毎月5万件以上の医療クエリに回答する。
それらをサポートするために,大規模言語モデル(LLM)を用いてメッセージが緊急であるかどうかを分類するシステムを構築した。
0.565から0.810へ、F1は0.606から0.702へリコールされた。
- 参考スコア(独自算出の注目度): 1.121169121023536
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: At Noora Health, our nurses answer more than 50,000 medical queries per month on our WhatsApp-based service that provides caregivers with on-demand support. Their most time-critical task is emergency triage: deciding which queries need immediate in-person attention. To support them, we built a system that uses a large language model (LLM) to classify whether a message is an emergency and provide a rationale for interpretability. But the system was opaque: analyzing mistakes meant reading reasoning chains for each message, which is infeasible at our scale. Prompt changes meant re-running a full evaluation to prevent regressions, which was both costly and operationally challenging. Clinicians follow a decision tree to make this call, but it was never documented or passed to the model, which relied on a flat list of danger signs. To address these issues, we decomposed triage into two steps: an LLM extracts canonical symptoms and patient context from the query using a clinician-authored vocabulary, and a deterministic rule engine captures the scenarios that indicate an emergency. We show that the new system raised recall from 0.565 to 0.810 and F1 from 0.606 to 0.702, with structured rules driving most of the accuracy gains while the decomposition provides auditability: clinical experts can inspect each stage of the new system to see whether the query was mistranslated, symptoms were incorrectly extracted, patient context was wrongly inferred, or the necessary rules were missing. They can add new rules independently without causing regressions and avoid running costly evaluations. Since deployment, the new system has triaged 152,421 patient queries and flagged 28,535 (18.7%) as emergencies. The over-escalation rate has been 17.8%, without any increase in missed emergencies. Clinicians have also added 48 new rules since deployment, evidence of the faster correction loop we set out to build.
- Abstract(参考訳): Noora Healthでは、介護者にオンデマンドサポートを提供するWhatsAppベースのサービスで、看護師が毎月5万件以上の医療クエリに回答します。
彼らの最も重要なタスクは緊急トリアージ(緊急トリアージ)である。
それらをサポートするために,大規模言語モデル(LLM)を用いて,メッセージが緊急かどうかを分類し,解釈可能性の根拠を提供するシステムを構築した。
しかし、このシステムは不透明で、ミスを分析することは、メッセージごとに推論チェーンを読み取ることを意味しており、これは我々の規模では不可能である。
急激な変更は、コストと運用上の両面で困難なレグレッションを防止するために、完全な評価を再実行することを意味した。
臨床医は、この電話を行うための決定木に従うが、危険標識のフラットリストに依存するモデルに記録されたり渡されたりはしなかった。
これらの問題に対処するため, LLMは, 臨床用語彙を用いた質問紙から標準症状と患者コンテキストを抽出し, 決定論的ルールエンジンは緊急時を示すシナリオをキャプチャする。
分析結果から,新たなシステムが0.565から0.810に,F1が0.606から0.702にリコールされ,構造化されたルールがほとんどの精度向上を推進し,分解性も高いことが判明した。
彼らは、レグレッションを引き起こすことなく、独立して新しいルールを追加でき、コストのかかる評価を避けることができる。
配備以来、新しいシステムは152,421人の患者クエリをトリガし、緊急時として28,535 (18.7%) をフラグ付けしている。
過度のエスカレーション率は17.8%であり、緊急の欠如は生じていない。
臨床医はデプロイ以来、48の新しいルールも追加しています。
関連論文リスト
- Beyond the Flag: Clinical Framing Closes the Moderation Gap in Suicide Risk Measurement [0.0]
臨床的に有意な重症度を回復するための安全信号の有効性について尋ねる。
4段階の順序スキーマ上で、ライセンスされた精神科医によって評価された516のr/Watchポストのベンチマークをリリースする。
我々は、二分旗ではなく、格付けされた重大さが、ケアの義務に比例するものであると主張している。
論文 参考訳(メタデータ) (2026-09-05T21:16:16Z) - Case2Flow: Bridging Patient Cases and Guideline Flowcharts through Multimodal Retrieval [65.99409194536337]
Case2Flowは、患者に対して最も関連性の高いガイドラインフローチャートを取得するために設計されたタスクである。
FlowAtlasは、2,080の医療ガイドラインから抽出された202のフローチャートのキュレートコーパスである。
CRISPは、非形式的パッチを抑えることで遅延相互作用検索を鋭くする訓練不要スコアリング手法である。
論文 参考訳(メタデータ) (2026-08-26T21:27:22Z) - Beyond Information Seeking: Severity-Aware Question Supervision for Proactive Medical Dialogue [3.62175729900672]
本稿では,重大度を意識した端末リスクの低減によって各候補を評価可能な,結果認識型質問紙(ESR)を提案する。
一致したESRの監督は、平均的な高重度診断ミスを.0645から.0455(-29.5%)に減らし、平均診断精度を.9123から.9320に改善し、対話毎に0.14の質問しか必要としないことを示した。
論文 参考訳(メタデータ) (2026-08-25T13:09:45Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B [0.0]
オープンウェイト医療言語モデルは、患者向けおよび臨床支援アプリケーションの基礎として、ますます利用されている。
MedGemma-4B-itの技術的洗練を必要としない攻撃におけるギャップを定量化する。
論文 参考訳(メタデータ) (2026-07-09T18:31:43Z) - Agentic AI-based Framework for Mitigating Premature Diagnostic Handoff and Silent Hallucination in Healthcare Applications [17.69274632062373]
オープンエンドの会話エージェントは、早期診断ハンドオフとサイレントな臨床幻覚という、2つの重要な障害モードを伴いがちである。
LLM-as-a-judge'のルーティングを決定論的オーケストレーション制約に置き換えることで、両方の問題に対処するマルチエージェントフレームワークを提案する。
本稿では,150症例を対象に,ラマ3.1-70b-インストラクトモデルを用いたシミュレートされた患者エージェントを用いたシステムの評価を行った。
論文 参考訳(メタデータ) (2026-06-16T15:39:19Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - From Conflict to Consensus: Boosting Medical Reasoning via Multi-Round Agentic RAG [65.0203623486525]
大規模言語モデル(LLM)は、医学的質問応答において高い推論能力を示す。
幻覚や時代遅れの知識を生み出す傾向は、医療分野において重大なリスクをもたらす。
既存の手法はノイズの多いトークンレベルの信号に依存しており、複雑な推論に必要なマルチラウンドの改良は欠如している。
論文 参考訳(メタデータ) (2026-02-06T08:25:30Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - A Locally Executable AI System for Improving Preoperative Patient Communication: A Multi-Domain Clinical Evaluation [1.9205944025326396]
LENOHAは、入力を高精度な文変換器の制約でルーティングする安全第一のローカルファーストシステムである。
臨床問合せのために、クリニカルカレーションされたFAQから口頭で回答を返す。
エネルギー検定の結果,1回の入力で1.0 mWh,小語で168 mWhの応答で1回の応答で1.0 mWhを消費することがわかった。
論文 参考訳(メタデータ) (2025-10-02T04:53:11Z) - Transforming unstructured voice and text data into insight for paramedic
emergency service using recurrent and convolutional neural networks [68.8204255655161]
救急隊員は救急車内で限られた時間内に救命判断をしなければならないことが多い。
本研究の目的は、音声とテキストデータを自動的に融合して、救急隊員に適切な状況認識情報を提供することである。
論文 参考訳(メタデータ) (2020-05-30T06:47:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。