論文の概要: Unknown is not normal: separating language-model extraction from rule-based decision logic for clinical risk scores
- arxiv url: http://arxiv.org/abs/2609.34112v1
- Date: Mon, 28 Sep 2026 01:48:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-04 06:55:38.138978
- Title: Unknown is not normal: separating language-model extraction from rule-based decision logic for clinical risk scores
- Title(参考訳): 正常ではない:臨床リスクスコアのためのルールに基づく決定論理から言語モデル抽出を分離する
- Abstract要約: 大規模言語モデル(LLM)は、フリーテキストノートから臨床リスクスコアを計算するために、ますます使われてきている。
決定論理から三状態抽出を分離することで、システムは決定を変えることができる質問のみを問うことができるかどうかを検証する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly used to compute clinical risk scores from free-text notes. Notes are often incomplete, and treating undocumented findings as normal can silently misclassify patients. We test whether separating three-state extraction (present, absent or unknown, by an LLM) from decision logic (deterministic code computing score bounds over unknown inputs) lets a system ask only questions that can change the decision. On 1,200 synthetic emergency cases across six calculators (HEART, CURB-65, qSOFA, PERC, Wells, Cockcroft-Gault), with a simulated clinician answering questions, we compared this bounds policy with asking for every missing input, a missing-equals-normal schema, and an end-to-end LLM agent (Claude Opus 5.5). With Claude Haiku 4.5 as extractor, the bounds policy matched ask-all accuracy (99.4% vs 99.4%) with half the questions (0.92 vs 1.78 per case) and no irrelevant ones. Treating missing as normal dropped accuracy to 91.2% and under-triaged 8.5% of patients (95% CI 7.1-10.2), and under-triage persisted under messy notes and a noisy clinician. The agent was equally accurate under ideal conditions (99.6%) but 9.5% of its questions were irrelevant; with a noisy clinician it was less accurate than the bounds policy (83.5% vs 87.0%, p<0.001) and committed prematurely in 2.7% of cases (bounds: 0%). A 9B local model as extractor reached oracle-level accuracy (99.8%). In 584 real case reports from MedCalc-Bench, only 52% contained enough information to determine the category (HEART 13%). Routing decisions through code that reasons explicitly about unknowns avoids premature commitment and irrelevant questions, halves the questions asked, and works with small local models.
- Abstract(参考訳): 大規模言語モデル(LLM)は、フリーテキストノートから臨床リスクスコアを計算するために、ますます使われてきている。
注記はしばしば不完全であり、文書化されていない所見を正常に患者を誤分類する可能性があるとして扱う。
決定論理(決定論的符号計算のスコアは未知の入力に制限される)から三状態抽出(現在、不在または未知)を分離することで、決定を変更できる質問のみをシステムに問うことができるかどうかを検証する。
6つの電卓(HEART, CURB-65, qSOFA, PERC, Wells, Cockcroft-Gault)の1200件の総合緊急ケースに対して, 模擬臨床回答質問を行った。
クロード・ハイク4.5が抽出者となり、バウンドポリシーは全ての質問の正確さ(99.4%対99.4%)に一致し、質問の半分(0.92対1.78対1.78)と無関係なものは含まれなかった。
正常な治療は91.2%に低下し、患者の8.5%(95% CI 7.1-10.2)が治療を受けなかった。
理想的な条件(99.6%)下でも同様に正確であったが、9.5%の質問は無関係であり、ノイズのある臨床医では境界政策(83.5%対87.0%、p<0.001)よりも正確ではなく、2.7%のケース(境界:0%)で早期に実行された。
抽出器としての9B局所モデルはオラクルレベルの精度(99.8%)に達した。
584年のMedCalc-Benchによる実例報告では、カテゴリーを決定するのに十分な情報は52%しかなかった(HEART 13%)。
未知を明示的に理由づけるコードを通じて決定をルーティングすることは、早急なコミットメントや無関係な質問を避け、質問を半減させ、小さなローカルモデルで作業する。
関連論文リスト
- Benchmarking Open-Source Speech Emotion Recognition in Naturalistic Mandarin Spine Clinic Consultations: A Pilot Validation Study [5.110846032142439]
音声感情認識(SER)は、臨床診断における受動的影響モニタリングを可能にする。
我々は,3つのオープンソースSERモデルを,自然主義的スピン・クリニック音声における研究者合意基準と比較した。
高いインターモデル(90.8%)にもかかわらず、全てのモデルはサッド、フィア、アンガー、ニュートラル、サプライズドをほぼゼロにリコールした。
論文 参考訳(メタデータ) (2026-08-24T13:36:23Z) - RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning [42.80742579670377]
RareLensは、まれな疾患の軌跡全体にわたる臨床的意思決定を支援するシステムである。
RareBenchは、33のOrphanetカテゴリと7000以上の条件にまたがる157,525件の実際のデータセットである。
検診で0.917、診断と治療で65.5%、89.8%の成績を収めた。
論文 参考訳(メタデータ) (2026-07-25T16:58:10Z) - Bayesian uncertainty estimation improves clinical decision making in medical AI agents [3.251669068529209]
モンテカルロのドロップアウトは、トレーニングセットのスケールをまたいだ一般化を追跡できる不確実な信号であり、信頼できながらエラーを起こしやすい予測を示す。
コントロールされた2x2因子分析実験において、臨床判定支援剤は、生のスコアではなくバイナリエラーリスクフラグとして配信された場合にのみ、この不確実性を利用した。
論文 参考訳(メタデータ) (2026-07-22T11:54:23Z) - Measuring Epistemic Resilience of LLMs Under Misleading Medical Context [47.20527783144983]
大規模言語モデル(LLMs)は、医療ライセンス試験のエキスパートレベルスコアに到達した。
誤解を招く文脈が LLM が元来正しく答える質問に注入されると、彼らは正しい答えを放棄する。
本研究は, 逆行性てんかんのレジリエンス下での正しい判断を維持できる能力と, 測定にMedMisBenchを導入している。
論文 参考訳(メタデータ) (2026-06-10T16:27:26Z) - Automating Clinical Information Retrieval from Finnish Electronic Health Records Using Large Language Models [0.0]
ローカルにデプロイ可能なフレームワークは、外部データ転送なしでEHRから直接臨床質問に答える。
オープンソースの大規模言語モデル(LLM)は、4Bから70Bまでのパラメータを完全にオフラインでベンチマークした。
論文 参考訳(メタデータ) (2026-03-27T14:03:51Z) - From Days to Minutes: An Autonomous AI Agent Achieves Reliable Clinical Triage in Remote Patient Monitoring [2.0918370570198763]
遠隔患者モニタリング(RPM)は膨大なデータを生成するが、データ量が臨床スタッフを圧倒したため、目覚ましい臨床試験(Tele-HF, BEAT-HF)は失敗した。
RPMバイタルのコンテキストトリアージにモデルコンテキストプロトコル(MCP)を用いた自律型AIエージェントSentinelを開発した。
論文 参考訳(メタデータ) (2026-03-10T00:50:54Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - Explainable Admission-Level Predictive Modeling for Prolonged Hospital Stay in Elderly Populations: Challenges in Low- and Middle-Income Countries [65.4286079244589]
長期滞在期間 (pLoS) は, 院内感染のリスクに関連する重要な要因である。
入院レベルの患者と病院の診療データを用いて, pLosの予測モデルを開発し, 解説する。
論文 参考訳(メタデータ) (2026-01-07T23:35:24Z) - Automated Quantification of CT Patterns Associated with COVID-19 from
Chest CT [48.785596536318884]
提案法は,非造影胸部CTを入力として,病変,肺,葉を3次元に分割する。
この方法では、肺の重症度と葉の関与度を2つの組み合わせて測定し、COVID-19の異常度と高不透明度の存在度を定量化する。
このアルゴリズムの評価は、カナダ、ヨーロッパ、米国からの200人の参加者(感染者100人、健康管理100人)のCTで報告されている。
論文 参考訳(メタデータ) (2020-04-02T21:49:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。