論文の概要: Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support
- arxiv url: http://arxiv.org/abs/2607.28677v1
- Date: Wed, 29 Jul 2026 07:12:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.365135
- Title: Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support
- Title(参考訳): 実際の臨床医療における推論 : 大規模言語モデルが自律的な臨床診断支援に必ずしも安全でない理由
- Abstract要約: このパースペクティブは、これらのアプリケーションの中で最も重要であり、自己表現的、未分化な患者の自律的なトリアージである。
最も予測可能なテキストを継続するように最適化されたモデルは、安全回答が不可能な必然性診断である場合に安全に動作するように最適化されていない。
したがって、中核的な欠陥は不確実性の下で収集される情報の1つである。
- 参考スコア(独自算出の注目度): 1.4678996144709464
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM now pass medical licensing examinations and, in curated cases, can rival physicians at diagnostic reasoning. These developments have accelerated the use of LLMs for symptom assessment and clinical decision support in diagnostic and treatment guidance, administrative documentation, and rules-based alert enhancement. This Perspective concerns the most consequential of these applications: the autonomous triage of self-presenting, undifferentiated patients, with little or no clinician in the loop. For that task, the evidence of safety does not yet exist. The gap is not in medical knowledge but in the fidelity of clinical evaluation: a model optimized to continue the most probable text is not optimized to act safely when the safe answer is the improbable must-not-miss diagnosis. Safe triage is not the selection of the most likely diagnosis; it is a sequential decision under asymmetric cost, in which the single catastrophic miss outweighs many false alarms, and the decisive signal may be one the patient has not volunteered - and that the model has not been trained to seek. The core deficit is therefore one of information gathering under uncertainty. Under incomplete histories, LLM systems may fail to show the behaviors safe triage requires: broadening the differential; seeking the missing red flag; lowering the threshold for escalation; deferring judgement until sufficient information is obtained; and escalating concern where high-harm diagnoses remain unexcluded. These modes of failure for LLMs can be difficult to detect considering that evaluations to date often use complete, well-curated, confidence-gated simulations. The application of LLMs under these conditions may be amplified by assistant-like behaviors and positive bias, including credulity, agreeableness, and miscalibration - when these are not constrained by clinical triage logic.
- Abstract(参考訳): LLMは現在、医療ライセンス試験に合格し、治療を受けた場合、診断上の理由付けで医師と競合する可能性がある。
これらの発展は、診断・治療指導、管理文書、および規則に基づくアラート強化における、症状評価および臨床診断支援のためのLCMの使用を加速させてきた。
このパースペクティブは、これらの応用の中で最も重要であり、自己表現型、無分化型患者の自律的トリアージであり、ループにはほとんど、あるいは全く臨床医がいない。
そのため、安全の証拠は現存していない。
このギャップは、医学的知識ではなく、臨床評価の忠実さにある:最も可能性の高いテキストを継続するために最適化されたモデルは、安全回答が不適切な必然診断である場合に安全に行動するように最適化されない。
安全なトリアージは、最も可能性の高い診断の選択ではなく、非対称なコストの下でのシーケンシャルな決定であり、単一の破滅的なミスは、多くの誤報を上回るものであり、決定的なシグナルは、患者がボランティアしていないものかもしれない。
したがって、中核的な欠陥は不確実性の下で収集される情報の1つである。
不完全な歴史の下では、LLMシステムは安全なトリアージの振る舞いを示すのに失敗する可能性がある: ディファレンシャルを広げ、赤旗を欠くこと、エスカレーションのしきい値を下げること、十分な情報が得られるまで判断を遅らせること、ハイハーム診断が未定義であるという懸念をエスカレーションすること。
LLMのこれらの障害モードは、評価が完全で正確で信頼性の高いシミュレーションを使用する場合が多いことを考慮し、検出することが困難である。
これらの条件下でのLSMの応用は、補助的行動や正のバイアスによって増幅されうる。
関連論文リスト
- When Confidence Fails: Overconfidence in LLMs under Uncertainty and Missing Clinical Information [14.659028787864996]
大規模言語モデル (LLM) は, 医療質問応答や臨床推論タスクにおいて, 高い性能を達成している。
臨床情報の不確実性を考慮したLCMの行動解析を行った。
正解が得られない場合に、モデル間で大きな変動を観測する。
論文 参考訳(メタデータ) (2026-08-10T03:28:46Z) - Possible or Definite? A Benchmark for Evaluating Diagnostic Uncertainty Preservation in Clinical Text [0.28037951156321367]
大きな言語モデル(LLM)は、要約やリビジョンといった臨床テキストタスクにますます使われている。
臨床実践では、肺炎の可能性のようなフレーズは、利用可能な証拠の強さを伝達する。
これらの不確実性表現を変えることは、臨床的意味を完全に変えることができる。
論文 参考訳(メタデータ) (2026-06-16T20:30:53Z) - When Large Language Models Fail in Healthcare: Evaluating Sensitivity to Prompt Variations [1.0152838128195467]
大規模言語モデル (LLMs) は、臨床質問応答、診断支援、報告要約などのタスクのために医療でますます使われている。
彼らの約束にもかかわらず、これらのモデルは語彙的および構文的両方の微妙な急激な摂動に対して非常に敏感であり、安全クリティカルな臨床応用に重大なリスクをもたらす。
摂動を自然型, 逆型に分類し, モデル整合性, 精度, 信頼性に及ぼす効果について検討した。
論文 参考訳(メタデータ) (2026-06-05T13:07:11Z) - Medical Model Synthesis Architectures: A Case Study [72.46211022258122]
現在のAIシステムは、不確実性の下で調整された推論に苦労している。
我々は,不確実性の下で,現実的に有用だが公式に透過的な臨床予測を行うことができるAIシステムのためのフレームワークを提案する。
このフレームワークの最初の概念実証は、どのようにして差分診断に利用できるかを示す。
論文 参考訳(メタデータ) (2026-05-10T19:30:16Z) - Ask Before You Diagnose: Safe-Psych, a Sequential Evaluation Benchmark for LLMs in Psychiatry [2.60905622443275]
大規模言語モデル(LLM)は、医療における意思決定支援にますます利用されている。
臨床証拠はしばしば不完全または進化している。
LLMが進化する診断の不確実性にどう対処するかを評価するためのベンチマークであるSafe-Psychを紹介する。
論文 参考訳(メタデータ) (2026-05-06T08:52:45Z) - CURA: Clinical Uncertainty Risk Alignment for Language Model-Based Risk Prediction [10.129412789850239]
本稿では,臨床用LMに基づくリスク推定と,個々のエラー確率とコホートレベルのあいまいさを一致させる枠組みを提案する。
MIMIC-IV 臨床リスク予測タスクの実験では、CURA は差別を実質的に損なうことなくキャリブレーションの指標を一貫して改善している。
論文 参考訳(メタデータ) (2026-04-16T05:58:37Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - ClinDet-Bench: Beyond Abstention, Evaluating Judgment Determinability of LLMs in Clinical Decision-Making [38.53727520114093]
不完全な情報の下で決定可能性を評価するベンチマークであるClinDet-Benchを開発した。
近年の大規模言語モデル (LLM) は不完全情報に基づく決定可能性の同定に失敗している。
論文 参考訳(メタデータ) (2026-02-26T09:03:41Z) - Timely Clinical Diagnosis through Active Test Selection [49.091903570068155]
本稿では,現実の診断推論をよりうまくエミュレートするためのACTMED (Adaptive Clinical Test selection via Model-based Experimental Design)を提案する。
LLMは柔軟なシミュレータとして機能し、構造化されたタスク固有のトレーニングデータを必要とせずに、患者状態のもっともらしい分布を生成し、信念の更新をサポートする。
我々は、実世界のデータセット上でACTMEDを評価し、診断精度、解釈可能性、リソース使用量を改善するためにテスト選択を最適化できることを示す。
論文 参考訳(メタデータ) (2025-10-21T18:10:45Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z) - Uncertainty-Based Abstention in LLMs Improves Safety and Reduces Hallucinations [63.330182403615886]
大きな言語モデル(LLM)の実践的デプロイに対する大きな障壁は、信頼性の欠如である。
このことが特に顕著な3つの状況は、正しさ、未解決の質問に対する幻覚、安全性である。
人間のように、不確実性を理解する能力があるため、私たちが知らない質問への答えを控えるべきです。
論文 参考訳(メタデータ) (2024-04-16T23:56:38Z) - Towards Causality-Aware Inferring: A Sequential Discriminative Approach
for Medical Diagnosis [142.90770786804507]
医学診断アシスタント(MDA)は、疾患を識別するための症状を逐次調査する対話型診断エージェントを構築することを目的としている。
この研究は、因果図を利用して、MDAにおけるこれらの重要な問題に対処しようとする。
本稿では,他の記録から知識を引き出すことにより,非記録的調査に効果的に答える確率に基づく患者シミュレータを提案する。
論文 参考訳(メタデータ) (2020-03-14T02:05:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。