論文の概要: Decide, Ask, or Defer: Clinical LLMs under Incomplete Evidence
- arxiv url: http://arxiv.org/abs/2610.04542v2
- Date: Tue, 06 Oct 2026 23:26:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.373206
- Title: Decide, Ask, or Defer: Clinical LLMs under Incomplete Evidence
- Title(参考訳): 決定, 質問, 決定: 不完全証拠下における臨床LCM
- Abstract要約: 本稿では,DeCIDE/ASK/DEFERの定式化とブラインドプロトコルを導入することにより,モデルがエビデンス完全性メタデータを使用するのを防ぐ。
DDXPlusを用いて構築した200種類の臨床検査結果からQwen,Gemini,GPTの評価を行った。
- 参考スコア(独自算出の注目度): 1.9103545857576274
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Clinical LLMs must decide not only what diagnosis to produce, but also whether the available evidence is sufficient for autonomous decision making. Binary DECIDE/ABSTAIN formulations merge distinct non decision states and do not explicitly evaluate information acquisition. We introduce a DECIDE/ASK/DEFER formulation together with a blinded protocol that prevents models from using evidence completeness metadata. We evaluate Qwen, Gemini, and GPT on 200 matched clinical evidence states constructed from DDXPlus. The models show substantial differences in action selection under identical evidence, with disagreement in 137 of 200 states. For Qwen, a matched targeted versus random analysis shows that selected information changes the likelihood of a subsequent autonomous decision more clearly than diagnostic correctness. Its matched DECIDE/ABSTAIN baseline further reveals a safety autonomy tradeoff: the three action policy rescues some erroneous autonomous decisions but also removes some correct autonomous deci sions. These results show that separating information acquisition from clinician deferral exposes behavior that binary abstention hides, without yielding a uniformly improved decision policy.
- Abstract(参考訳): 臨床LSMは、どの診断を行うかだけでなく、利用可能な証拠が自律的な意思決定に十分かどうかも判断しなければならない。
バイナリ DECIDE/ABSTAIN の定式化は、異なる非決定状態をマージし、情報取得を明示的に評価しない。
本稿では,DeCIDE/ASK/DEFERの定式化とブラインドプロトコルを導入することにより,モデルがエビデンス完全性メタデータを使用するのを防ぐ。
DDXPlusを用いて構築した200種類の臨床検査結果からQwen,Gemini,GPTの評価を行った。
これらのモデルでは、200州中137州で意見の相違がみられ、同一の証拠の下での行動選択の実質的な違いが示されている。
Qwen氏にとって、一致したターゲット対ランダム分析は、選択された情報が、診断の正しさよりも、その後の自律的な決定の可能性がより明確に変化することを示している。
DECIDE/ABSTAINベースラインにマッチしたこの3つのアクションポリシーは、いくつかの誤った自律的な決定を救いますが、正しい自律的な決定権も取り除きます。
これらの結果から,臨床分離からの情報取得を分離すると,一様に改善された意思決定方針が得られず,二項禁忌が隠蔽する行動が明らかとなる。
関連論文リスト
- ClinEnv: An Interactive Multi-Stage Long Horizon EHR Environment for Agents [14.434996950038956]
ClinEnvは、決定論的グラウンドマッチングと、その情報収集方法を通じて、モデルが決定するものをスコア付けする。
ClinEnvは、結果のみの評価に見えない、直接測定可能な情報取得ギャップを作る。
論文 参考訳(メタデータ) (2026-06-01T17:56:26Z) - DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs [21.52456139726765]
ほとんどの医療AIベンチマークは、関連するコンテキストを事前に明らかにし、最終回答のみをスコア付けする。
MDX-TRACEはマルチモーダル・ニューロラジオロジーのための医師適応型ベンチマークである。
211件の難治性症例に対して、隠れた証拠の下で診断の軌跡を評価する。
論文 参考訳(メタデータ) (2026-05-22T13:41:10Z) - Medical Model Synthesis Architectures: A Case Study [72.46211022258122]
現在のAIシステムは、不確実性の下で調整された推論に苦労している。
我々は,不確実性の下で,現実的に有用だが公式に透過的な臨床予測を行うことができるAIシステムのためのフレームワークを提案する。
このフレームワークの最初の概念実証は、どのようにして差分診断に利用できるかを示す。
論文 参考訳(メタデータ) (2026-05-10T19:30:16Z) - Can Revealed Preferences Clarify LLM Alignment and Steering? [23.175180848107093]
LLMの観測した選択が最適化するインプリート嗜好を推定するための経験的パイプラインを提案する。
提案手法は,モデルが一貫したゴール指向の振る舞いをするかどうかの厳密な評価を可能にすることを示す。
論文 参考訳(メタデータ) (2026-05-08T23:26:35Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - AdURA-Net: Adaptive Uncertainty and Region-Aware Network [0.7771558179849474]
臨床的意思決定においては、モデルが確実な予測を強制されるべきではないため、不確実なラベルがトリッキーな役割を果たす。
本稿では,高信頼胸部疾患分類のための幾何駆動型適応不確実性認識フレームワークAdURA-Netを提案する。
論文 参考訳(メタデータ) (2026-02-27T08:56:24Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z) - MEDEQUALQA: Evaluating Biases in LLMs with Counterfactual Reasoning [7.167933033102407]
重篤な症状と症状を一定に保ちながら,患者代名詞のみを摂動する反ファクト・ベンチマークであるMEDEQUALQAを紹介する。
我々は、GPT-4.1モデルを評価し、代名詞の変種間の安定性を測定するために、推論トレース間のセマンティックテキスト類似性(STS)を計算する。
以上の結果から,総じて高い類似性(平均STS >0.80)を示した。
論文 参考訳(メタデータ) (2025-10-09T22:12:58Z) - Uncertainty-aware abstention in medical diagnosis based on medical texts [87.88110503208016]
本研究は,AI支援医療診断における信頼性の重要課題について論じる。
本研究は,診断に自信がなければ,診断システムによる意思決定の回避を可能にする選択予測手法に焦点をあてる。
我々は、選択予測タスクにおける信頼性を高めるための新しい最先端手法であるHUQ-2を紹介する。
論文 参考訳(メタデータ) (2025-02-25T10:15:21Z) - Towards Causality-Aware Inferring: A Sequential Discriminative Approach
for Medical Diagnosis [142.90770786804507]
医学診断アシスタント(MDA)は、疾患を識別するための症状を逐次調査する対話型診断エージェントを構築することを目的としている。
この研究は、因果図を利用して、MDAにおけるこれらの重要な問題に対処しようとする。
本稿では,他の記録から知識を引き出すことにより,非記録的調査に効果的に答える確率に基づく患者シミュレータを提案する。
論文 参考訳(メタデータ) (2020-03-14T02:05:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。