論文の概要: When Confidence Fails: Overconfidence in LLMs under Uncertainty and Missing Clinical Information
- arxiv url: http://arxiv.org/abs/2608.09080v1
- Date: Mon, 10 Aug 2026 03:28:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.068343
- Title: When Confidence Fails: Overconfidence in LLMs under Uncertainty and Missing Clinical Information
- Title(参考訳): 信頼が失われる時:不確かさと臨床情報の欠如によるLCMの過信
- Abstract要約: 大規模言語モデル (LLM) は, 医療質問応答や臨床推論タスクにおいて, 高い性能を達成している。
臨床情報の不確実性を考慮したLCMの行動解析を行った。
正解が得られない場合に、モデル間で大きな変動を観測する。
- 参考スコア(独自算出の注目度): 14.659028787864996
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) have achieved strong performance in medical question answering and clinical reasoning tasks. However, their reliability under uncertainty remains poorly understood which raises critical concerns for deployment in high-stakes clinical settings. In such environments, incorrect predictions are inherently risky, but confident incorrect predictions can be particularly harmful as they may mislead clinical decision-making. In this paper, we conduct a systematic behavioral analysis of LLMs under clinical information uncertainty. We propose an evaluation framework based on the MedMCQA dataset consisting of two complementary uncertainty settings. First, we introduce linguistic uncertainty cues through prompt modifications to simulate ambiguous clinical contexts. Second, we construct an answer removal setting, wherein the correct option is deliberately excluded mandating the model to recognize insufficient information and abstain. We analyze both model accuracy and confidence behavior using multiple calibration metrics including calibration gap, Expected Calibration Error (ECE), and Unsafe Confident Error Rate (UCER) across 500 medical questions. Our results reveal a consistent failure mode, i.e., although accuracy degrades under increasing uncertainty, model confidence remains misaligned with accuracy. This leads to a substantial increase in unsafe confident errors, indicating that model confidence remains largely insensitive to clinically meaningful information loss. Furthermore, we observe significant variation across models in their ability to abstain when the correct answer is unavailable, with some models persistently producing high confidence hallucinated answers. These findings expose critical limitations in the epistemic reliability of current LLMs and highlight the need for uncertainty aware evaluation methods prior to their deployment in clinical workflows.
- Abstract(参考訳): 大規模言語モデル (LLM) は, 医療質問応答や臨床推論タスクにおいて, 高い性能を達成している。
しかし、不確実性下での信頼性はいまだによく理解されていないため、高度臨床環境での展開に重大な懸念が生じる。
このような環境では、誤予測は本質的に危険であるが、確実な誤予測は、臨床的意思決定を誤解させる可能性があるため、特に有害である。
本稿では,臨床情報の不確実性を考慮したLCMの系統的行動解析を行う。
2つの相補的不確実性設定からなるMedMCQAデータセットに基づく評価フレームワークを提案する。
まず,不明瞭な臨床背景をシミュレートする素早い修正による言語不確実性手法を提案する。
第2に、適切な選択肢を意図的に排除して、不十分な情報を認識し、不在を宣言する回答除去設定を構築する。
キャリブレーションギャップ, 期待校正誤差 (ECE) , 安全信頼度 (UCER) を含む複数の校正指標を用いて, モデルの精度と信頼性の両面を分析した。
以上の結果から,不確実性の増加に伴って精度が低下するが,モデルの信頼性は精度と不一致であることが明らかとなった。
これにより、安全でない確実なエラーが大幅に増加し、モデル信頼度が臨床的に意味のある情報損失に対してほとんど無関心であることが示される。
さらに, 正解が得られない場合の回避能力において, モデル間の有意な変動を観測し, 高信頼度幻覚応答を持続的に生成するモデルも見いだした。
これらの知見は, 臨床ワークフローに展開する前の不確実性評価法の必要性を浮き彫りにした。
関連論文リスト
- Uncertainty Is Not a Safety Net for Clinical VQA, but Can It Anticipate Model Failure? [33.91781729231922]
臨床視覚質問応答(VQA)における視覚言語モデル(VLM)の8つの手法をベンチマークした。
UEの品質はUE法の本質的な特性ではなく,モデルの精度を正確に追跡し,モデル性能の弱点を正確に判定する。
その結果,UEは脆弱な予測を識別し,摂動に基づく評価を安全な臨床展開への道として動機付けるための診断ツールとして位置づけられた。
論文 参考訳(メタデータ) (2026-06-15T11:27:11Z) - Calibrated? Not for Everyone: How Sexual Orientation and Religious Markers Distort LLM Accuracy and Confidence in Medical QA [5.307797621937223]
患者の社会的記述子は不確実性信号とモデル精度を歪めます。
ホモセクシャル」マーカーは、常にパフォーマンス低下を誘発し、交叉のアイデンティティは、校正に対する慣用的かつ非付加的な害を生み出す。
論文 参考訳(メタデータ) (2026-04-19T08:11:45Z) - CURA: Clinical Uncertainty Risk Alignment for Language Model-Based Risk Prediction [10.129412789850239]
本稿では,臨床用LMに基づくリスク推定と,個々のエラー確率とコホートレベルのあいまいさを一致させる枠組みを提案する。
MIMIC-IV 臨床リスク予測タスクの実験では、CURA は差別を実質的に損なうことなくキャリブレーションの指標を一貫して改善している。
論文 参考訳(メタデータ) (2026-04-16T05:58:37Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - Calibrated Bayesian Deep Learning for Explainable Decision Support Systems Based on Medical Imaging [6.826979426009301]
モデルが予測精度と相関する方法で不確実性を定量化し、臨床医がさらなるレビューのために信頼できないアウトプットを特定できることが不可欠である。
本稿では,ベイズ深層学習に基づく一般化可能な確率的最適化フレームワークを提案する。
特に、信頼性・不確実性境界損失(CUB-Loss)が新しく導入され、高い精度の誤差と低い精度の正確な予測に罰則が課せられる。
提案手法は, 肺炎の自動スクリーニング, 糖尿病性網膜症検出, 皮膚病変の同定という, 3つの異なる医用画像処理課題に対して検証された。
論文 参考訳(メタデータ) (2026-02-12T14:03:41Z) - Calibration Is Not Enough: Evaluating Confidence Estimation Under Language Variations [49.84786015324238]
信頼度推定(CE)は、大きな言語モデル(LLM)の回答がどれほど信頼性が高いかを示し、ユーザの信頼と意思決定に影響を与える可能性がある。
本稿では,CEの信頼性を3つの新しい側面で評価する総合評価フレームワークを提案する。
これには、急激な摂動に対する自信の堅牢性、意味論的に等価な答えに対する安定性、意味論的に異なる答えに対する感受性が含まれる。
論文 参考訳(メタデータ) (2026-01-12T23:16:50Z) - MedBayes-Lite: Bayesian Uncertainty Quantification for Safe Clinical Decision Support [5.22077647816926]
MedBayes-Liteはトランスフォーマーに基づく臨床言語モデルのための軽量ベイズ拡張である。
MedBayes-Liteは、リトレーニングやアーキテクチャの変更なしに、既存のトランスフォーマーパイプラインに直接不確実な定量化を組み込む。
キャリブレーションと信頼性を継続的に改善し、自信過剰を32%から48%減らす。
論文 参考訳(メタデータ) (2025-11-20T18:33:12Z) - Towards Reliable LLM-based Robot Planning via Combined Uncertainty Estimation [68.106428321492]
大規模言語モデル (LLM) は高度な推論能力を示し、ロボットが自然言語の命令を理解し、適切な接地で高レベルな計画を生成することができる。
LLMの幻覚は重大な課題であり、しばしば過度に信頼され、不一致または安全でない計画に繋がる。
本研究は, 信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性評価を別々に評価するものである。
論文 参考訳(メタデータ) (2025-10-09T10:26:58Z) - Probabilistic Modeling of Disparity Uncertainty for Robust and Efficient Stereo Matching [61.73532883992135]
本稿では,新しい不確実性を考慮したステレオマッチングフレームワークを提案する。
我々はベイズリスクを不確実性の測定として採用し、データを別々に見積もり、不確実性をモデル化する。
論文 参考訳(メタデータ) (2024-12-24T23:28:20Z) - Uncertainty-Based Abstention in LLMs Improves Safety and Reduces Hallucinations [63.330182403615886]
大きな言語モデル(LLM)の実践的デプロイに対する大きな障壁は、信頼性の欠如である。
このことが特に顕著な3つの状況は、正しさ、未解決の質問に対する幻覚、安全性である。
人間のように、不確実性を理解する能力があるため、私たちが知らない質問への答えを控えるべきです。
論文 参考訳(メタデータ) (2024-04-16T23:56:38Z) - Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling [69.83976050879318]
大規模言語モデル(LLM)では、不確実性の原因を特定することが、信頼性、信頼性、解釈可能性を改善するための重要なステップである。
本稿では,LLMのための不確実性分解フレームワークについて述べる。
提案手法は,入力に対する一連の明確化を生成し,それらをLLMに入力し,対応する予測をアンサンブルする。
論文 参考訳(メタデータ) (2023-11-15T05:58:35Z) - Towards Reliable Medical Image Segmentation by Modeling Evidential Calibrated Uncertainty [57.023423137202485]
医用画像のセグメンテーションの信頼性に関する懸念が臨床医の間で続いている。
本稿では,医療画像セグメンテーションネットワークにシームレスに統合可能な,実装が容易な基礎モデルであるDEviSを紹介する。
主観的論理理論を活用することで、医用画像分割の確率と不確実性を明示的にモデル化する。
論文 参考訳(メタデータ) (2023-01-01T05:02:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。