論文の概要: Deterministic Hallucination Detection in Medical VQA via Confidence-Evidence Bayesian Gain
- arxiv url: http://arxiv.org/abs/2603.21693v1
- Date: Mon, 23 Mar 2026 08:29:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.564988
- Title: Deterministic Hallucination Detection in Medical VQA via Confidence-Evidence Bayesian Gain
- Title(参考訳): 信頼-証拠ベイズゲインを用いた医療用VQAにおける決定論的幻覚検出
- Authors: Mohammad Asadi, Tahoura Nedaee, Jack W. O'Sullivan, Euan Ashley, Ehsan Adeli,
- Abstract要約: マルチモーダル大言語モデル(MLLM)は、医用視覚質問応答(VQA)の強力な可能性を示している。
それらは、入力画像に矛盾する反応を発生させ、臨床的な設定で重大なリスクを生じさせる、幻覚の傾向を保ち続ける。
セマンティック・エントロピー (SE) や視覚増幅セマンティック・エントロピー (VASE) のような現在の幻覚検出法は、セマンティック・クラスタリングのための外部自然言語推論モデルとともに1サンプルにつき10世代から20世代を必要とする。
サンプリングも外部モデルもタスクも不要な決定論的検出法を提案する。
- 参考スコア(独自算出の注目度): 6.272224314406867
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models (MLLMs) have shown strong potential for medical Visual Question Answering (VQA), yet they remain prone to hallucinations, defined as generating responses that contradict the input image, posing serious risks in clinical settings. Current hallucination detection methods, such as Semantic Entropy (SE) and Vision-Amplified Semantic Entropy (VASE), require 10 to 20 stochastic generations per sample together with an external natural language inference model for semantic clustering, making them computationally expensive and difficult to deploy in practice. We observe that hallucinated responses exhibit a distinctive signature directly in the model's own log-probabilities: inconsistent token-level confidence and weak sensitivity to visual evidence. Based on this observation, we propose Confidence-Evidence Bayesian Gain (CEBaG), a deterministic hallucination detection method that requires no stochastic sampling, no external models, and no task-specific hyperparameters. CEBaG combines two complementary signals: token-level predictive variance, which captures inconsistent confidence across response tokens, and evidence magnitude, which measures how much the image shifts per-token predictions relative to text-only inference. Evaluated across four medical MLLMs and three VQA benchmarks (16 experimental settings), CEBaG achieves the highest AUC in 13 of 16 settings and improves over VASE by 8 AUC points on average, while being fully deterministic and self-contained. The code will be made available upon acceptance.
- Abstract(参考訳): マルチモーダル大言語モデル (MLLM) は, 医療用視覚質問応答 (VQA) の可能性を強く示しているが, 入力画像に矛盾する反応を生じさせ, 臨床現場で深刻なリスクを生じさせると定義された幻覚を呈する傾向にある。
セマンティック・エントロピー (SE) や視覚増幅セマンティック・エントロピー (VASE) のような現在の幻覚検出法は、セマンティック・クラスタリングのための外部自然言語推論モデルとともに、1サンプルあたり10から20の確率的世代を必要とする。
幻覚応答は, 自己の対数確率において, 不整合なトークンレベルの信頼と視覚的証拠に対する弱い感度という, 顕著な特徴を示す。
本研究は,確率的サンプリングも外部モデルもタスク固有のハイパーパラメータも不要な決定論的幻覚検出法であるCEBaGを提案する。
CEBaGは、応答トークン間の一貫性のない信頼を捉えるトークンレベルの予測分散と、画像がテキストのみの推論に対してトーケン毎の予測をどの程度シフトするかを測定するエビデンススケールの2つの補完的な信号を組み合わせる。
4つの医療MLLMと3つのVQAベンチマーク(実験設定16)で評価され、CEBaGは16設定中13AUCで最高値に達し、VASEよりも平均8AUCポイント改善され、完全に決定論的かつ自己完結している。
コードは受理時に利用可能になる。
関連論文リスト
- Neural Uncertainty Principle: A Unified View of Adversarial Fragility and LLM Hallucination [60.197429875410286]
大規模言語モデルにおける視覚と幻覚の対立的脆弱性は、伝統的に別の問題と見なされている。
損失誘起状態下でのニューラル不確実性原理(NUP)の定式化により, ほぼバウンド状態においては, さらなる圧縮は感度分散の増大を伴うことが判明した。
視覚では、高度に結合したコンポーネントをマスキングすることで、コストのかかる敵の訓練なしに堅牢性を向上させる。
言語では、任意の応答トークンを生成する前に、同じプレフィルステージプローブが幻覚リスクを検出する。
論文 参考訳(メタデータ) (2026-03-20T02:07:10Z) - FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering [14.550872089352943]
FaithSCANは視覚言語モデルの豊富な内部信号を利用して幻覚を検出する軽量ネットワークである。
本稿では,LLM-as-a-JudgeパラダイムをVQA幻覚に拡張し,モデル依存型監視信号の自動生成のための低コスト戦略を提案する。
深い分析により、幻覚は視覚知覚、相互モーダル推論、言語復号における系統的な内部状態の変化から生じることが示された。
論文 参考訳(メタデータ) (2026-01-01T09:19:39Z) - Semantic Energy: Detecting LLM Hallucination Beyond Entropy [106.92072182161712]
大規模言語モデル(LLM)は、現実のアプリケーションにますますデプロイされているが、幻覚の影響を受けやすいままである。
不確実性推定は、そのような幻覚を検出するための実現可能なアプローチである。
本稿では,新しい不確実性推定フレームワークであるセマンティック・エナジーを紹介する。
論文 参考訳(メタデータ) (2025-08-20T07:33:50Z) - SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs [52.03164192840023]
LVLM(Large Vision-Language Models)は、いまだ幻覚に悩まされている。
本稿では,スケーラブルで制御可能で多様な評価データを生成する自動データ構築パイプラインを提案する。
我々は,忠実度と事実性幻覚の両方を評価するためのベンチマークであるSHALEを構築した。
論文 参考訳(メタデータ) (2025-08-13T07:58:01Z) - Detecting Token-Level Hallucinations Using Variance Signals: A Reference-Free Approach [0.0]
大規模言語モデル(LLM)は、様々なタスクにまたがる印象的な生成能力を示したが、幻覚に弱いままである。
複数世代にわたるトークンログ確率のばらつきを利用した,参照不要なトークンレベルの幻覚検出フレームワークを提案する。
我々のアプローチは、モデルに依存しず、解釈可能であり、リアルタイムまたはポストホック分析に適している。
論文 参考訳(メタデータ) (2025-07-05T19:20:59Z) - RePPL: Recalibrating Perplexity by Uncertainty in Semantic Propagation and Language Generation for Explainable QA Hallucination Detection [26.186204911845866]
幻覚は大きな言語モデルにとって 重要な障害です
これら2つの側面により不確実性の測定を補正するRePPLを提案する。
提案手法は,様々なQAデータセットにまたがる最高の包括的検出性能を実現する。
論文 参考訳(メタデータ) (2025-05-21T11:23:05Z) - REAL Sampling: Boosting Factuality and Diversity of Open-Ended Generation via Asymptotic Entropy [93.8400683020273]
大規模言語モデル(LLM)の復号法は通常、事実性の確保と多様性の維持のトレードオフに苦慮する。
核サンプリングにおける事実性および多様性を向上させる復号法であるREALサンプリングを提案する。
論文 参考訳(メタデータ) (2024-06-11T21:44:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。