論文の概要: Hallucination Detection and Correction in Medical VLMs via Counter-Evidence Verification
- arxiv url: http://arxiv.org/abs/2606.18609v1
- Date: Wed, 17 Jun 2026 02:14:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-18 17:16:50.965719
- Title: Hallucination Detection and Correction in Medical VLMs via Counter-Evidence Verification
- Title(参考訳): 医療用VLMにおける幻覚検出と矯正
- Authors: Nan Zhou, Ke Zou, Meng Liu, Linchao He, Jiaqi Zhu, Yi Zhang, Hu Chen, Huazhu Fu,
- Abstract要約: 医用診断における視覚言語モデル (VLM) の信頼性は, 信頼を損なう幻覚によって問題視される。
幻覚を検知し修正する訓練不要なプラグアンドプレイフレームワークであるCoEV(Counter-Evidence Verification)を提案する。
幻覚検出のために、CoEVは既存の手法を一貫して上回り、平均的なPR-AUCとROC-AUCを改善している。
幻覚補正のためには、Micro-F1を最大12.5%改善し、医療報告生成において幻覚率を11.9%以上削減し、医療用VQAの精度を向上する。
- 参考スコア(独自算出の注目度): 44.48746443825558
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language models (VLMs) reliability in medical diagnosis is challenged by trust-undermining hallucinations. Existing hallucination detection approaches mainly focus on identifying factual inconsistencies between generated text and reference data. While some studies analyze where models attend in images, they seldom verify whether such attention truly reflects the visual evidence supporting the generated text. To address this gap, we propose Co}unter-Evidence Verification (CoEV), a training-free plug-and-play framework that detects and corrects hallucinations through evidence-based factual consistency verification. CoEV performs bidirectional verification between textual assertions and visual evidence, testing whether each statement is supported by its corresponding evidence region, and assigns each statement into a four-quadrant diagnostic map capturing combinations of text factuality and visual grounding. CoEV detects hallucinated content and serves as a post hoc refinement tool, correcting hallucinations without retraining. Extensive experiments on four medical datasets show that CoEV combats hallucinations in VLMs.For hallucination detection, CoEV consistently outperforms existing methods, improving average PR-AUC and ROC-AUC by 3.0% and 3.9% absolute points respectively, with notable gains of up to 18.5% in specific VQA scenarios. For hallucination correction, it improves Micro-F1 by up to 12.5%, reduces hallucination rates by over 11.9% on medical report generation, and also boosts medical VQA accuracy. These results show that CoEV enables reliable detection and correction of hallucinations, providing clinicians with dependable, evidence-based cues for diagnosis. Code will be released upon acceptance.
- Abstract(参考訳): 医用診断における視覚言語モデル (VLM) の信頼性は, 信頼を損なう幻覚によって問題視される。
既存の幻覚検出手法は主に、生成されたテキストと参照データの間の事実の不整合を識別することに焦点を当てている。
いくつかの研究では、モデルが画像のどこに出席するかを分析するが、そのような注意が生成したテキストを支持する視覚的証拠を真に反映しているかどうかを検証することは滅多にない。
このギャップに対処するために,実証に基づく事実整合性検証を通じて幻覚を検出し,修正する訓練不要なプラグアンドプレイフレームワークであるCoEV(Co}unter-Evidence Verification)を提案する。
CoEVは、テキストのアサーションと視覚的エビデンスの間で双方向の検証を行い、それぞれのステートメントが対応するエビデンス領域でサポートされているかどうかを確認し、各ステートメントをテキストの事実と視覚的グラウンドの組み合わせをキャプチャする4つのクアドラントな診断マップに割り当てる。
CoEVは幻覚を検知し、再訓練せずに幻覚を補正するポストホックリファインメントツールとして機能する。
4つの医学データセットの大規模な実験は、CoEVがVLMで幻覚と戦うことを示している。幻覚検出のために、CoEVは既存の手法を一貫して上回り、平均PR-AUCとROC-AUCをそれぞれ3.0%、絶対点を3.9%改善し、特定のVQAシナリオでは最大18.5%の顕著な上昇を示した。
幻覚補正のためには、Micro-F1を最大12.5%改善し、医療報告生成において幻覚率を11.9%以上削減し、医療用VQAの精度を向上する。
これらの結果から,CoEVは幻覚の確実な検出と修正を可能にし,臨床医に診断のための信頼性の高いエビデンスベースの手がかりを提供することが示唆された。
コードは受理時にリリースされる。
関連論文リスト
- VIHD: Visual Intervention-based Hallucination Detection for Medical Visual Question Answering [27.827862126990553]
幻覚は臨床的な意思決定にリスクをもたらし、効果的な検出を必要とする。
既存のイントロスペクティブ検出法は、主に不確実性推定や論理的検証を行う。
視覚的介入に基づく幻覚検出法であるVIHDを提案する。
論文 参考訳(メタデータ) (2026-05-20T06:14:45Z) - CuraView: A Multi-Agent Framework for Medical Hallucination Detection with GraphRAG-Enhanced Knowledge Verification [3.422186949568493]
本報告では,文レベル検出のためのフレームワークであるCuraViewについて述べる。
CuraViewは、患者レベルのEHRからGraphRAGベースの知識グラフを構築する。
我々は,50例の患者を対象に,Ex Discharge-Meベンチマークから250例のCuraViewを評価した。
論文 参考訳(メタデータ) (2026-05-05T08:05:31Z) - Deterministic Hallucination Detection in Medical VQA via Confidence-Evidence Bayesian Gain [6.272224314406867]
マルチモーダル大言語モデル(MLLM)は、医用視覚質問応答(VQA)の強力な可能性を示している。
それらは、入力画像に矛盾する反応を発生させ、臨床的な設定で重大なリスクを生じさせる、幻覚の傾向を保ち続ける。
セマンティック・エントロピー (SE) や視覚増幅セマンティック・エントロピー (VASE) のような現在の幻覚検出法は、セマンティック・クラスタリングのための外部自然言語推論モデルとともに1サンプルにつき10世代から20世代を必要とする。
サンプリングも外部モデルもタスクも不要な決定論的検出法を提案する。
論文 参考訳(メタデータ) (2026-03-23T08:29:53Z) - Med-VCD: Mitigating Hallucination for Medical Large Vision Language Models through Visual Contrastive Decoding [0.8431877864777443]
医用LVLMにおける幻覚を、二次復号の時間的オーバーヘッドを伴わずに緩和する、疎視的復号法であるMed-VCDを導入する。
以上の結果から,Med-VCDは平均13%,幻覚精度は6%向上した。
論文 参考訳(メタデータ) (2025-12-01T17:40:03Z) - SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs [52.03164192840023]
LVLM(Large Vision-Language Models)は、いまだ幻覚に悩まされている。
本稿では,スケーラブルで制御可能で多様な評価データを生成する自動データ構築パイプラインを提案する。
我々は,忠実度と事実性幻覚の両方を評価するためのベンチマークであるSHALEを構築した。
論文 参考訳(メタデータ) (2025-08-13T07:58:01Z) - Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling [78.78822033285938]
VLM(Vision-Language Models)は視覚的理解に優れ、視覚幻覚に悩まされることが多い。
本研究では,幻覚を意識したトレーニングとオンザフライの自己検証を統合した統合フレームワークREVERSEを紹介する。
論文 参考訳(メタデータ) (2025-04-17T17:59:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。