論文の概要: MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.27004v2
- Date: Mon, 31 Aug 2026 12:39:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 15:47:04.289308
- Title: MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models
- Title(参考訳): MVC-Bench: 医療ビジョンランゲージモデルのベンチマーク校正
- Authors: Ashshak Sharifdeen, Shihab Aaqil Ahamed, Ufaq Khan, Muhammad Akhtar Munir, Sujair Ibrahim, Mohamed Rafeek Mareer Ahamed, Yutong Xie, Imran Razzak, Muhammad Haris Khan,
- Abstract要約: MVCBenchは、ヴィジュアル言語モデル(VLM)と医用ヴィジュアル言語モデル(Medical-VLM)を用いた医用画像分類のためのキャリブレーション中心のベンチマークである。
i) モダリティ、バックボーン、ドメインシフトに対するロバスト性(ii) キャリブレーション戦略の有効性と、(iii) 急進的およびランダムな条件下での安定性を評価する。
1638以上の制御実験において,精度と予測誤差(ECE)を主指標として報告し,相補的校正法を用いて結果を報告する。
- 参考スコア(独自算出の注目度): 30.332542666039647
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reliable evaluation of vision-language models (VLMs) and medical vision-language models (Medical-VLMs) requires calibrated confidence, particularly under realistic clinical conditions. However, existing efforts mainly focused on improving accuracy, leaving calibration in the medical domain underexplored. To this end, we propose MVC-Bench, a calibration-centric benchmark for medical image classification with VLMs and Medical-VLMs. MVC-Bench assesses the calibration across three axes: (i) robustness to modality, backbone, and domain shift (ii) effectiveness of calibration strategies and prompt-tuning methods (iii) stability under prompt-template and random-seed variations. The benchmark covers eight different backbones, three medical modalities, including fundus imaging, histopathology, and chest X-ray under in-domain and domain shift settings. It compares post-hoc calibration, train-time calibration, and zero-shot inference methods, together with six prompt-tuning methods. Across more than 1638 controlled experiments, we report accuracy and Expected Calibration Error (ECE) as primary metrics, and further report results with complementary calibration measures, including Maximum Calibration Error (MCE) and Adaptive Calibration Error (ACE). We further investigate the underlying causes of miscalibration in VLMs and Medical-VLMs and propose a simple train-time calibration method, Multi-Class Margin (MCM) regularization, which achieves lowest ECE on 10 out of 12 settings in in-domain and remains competitive under domain shifts. Collectively, MVC-Bench provides a structured evaluation framework and actionable guidance for improving calibration in safety-critical medical workflows.
- Abstract(参考訳): ヴィジュアル言語モデル(VLM)と医用ヴィジュアル言語モデル(医療用ヴィジュアル言語モデル)の信頼性評価には、特に現実的な臨床条件下では、校正された信頼性が必要である。
しかし、既存の取り組みは主に精度の向上に重点を置いており、医療領域の校正は過小評価されていた。
この目的のために,VLM と Medical-VLM を用いた医用画像分類のためのキャリブレーション中心のベンチマークである MVC-Bench を提案する。
MVC-Benchは3つの軸のキャリブレーションを評価する。
(i)モダリティ、バックボーン、ドメインシフトに対する堅牢性
二 校正方略及び習熟方法の有効性
三 急変・無作為変種時の安定性
このベンチマークは、8つの異なるバックボーン、基礎画像、病理組織学、胸部X線をドメイン内およびドメインシフト設定でカバーしている。
ポストホックキャリブレーション、列車時間キャリブレーション、ゼロショット推論法と6つのプロンプトチューニング法を比較している。
最大校正誤差(MCE)や適応校正誤差(ACE)などの相補的校正指標を用いて1638以上の制御実験を行い,精度と予測校正誤差(ECE)を主指標として報告する。
さらに,VLMとメディカルVLMの誤校正の原因について検討し,ドメイン内12設定中10設定で最小のCEを達成し,ドメインシフト下での競争力を維持する,単純な列車時校正手法であるMCM(Multi-Class Margin)正則化を提案する。
まとめると、MVC-Benchは、安全クリティカルな医療ワークフローの校正を改善するための構造化評価フレームワークと実行可能なガイダンスを提供する。
関連論文リスト
- Discovery of Hidden Miscalibration Regimes [52.452902154360565]
モデルは何らかの入力を体系的に過信し、他人を過信することがある。
対応する誤校正分野を定義し,それを推定するための診断フレームワークを提案する。
提案手法は,入力空間のキャリブレーションを意識した表現を学習し,学習幾何学におけるカーネルの平滑化による符号付き局所的誤校正を推定する。
論文 参考訳(メタデータ) (2026-05-13T13:07:50Z) - Overconfidence and Calibration in Medical VQA: Empirical Findings and Hallucination-Aware Mitigation [4.247706336083815]
ビジョン言語モデル(VLM)の過信は、モデルファミリにわたって持続し、スケーリングやプロンプトによって解決されない。
プラットスケーリングのようなポストホックキャリブレーションアプローチは、キャリブレーションエラーを低減し、プロンプトベースの戦略を一貫して上回る。
幻覚を意識した校正 (HAC) では、視覚的な幻覚検出信号が補完的な入力として組み込まれ、信頼度の推定を洗練させる。
論文 参考訳(メタデータ) (2026-04-02T21:52:29Z) - Scalable Utility-Aware Multiclass Calibration [53.28176049547449]
ユーティリティキャリブレーション(英: Utility calibration)は、特定のユーティリティ関数に対するキャリブレーション誤差を測定する一般的なフレームワークである。
我々は、このフレームワークが既存のキャリブレーションメトリクスを統一し、再解釈する方法を実証する。
論文 参考訳(メタデータ) (2025-10-29T12:32:14Z) - Calibration-Aware Prompt Learning for Medical Vision-Language Models [44.97741487992985]
ミススカラー予測は、過度に自信過剰なエラーを引き起こし、臨床信頼と意思決定の信頼性を損なう。
本稿では,Med-VLM を即時チューニングする最初のフレームワークである CalibPrompt を紹介する。
CalibPromptは、クリーンな精度に大きな影響を及ぼすことなく、キャリブレーションを継続的に改善する。
論文 参考訳(メタデータ) (2025-09-18T17:59:58Z) - Where are we with calibration under dataset shift in image classification? [13.432791129536255]
画像分類のための実世界のデータセットシフトの下でキャリブレーションの状況について検討する。
様々なポストホックキャリブレーション手法と、一般的なトレーニング中のキャリブレーション戦略との相互作用を比較した。
i) アンサンブル前に校正を適用することは、シフトの下で校正するのにより効果的である。
論文 参考訳(メタデータ) (2025-07-10T13:59:53Z) - Exposing and Mitigating Calibration Biases and Demographic Unfairness in MLLM Few-Shot In-Context Learning for Medical Image Classification [8.43909252072479]
マルチモーダル大言語モデル (MLLM) は、医療画像解析の文脈において、少数の文脈内学習を行う大きな可能性を秘めている。
医療画像分類のためのテキスト内学習におけるMLLMの予測と信頼性スコアの校正バイアスと人口統計学的不公平性に関する最初の調査を行った。
我々は、関連するバイアスを軽減するために、推論時キャリブレーション法であるCALINを紹介する。
論文 参考訳(メタデータ) (2025-06-29T15:37:17Z) - Adaptive Set-Mass Calibration with Conformal Prediction [60.47079469141295]
提案手法は,まず共形予測から始まり,所望のカバレッジを与えるラベルの集合を得る。
次に、共形制約に合わせて、質量正規化と温度スケーリングに基づくルールの2つの簡単なポストホックキャリブレータをインスタンス化する。
論文 参考訳(メタデータ) (2025-05-21T12:18:15Z) - Calibration by Distribution Matching: Trainable Kernel Calibration
Metrics [56.629245030893685]
カーネルベースのキャリブレーションメトリクスを導入し、分類と回帰の両方で一般的なキャリブレーションの形式を統一・一般化する。
これらの指標は、異なるサンプル推定を許容しており、キャリブレーションの目的を経験的リスク最小化に組み込むのが容易である。
決定タスクにキャリブレーションメトリクスを調整し、正確な損失推定を行ない、後悔しない決定を行うための直感的なメカニズムを提供する。
論文 参考訳(メタデータ) (2023-10-31T06:19:40Z) - Calibration of Neural Networks [77.34726150561087]
本稿では,ニューラルネットワークの文脈における信頼性校正問題について調査する。
我々は,問題文,キャリブレーション定義,評価に対する異なるアプローチについて分析する。
実験実験では、様々なデータセットとモデルをカバーし、異なる基準に従って校正方法を比較する。
論文 参考訳(メタデータ) (2023-03-19T20:27:51Z) - On Calibrating Semantic Segmentation Models: Analyses and An Algorithm [51.85289816613351]
セマンティックセグメンテーションキャリブレーションの問題について検討する。
モデルキャパシティ、作物サイズ、マルチスケールテスト、予測精度はキャリブレーションに影響を及ぼす。
我々は、単純で統一的で効果的なアプローチ、すなわち選択的スケーリングを提案する。
論文 参考訳(メタデータ) (2022-12-22T22:05:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。