論文の概要: Are Large Vision Language Models Truly Grounded in Medical Images? Evidence from Italian Clinical Visual Question Answering
- arxiv url: http://arxiv.org/abs/2511.19220v1
- Date: Mon, 24 Nov 2025 15:26:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-11-25 18:34:25.277734
- Title: Are Large Vision Language Models Truly Grounded in Medical Images? Evidence from Italian Clinical Visual Question Answering
- Title(参考訳): 医用画像の中に大きな視覚言語モデルが存在するか? : イタリアにおける臨床視力検査からの証拠
- Abstract要約: イタリアの医学的疑問に答える際に,大きな視覚言語モデル (VLM) が真の視覚的根拠を示すかどうかを検討する。
我々は4つの最先端モデル(Claude Sonnet 4.5, GPT-4o, GPT-5-mini, Gemini 2.0 flash exp)をテストする。
- 参考スコア(独自算出の注目度): 28.404018926483985
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large vision language models (VLMs) have achieved impressive performance on medical visual question answering benchmarks, yet their reliance on visual information remains unclear. We investigate whether frontier VLMs demonstrate genuine visual grounding when answering Italian medical questions by testing four state-of-the-art models: Claude Sonnet 4.5, GPT-4o, GPT-5-mini, and Gemini 2.0 flash exp. Using 60 questions from the EuropeMedQA Italian dataset that explicitly require image interpretation, we substitute correct medical images with blank placeholders to test whether models truly integrate visual and textual information. Our results reveal striking variability in visual dependency: GPT-4o shows the strongest visual grounding with a 27.9pp accuracy drop (83.2% [74.6%, 91.7%] to 55.3% [44.1%, 66.6%]), while GPT-5-mini, Gemini, and Claude maintain high accuracy with modest drops of 8.5pp, 2.4pp, and 5.6pp respectively. Analysis of model-generated reasoning reveals confident explanations for fabricated visual interpretations across all models, suggesting varying degrees of reliance on textual shortcuts versus genuine visual analysis. These findings highlight critical differences in model robustness and the need for rigorous evaluation before clinical deployment.
- Abstract(参考訳): 大規模視覚言語モデル (VLM) は, 医用視覚質問応答ベンチマークにおいて有意な性能を達成しているが, 視覚情報への依存度は未定である。
イタリアの医学的疑問に答える際,フロンティアVLMが真の視覚的根拠を示すかどうかをクロード・ソネット4.5, GPT-4o, GPT-5-mini, Gemini 2.0フラッシュexpの4モデルを用いて検討した。
画像の解釈を明示的に要求するEuropeMedQAイタリアのデータセットからの60の質問を用いて、適切な医療画像を空白のプレースホルダーに置き換えて、モデルが本当に視覚情報とテキスト情報を統合するかどうかをテストする。
GPT-4oは27.9ppの精度低下(83.2% [74.6%, 91.7%]から55.3% [44.1%, 66.6%)で、GPT-5-mini, Gemini, Claudeはそれぞれ8.5pp, 2.4pp, 5.6ppと高い精度を維持している。
モデル生成推論の解析は、すべてのモデルで生成された視覚的解釈に対して自信ある説明を示し、テキストのショートカットと真の視覚的分析への依存度が異なることを示唆している。
これらの知見は, モデルロバスト性と, 臨床展開前の厳密な評価の必要性に重要な違いを呈するものである。
関連論文リスト
- Polish Medical Visual Question Answering: Vision-Language Models Underutilize Visual Evidence [2.779050345468656]
このベンチマークは、多様な医療専門分野と視覚領域にまたがる画像を含む質問を含む。
ポーランド語、汎用的オープンウェイト、商用視覚言語モデルの評価を行った。
論文 参考訳(メタデータ) (2026-08-13T08:07:22Z) - Do Medical Vision Language Models Actually See? A Counterfactual Grounding Framework and Hard-Negative Contrastive Training for Visually-Reliant Medical VLMs [6.775973739193119]
大規模視覚言語モデル(VLM)は、医学的質問に対する回答に強い精度を報告しているが、それらが視覚的エビデンスから引き起こされたのか、あるいはテキストによるショートカットを悪用したのかは定かではない。
本稿では,視覚的およびテキスト的コントリビューションを,制御されたサロゲート,ピクセルシャッフル,イメージアプサント,CLIP検索したハード負の入力画像に置換することで分離する,対物的評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-04T00:06:35Z) - Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs [21.95646908343504]
Med-R2 Benchは、視覚的接地による対向的堅牢性を評価するために、臨床ワークフローと整合した階層的ベンチマークである。
本研究は,4つの臨床段階の視覚的エビデンスに連鎖推論が厳密に根付いているかを評価するために,段階的にQAタスクを設計する。
論文 参考訳(メタデータ) (2026-05-23T09:50:19Z) - JMed48k: A Multi-Profession Japanese Medical Licensing Benchmark for Vision-Language Model Evaluation [53.571125769505194]
本稿では,視覚言語モデルを評価するための医療ライセンスベンチマークであるJMed48kを紹介する。
JMed48kは、厚生労働省が発行した公式PDF資料から作成され、48,862件の試験質問と20,142件の画像を収録している。
JMed48k-Evalは,テキストのみの質問9,905件,画像による質問2,579件を含む12,484件の回答を得た。
論文 参考訳(メタデータ) (2026-05-21T07:20:38Z) - Medical thinking with multiple images [44.04557445622649]
我々はMedThinkVQAを紹介した。MedThinkVQAは、複数の画像で考えるためのエキスパートアノテーション付きベンチマークである。
データセットは720のテストケースを含む8,067ケースを含み、1ケースあたり平均6.62イメージである。
テストセットでは、最高のクローズドソースモデルであるClaude-4.6-Opus、Gemini-3-Pro、GPT-5.2-xhighは57.2%、55.3%、54.9%の精度しか達成できなかった。
論文 参考訳(メタデータ) (2026-04-14T18:51:07Z) - DeepGI: Explainable Deep Learning for Gastrointestinal Image Classification [0.0]
この研究は、可変照明、ゆらぎのあるカメラアングル、頻繁な画像アーティファクトなど、一般的な内視鏡的課題に直面している。
最高性能のVGG16とMobileNetV2はそれぞれ96.5%の精度を達成した。
このアプローチには、Grad-CAM視覚化による説明可能なAIが含まれており、モデル予測に最も影響を及ぼす画像領域の識別を可能にする。
論文 参考訳(メタデータ) (2025-11-26T22:35:57Z) - Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations [19.488236277427358]
視覚言語モデル(VLM)は、しばしばチェーン・オブ・シント(CoT)の説明を生み出す。
胸部X線視覚質問応答(VQA)の臨床的基盤として,制御されたテキストと画像修正を用いてCoT忠実度を探索するフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-13T09:28:22Z) - EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models [82.43729208063468]
医療用LVLM(Large Vision-Language Models)の最近のベンチマークでは、信頼性と安全性を見越して、リーダボードの精度を強調している。
ユーザが提供した情報を非批判的に反響させる傾向のモデルについて検討する。
医療用LVLMの梅毒を系統的に評価するベンチマークであるEchoBenchを紹介する。
論文 参考訳(メタデータ) (2025-09-24T14:09:55Z) - COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark [3.5018278981067685]
COREVQA (Crowd Observations and Reasoning Entailment) は5608の画像と合成生成された真/偽のステートメントペアのベンチマークである。
以上の結果から,トップパフォーマンスのVLMでも80%以下で精度が向上し,他のモデルも大幅に悪化した。
論文 参考訳(メタデータ) (2025-07-17T04:47:47Z) - An Early Investigation into the Utility of Multimodal Large Language Models in Medical Imaging [0.3029213689620348]
医用画像解析のためのGemini(textitgemini-1.0-pro-vision-latst)モデルとGPT-4Vモデルの可能性を探る。
Gemini AIとGPT-4Vはどちらも、まず実画像と合成画像の分類に使用され、次に入力画像の解釈と解析を行う。
本研究で紹介した早期研究は,網膜眼底鏡および肺X線像の分類と解釈を支援するMLLMの可能性についての知見を提供するものである。
論文 参考訳(メタデータ) (2024-06-02T08:29:23Z) - Language Models Meet Anomaly Detection for Better Interpretability and Generalizability [13.674931689496225]
本研究では,医療画像における言語モデルと教師なし異常検出の統合について検討する。
脳磁気共鳴画像におけるマルチイメージ視覚的質問応答のための新しいデータセットを提案する。
本モデルでは, 閉鎖質問に対する60.81%の精度を達成し, 疾患の分類と重症度を15種類のクラスに分けた。
論文 参考訳(メタデータ) (2024-04-11T10:16:44Z) - Gemini vs GPT-4V: A Preliminary Comparison and Combination of
Vision-Language Models Through Qualitative Cases [98.35348038111508]
本稿では,Google の Gemini と OpenAI の GPT-4V(ision) の2つのパイオニアモデルについて,詳細な比較研究を行った。
分析の核となるのは、各モデルの視覚的理解能力である。
両モデルのユニークな強みとニッチを照らし出した。
論文 参考訳(メタデータ) (2023-12-22T18:59:58Z) - Multimodal Foundation Models Exploit Text to Make Medical Image Predictions [3.4230952713864373]
我々は、画像やテキストを含む様々なデータモダリティを、マルチモーダル基礎モデルが統合し、優先順位付けするメカニズムを評価する。
以上の結果から,マルチモーダルAIモデルは医学的診断的推論に有用であるが,テキストの活用によって精度が大きく向上することが示唆された。
論文 参考訳(メタデータ) (2023-11-09T18:48:02Z) - Holistic Analysis of Hallucination in GPT-4V(ision): Bias and
Interference Challenges [54.42256219010956]
このベンチマークは、視覚言語モデルにおける2つの一般的な幻覚、すなわちバイアスと干渉を評価するために設計されている。
偏見はモデルがある種の反応を幻覚させる傾向を示すもので、おそらくはトレーニングデータの不均衡によるものである。
干渉とは、テキストプロンプトのフレーズ化や入力画像の表示方法によって、GPT-4V(ision)の判定が破壊されるシナリオである。
論文 参考訳(メタデータ) (2023-11-06T17:26:59Z) - HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models [69.52245481329899]
本稿では,画像コンテキスト推論評価のためのベンチマークであるHalusionBenchを紹介する。
このベンチマークは、1129の質問と組み合わせた346の画像で構成されており、すべて人間の専門家によって細心の注意を払って作成されている。
HallusionBenchの評価では、15種類のモデルをベンチマークし、最先端のGPT-4Vによって達成された31.42%の質問対精度を強調した。
論文 参考訳(メタデータ) (2023-10-23T04:49:09Z) - Robust and Interpretable Medical Image Classifiers via Concept
Bottleneck Models [49.95603725998561]
本稿では,自然言語の概念を用いた堅牢で解釈可能な医用画像分類器を構築するための新しいパラダイムを提案する。
具体的には、まず臨床概念をGPT-4から検索し、次に視覚言語モデルを用いて潜在画像の特徴を明示的な概念に変換する。
論文 参考訳(メタデータ) (2023-10-04T21:57:09Z) - Learning to Decompose Visual Features with Latent Textual Prompts [140.2117637223449]
視覚言語モデルを改善するために,Decomposed Feature Prompting (DeFo)を提案する。
我々の実証研究は、視覚言語モデルを改善する上でDeFoが重要であることを示している。
論文 参考訳(メタデータ) (2022-10-09T15:40:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。