論文の概要: Attention Without Grounding: Causal Evaluation of Visual Explanations in Medical VLMs
- arxiv url: http://arxiv.org/abs/2607.18577v1
- Date: Mon, 20 Jul 2026 23:19:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.272882
- Title: Attention Without Grounding: Causal Evaluation of Visual Explanations in Medical VLMs
- Title(参考訳): 接地のない注意:医用VLMにおける視覚的説明の因果的評価
- Authors: Binesh Sadanandan, Vahid Behzadan,
- Abstract要約: 胸部X線におけるVLM(Vision-Language Model)の出力を説明するために,注意とサリエンシのヒートマップが広く用いられている。
PadChestの放射線学的バウンディングボックスと重なり合うことで,忠実さを検査する。
LLaVA-RADとQwen3-VL-8B-InstructとCheXagent-2-3bの3種類のMedGemma-4B変異体について検討した。
- 参考スコア(独自算出の注目度): 2.064612766965483
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Attention and saliency heatmaps are widely used to explain medical Vision-Language Model (VLM) outputs on chest X-rays, yet whether they truly highlight the image evidence driving predictions has not been causally tested. We audit faithfulness via overlap with radiologist bounding boxes on PadChest (n=637), attribution mass within radiologist masks on CheXlocalize (n=643), and 16x16 patch-occlusion maps that record which regions, when hidden, change the answer. We study three MedGemma-4B variants, cross-family probes on LLaVA-RAD and Qwen3-VL-8B-Instruct, and the specialist CheXagent-2-3b, with two CXR-trained classifiers (DenseNet121, ResNet50) as positive controls. A heatmap is faithful only if the model uses the image and attention concentrates on regions whose occlusion alters the prediction. No evaluated VLM meets both criteria. MedGemma and Qwen3-VL use the image, but attention anti-correlates with patch-occlusion importance (rho < 0 with 95% bootstrap CIs below zero). LLaVA-RAD's attention correlates positively, but the model is almost text-only (99.1% text-only agreement, near-zero causal mass), so correlation ties two near-zero signals. Attention also misses annotated anatomy: overlap with true regions never beats shifted or random controls, and no method places more than 22% of its mass inside radiologist masks. The two CXR classifiers pass all metrics, indicating the failure is specific to VLM heatmaps, not the evaluation. These heatmaps are visually reassuring but not faithful; clinical explanations require controlled localization metrics and causal perturbation, not visual inspection alone.
- Abstract(参考訳): 胸部X線によるVLM(Vision-Language Model)の出力を説明するために,注意とサリエンシのヒートマップが広く用いられている。
PadChest(n=637),CheX Localize(n=643),CheX Localize(n=643),CheXlocalize(n=643),CheXlocalize(n=643),および,どの領域に隠れているかを示す16x16のパッチ・オクルージョン・マップで,各領域の回答が変化した。
我々は、3つのMedGemma-4B変異体、LLaVA-RADとQwen3-VL-8B-Instruct上のクロスサイトプローブ、CheXagent-2-3bの2つのCXR訓練型分類器(DenseNet121,ResNet50)を正の制御として研究した。
ヒートマップは、モデルが画像を使用し、オクルージョンが予測を変える領域に注意を集中する場合のみ忠実である。
両基準を満たす評価VLMは存在しない。
MedGemmaとQwen3-VLはイメージを使用するが、注意力はパッチの排除の重要性と相関する(rho < 0 は 95% ブートストラップ CI が 0 以下)。
LLaVA-RADの注意は正に相関するが、ほぼテキストのみのモデルである(99.1%のテキストのみの合意、ほぼゼロの因果質量)。
本物の領域との重なり合いは、シフトやランダムな制御を決して行わず、放射線学者のマスクの中に質量の22%以上を配置する手法も存在しない。
2つのCXR分類器はすべてのメトリクスをパスし、失敗は評価ではなく、VLMヒートマップに固有のものであることを示す。
これらの熱マップは視覚的に安心できるが、忠実ではない;臨床説明は視覚検査だけでは無く、制御された局所化指標と因果摂動を必要とする。
関連論文リスト
- CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs [20.96410413299322]
CXR-ContraBenchは、内部のReXVQAスライスと外部のOpenIおよびCheXpertプロトコルにまたがる診断ベンチマークである。
我々は,この失敗を,視覚的証拠と疑問の両方に矛盾する場合でも,否定的回答オプションにモデルを引き付けるという,否定的選択の誘因として研究する。
論文 参考訳(メタデータ) (2026-05-07T07:46:17Z) - Wasserstein-Aligned Localisation for VLM-Based Distributional OOD Detection in Medical Imaging [8.915586506306875]
比較推論が可能な最適輸送理論に基づく学習自由フレームワークであるWALDOを紹介する。
Qwen2.5-VL-72B の WALDO は 43.5_pm1.6%$ mAP@30 (95% CI: [40.4, 46.7]) を達成し、ゼロショットベースラインよりも 19% の相対的な改善を示した。
論文 参考訳(メタデータ) (2026-05-06T17:32:34Z) - Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations [19.488236277427358]
視覚言語モデル(VLM)は、しばしばチェーン・オブ・シント(CoT)の説明を生み出す。
胸部X線視覚質問応答(VQA)の臨床的基盤として,制御されたテキストと画像修正を用いてCoT忠実度を探索するフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-13T09:28:22Z) - DualAttNet: Synergistic Fusion of Image-level and Fine-Grained Disease
Attention for Multi-Label Lesion Detection in Chest X-rays [1.3367903535457364]
胸部X線写真におけるDualAttNet(DualAttNet)というマルチラベル病変検出のための二重注意制御モジュールを提案する。
画像レベルの注意ブロックと微細な疾患注意アルゴリズムに基づいて、グローバルおよびローカルな病変分類情報を効率的に融合する。
論文 参考訳(メタデータ) (2023-06-23T23:19:27Z) - Attention-based Saliency Maps Improve Interpretability of Pneumothorax
Classification [52.77024349608834]
視覚変換器(ViT)の胸部X線撮影(CXR)分類性能と注意ベース唾液の解釈可能性について検討する。
ViTは、CheXpert、Chest X-Ray 14、MIMIC CXR、VinBigDataの4つの公開データセットを用いて、肺疾患分類のために微調整された。
ViTsは最先端のCNNと比べてCXR分類AUCに匹敵するものであった。
論文 参考訳(メタデータ) (2023-03-03T12:05:41Z) - Radiomics-Guided Global-Local Transformer for Weakly Supervised
Pathology Localization in Chest X-Rays [65.88435151891369]
Radiomics-Guided Transformer (RGT)は、テキストトグロバル画像情報と、テキストトグロバル情報とを融合する。
RGTは、画像トランスフォーマーブランチ、放射能トランスフォーマーブランチ、および画像と放射線情報を集約する融合層から構成される。
論文 参考訳(メタデータ) (2022-07-10T06:32:56Z) - Explainable multiple abnormality classification of chest CT volumes with
AxialNet and HiResCAM [89.2175350956813]
本稿では,容積医用画像における多変量分類の課題について紹介する。
本稿では,複数のインスタンス学習型畳み込みニューラルネットワークであるAxialNetを提案する。
そして、HiResCAMと3D許容領域を利用した新しいマスクロスにより、モデルの学習を改善することを目指す。
論文 参考訳(メタデータ) (2021-11-24T01:14:33Z) - Contralaterally Enhanced Networks for Thoracic Disease Detection [120.60868136876599]
胸骨、肺野、気管支管など、胸部左右に類似した構造が多数存在する。
このような類似性は、広義の放射線学者の経験から、胸部X線における疾患の同定に利用することができる。
本稿では,病状提案の特徴表現を強化するために,対向的コンテキスト情報を活用するディープ・エンド・ツー・エンド・モジュールを提案する。
論文 参考訳(メタデータ) (2020-10-09T10:15:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。