論文の概要: MedQA-MM: Shortcuts Behind Medical Visual Reasoning
- arxiv url: http://arxiv.org/abs/2609.03261v2
- Date: Tue, 08 Sep 2026 16:34:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:41.82645
- Title: MedQA-MM: Shortcuts Behind Medical Visual Reasoning
- Title(参考訳): MedQA-MM:医療用ビジュアル推論の背後にあるショートカット
- Authors: Benlu Wang, Yifan Zhang, Jiaqing Yu, Chin Siang Ong, Juncheng Huang, Zhuohao Li, Zhenyu Zhang, Arman Cohan, Hong Yu, Zonghai Yao,
- Abstract要約: ベンチマークスコアは最終回答を信用するが、アイテムが答えられるルートではない。
医用マルチモーダル多重選択質問(MCQ)では、適切な回答が意図された画像発見によって支持されるため、この区別が重要である。
ここでは、ルートは、モデルの隠れた認識に関するクレームではなく、回答の選択をサポートすることができる観測可能な入力パスである。
- 参考スコア(独自算出の注目度): 45.333881843709804
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A benchmark score credits final answers, but not the route by which an item can be answered. In medical multimodal multiple-choice questions (MCQs), this distinction matters because a correct answer can be supported by the intended image finding or by benchmark-preserved cues in the wording of answers, non-visual clinical text, visible image text, artificial annotations, or device/context artifacts. We call the resulting score-level overinterpretation reasoning inflation. Here, a route is an observable input path that can support answer selection, not a claim about the model's hidden cognition. Across six medical multimodal MCQ datasets, we separate candidate cues from behavioral evidence through prompt- and image-side audits, modality ablations, and matched repairs that preserve the medical target and answer key. In a 13-configuration open-model panel, full-input accuracy is 62.63%, while text-only and options-only settings achieve 53.96% and 29.71%, respectively. Removing length-gap, absolute/conspicuous, and spatial/prepositional cues lowers accuracy by 6.58, 3.50, and 4.77 percentage points. We also construct MedQA-MM, a 1,000-item shortcut-mitigated subset, where text-only and options-only accuracy fall to 5.21% and 12.33%. This does not imply that models never use images; it shows that medical image-reasoning claims require route-level evidence.
- Abstract(参考訳): ベンチマークスコアは最終回答を信用するが、アイテムが答えられるルートではない。
医用マルチモーダル多重選択質問(MCQ)において、この区別は、意図された画像発見または、非視覚的臨床テキスト、可視画像テキスト、人工アノテーション、デバイス/テキストアーティファクトのワードリングにおいて、ベンチマーク保存されたキューによって正しい回答を支持できるという点で重要である。
インフレを理由とする結果のスコアレベルの過大解釈を私たちは呼びます。
ここでは、ルートは、モデルの隠れた認識に関するクレームではなく、回答の選択をサポートすることができる観測可能な入力パスである。
医療用マルチモーダルMCQデータセットの6つにまたがって,プロンプトとイメージサイドの監査,モダリティの軽減,医療目標と回答キーを保存した修復のマッチングを通じて,行動証拠から候補キューを分離する。
13構成のオープンモデルパネルでは、完全な入力精度は62.63%であり、テキストのみとオプションのみの設定はそれぞれ53.96%と29.71%である。
長さギャップ、絶対/目立たず、空間/前置的なキューを除去すると、精度は6.58、3.50、および4.77ポイント低下する。
また、テキストのみとオプションのみの精度が5.21%と12.33%に低下する1000itemのショートカット緩和サブセットであるMedQA-MMを構築した。
これは、モデルが決して画像を使用しないという意味ではなく、医療画像推論の主張がルートレベルの証拠を必要とすることを示している。
関連論文リスト
- Candidate-Expanding Routing with Permutation-Stabilized Experts for Mixed-Format Medical VQA [2.313903538324245]
VQA(Mixed-format Medical visual question answering)は、安定したオプション選択と機械可読な自由テキスト出力を必要とする。
両課題を,応答テキストメモリ,置換安定化専門家,スパース候補拡張ルータを用いて解決する。
論文 参考訳(メタデータ) (2026-09-01T09:18:19Z) - When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning [73.56343820592399]
本稿では,視覚的タスクセマンティックス(VTS, Visualized Task Semantics)について紹介する。
6つのMLLMと4つのベンチマークで、24のモデルとタスクのペアの精度は平均17.8ポイント低下した。
本稿では,質問領域を型付きセマンティクスと整合させ,そのクリーンな表現をマスクビューから復元するプロンプト領域グラウンドを提案する。
論文 参考訳(メタデータ) (2026-08-05T11:46:15Z) - Visual Credit Audit for Multimodal Spatial Reasoning [70.16915309526443]
Visual Credit Auditは、ベンチマーク画像がテキストのみとブランクコントロールよりもモデルの宣言された決定をもっとサポートするかどうか、モデルが関係性固有の視覚的エビデンスに反応するかどうかの2つの評価を分離する。
ラベルを適用すれば依存性認定正当性(D-CC)が得られる
4つのオープンMLLMと2つの空間ベンチマーク、12.73-26.25%の判定は正確であるが、証明されていない。
論文 参考訳(メタデータ) (2026-07-29T15:55:31Z) - NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding [6.217658756255346]
NeuroQAは3次元脳磁気共鳴画像(MRI)における視覚的質問応答のための大規模ベンチマークである
5-104歳と5つの臨床領域(アルツハイマー病、パーキンソン病、腫瘍、白質疾患、神経発達)にまたがる。
NeuroQAは、Yes/No、Multi-choice、オープンエンドフォーマットの11の臨床基礎的推論スキルを評価している。
論文 参考訳(メタデータ) (2026-05-19T21:54:12Z) - When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models [2.064612766965483]
MedMCQA(4,183質問)とPubMedQA(1,000質問)でMedGemma(4Bおよび27Bパラメータ)を評価する。
実験の結果,いくつかの知見が得られた。
論文 参考訳(メタデータ) (2026-03-26T23:04:20Z) - Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations [19.488236277427358]
視覚言語モデル(VLM)は、しばしばチェーン・オブ・シント(CoT)の説明を生み出す。
胸部X線視覚質問応答(VQA)の臨床的基盤として,制御されたテキストと画像修正を用いてCoT忠実度を探索するフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-13T09:28:22Z) - MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine [69.08855631283829]
我々は,操作的ヒント条件下での安全性能トレードオフの定量化を目的としたベンチマークであるMed Omni-45 Degreesを紹介する。
6つの専門分野にまたがる1,804の推論に焦点を当てた医療質問と3つのタスクタイプが含まれており、その中にはMedMCQAの500が含まれる。
結果は、モデルが対角線を超えることなく、一貫した安全性と性能のトレードオフを示す。
論文 参考訳(メタデータ) (2025-08-22T08:38:16Z) - Reliable Visual Question Answering: Abstain Rather Than Answer
Incorrectly [100.60560477391732]
我々は、信頼性のある視覚的質問応答(VQA)のための問題定式化を促進する。
私たちは、彼らのカバレッジ、回答された質問の一部、そしてその部分のエラーの両方を分析します。
最高のパフォーマンスモデルは、VQA v2データセットで71%以上の精度を達成するが、そのオプションを導入することで、低いエラー(1%)のリスクを達成するために、8%未満の質問に答えることが制限されることがわかった。
これにより、マルチモーダル選択関数を用いて、予測された回答の正しさを直接推定し、例えば5.0%から16.7%のカバレッジを3倍にすることができることを示す。
論文 参考訳(メタデータ) (2022-04-28T16:51:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。