論文の概要: Is There Knowledge Left to Extract? Evidence of Fragility in Medically Fine-Tuned Vision-Language Models
- arxiv url: http://arxiv.org/abs/2604.09841v1
- Date: Fri, 10 Apr 2026 19:14:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:15.704463
- Title: Is There Knowledge Left to Extract? Evidence of Fragility in Medically Fine-Tuned Vision-Language Models
- Title(参考訳): 抽出すべき知識は残されているか? 医療用微調整視覚言語モデルにおける脆弱性の証拠
- Authors: Oliver McLaughlin, Daniel Shubin, Carsten Eickhoff, Ritambhara Singh, William Rudman, Michal Golovanevsky,
- Abstract要約: 我々は,4つの医用画像処理タスクに対して,オープンソースビジョン言語モデル(VLM)を4つ評価した。
その結果,タスクの難易度が増大するにつれて,パフォーマンスがほぼランダムなレベルに低下し,臨床上の理由が限定されることが判明した。
医療用VLMの性能は脆弱で、即時依存であり、ドメイン固有の微調整によって確実に改善されない。
- 参考スコア(独自算出の注目度): 23.48481783960546
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) are increasingly adapted through domain-specific fine-tuning, yet it remains unclear whether this improves reasoning beyond superficial visual cues, particularly in high-stakes domains like medicine. We evaluate four paired open-source VLMs (LLaVA vs. LLaVA-Med; Gemma vs. MedGemma) across four medical imaging tasks of increasing difficulty: brain tumor, pneumonia, skin cancer, and histopathology classification. We find that performance degrades toward near-random levels as task difficulty increases, indicating limited clinical reasoning. Medical fine-tuning provides no consistent advantage, and models are highly sensitive to prompt formulation, with minor changes causing large swings in accuracy and refusal rates. To test whether closed-form VQA suppresses latent knowledge, we introduce a description-based pipeline where models generate image descriptions that a text-only model (GPT-5.1) uses for diagnosis. This recovers a limited additional signal but remains bounded by task difficulty. Analysis of vision encoder embeddings further shows that failures stem from both weak visual representations and downstream reasoning. Overall, medical VLM performance is fragile, prompt-dependent, and not reliably improved by domain-specific fine-tuning.
- Abstract(参考訳): 視覚言語モデル(VLM)は、ドメイン固有の微調整によってますます適応している。
脳腫瘍, 肺炎, 皮膚癌, 病理組織学的分類の4つの課題について, 4つの組のオープンソースVLM(LLaVA vs. LLaVA-Med; Gemma vs. MedGemma)を評価した。
その結果,タスクの難易度が増大するにつれて,パフォーマンスがほぼランダムなレベルに低下し,臨床上の理由が限定されることが判明した。
医学的な微調整は、一貫した優位性を持たず、モデルは非常に敏感であり、微妙な変化が正確さと拒絶率の大きな揺らぎを引き起こしている。
クローズドフォームVQAが潜伏知識を抑制するかどうかを検証するために,テキストのみのモデル(GPT-5.1)が診断に使用する画像記述をモデルが生成する記述ベースパイプラインを導入する。
これにより、制限された追加信号が回復するが、タスクの困難さによって境界が保たれる。
視覚エンコーダの埋め込みの解析により、失敗は弱い視覚表現と下流の推論の両方から生じることが示された。
全体として、医療用VLMの性能は脆弱であり、即時依存であり、ドメイン固有の微調整によって確実に改善されない。
関連論文リスト
- MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering [8.481971263315854]
textscMedLVRは、自動テキストデコーディングに明示的な視覚的エビデンス状態を導入する。
潜在的な視覚的推論は、診断に関連のある視覚的証拠を保存するための効果的なメカニズムを提供する。
論文 参考訳(メタデータ) (2026-04-10T16:03:03Z) - MedObvious: Exposing the Medical Moravec's Paradox in VLMs via Clinical Triage [20.835664121303534]
ビジョン言語モデル(VLM)は、医療報告生成や視覚的質問応答といったタスクにますます使われています。
臨床実践では、解釈は診断前の衛生検査から始まる。
既存のベンチマークでは、このステップが解決されたと仮定しており、致命的な障害モードを見逃している。
我々は1,880タスクのベンチマークであるMedObviousを導入し、入力検証をセットレベルの一貫性機能として分離する。
論文 参考訳(メタデータ) (2026-03-24T17:59:54Z) - Unleashing Video Language Models for Fine-grained HRCT Report Generation [15.816436105926542]
AbSteeringは、ビデオLMをHRCTの正確なレポート生成に活用する、異常中心のフレームワークである。
以上の結果より,高ボリューム医用画像の転送性は高いことが示唆された。
論文 参考訳(メタデータ) (2026-03-12T21:34:38Z) - Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge [66.67024684187915]
LVLM(Large Vision Language Models)は、眼科における自動診断の可能性を秘めている。
彼らの臨床展開は、ドメイン固有の知識の欠如によって著しく妨げられている。
EyExInは、Deep Expert Injectionメカニズムを通じて専門知識で網膜VLMを固定するように設計されたフレームワークである。
論文 参考訳(メタデータ) (2026-03-07T09:43:49Z) - Route, Retrieve, Reflect, Repair: Self-Improving Agentic Framework for Visual Detection and Linguistic Reasoning in Medical Imaging [3.6136448489318695]
医用イメージングを4つの協調エージェントに分解するエージェントフレームワークであるR4を提案する。
R4 は LLM-as-a-Judge のスコアを約 +1.7-2.5 で、mAP50 は 2.5-+3.5 の絶対点を強い単VLM ベースライン上で連続的に引き上げる。
論文 参考訳(メタデータ) (2026-01-13T03:44:06Z) - Med-VCD: Mitigating Hallucination for Medical Large Vision Language Models through Visual Contrastive Decoding [0.8431877864777443]
医用LVLMにおける幻覚を、二次復号の時間的オーバーヘッドを伴わずに緩和する、疎視的復号法であるMed-VCDを導入する。
以上の結果から,Med-VCDは平均13%,幻覚精度は6%向上した。
論文 参考訳(メタデータ) (2025-12-01T17:40:03Z) - TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models [54.48710348910535]
既存の医学推論ベンチマークは、主に1回の訪問からの画像に基づいて患者の状態を分析することに焦点を当てている。
臨床訪問における患者の状態の変化を分析するための最初のベンチマークであるTemMed-Benchを紹介する。
論文 参考訳(メタデータ) (2025-09-29T17:51:26Z) - Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding [45.248265283405004]
現在のモデルは、非効率な注意機構ときめ細かいトークン表現の欠如により、テキスト記述と病気領域を関連付けるのに苦労している。
本稿では、VLMの説明可能性マップを用いて、適切な画像特徴を識別する病原体認識プロンプト(DAP)を提案する。
DAPは3つの主要な胸部X線データセットの最先端手法と比較して、視覚的接地精度を20.74%向上させる。
論文 参考訳(メタデータ) (2025-05-21T05:16:45Z) - MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models [49.765466293296186]
近年,Med-LVLM (Med-LVLMs) の進歩により,対話型診断ツールの新たな可能性が高まっている。
Med-LVLMは、しばしば事実の幻覚に悩まされ、誤った診断につながることがある。
我々は,Med-LVLMの現実性を高めるために,多目的マルチモーダルRAGシステムMMed-RAGを提案する。
論文 参考訳(メタデータ) (2024-10-16T23:03:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。