論文の概要: Evaluating and Understanding Model Editing for Medical Vision Language Models
- arxiv url: http://arxiv.org/abs/2607.05310v1
- Date: Mon, 06 Jul 2026 16:49:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.245452
- Title: Evaluating and Understanding Model Editing for Medical Vision Language Models
- Title(参考訳): 医用視覚言語モデルのためのモデル編集の評価と理解
- Abstract要約: M3Benchは,マルチモーダルモデル編集のための臨床応用ベンチマークである。
6つの医用および一般的な視覚言語モデルにまたがる4つの代表的編集者を評価した結果,全ての基準を超越する手法が存在しないことがわかった。
全体として、M3Benchはマルチモーダルモデル編集のための厳格な臨床ストレステストを確立し、より安全なデプロイ後適応のための実用的なガイダンスを提供する。
- 参考スコア(独自算出の注目度): 9.348457930247791
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Model editing promises a fast, targeted way to correct post-deployment mistakes in medical vision-language models (VLMs) without costly retraining. However, existing multimodal model editing benchmarks focus on general-purpose tasks and do not reflect realistic clinical domain requirements and variability. To address this, we introduce M3Bench, a clinically grounded benchmark for multimodal model editing that evaluates whether an edit remains reliable, precise, and generalizable under the challenges of image and text variation, modality and protocol shifts, clinical knowledge composition, and temporal progression. M3Bench contains 16,276 questions spanning diverse anatomy, modalities, and specialties, and supports both single and sequential edits. By evaluating 4 representative editors across 6 medical and general VLMs, we find that no method excels across all criteria. Gradient-based editors achieve strong transfer but suffer from catastrophic locality violations, whereas memory-based methods preserve locality but lack compositional generality and exhibit high backbone-dependent hyperparameter sensitivity. We further attribute these failures to the latent space geometry of VLMs and how different editing methods shift its landscape. Overall, M3Bench establishes a rigorous clinical stress test for multimodal model editing and offers actionable guidance for safer post-deployment adaptation. The benchmark is publicly available at https://github.com/BioMed-AI-Lab-U-Michgan/M3Bench .
- Abstract(参考訳): モデル編集は、医療ビジョン言語モデル(VLM)のデプロイ後のミスを、コストのかかる再トレーニングなしに修正する、高速で目標とする手段を約束する。
しかし、既存のマルチモーダルモデル編集ベンチマークは汎用的なタスクに重点を置いており、現実的な臨床領域要件や変動性を反映していない。
この問題を解決するため,M3Benchは,画像とテキストのバリエーション,モダリティとプロトコルシフト,臨床知識構成,時間的進歩といった課題の下で,編集が信頼性,正確性,一般化可能かどうかを評価する,マルチモーダルモデル編集のための基礎的なベンチマークである。
M3Benchには、多様な解剖学、モダリティ、特殊性にまたがる16,276の質問が含まれており、単一の編集とシーケンシャルな編集の両方をサポートしている。
6つの医用および一般VLMにまたがる4つの代表的編集者を評価した結果,全ての基準を超越する手法が存在しないことがわかった。
グラディエントベースのエディタは強い転送を達成できるが、破滅的な局所性違反に悩まされる一方、メモリベースの手法では局所性は保たれるが、構成上の汎用性は欠如しており、背骨依存性のハイパーパラメーター感度が高い。
さらに、これらの失敗は、VLMの潜時空間幾何学と、異なる編集方法がランドスケープをどう変えているかに起因している。
全体として、M3Benchはマルチモーダルモデル編集のための厳格な臨床ストレステストを確立し、より安全なデプロイ後適応のための実用的なガイダンスを提供する。
ベンチマークはhttps://github.com/BioMed-AI-Lab-U-Michgan/M3Benchで公開されている。
関連論文リスト
- Concept-Grounded Reasoning with Prompt-Driven Localization for Interpretable Structured Report Generation [66.62662330558906]
CORALは、空間的接地と概念レベルの監督を統一的な推論プロセスに統合するマルチモーダルフレームワークである。
コーラルは、疾患の局所化とコンセプション・ボトルネックモジュールによる多クラス臨床属性の予測のために、プロンプト駆動型医療セグメンテーションモデルを採用している。
BUS-CoTとIU X線データセットの実験では、診断精度、概念整合性、報告品質が強力な汎用および医療MLLMよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-09-14T10:21:23Z) - TGC-Net: A Structure-Aware and Semantically-Aligned Framework for Text-Guided Medical Image Segmentation [56.09179939570486]
本稿では,パラメータ効率,タスク固有適応に着目したCLIPベースのフレームワークであるTGC-Netを提案する。
TGC-Netは、挑戦的なベンチマークで顕著なDiceゲインを含む、トレーニング可能なパラメータをかなり少なくして、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-12-24T12:06:26Z) - MedREK: Retrieval-Based Editing for Medical LLMs with Key-Aware Prompts [70.64143198545031]
本稿では,情報誘導のための注目型プロンプトエンコーダと正確なマッチングのための共有クエリキーモジュールを統合した検索ベースの編集フレームワークであるMedREKを提案する。
各種医用ベンチマークの結果から,MedREKは異なるコアメトリクス間で優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-10-15T12:50:33Z) - MultiMedEdit: A Scenario-Aware Benchmark for Evaluating Knowledge Editing in Medical VQA [31.344312340552495]
知識編集(KE)は、大規模な言語モデルにおいて、完全なリトレーニングなしに事実知識を更新するためのスケーラブルなアプローチを提供する。
臨床マルチモーダルタスクにおけるKEの評価に適した最初のベンチマークであるMultiMedEditを提案する。
我々のフレームワークは,タスクの理解と推論の両方にまたがり,3次元計量スイート(信頼性,一般性,局所性)を定義し,パラダイム間比較をサポートする。
論文 参考訳(メタデータ) (2025-08-09T15:36:08Z) - MedMKEB: A Comprehensive Knowledge Editing Benchmark for Medical Multimodal Large Language Models [5.253788190589279]
MedMKEBは,知識編集の信頼性,汎用性,局所性,可搬性,堅牢性を評価するために設計された,最初の総合的なベンチマークである。
MedMKEBは高品質な医用視覚質問応答データセット上に構築されており、慎重に構築された編集タスクに富んでいる。
ベンチマークの精度と信頼性を確保するために、人間の専門家による検証を組み込んだ。
論文 参考訳(メタデータ) (2025-08-07T07:09:26Z) - Multimodal Causal-Driven Representation Learning for Generalizable Medical Image Segmentation [56.52520416420957]
医用画像セグメンテーションにおける領域一般化に取り組むために, MCDRL(Multimodal Causal-Driven Representation Learning)を提案する。
MCDRLは競合する手法より一貫して優れ、セグメンテーション精度が優れ、堅牢な一般化性を示す。
論文 参考訳(メタデータ) (2025-08-07T03:41:41Z) - How Far Have Medical Vision-Language Models Come? A Comprehensive Benchmarking Study [16.84832179579428]
VLM(Vision-Language Models)は、Webスケールのコーパスを訓練し、自然画像のタスクに優れ、医療に利用されつつある。
本稿では,8つのベンチマークを用いて,オープンソース汎用および医療専門のVLMの総合評価を行う。
まず、大規模な汎用モデルは、いくつかのベンチマークで、すでに医学固有のモデルと一致しているか、あるいは超えている。
第二に、推論のパフォーマンスは理解よりも一貫して低く、安全な意思決定支援にとって重要な障壁を強調します。
論文 参考訳(メタデータ) (2025-07-15T11:12:39Z) - MEMOIR: Lifelong Model Editing with Minimal Overwrite and Informed Retention for LLMs [76.28901550926021]
寿命の長いモデル編集のための既存の方法は、妥協の一般化、過去の編集の妨害、長い編集シーケンスへのスケールの失敗である。
我々は,学習済みモデルのコア能力を保ちながら,残メモリを介して知識を注入する,新しいスケーラブルなフレームワークMEMOIRを提案する。
MeMOIRは信頼性、一般化、ローカリティのメトリクスにまたがる最先端のパフォーマンスを実現し、最小限の忘れ物で数千のシーケンシャルな編集にスケールする。
論文 参考訳(メタデータ) (2025-06-09T16:16:42Z) - MedBridge: Bridging Foundation Vision-Language Models to Medical Image Diagnosis [10.082738539201804]
最近の視覚言語基盤モデルは、自然画像分類の最先端結果を提供するが、ドメインシフトによる医用画像に干渉する。
MedBridgeは,医用画像の正確な診断のためにトレーニング済みのVLMを再利用した,軽量なマルチモーダル適応フレームワークである。
MedBridgeはマルチラベル胸部疾患の診断において最先端のVLM適応法と比較して6~15%改善した。
論文 参考訳(メタデータ) (2025-05-27T19:37:51Z) - Interactive Tumor Progression Modeling via Sketch-Based Image Editing [54.47725383502915]
腫瘍進行編集のためのスケッチベース拡散モデルであるSkEditTumorを提案する。
スケッチを構造的先行として活用することにより,構造的整合性と視覚的リアリズムを維持しつつ,腫瘍領域の精密な修正を可能にする。
私たちのコントリビューションには、医用画像編集のための拡散モデルとスケッチの新たな統合、腫瘍進行の可視化のきめ細かい制御、複数のデータセットにわたる広範な検証などが含まれています。
論文 参考訳(メタデータ) (2025-03-10T00:04:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。