論文の概要: Solve the Missing First Step: Can VLMs Standardize Raw Heterogeneous Medical Data?
- arxiv url: http://arxiv.org/abs/2607.04694v1
- Date: Mon, 06 Jul 2026 05:52:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.053143
- Title: Solve the Missing First Step: Can VLMs Standardize Raw Heterogeneous Medical Data?
- Title(参考訳): VLMは不均一な医療データを標準化できるのか?
- Authors: Xin Chen, Dongliang Xu, Cunhao Zhu, Xudong Luo, Haoyang Lyu, Xiaoxiao Sun, Serena Yeung-Levy, Yue Yao,
- Abstract要約: 生の医療データは、しばしば生で異質で、異なるソースで断片化されている。
モデルは、ソースフォーマットを識別し、生の医用画像をVLM互換の視覚入力に変換し、関連するテキスト情報を抽出し、結果を構造化された画像とテキストのペアに整理する能力に基づいて評価される。
本研究は,医療用AI診断における重要なボトルネックとして,生医療データの標準化に注目した。
- 参考スコア(独自算出の注目度): 22.530682215493798
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As vision-language models (VLMs) are increasingly applied to medical AI, existing benchmarks mainly focus on evaluating their diagnosis ability over given medical images and texts, implicitly assuming that standardized medical images, texts or question-answer pairs are already prepared. However, this assumption does not hold when we apply VLMs in real clinical practice, where medical data is often raw, heterogeneous, and fragmented across different sources. In this paper, we study this missing step, i.e., raw medical data standardization. Specifically, models are given raw dataset folders and evaluated on their ability to identify source formats, convert raw medical images into VLM-compatible visual inputs, extract relevant textual information, and organize the results into structured image-text pairs. To construct this Medical Data Standardization Benchmark (MDS-Bench), we manually annotate 1,939 raw medical data standardization tasks covering diverse clinical practice, radiology modalities, annotation formats, and directory layouts. Extensive experiments show that even the best performing VLMs, i.e., Gemini 3 Flash, achieve only 48.6% end-to-end success rate. Our research highlights raw medical data standardization as a critical bottleneck for medical AI diagnosis in real practice.
- Abstract(参考訳): ヴィジュアル言語モデル(VLM)が医療AIにますます適用されるにつれて、既存のベンチマークは主に与えられた医療画像やテキストよりも診断能力を評価することに集中し、標準化された医療画像、テキスト、質問応答ペアがすでに準備されていることを暗黙的に仮定している。
しかし、この仮定は、医療データが生で異質で、異なるソースで断片化されることが多い、実際の臨床実践でVLMを適用する際には成立しない。
本稿では、この欠落したステップ、すなわち生医療データの標準化について検討する。
具体的には、モデルに生のデータセットフォルダを付与し、ソースフォーマットを識別し、生の医用画像をVLM互換の視覚入力に変換し、関連するテキスト情報を抽出し、結果を構造化された画像とテキストのペアに整理する能力について評価する。
この医療データ標準化ベンチマーク(MDS-Bench)を構築するために,臨床,放射線学,アノテーションフォーマット,ディレクトリレイアウトなどを含む1,939の生医療データ標準化タスクを手作業でアノテートする。
大規模な実験では、最高のパフォーマンスを持つVLM、すなわちGemini 3 Flashでさえ、エンドツーエンドの成功率は48.6%に過ぎなかった。
本研究は,医療用AI診断における重要なボトルネックとして,生医療データの標準化に注目した。
関連論文リスト
- MetaDent: Labeling Clinical Images for Vision-Language Models in Dentistry [32.93319761809706]
VLM(Vision-Language Models)は、医用画像解析において重要な可能性を示している。
口内撮影におけるそれらの応用は、細粒度で注釈付きデータセットと包括的なベンチマークが欠如していることから、いまだほとんど探索されていない。
本稿では, 臨床, 公衆およびWebソースから収集した, 新規で大規模な歯科画像データセットを含む包括的リソースであるMetaDentについて紹介する。
論文 参考訳(メタデータ) (2026-04-16T10:56:54Z) - MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities [89.81463562506637]
医用画像のための最初のリアルタイムオープン語彙検出モデルであるMedROVを紹介する。
対照的な学習とクロスモーダル表現を活用することで、MedROVは既知の構造と新しい構造の両方を効果的に検出する。
論文 参考訳(メタデータ) (2025-11-25T18:59:53Z) - On the Risk of Misleading Reports: Diagnosing Textual Biases in Multimodal Clinical AI [4.866086225040713]
本稿では,モデルが二項分類タスクにおける各モータリティに依存することを定量化するための摂動に基づくアプローチを提案する。
画像やテキストを反対のラベルと交換することで、モダリティ固有のバイアスを露呈する。
論文 参考訳(メタデータ) (2025-07-31T21:35:52Z) - Towards Domain Specification of Embedding Models in Medicine [1.0713888959520208]
MTEB(Massive Text Embedding Benchmark)に基づく分類,クラスタリング,ペア分類,検索を対象とする51タスクの総合ベンチマークスイートを提案する。
以上の結果から,本手法はロバストな評価枠組みを確立し,各タスクにおける工芸品の代替品の状態を常に上回り,組込み性能が向上することを示した。
論文 参考訳(メタデータ) (2025-07-25T16:15:00Z) - UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities [68.12889379702824]
対照的な学習によって訓練された視覚言語モデル(VLM)は、自然画像タスクにおいて顕著な成功を収めた。
UniMedは530万以上の画像テキストペアからなる、大規模でオープンソースのマルチモーダル医療データセットである。
我々は、6つのモダリティのための統一VLMであるUniMed-CLIPを訓練し、ゼロショット評価において顕著な利益を得た。
論文 参考訳(メタデータ) (2024-12-13T18:59:40Z) - GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI [67.09501109871351]
LVLM(Large Vision-Language Model)は、画像、テキスト、生理学的信号などの多様なデータタイプを扱うことができる。
GMAI-MMBenchは、よく分類されたデータ構造と、これまででもっとも包括的な一般医療用AIベンチマークである。
38の医療画像モダリティ、18の臨床関連タスク、18の部門、視覚質問回答(VQA)フォーマットの4つの知覚的粒度からなる284のデータセットで構成されている。
論文 参考訳(メタデータ) (2024-08-06T17:59:21Z) - Medical Vision-Language Pre-Training for Brain Abnormalities [96.1408455065347]
本稿では,PubMedなどの公共リソースから,医用画像・テキスト・アライメントデータを自動的に収集する方法を示す。
特に,まず大きな脳画像テキストデータセットを収集することにより,事前学習プロセスの合理化を図るパイプラインを提案する。
また,医療領域におけるサブフィギュアをサブキャプションにマッピングするというユニークな課題についても検討した。
論文 参考訳(メタデータ) (2024-04-27T05:03:42Z) - LVM-Med: Learning Large-Scale Self-Supervised Vision Models for Medical
Imaging via Second-order Graph Matching [59.01894976615714]
LVM-Medは、大規模医療データセットに基づいてトレーニングされた、最初のディープネットワークファミリーである。
55の公開データセットから約13万の医療画像を収集しました。
LVM-Medは、多くの最先端の教師付き、自己監督型、基礎モデルよりも経験的に優れている。
論文 参考訳(メタデータ) (2023-06-20T22:21:34Z) - MedFMC: A Real-world Dataset and Benchmark For Foundation Model
Adaptation in Medical Image Classification [41.16626194300303]
ファンデーションモデルは、多くの場合、大規模なデータで事前訓練されているが、様々なビジョンや言語アプリケーションのジャンプ開始において、最も成功している。
最近の進歩により、下流タスクにおける基礎モデルの適応は、少数のトレーニングサンプルだけで効率的に行えるようになった。
しかし, 医用画像解析におけるそのような学習パラダイムの適用は, 一般に公開されているデータやベンチマークが不足しているため, 依然として少ない。
論文 参考訳(メタデータ) (2023-06-16T01:46:07Z) - Vision-Language Modelling For Radiological Imaging and Reports In The
Low Data Regime [70.04389979779195]
本稿では,視覚および言語入力を共通空間に埋め込んだ医用視覚言語モデル(VLM)について検討する。
本稿では,新しい画像領域やテキスト領域への汎用事前学習モデルの適用など,低データ性能向上のためのいくつかの候補手法について検討する。
テキスト・ツー・イメージ検索をベンチマークとして,2つの胸部X線および放射線学的報告を用いた可変サイズのトレーニングデータセットを用いて,これらの手法の性能評価を行った。
論文 参考訳(メタデータ) (2023-03-30T18:20:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。