論文の概要: MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models
- arxiv url: http://arxiv.org/abs/2607.07673v1
- Date: Wed, 08 Jul 2026 17:26:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.47629
- Title: MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models
- Title(参考訳): MedPMC:基礎モデルのための高忠実度医療マルチモーダルデータのスケーリングのためのシステムフレームワーク
- Abstract要約: MedPMCは,医療用マルチモーダルモデルのための,パーミッシブライセンスの文献を高忠実度インフラストラクチャに変換する自動フレームワークである。
6100万のPMC記事に適用されたMedPMCは、1100万の医療用画像テキストペアをキュレートした。
MedPMCで訓練されたCLIPスタイルの26のベンチマークでは、平均ゼロショットAUCが7.1ポイント向上した。
- 参考スコア(独自算出の注目度): 39.13366427393118
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Medicine is inherently multimodal, requiring clinicians to synthesize information across diverse data streams. Yet the development of multimodal foundation models is constrained by limited access to large-scale, high-quality clinical data. Although PubMed Central (PMC) offers a complementary source of expert-authored image-text data, existing PMC-derived resources remain limited in fidelity, reproducibility, and clinical validation. We introduce MedPMC, an automated, continuously updatable framework that transforms permissively licensed literature into high-fidelity infrastructure for medical multimodal models. Applied to 6.1 million PMC articles, MedPMC curated 11 million medical image-text pairs. Component evaluations showed strong performance for initial screening (F1 = 93.2), multi-panel figure detection (F1 = 96.5), figure separation (mAP = 89.8), caption separation and alignment (F1 = 81.4; ROUGE-L = 85.3), and medical figure classification (F1 = 96.5). Manual review by five annotators, three with medical training, found 95.3% of MedPMC images medically relevant, versus 19.7% in a prior PMC-derived dataset. Across 26 benchmarks spanning 11 specialties, a MedPMC-trained CLIP-style model improved average zero-shot AUC by 7.1 percentage points over the strongest architecture-matched biomedical CLIP baseline despite using fewer than half as many image-text pairs. As the vision encoder in a multimodal large language model, it improved medical visual question-answering by 1.9 and 16.9 percentage points across two benchmarks. In 10,524 Yale New Haven Health System dermatology photographs, it improved morphology-to-image retrieval Recall@5 by 11.7 percentage points. These findings show that high-fidelity literature curation strengthens medical multimodal foundation models across benchmark and clinical settings. We publicly release the framework, corpus, benchmarks, and pretrained models.
- Abstract(参考訳): 医学は本質的にマルチモーダルであり、臨床医は様々なデータストリームにまたがって情報を合成する必要がある。
しかし、マルチモーダル基礎モデルの開発は、大規模で高品質な臨床データへのアクセス制限によって制限されている。
PubMed Central (PMC) は、専門家による画像テキストデータの補完的な情報源を提供するが、既存のPMC由来のリソースは、忠実さ、再現性、臨床検証に限られている。
MedPMCは,医療用マルチモーダルモデルのための,パーミッシブライセンスの文献を高忠実度インフラストラクチャに変換する,自動更新可能なフレームワークである。
6100万のPMC記事に適用されたMedPMCは、1100万の医療用画像テキストペアをキュレートした。
コンポーネント評価では、初期スクリーニング(F1 = 93.2)、マルチパネルフィギュア検出(F1 = 96.5)、フィギュア分離(mAP = 89.8)、キャプション分離とアライメント(F1 = 81.4; ROUGE-L = 85.3)、医用フィギュア分類(F1 = 96.5)に強い性能を示した。
5人のアノテータによるマニュアルレビューでは、3人が医療訓練を受けており、95.3%のMedPMC画像が医学的に関連があるのに対し、以前のMCC由来のデータセットでは19.7%であった。
MedPMCで訓練されたCLIPスタイルの26のベンチマークでは、半分以下の画像テキストペアを使用しても、最強のアーキテクチャに適合したバイオメディカルCLIPベースラインよりも平均ゼロショットAUCを7.1ポイント改善した。
マルチモーダルな大言語モデルにおける視覚エンコーダとして、2つのベンチマークで1.9と16.9ポイントの医学的視覚的質問応答を改善した。
イェール・ニューヘイブン・ヘルス・システム(Yale New Haven Health System)の皮膚写真10,524枚で、画像検索のRecall@5を11.7%改善した。
これらの結果から,高忠実度文献キュレーションは,ベンチマークおよび臨床環境における医療マルチモーダル基盤モデルを強化することが示唆された。
フレームワーク、コーパス、ベンチマーク、事前訓練済みのモデルを公開しています。
関連論文リスト
- A visual large language foundational model for medical image recognition using clinician-oriented social media [21.681667706513423]
大規模言語モデル(LLM)は、様々な領域にまたがる強力な能力を示しており、医学においてかなりの可能性を示している。
ここでは、特定されていない医療画像と専門家による臨床指向のソーシャルメディアに関するコメントの活用について述べる。
先進的なLCMとループ内臨床検査を組み合わせることで,ThoughtMed-1Mを構築するための厳密なパイプラインを構築した。
論文 参考訳(メタデータ) (2026-09-07T01:30:34Z) - ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding [67.57715989349471]
MLLM(Multimodal large language model)は、臨床実践に革命をもたらす大きな可能性を秘めている。
我々は、総合的な医学的理解のために設計された視覚中心のMLLMであるClinFusionを紹介する。
ClinFusionは、総合的な2Dおよび3Dマルチモーダル・メディカル・ベンチマーク・スイートにまたがって、最先端の新たな状態を設定する。
論文 参考訳(メタデータ) (2026-07-27T17:59:49Z) - A Vision-language Framework for Comparative Reasoning in Radiology [68.52471827773482]
我々は,放射線学的比較を実体認識のクロスイメージ推論問題として定式化する。
我々は,日常的な画像とレポートのペアから得られた大規模比較画像資源を構築した。
臨床類似症例の検索を制御可能なエンティティ対応ビジュアルエンコーダであるMedReCoを開発した。
論文 参考訳(メタデータ) (2026-06-04T17:12:47Z) - MedGemma Technical Report [75.88152277443179]
MedGemmaは、Gemma 3 4Bと27Bをベースとした医療ビジョン言語基盤モデルの集合体である。
MedGemmaは、画像とテキストの高度な医学的理解と推論を実証する。
また、SigLIPから派生した医用目視エンコーダであるMedSigLIPを紹介する。
論文 参考訳(メタデータ) (2025-07-07T17:01:44Z) - From Embeddings to Accuracy: Comparing Foundation Models for Radiographic Classification [33.96915720287914]
ラジオグラフィー分類における軽量アダプタの訓練のための7つの基礎モデルからの埋め込みを評価する。
MedImageInsightの埋め込みとSVMとアダプタの組み合わせは、曲線(mAUC)における平均面積が93.1%に達した。
これらの軽量グループは計算効率が良く、数分でトレーニングし、CPU上で数秒で推論を行う。
論文 参考訳(メタデータ) (2025-05-16T03:39:46Z) - Multimodal Medical Disease Classification with LLaMA II [0.14999444543328289]
臨床報告に関連付けられた2次元胸部X線によるOpenIのテキストイメージペアデータセットを用いて検討した。
我々の焦点は、医療データセットから抽出したテキストと視覚情報を融合するための融合手法である。
新たに導入されたマルチモーダルアーキテクチャは、少ない労力で他のマルチモーダルデータセットに適用することができ、さらなる研究に容易に適応することができる。
論文 参考訳(メタデータ) (2024-12-02T09:18:07Z) - PE-MVCNet: Multi-view and Cross-modal Fusion Network for Pulmonary Embolism Prediction [4.659998272408215]
肺塞栓症(PE)の早期発見は、患者の生存率を高めるために重要である。
PE-MVCNetとよばれる多モード核融合法を提案する。
提案モデルは既存の手法より優れており, 単一のデータモダリティを用いたモデルと比較して, マルチモーダル融合モデルの方が優れていることを裏付けるものである。
論文 参考訳(メタデータ) (2024-02-27T03:53:27Z) - C^2M-DoT: Cross-modal consistent multi-view medical report generation
with domain transfer network [67.97926983664676]
ドメイン転送ネットワーク(C2M-DoT)を用いたクロスモーダルなマルチビュー医療レポート生成を提案する。
C2M-DoTは、すべてのメトリクスで最先端のベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2023-10-09T02:31:36Z) - LVM-Med: Learning Large-Scale Self-Supervised Vision Models for Medical
Imaging via Second-order Graph Matching [59.01894976615714]
LVM-Medは、大規模医療データセットに基づいてトレーニングされた、最初のディープネットワークファミリーである。
55の公開データセットから約13万の医療画像を収集しました。
LVM-Medは、多くの最先端の教師付き、自己監督型、基礎モデルよりも経験的に優れている。
論文 参考訳(メタデータ) (2023-06-20T22:21:34Z) - PMC-CLIP: Contrastive Language-Image Pre-training using Biomedical
Documents [35.64805788623848]
PMC-OAは,PubMedCentralのOpenAccessサブセットから1.6Mイメージキャプチャペアを収集したバイオメディカルデータセットである。
PMC-OAは様々なモダリティや病気をカバーしており、ほとんどの画像キャプチャーサンプルはよりきめ細かいレベルで調整されている。
PMC-OA上でCLIPスタイルのモデルを事前学習しながら、PMC-CLIPと呼ばれるモデルが、様々なダウンストリームタスクで最先端の結果を得る。
論文 参考訳(メタデータ) (2023-03-13T16:13:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。