論文の概要: HarMoE: Multi-Source Chest Radiograph Pretraining with Dataset-Disentangled Experts
- arxiv url: http://arxiv.org/abs/2608.02252v1
- Date: Mon, 03 Aug 2026 14:00:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.586774
- Title: HarMoE: Multi-Source Chest Radiograph Pretraining with Dataset-Disentangled Experts
- Title(参考訳): HarMoE: Dataset-Disentangled Expertsによるマルチソース胸部X線撮影
- Authors: Haozhe Luo, Ziyu Zhou, Shelley Zixin Shu, Mauricio Reyes,
- Abstract要約: HarMoEはデータセット対応のミックスオブエキスパートフレームワークで、共有データセットの医療セマンティクスを学習する。
大規模な胸部X線ベンチマークの実験では、HarMoEはゼロショットの分類転送を一貫して改善している。
- 参考スコア(独自算出の注目度): 6.917612472314974
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent vision-language models for chest X-ray understanding are largely built on image-report alignment and therefore rely heavily on MIMIC-CXR as the dominant pretraining source. While effective at scale, this paradigm underexplores an important alternative source of supervision: a range of existing multi-label classification datasets, which provide cleaner and more explicit disease signals than free-text reports, and can offer broader pathology coverage when combined across sources. However, learning from such heterogeneous datasets is nontrivial, as differences in label ontologies, annotation protocols, acquisition pipelines, and report styles can cause models to entangle clinical semantics with dataset identity, leading to poor transfer despite increased scale. In this work, we revisit radiology VLM construction from the perspective of harmonized multi-source learning. We propose HarMoE, a dataset-aware mixture-of-experts framework that learns shared cross-dataset medical semantics while confining source-specific variation to lightweight residual experts in deeper decoder layers. To further exploit clean supervision from labeled datasets, we train in a unified disease vocabulary with masked multi-dataset supervision, enabling the model to leverage complementary annotations without introducing false negatives. Experiments on large-scale chest X-ray benchmarks show that HarMoE consistently improves zero-shot classification, out-of-distribution transfer, and grounding over strong baselines. Our results suggest that building robust radiology VLMs requires moving beyond single-source image-report alignment toward structured knowledge construction from heterogeneous datasets with cleaner supervision and broader coverage. Code and the 873k harmonized dataset will be released at https://github.com/Roypic/harmoe.
- Abstract(参考訳): 胸部X線理解のための近年の視覚言語モデルは、主に画像レポートアライメントに基づいて構築されているため、MIMIC-CXRを主要な事前学習源として大きく依存している。
既存の多ラベル分類データセットは、自由テキストレポートよりもクリーンで明示的な疾患信号を提供し、ソースをまたいで組み合わせた場合により広い病態カバレッジを提供する。
しかし、ラベルオントロジー、アノテーションプロトコル、取得パイプライン、レポートスタイルの違いは、モデルにデータセットの同一性を伴う臨床的意味論を絡め込ませる原因となり、規模が大きくなるにもかかわらず転送が貧弱になるため、そのような異種データセットからの学習は簡単ではない。
本研究では,調和型マルチソース学習の観点から,放射線学のVLM構築を再考する。
我々は、より深いデコーダ層における軽量な残留専門家にソース固有のバリエーションを補足しながら、共有データセットの医療意味論を学習する、データセット対応のミックス・オブ・エキスパートフレームワークであるHarMoEを提案する。
ラベル付きデータセットからのクリーンな監視をさらに活用するため、マスク付きマルチデータセット監視による統一的な疾患語彙をトレーニングし、偽陰性を導入することなく補完的なアノテーションを活用することができる。
大規模な胸部X線ベンチマークの実験では、HarMoEはゼロショット分類、分布外移動、強いベースラインの接地を一貫して改善している。
以上の結果から,ロバストなラジオロジーVLMの構築には,よりクリーンな監視と広範なカバレッジを備えた異種データセットから構築された知識構築へ,単一ソースのイメージレポートアライメントを超えて移行する必要があることが示唆された。
Codeと873kの調和データセットはhttps://github.com/Roypic/harmoe.comでリリースされる。
関連論文リスト
- AnchorDiff: Topology-Aware Masked Diffusion with Confidence-based Rewriting for Radiology Report Generation [2.2748974006378933]
医用画像から臨床的に正確なテキストレポートを自動生成することを目的とする。
既存の手法は自己回帰(AR)言語モデルに依存しており、因果依存性構造は生成を一方向の左から右へのプロセスに制限する。
本稿では,知識グラフに基づく臨床アンカーを拡散言語モデリングに統合したRRGのための最初のマスク付き拡散フレームワークであるAnchorDiffを提案する。
論文 参考訳(メタデータ) (2026-05-16T16:42:43Z) - Exploring the Capabilities of LLM Encoders for Image-Text Retrieval in Chest X-rays [8.019362739504087]
視覚言語による事前訓練は画像とテキストのアライメントが進んでいるが、臨床報告の不均一性によって放射線学の進歩が制限されている。
我々は,大規模言語モデル (LLM) エンコーダが,多様なスタイルにまたがる堅牢な臨床表現を提供できるかどうかを問う。
胸部X線レポート用のドメイン適応エンコーダLLM2VEC4CXRと、このエンコーダとビジョンバックボーンを結合するデュアルトウワーフレームワークLLM2CLIP4CXRを紹介する。
論文 参考訳(メタデータ) (2025-09-17T09:44:59Z) - SimCroP: Radiograph Representation Learning with Similarity-driven Cross-granularity Pre-training [25.763109982379703]
胸部CTにおける類似性駆動型クロスグラニュラリティ事前学習フレームワークを提案する。
類似性駆動アライメントとクロスグラニュラリティ融合を組み合わせて、ラジオグラフィーの解釈を改善する。
SimCroPは、大規模なペアCTレポートデータセットで事前トレーニングされ、画像分類とセグメンテーションタスクで検証される。
論文 参考訳(メタデータ) (2025-09-10T06:20:53Z) - Privacy-Preserving Chest X-ray Report Generation via Multimodal Federated Learning with ViT and GPT-2 [0.1874930567916036]
IU-Xrayデータセットを用いた胸部X線レポート生成のためのマルチモーダルフェデレートラーニングフレームワークを提案する。
このシステムは、ヴィジュアルトランスフォーマー(ViT)をエンコーダとして、GPT-2をレポートジェネレータとして使用し、生データを共有せずに分散トレーニングを可能にする。
その結果、FLは臨床的に関連性があり、セマンティックにリッチな放射線学レポートを作成する際に、集中型モデルと一致または超えることができることがわかった。
論文 参考訳(メタデータ) (2025-05-27T20:01:12Z) - Cross-Modal Causal Intervention for Medical Report Generation [107.76649943399168]
放射線医学報告生成(RRG)は, コンピュータ支援診断と薬剤指導に不可欠である。
視覚言語的バイアスによる急激な相関により、正確な病変記述の生成は依然として困難である。
我々はCrossModal Causal Representation Learning (CMCRL)という2段階のフレームワークを提案する。
IU-XrayとMIMIC-CXRの実験により、我々のCMCRLパイプラインは最先端の手法よりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2023-03-16T07:23:55Z) - Breaking with Fixed Set Pathology Recognition through Report-Guided
Contrastive Training [23.506879497561712]
我々は、非構造化医療報告から直接概念を学ぶために、対照的なグローバルローカルなデュアルエンコーダアーキテクチャを採用している。
疾患分類のための大規模胸部X線データセットMIMIC-CXR,CheXpert,ChestX-Ray14について検討した。
論文 参考訳(メタデータ) (2022-05-14T21:44:05Z) - Many-to-One Distribution Learning and K-Nearest Neighbor Smoothing for
Thoracic Disease Identification [83.6017225363714]
ディープラーニングは、病気の識別性能を改善するための最も強力なコンピュータ支援診断技術となった。
胸部X線撮影では、大規模データの注釈付けには専門的なドメイン知識が必要で、時間を要する。
本論文では、単一モデルにおける疾患同定性能を改善するために、複数対1の分布学習(MODL)とK-nearest neighbor smoothing(KNNS)手法を提案する。
論文 参考訳(メタデータ) (2021-02-26T02:29:30Z) - Learning Invariant Feature Representation to Improve Generalization
across Chest X-ray Datasets [55.06983249986729]
我々は、トレーニングデータと同じデータセットでテストすると、ディープラーニングモデルが、異なるソースからデータセットでテストされると、パフォーマンスが低下し始めることを示す。
対戦型トレーニング戦略を用いることで、ネットワークはソース不変表現を学習せざるを得ないことを示す。
論文 参考訳(メタデータ) (2020-08-04T07:41:15Z) - Deep Mining External Imperfect Data for Chest X-ray Disease Screening [57.40329813850719]
我々は、外部のCXRデータセットを組み込むことで、不完全なトレーニングデータにつながると論じ、課題を提起する。
本研究は,多ラベル病分類問題を重み付き独立二分課題として分類する。
我々のフレームワークは、ドメインとラベルの相違を同時にモデル化し、対処し、優れた知識マイニング能力を実現する。
論文 参考訳(メタデータ) (2020-06-06T06:48:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。