論文の概要: Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding
- arxiv url: http://arxiv.org/abs/2510.08668v1
- Date: Thu, 09 Oct 2025 17:06:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-10-14 00:38:47.315003
- Title: Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding
- Title(参考訳): Hulu-Med:全体像理解のための透明なジェネリストモデル
- Abstract要約: Hulu-Medは透明な医療用VLMで、これらすべてのモダリティの理解を統一する。
パッチベースのビジョンエンコーダとLCMデコーダを統一して構築され、Hulu-Medは2Dから3D、ビデオの理解のために167万 (M) のサンプルを徐々に訓練した。
- 参考スコア(独自算出の注目度): 112.46150793476603
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-world clinical decision-making grapples with integrating information from diverse data modalities, including medical text, 2D/3D images, and video, leading to inefficiencies and potential diagnostic oversights. While generalist vision-language models (VLMs) offer promise, their medical development faces challenges of opaque pipelines, data scarcity, and architectural inflexibility. Here we present Hulu-Med, a transparent medical VLM that unifies understanding across all these modalities. Built upon a unified patch-based vision encoder and an LLM decoder, Hulu-Med was progressively trained on 16.7 million (M) samples to scale from 2D to 3D and video comprehension. The medical-aware token reduction enables efficient training, requiring only 4,000 to 40,000 GPU hours for 7B to 32B parameter variants. Extensive evaluation across 30 benchmarks exhibits state-of-the-art performance, surpassing leading open-source models and competing with proprietary systems in tasks spanning visual question-answering, medical report generation, and complex reasoning in multilingual and rare disease scenarios. By open-sourcing our complete pipeline, we establish that high-performance medical VLM can be achieved transparently, providing a foundational tool for accessible and impactful clinical AI. Code is released on \href{https://github.com/ZJUI-AI4H/Hulu-Med}{https://github.com/ZJUI-AI4H/Hulu-Med}.
- Abstract(参考訳): 現実の臨床的意思決定は、医療用テキスト、2D/3D画像、ビデオなどの様々なデータモダリティからの情報を統合することで、非効率性と潜在的な診断監督につながる。
一般的なビジョン言語モデル(VLM)は約束を提供するが、その医療開発は不透明なパイプライン、データの不足、アーキテクチャの柔軟性といった課題に直面している。
ここでは、Hulu-Medという透明な医療用VLMを紹介します。
パッチベースのビジョンエンコーダとLCMデコーダを統一して構築され、Hulu-Medは2Dから3D、ビデオの理解のために167万 (M) のサンプルを徐々に訓練した。
医療対応トークンの削減は、効率的なトレーニングを可能にし、7Bから32Bパラメータの変種に対して、わずか4,000から40,000のGPU時間しか必要としない。
30ベンチマークにわたる大規模な評価は、最先端のパフォーマンスを示し、主要なオープンソースモデルを超え、視覚的質問応答、医療報告生成、多言語およびまれな疾患シナリオにおける複雑な推論を含むタスクにおいて、プロプライエタリなシステムと競合する。
完全なパイプラインをオープンソース化することで、高性能な医療用VLMを透過的に実現し、アクセシブルで影響力のある臨床AIの基礎となるツールを提供する。
コードは \href{https://github.com/ZJUI-AI4H/Hulu-Med}{https://github.com/ZJUI-AI4H/Hulu-Med} で公開されている。
関連論文リスト
- MEDLAYXPLAIN: Benchmarking the Expert-Lay Gap in Medical Vision-Language Models [1.7578235992860856]
我々はMedLayXPlainを紹介した。MedLay言語生成のための最初の大規模ベンチマークおよび評価フレームワークである。
MedLayXPlain-122Kは、12の公開ソースデータセットから8つの画像モダリティにわたる122,789の領域基底サンプルを提供する。
また,27B検証器から抽出した軽量な3B評価器であるMedLayEvalについても紹介した。
論文 参考訳(メタデータ) (2026-06-19T08:06:09Z) - MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images [25.29568841502814]
一般化MLLMアーキテクチャ上に構築された医療基盤モデルであるMedMOを紹介する。
VQAベンチマークでは、MedMOはベースラインよりも平均精度が+13.7%向上した。
医療報告生成において、MedMOは意味的および臨床的正確性の両方において大きな利益をもたらす。
論文 参考訳(メタデータ) (2026-02-06T18:59:59Z) - DuPLUS: Dual-Prompt Vision-Language Framework for Universal Medical Image Segmentation and Prognosis [5.494301428436596]
効率的なマルチモーダル医療画像解析のためのディープラーニングフレームワークであるDuPLUSを紹介する。
DuPLUSは、階層的セマンティックプロンプトを利用して分析タスクのきめ細かい制御を行う新しい視覚言語フレームワークを導入した。
セグメンテーションのために、DuPLUSは、30以上の臓器と腫瘍タイプを含む10の異なる医療データセットである3つの画像モダリティを一般化することができる。
論文 参考訳(メタデータ) (2025-10-03T20:01:00Z) - MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos [16.86256309424395]
MedVideoCap-55Kは、医用ビデオ生成のための、最初の大規模、多様な、キャプションに富んだデータセットである。
実際の医療シナリオにまたがる55,000以上のキュレートされたクリップで構成されている。
このデータセット上に構築されたMedGenは,オープンソースモデル間での先行的なパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-07-08T04:58:36Z) - MedGemma Technical Report [75.88152277443179]
MedGemmaは、Gemma 3 4Bと27Bをベースとした医療ビジョン言語基盤モデルの集合体である。
MedGemmaは、画像とテキストの高度な医学的理解と推論を実証する。
また、SigLIPから派生した医用目視エンコーダであるMedSigLIPを紹介する。
論文 参考訳(メタデータ) (2025-07-07T17:01:44Z) - Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning [57.873833577058]
医療知識の豊富なマルチモーダルデータセットを構築した。
次に医学専門のMLLMであるLingshuを紹介します。
Lingshuは、医療専門知識の組み込みとタスク解決能力の向上のために、マルチステージトレーニングを行っている。
論文 参考訳(メタデータ) (2025-06-08T08:47:30Z) - OmniV-Med: Scaling Medical Vision-Language Model for Universal Visual Understanding [35.35197484810533]
我々はマルチモーダル医療理解のための統合フレームワークであるOmniV-Medを紹介する。
我々は,多解像度2D/3D画像と映像を統一アーキテクチャで処理する回転位置適応エンコーダを考案した。
本稿では,ボリュームデータと医用ビデオの空間的冗長性を生かした,医療対応型トークンプルーニング機構を提案する。
論文 参考訳(メタデータ) (2025-04-20T17:53:56Z) - HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale [29.956053068653734]
私たちは13万の医療用VQAサンプルでPubMedVisionデータセットを作成します。
PubMedVisionを用いて34Bの医療MLLM HuatuoGPT-Visionを訓練し、医療マルチモーダルシナリオにおいて優れたパフォーマンスを示す。
論文 参考訳(メタデータ) (2024-06-27T15:50:41Z) - Medical Vision-Language Pre-Training for Brain Abnormalities [96.1408455065347]
本稿では,PubMedなどの公共リソースから,医用画像・テキスト・アライメントデータを自動的に収集する方法を示す。
特に,まず大きな脳画像テキストデータセットを収集することにより,事前学習プロセスの合理化を図るパイプラインを提案する。
また,医療領域におけるサブフィギュアをサブキャプションにマッピングするというユニークな課題についても検討した。
論文 参考訳(メタデータ) (2024-04-27T05:03:42Z) - Med-Flamingo: a Multimodal Medical Few-shot Learner [58.85676013818811]
医療領域に適応したマルチモーダル・数ショット学習者であるMed-Flamingoを提案する。
OpenFlamingo-9Bに基づいて、出版物や教科書からの医療画像テキストデータのペア化とインターリーブ化を継続する。
本研究は,医療用VQA(ジェネレーティブ医療用VQA)の最初の人間評価である。
論文 参考訳(メタデータ) (2023-07-27T20:36:02Z) - Customizing General-Purpose Foundation Models for Medical Report
Generation [64.31265734687182]
ラベル付き医用画像-レポートペアの不足は、ディープニューラルネットワークや大規模ニューラルネットワークの開発において大きな課題となっている。
本稿では,コンピュータビジョンと自然言語処理の基盤モデル (FM) として,市販の汎用大規模事前学習モデルのカスタマイズを提案する。
論文 参考訳(メタデータ) (2023-06-09T03:02:36Z) - LLaVA-Med: Training a Large Language-and-Vision Assistant for
Biomedicine in One Day [85.19963303642427]
本稿では,バイオメディカルイメージのオープンな研究課題に答えられる視覚言語対話アシスタントを訓練するための費用効率のよいアプローチを提案する。
モデルはまず、フィギュア・キャプションのペアを使ってバイオメディカル・ボキャブラリをアライメントし、その後、オープンエンドの会話意味論を習得する。
これにより、バイオメディジンのための大規模言語と視覚アシスタントを15時間以内で(8つのA100で)訓練することができる。
論文 参考訳(メタデータ) (2023-06-01T16:50:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。