論文の概要: ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding
- arxiv url: http://arxiv.org/abs/2607.24743v2
- Date: Tue, 28 Jul 2026 10:52:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 14:13:57.682456
- Title: ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding
- Title(参考訳): ClinFusion:ホロスティック医療理解のための視覚中心型マルチモーダルLCMシステム
- Abstract要約: MLLM(Multimodal large language model)は、臨床実践に革命をもたらす大きな可能性を秘めている。
我々は、総合的な医学的理解のために設計された視覚中心のMLLMであるClinFusionを紹介する。
ClinFusionは、総合的な2Dおよび3Dマルチモーダル・メディカル・ベンチマーク・スイートにまたがって、最先端の新たな状態を設定する。
- 参考スコア(独自算出の注目度): 67.57715989349471
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal large language models (MLLMs) hold immense potential to revolutionize clinical practice, yet deploying them in the medical domain is fundamentally a vision-centric challenge: models must absorb knowledge from heterogeneous 2D and 3D medical images, and evaluation protocols must align with radiologists' clinical practice and provide an accurate, fine-grained and factualness-driven assessment. In this paper, we introduce ClinFusion, a vision-centric MLLM designed for holistic medical understanding that systematically addresses these limitations. We propose a compositional and cascaded vision encoder architecture featuring a Cascade Spatial-Aware Locality Fusion operator that unifies diverse 2D and native 3D medical image understanding within a fused encoder. We further introduce a vision-grounded evaluation framework, including MedIF-Bench for instruction-following assessment and a region-of-interest-grounded method for clinically aligned and factualness-driven report generation evaluation. We show that ClinFusion sets a new state-of-the-art across a comprehensive suite of 2D and 3D multimodal medical benchmarks---spanning visual question answering, report generation, and instruction following---as well as textual medical tasks, outperforming leading open-source medical MLLMs (\textit{e.g.}, Hulu-Med, Lingshu) on 20 out of 24 benchmarks and demonstrating multimodal capabilities better than powerful proprietary models such as GPT-5.2 and Gemini-3-Flash on 13 out of 16 benchmarks, and can be further augmented with agentic tool use for retrieval-augmented and tool-assisted clinical workflows. A blinded evaluation by board-certified radiologists confirms that ClinFusion produces the highest-ranked reports, and validates our RoI-grounded metric as achieving the strongest correlation with expert judgment among all automatic evaluation metrics examined.
- Abstract(参考訳): モデルは異質な2Dおよび3D医療画像からの知識を吸収し、評価プロトコルは放射線技師の臨床的実践と整合し、正確できめ細かな、事実に基づく評価を提供する必要がある。
本稿では、これらの制約に体系的に対処する総合的な医学的理解のために設計された視覚中心のMLLMであるClinFusionを紹介する。
本稿では、カスケード空間認識局所性融合演算子を特徴とする合成およびケースケード視覚エンコーダアーキテクチャを提案する。
さらに,指導フォロー評価のためのMedIF-Benchや,臨床的整合性および事実性駆動型レポート生成評価のための関心領域評価手法など,視覚的基盤評価フレームワークについても紹介する。
ClinFusionは、2Dおよび3Dの総合的なマルチモーダル・メディカル・ベンチマーク・スイートにまたがって、新たな最先端の最先端を設定できることを示します。 視覚的質問応答、レポート生成、インストラクション、テキスト・メディカル・タスク、24ベンチマーク中20ベンチマークで先進的なオープンソース医療MLLM(\textit{e g }、Hulu-Med、Lingshu)、そして16ベンチマーク中13ベンチマークでGPT-5.2やGemini-3-Flashといった強力なプロプライエタリ・モデルよりも優れたマルチモーダル能力を示し、検索およびツール支援のワークフローにエージェントツールを使用すれば、さらに強化することができる。
ClinFusionが最上位のレポートを生成することを確認し、調査対象のすべての自動評価指標のうち、専門家の判断と最強の相関を達成できるものとして、我々のRoI地上測定値を検証する。
関連論文リスト
- Concept-Grounded Reasoning with Prompt-Driven Localization for Interpretable Structured Report Generation [66.62662330558906]
CORALは、空間的接地と概念レベルの監督を統一的な推論プロセスに統合するマルチモーダルフレームワークである。
コーラルは、疾患の局所化とコンセプション・ボトルネックモジュールによる多クラス臨床属性の予測のために、プロンプト駆動型医療セグメンテーションモデルを採用している。
BUS-CoTとIU X線データセットの実験では、診断精度、概念整合性、報告品質が強力な汎用および医療MLLMよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-09-14T10:21:23Z) - Can Multimodal Large Language Models Understand OCT? [3.932595394031011]
マルチモーダル大言語モデル (MLLM) は, 医用画像解析において有意な可能性を証明している。
OCT-Benchは、7つの公開データセットにわたる4,137のOCT画像から構築された10,076の高品質な多重選択質問からなる。
我々は,プロプライエタリモデル,オープンソース汎用モデル,医療ドメインモデルを含む20の代表的なMLLMを体系的に評価する。
論文 参考訳(メタデータ) (2026-07-18T03:08:31Z) - Brain-Adapter: A Dual-Stream Vision-Language MIL Framework for Comprehensive 3D CT Diagnosis of Acute Intracranial Pathologies [8.984636910625886]
Brain-Adapterは、新しいデュアルストリームマルチインスタンス学習フレームワークである。
提案手法は,最先端の3Dモデルと標準MIL手法を大幅に上回っている。
論文 参考訳(メタデータ) (2026-06-22T15:41:16Z) - MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models [83.50100003741628]
ビジョンと言語モデル(VLM)は、バイオメディカルイメージングを変革する大きな可能性を秘めている。
本稿では,MMBU(Massive Multimodal Biomedical Understanding)ベンチマークを紹介する。
今までで最大のビジョンと言語ベンチマークで、35のサブモダリティと豊富な構造化メタデータをカバーしている。
論文 参考訳(メタデータ) (2026-06-04T20:24:47Z) - MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging [31.5409689069707]
本稿では,多次元,細粒度,奥行き評価へのパラダイムシフトを提案する。
我々は33のMLLMをベンチマークし、textitLingshu-32Bでトップレベルのパフォーマンスを実現した。
信頼性を定量化するための信頼性評価サブセットを導入し、ショートカット動作と診断タスク性能の極めて有意な関連を明らかにする。
論文 参考訳(メタデータ) (2026-04-15T11:41:20Z) - Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs [7.542510160217106]
Fleming-VLは不均一なモーダルを包括的に理解するためのフレームワークである。
Fleming-VLは、医療用VQA、ビデオQA、医用画像理解など、複数のベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-11-02T12:30:22Z) - MedKGEval: A Knowledge Graph-Based Multi-Turn Evaluation Framework for Open-Ended Patient Interactions with Clinical LLMs [19.12790150016383]
MedKGEvalは、臨床用大規模言語モデルのための新しいマルチターン評価フレームワークである。
知識グラフ駆動患者シミュレーション機構は、キュレートされた知識グラフから関連する医療事実を検索する。
ターンレベル評価フレームワークは、各モデル応答を臨床的適切性、事実的正当性、安全性について評価する。
論文 参考訳(メタデータ) (2025-10-14T07:22:26Z) - RAD: Towards Trustworthy Retrieval-Augmented Multi-modal Clinical Diagnosis [56.373297358647655]
Retrieval-Augmented Diagnosis (RAD)は、下流タスクで直接マルチモーダルモデルに外部知識を注入する新しいフレームワークである。
RADは、複数の医療ソースからの疾患中心の知識の検索と改善、ガイドライン強化コントラスト損失トランスフォーマー、デュアルデコーダの3つの主要なメカニズムで機能する。
論文 参考訳(メタデータ) (2025-09-24T10:36:14Z) - Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning [57.873833577058]
医療知識の豊富なマルチモーダルデータセットを構築した。
次に医学専門のMLLMであるLingshuを紹介します。
Lingshuは、医療専門知識の組み込みとタスク解決能力の向上のために、マルチステージトレーニングを行っている。
論文 参考訳(メタデータ) (2025-06-08T08:47:30Z) - LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation [58.25892575437433]
医学における大規模言語モデル (LLMs) の評価は, 医療応用には精度が高く, 誤差の少ないため重要である。
LLMEval-Medは、5つの中核医療領域をカバーする新しいベンチマークであり、現実の電子健康記録から得られた2,996の質問と専門家が設計した臨床シナリオを含む。
論文 参考訳(メタデータ) (2025-06-04T15:43:14Z) - A Generative Framework for Bidirectional Image-Report Understanding in Chest Radiography [1.2289361708127877]
Multi-Stage Adaptive Vision-Language Tuning (MAViLT)は、視覚に基づく理解のためのマルチモーダル推論と生成を強化するために設計された新しいフレームワークである。
MAViLTは、臨床勾配重み付きトークン化プロセスと階層的な微調整戦略を取り入れており、正確な放射線学レポートを生成し、テキストから現実的なCXRを合成し、視覚に基づく臨床質問に答えることができる。
我々は、MIMIC-CXRとインディアナ大学CXRの2つのベンチマークデータセット上でMAViLTを評価し、すべてのタスクで最先端の結果を得る。
論文 参考訳(メタデータ) (2025-02-09T15:02:57Z) - Cross-modal Clinical Graph Transformer for Ophthalmic Report Generation [116.87918100031153]
眼科報告生成(ORG)のためのクロスモーダルな臨床グラフ変換器(CGT)を提案する。
CGTは、デコード手順を駆動する事前知識として、臨床関係を視覚特徴に注入する。
大規模FFA-IRベンチマークの実験は、提案したCGTが従来のベンチマーク手法より優れていることを示した。
論文 参考訳(メタデータ) (2022-06-04T13:16:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。