論文の概要: MedLayBench-V: A Large-Scale Benchmark for Expert-Lay Semantic Alignment in Medical Vision Language Models
- arxiv url: http://arxiv.org/abs/2604.05738v1
- Date: Tue, 07 Apr 2026 11:39:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.78913
- Title: MedLayBench-V: A Large-Scale Benchmark for Expert-Lay Semantic Alignment in Medical Vision Language Models
- Title(参考訳): MedLayBench-V:医療ビジョン言語モデルにおけるエキスパートレイセマンティックアライメントのための大規模ベンチマーク
- Authors: Han Jang, Junhyeok Lee, Heeseong Eum, Kyu Sung Choi,
- Abstract要約: MedLayBench-Vは、エキスパート・レイ・セマンティックアライメントに特化した最初の大規模マルチモーダル・ベンチマークである。
MedLayBench-Vは、臨床専門家と患者の間のコミュニケーションの分断をブリッジできる次世代のMed-VLMの訓練と評価のための検証された基盤を提供する。
- 参考スコア(独自算出の注目度): 2.0221473384338884
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Medical Vision-Language Models (Med-VLMs) have achieved expert-level proficiency in interpreting diagnostic imaging. However, current models are predominantly trained on professional literature, limiting their ability to communicate findings in the lay register required for patient-centered care. While text-centric research has actively developed resources for simplifying medical jargon, there is a critical absence of large-scale multimodal benchmarks designed to facilitate lay-accessible medical image understanding. To bridge this resource gap, we introduce MedLayBench-V, the first large-scale multimodal benchmark dedicated to expert-lay semantic alignment. Unlike naive simplification approaches that risk hallucination, our dataset is constructed via a Structured Concept-Grounded Refinement (SCGR) pipeline. This method enforces strict semantic equivalence by integrating Unified Medical Language System (UMLS) Concept Unique Identifiers (CUIs) with micro-level entity constraints. MedLayBench-V provides a verified foundation for training and evaluating next-generation Med-VLMs capable of bridging the communication divide between clinical experts and patients.
- Abstract(参考訳): 医用ビジョンランゲージモデル (Med-VLMs) は, 診断画像の解釈に熟練した熟練度を実現している。
しかしながら、現在のモデルは、主に専門的な文献に基づいて訓練されており、患者中心の医療に必要な所定の登録簿で発見を伝達する能力を制限する。
テキスト中心の研究は医療ジャーゴンを簡素化するためのリソースを積極的に開発してきたが、日常的な医療画像理解を容易にするために設計された大規模マルチモーダルベンチマークが欠如している。
このリソースギャップを埋めるために、我々はMedLayBench-Vという、エキスパート・レイ・セマンティックアライメントに特化した最初の大規模マルチモーダル・ベンチマークを導入する。
リスク幻覚を危険にさらす単純なアプローチとは異なり、私たちのデータセットはStructured Concept-Grounded Refinement (SCGR)パイプラインを介して構築されます。
本手法は,Unified Medical Language System (UMLS) Concept Unique Identifiers (CUIs) とマイクロレベルのエンティティ制約を統合することで,厳密な意味的等価性を実現する。
MedLayBench-Vは、臨床専門家と患者の間のコミュニケーションの分断をブリッジできる次世代のMed-VLMの訓練と評価のための検証された基盤を提供する。
関連論文リスト
- A Medical Multimodal Diagnostic Framework Integrating Vision-Language Models and Logic Tree Reasoning [24.842846823884557]
視覚言語アライメントと論理正規化推論を組み合わせたLLaVAに基づく診断フレームワークを提案する。
提案手法は,テキストのみの設定では競争力を維持しつつ,マルチモーダルタスクにおいてより解釈可能な推論トレースが得られることを示す。
論文 参考訳(メタデータ) (2025-12-25T09:01:06Z) - MedAlign: A Synergistic Framework of Multimodal Preference Optimization and Federated Meta-Cognitive Reasoning [52.064286116035134]
我々はMed-VQA(Med-VQA)のための視覚的LVLM応答を保証するフレームワークであるMedAlignを開発した。
まず、優先学習を視覚的コンテキストに合わせるために、マルチモーダルな直接選好最適化(mDPO)の目的を提案する。
次に、画像とテキストの類似性を生かし、クエリを専門的でコンテキスト拡張されたLVLMにルーティングする検索型混合処理(RA-MoE)アーキテクチャを設計する。
論文 参考訳(メタデータ) (2025-10-24T02:11:05Z) - Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models [15.530083855947987]
我々は,Med-RwR を用いた最初のマルチモーダル医療推論フレームワークを提案する。
Med-RwRは、推論中に観察された症状やドメイン固有の医療概念を問い合わせることで、外部知識を積極的に回収する。
様々な公開医療ベンチマークの評価は、Med-RwRのベースラインモデルに対する大幅な改善を示している。
論文 参考訳(メタデータ) (2025-10-21T05:18:18Z) - MedCLM: Learning to Localize and Reason via a CoT-Curriculum in Medical Vision-Language Models [0.11666234644810893]
検出データセットを大規模医療視覚質問応答(VQA)データとChain-of-Thought(CoT)推論に変換する自動パイプラインであるMedCLMを紹介する。
視覚的接地のための明示的な病変箱を備えた簡易な段階,暗黙的な局所化を促す中段階,弱教師付き推論のためのハードステージからなる総合的なCoT-Curriculum戦略を提案する。
論文 参考訳(メタデータ) (2025-10-06T04:26:39Z) - MedBridge: Bridging Foundation Vision-Language Models to Medical Image Diagnosis [10.082738539201804]
最近の視覚言語基盤モデルは、自然画像分類の最先端結果を提供するが、ドメインシフトによる医用画像に干渉する。
MedBridgeは,医用画像の正確な診断のためにトレーニング済みのVLMを再利用した,軽量なマルチモーダル適応フレームワークである。
MedBridgeはマルチラベル胸部疾患の診断において最先端のVLM適応法と比較して6~15%改善した。
論文 参考訳(メタデータ) (2025-05-27T19:37:51Z) - Advancing AI Research Assistants with Expert-Involved Learning [84.30323604785646]
大規模言語モデル (LLM) と大規模マルチモーダルモデル (LMM) は、生物医学的な発見を促進することを約束するが、その信頼性は未定である。
ARIEL(AI Research Assistant for Expert-in-the-Loop Learning)は,オープンソースの評価・最適化フレームワークである。
LMMは詳細な視覚的推論に苦しむのに対し、最先端のモデルでは流動性はあるが不完全な要約を生成する。
論文 参考訳(メタデータ) (2025-05-03T14:21:48Z) - MedCoT: Medical Chain of Thought via Hierarchical Expert [48.91966620985221]
本稿では,新しい階層的検証手法であるMedCoTについて述べる。
生体画像検査における解釈可能性と精度を高めるように設計されている。
4つの標準Med-VQAデータセットに対する実験的評価は、MedCoTが既存の最先端アプローチを上回ることを示している。
論文 参考訳(メタデータ) (2024-12-18T11:14:02Z) - Uncertainty-aware Medical Diagnostic Phrase Identification and Grounding [72.18719355481052]
MRG(Messical Report Grounding)と呼ばれる新しい課題について紹介する。
MRGは医療報告から診断フレーズとその対応する接地箱を直接エンドツーエンドで識別することを目的としている。
マルチモーダルな大規模言語モデルを用いて診断フレーズを予測する,堅牢で信頼性の高いフレームワークである uMedGround を提案する。
論文 参考訳(メタデータ) (2024-04-10T07:41:35Z) - ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training [21.315060059765894]
本稿では,新しいEntity-centered Context-aware Medical Vision-Language Pre-trainingフレームワークを提案する。
まず,大規模言語モデルを用いた医療報告からエンティティ中心のコンテキストを抽出する。
次に、エンティティ・アウェア・リバランス係数と記述子マスキング戦略をマスキング言語モデルに組み込む。
粗い画像表現と細かな画像表現の両方のセマンティック統合を改善するため、コンテキスト誘導型超解像タスクをマルチスケールのコンテキスト融合設計と共に提案する。
論文 参考訳(メタデータ) (2023-12-20T11:00:54Z) - Multi-task Paired Masking with Alignment Modeling for Medical
Vision-Language Pre-training [55.56609500764344]
本稿では,マルチタスク・ペアド・マスキング・アライメント(MPMA)に基づく統合フレームワークを提案する。
また, メモリ拡張クロスモーダルフュージョン (MA-CMF) モジュールを導入し, 視覚情報を完全統合し, レポート再構築を支援する。
論文 参考訳(メタデータ) (2023-05-13T13:53:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。