論文の概要: SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation
- arxiv url: http://arxiv.org/abs/2607.26885v1
- Date: Wed, 29 Jul 2026 13:12:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.685711
- Title: SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation
- Title(参考訳): SCALPEL: 医用ビジョンランゲージ表現のためのLCMを用いたエンコーダ学習による意味的クロスモーダルアライメント
- Abstract要約: ビジョン言語による事前訓練は、医学的マルチモーダル表現学習の基盤となる。
textbfLLM-textbfPowered textbfEncoder textbfLearning による textbfSemantic textbfCross-modal textbfAlignment フレームワーク textbfSCALPEL を提案する。
- 参考スコア(独自算出の注目度): 5.487826115955642
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language pre-training (VLP) serves as a cornerstone for medical multimodal representation learning. However, existing medical VLP frameworks are often constrained by the limited context windows and shallow representational capacities of lightweight text encoders when processing lengthy, terminology-dense clinical reports. While integrating medical large language models (LLMs) offers unprecedented clinical reasoning capabilities, it introduces three major bottlenecks: (i) the anisotropic representational collapse of generative LLMs under standard contrastive objectives, (ii) the prohibitive memory overhead of joint end-to-end training with large batch sizes, and (iii) the medical hallucinations induced by vanilla contrastive losses that ignore fine-grained anatomical laterality and negation modifiers. To address these challenges, we propose \textbf{SCALPEL}, a \textbf{S}emantic \textbf{C}ross-modal \textbf{A}lignment framework via \textbf{L}LM-\textbf{P}owered \textbf{E}ncoder \textbf{L}earning. First, Clinical Report Contrastive fine-tuning converts a generative LLM into an isotropic encoder via domain-specific clinical text adaptation. Second, an asymmetric alignment strategy leverages offline feature caching to enable efficient training. Critically, we formulate an Anatomy-Negation Aware Objective that explicitly penalizes mismatched image-text pairs involving laterality confusion or false negations. Extensive experiments across MIMIC-CXR, CheXpert, and IU X-Ray benchmarks demonstrate that SCALPEL achieves state-of-the-art performance in cross-modal retrieval, zero-shot disease classification and medical visual question answering.
- Abstract(参考訳): ビジョン言語事前訓練(VLP)は、医学的マルチモーダル表現学習の基盤となる。
しかしながら、既存の医療用VLPフレームワークは、長い専門用語の専門的な臨床報告を処理する際に、限られたコンテキストウインドウと、軽量テキストエンコーダの浅い表現能力によって制約されることが多い。
医学的大言語モデル(LLM)の統合は、前例のない臨床推論能力を提供するが、大きなボトルネックは3つある。
一 標準コントラスト目的下における生成LDMの異方的表現的崩壊
二 より大きなバッチサイズを有する共同エンドツーエンドトレーニングの禁止メモリオーバーヘッド
三 微細な解剖学的側方性及び否定修飾体を無視したバニラによる医学的幻覚
これらの課題に対処するため, textbf{SCALPEL}, a \textbf{S}emantic \textbf{C}ross-modal \textbf{A}lignment framework via \textbf{L}LM-\textbf{P}owered \textbf{E}ncoder \textbf{L}earningを提案する。
第1に, 臨床報告 対照的な微調整は, 生成LDMをドメイン特異的な臨床テキスト適応による等方性エンコーダに変換する。
第二に、非対称アライメント戦略はオフライン機能キャッシングを活用して、効率的なトレーニングを可能にする。
批判的なことに、ラテラル混乱や偽否定を含む不一致画像とテキストのペアを明示的にペナルティ化する解剖・否定対象を定式化する。
MIMIC-CXR、CheXpert、IU X-Rayのベンチマークによる大規模な実験は、SCALPELがクロスモーダル検索、ゼロショット病分類、および医療視覚的質問応答において最先端のパフォーマンスを達成することを示した。
関連論文リスト
- Concept-Grounded Reasoning with Prompt-Driven Localization for Interpretable Structured Report Generation [66.62662330558906]
CORALは、空間的接地と概念レベルの監督を統一的な推論プロセスに統合するマルチモーダルフレームワークである。
コーラルは、疾患の局所化とコンセプション・ボトルネックモジュールによる多クラス臨床属性の予測のために、プロンプト駆動型医療セグメンテーションモデルを採用している。
BUS-CoTとIU X線データセットの実験では、診断精度、概念整合性、報告品質が強力な汎用および医療MLLMよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-09-14T10:21:23Z) - Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs [53.697403481143404]
LVLM(Large Vision-Language Models)は、医用画像処理タスクにおいて強力なパフォーマンスを実現している。
しかし、実際の不整合、視力の低下、臨床的に有意義なフィードバックによる不一致が続く傾向にある。
論文 参考訳(メタデータ) (2026-06-10T18:35:36Z) - CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis [0.4551615447454768]
ワイヤレスカプセル内視鏡(WCE)は小腸の非侵襲的視覚的評価を可能にする。
WCEの既存の学習ベースのアプローチは主に視覚のみであり、しばしば狭い病理セットに限られる。
本稿では,WCEのためのドメイン固有視覚言語表現学習フレームワークであるCapCLIPを紹介する。
論文 参考訳(メタデータ) (2026-05-08T21:14:56Z) - Multi-View Synergistic Learning with Vision-Language Adaption for Low-Resource Biomedical Image Classification [59.24009931000134]
MVSL(Multi-View Synergistic Learning)は、適応パラダイム、表現の粒度、疾患の意味的関係に対処する統合フレームワークである。
MVSLは、視覚的およびテキスト的エンコーダの適応を分離し、それぞれの表現特性を尊重する。
さらに、グローバルなイメージセマンティクスと局所的な病変レベルの証拠の両方を明示的にモデル化するために、多粒性コントラスト学習を導入する。
MVSLは、いくつかのショットとゼロショットの分類設定において、最先端のメソッドを一貫して上回る。
論文 参考訳(メタデータ) (2026-04-27T02:41:27Z) - TGC-Net: A Structure-Aware and Semantically-Aligned Framework for Text-Guided Medical Image Segmentation [56.09179939570486]
本稿では,パラメータ効率,タスク固有適応に着目したCLIPベースのフレームワークであるTGC-Netを提案する。
TGC-Netは、挑戦的なベンチマークで顕著なDiceゲインを含む、トレーニング可能なパラメータをかなり少なくして、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-12-24T12:06:26Z) - Anatomical Region-Guided Contrastive Decoding: A Plug-and-Play Strategy for Mitigating Hallucinations in Medical VLMs [20.507007953026346]
Anatomical Region-Guided Contrastive Decoding (ARCD) は、目標とする地域固有のガイダンスを提供することで幻覚を緩和するプラグアンドプレイ戦略である。
本手法は, 地域理解の向上, 幻覚の低減, 総合的診断精度の向上に有効である。
論文 参考訳(メタデータ) (2025-12-19T03:11:20Z) - Revolutionizing Precise Low Back Pain Diagnosis via Contrastive Learning [0.3499870393443268]
腰痛は世界中の何百万もの人に影響を与え、堅牢な診断モデルの必要性を喚起する。
我々は,腰椎MRIスキャンとそれに対応する放射線学的記述との整合性を確保するために,コントラスト言語画像事前訓練を利用する新しいフレームワークであるLumbarCLIPを提案する。
論文 参考訳(メタデータ) (2025-09-25T06:52:25Z) - Exploring the Capabilities of LLM Encoders for Image-Text Retrieval in Chest X-rays [8.019362739504087]
視覚言語による事前訓練は画像とテキストのアライメントが進んでいるが、臨床報告の不均一性によって放射線学の進歩が制限されている。
我々は,大規模言語モデル (LLM) エンコーダが,多様なスタイルにまたがる堅牢な臨床表現を提供できるかどうかを問う。
胸部X線レポート用のドメイン適応エンコーダLLM2VEC4CXRと、このエンコーダとビジョンバックボーンを結合するデュアルトウワーフレームワークLLM2CLIP4CXRを紹介する。
論文 参考訳(メタデータ) (2025-09-17T09:44:59Z) - VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine [11.993301266706139]
我々は,3次元CTや関連する放射線学報告など,限られたボリュームデータを対象とした視覚言語事前学習フレームワーク「textbfVELVET-Med」を提案する。
本研究は,ボリューム医療画像とそれに対応する臨床物語に埋め込まれた,豊かな空間的・意味的関係を明らかにすることを目的としている。
結果として得られるエンコーダは強い転送可能性を示し、幅広い下流タスクで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-08-16T17:08:43Z) - Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs [51.93737995405164]
LVLM(Large Vision-Language Models)は幻覚の影響を受けやすいモデルである。
本稿では,条件付きポイントワイド・ミューチュアル・インフォメーション(C-PMI)キャリブレーション・デコーディング・ストラテジーを導入する。
提案手法は,復号効率を保ちながら,LVLMの幻覚を著しく低減することを示す。
論文 参考訳(メタデータ) (2025-05-26T08:36:10Z) - Mitigating Hallucination for Large Vision Language Model by Inter-Modality Correlation Calibration Decoding [66.06337890279839]
大規模視覚言語モデル(LVLM)は、下流のマルチモーダルタスクに対する視覚言語理解において顕著な能力を示している。
LVLMは、複雑な生成タスクにおいて幻覚を生じさせ、視覚入力と生成されたコンテンツの間に矛盾が生じている。
本研究では,LVLMにおける幻覚を無訓練で緩和するIMCCD法を提案する。
論文 参考訳(メタデータ) (2025-01-03T17:56:28Z) - Mitigating Hallucinations of Large Language Models in Medical Information Extraction via Contrastive Decoding [92.32881381717594]
医療情報抽出タスクにおける幻覚の問題を解決するために,ALCD(ALternate Contrastive Decoding)を導入する。
ALCDは, 従来の復号法に比べて幻覚の解消に有意な改善が見られた。
論文 参考訳(メタデータ) (2024-10-21T07:19:19Z) - Language-guided Scale-aware MedSegmentor for Lesion Segmentation in Medical Imaging [7.912408164613206]
臨床的には、特定の病変の分節化は診断精度と治療効率を著しく向上させる。
本稿では,与えられたテキスト表現に基づいて,医療画像のターゲット病変をセグメント化する言語誘導型大規模メドセグメンタ(LSMS)を提案する。
我々のLSMSは、計算コストを大幅に下げて、常に優れた性能を実現しています。
論文 参考訳(メタデータ) (2024-08-30T15:22:13Z) - OTCXR: Rethinking Self-supervised Alignment using Optimal Transport for Chest X-ray Analysis [6.4136876268620115]
自己教師付き学習(SSL)は,X線などの医学的モダリティを解析するための有望な手法として登場した。
我々は,OTCXRを提案する。OTCXRは最適なトランスポート(OT)を利用して,密接なセマンティック不変性を学習する新しいSSLフレームワークである。
我々はOTCXRの有効性を3つの公開胸部X線データセットの総合的な実験により検証した。
論文 参考訳(メタデータ) (2024-04-18T02:59:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。