論文の概要: Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models
- arxiv url: http://arxiv.org/abs/2608.00976v1
- Date: Sun, 02 Aug 2026 03:59:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.041653
- Title: Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models
- Title(参考訳): 医用視覚基礎モデルのための位置認識細粒度表現学習
- Authors: Myeongkyun Kang, Yanting Yang, Xiaoxiao Li,
- Abstract要約: 位置認識表現学習に基づく医用視覚基礎モデルであるLoFiを提案する。
我々は4.48M画像テキストボックス三重項からなる大規模医療基盤データセットであるMedGを構築した。
LoFiは、汎用および医療ビジョンの基礎モデルと最先端のLVLMを一貫して上回っている。
- 参考スコア(独自算出の注目度): 33.30452735577703
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fine-grained visual representations are essential for medical image analysis, particularly when diagnostically relevant evidence is subtle and spatially localized. Modern transformer-based medical vision encoders must therefore learn patch-level representations that are both clinically meaningful and spatially consistent. Without these properties, large vision-language models (LVLMs) operate on an ambiguous visual foundation, limiting their ability to generate clinically reliable and spatially grounded responses. However, existing training strategies for medical vision encoders rarely achieve both objectives. Image-text alignment provides clinically meaningful supervision primarily at the image level, leaving the spatial localization of diagnostic evidence weakly constrained. In contrast, self-supervised learning promotes spatial consistency but lacks the semantic supervision needed to distinguish visually similar yet clinically distinct regions. To address this gap, we present LoFi, a medical vision foundation model built on location-aware fine-grained representation learning. LoFi trains a vision encoder with a lightweight large language model under grounding and grounded captioning objectives. Because these objectives require predicting location from clinical text and vice versa, spatial consistency emerges without any explicit patch-level regularization. To enable training at scale, we construct MedG, a large-scale medical grounding dataset of 4.48M image-text-box triplets curated from 84 datasets spanning 7 modalities. Across phrase grounding, visual question answering, and region-based organ classification under perturbations, LoFi consistently outperforms general-purpose and medical vision foundation models as well as state-of-the-art LVLMs. Code is available at https://github.com/myeongkyunkang/lofi-medg.
- Abstract(参考訳): 微細な視覚表現は、特に診断に関連のある証拠が微妙で空間的局所化されている場合、医用画像解析に不可欠である。
現代のトランスフォーマーベースの医療ビジョンエンコーダは、臨床的に意味があり空間的に一貫性のあるパッチレベルの表現を学習しなければならない。
これらの性質がなければ、大きな視覚言語モデル(LVLM)は曖昧な視覚基盤で機能し、臨床的に信頼性が高く空間的に接地された応答を生成する能力を制限する。
しかし、既存の医用視覚エンコーダのトレーニング戦略は、両方の目的を達成することは滅多にない。
画像テキストアライメントは、主に画像レベルで臨床的に意味のある監督を提供し、診断証拠の空間的局在は弱く制約される。
対照的に、自己教師付き学習は空間的一貫性を促進するが、視覚的に類似しているが臨床的に異なる領域を区別するために必要な意味的な監督が欠如している。
このギャップに対処するために,位置認識のきめ細かい表現学習に基づく医療ビジョン基盤モデルLoFiを提案する。
LoFiは、接地および接地されたキャプション目標の下で、軽量な大言語モデルで視覚エンコーダを訓練する。
これらの目的は臨床テキストから位置を予測する必要があり、またその逆も必要であるので、空間的整合性は明示的なパッチレベルの正規化を伴わない。
大規模なトレーニングを可能にするため,MedGは7つのモダリティにまたがる84のデータセットからキュレートされた4.48Mの画像テキストボックス三重項からなる大規模医療基盤データセットを構築した。
句の接頭辞、視覚的質問応答、摂動下での地域ベースの臓器分類などを通じて、LoFiは、最先端のLVLMだけでなく、汎用的および医療的視覚基盤モデルよりも一貫して優れています。
コードはhttps://github.com/myeongkyunkang/lofi-medg.comで入手できる。
関連論文リスト
- MedSIGHT: Towards Grounded Visual Comprehension in Medical Large Vision-Language Models [42.44822236388223]
我々は、Med-LVLMに基底的視覚的理解のための構造化されたピクセルレベルの理解を持たせる統一的なフレームワークであるMedSIGHTを提案する。
MedSIGHTは、領域中心のトークンを生成し、空間情報を言語モデルの表現空間に直接エンコードする新しいRerea Perceiverモジュールを導入した。
さらに, LLM語彙に医学領域のコードブックを組み込むことにより, 解剖学的および病理学的領域の記号表現として離散領域のコードを生成することができる。
論文 参考訳(メタデータ) (2026-06-04T22:54:59Z) - MedGround: Bridging the Evidence Gap in Medical Vision-Language Models with Verified Grounding Data [32.65971100171597]
セグメンテーションリソースを高品質な医療参照基盤データに変換する自動パイプラインであるMedGroundを紹介する。
我々はまた、MedGround-35Kという新しいマルチモーダル医療データセットを提示する。
論文 参考訳(メタデータ) (2026-01-11T10:34:18Z) - XBench: A Comprehensive Benchmark for Visual-Language Explanations in Chest Radiography [6.447908430647854]
胸部X線におけるクロスモーダル解釈性を評価するための最初の体系的ベンチマークを示す。
我々は,クロスアテンションと類似性に基づくローカライズマップを用いた視覚的説明を生成する。
複数の病理組織を横断する放射線診断領域とのアライメントを定量的に評価した。
論文 参考訳(メタデータ) (2025-10-22T13:52:19Z) - Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - RAU: Reference-based Anatomical Understanding with Vision Language Models [26.06602931463068]
視覚言語モデル(VLM)を用いた参照型解剖学的理解のためのフレームワークであるRAUを紹介する。
まず,VLMが参照画像と対象画像の相対的空間的推論により解剖学的領域の同定を学習することを示す。
次に, VLM由来の空間的手がかりをSAM2の細粒度セグメンテーション能力とシームレスに統合できることを実証した。
論文 参考訳(メタデータ) (2025-09-26T14:32:03Z) - Spatial Reasoning in Foundation Models: Benchmarking Object-Centric Spatial Understanding [8.202861909913791]
基礎モデルにおけるオブジェクト中心空間推論のベンチマークを示す。
グラウンディングディーノやOWLv2のような検出器は、リレーショナル推論に制限のある正確なボックスを提供する。
本研究は,地域化と真の空間理解のギャップを強調し,地域社会における空間認識基盤モデルの必要性を指摘する。
論文 参考訳(メタデータ) (2025-09-26T06:06:19Z) - From Gaze to Insight: Bridging Human Visual Attention and Vision Language Model Explanation for Weakly-Supervised Medical Image Segmentation [48.45209969191245]
視覚言語モデル(VLM)は、テキスト記述を通して意味的コンテキストを提供するが、説明精度は欠如している。
本稿では,その補完的強みを活かし,視線と言語指導を統合した教師教育フレームワークを提案する。
本手法は,8.78%,80.53%,84.22%のDiceスコアをそれぞれ達成し,アノテーション負担を増大させることなく視線ベースラインよりも3.5%向上した。
論文 参考訳(メタデータ) (2025-04-15T16:32:15Z) - Locality Alignment Improves Vision-Language Models [55.275235524659905]
近年では視覚言語モデル (VLM) が普及しているが、その多くが基本的な空間推論の誤りに悩まされている。
私たちのゴールは、ローカルとグローバルの両方の画像セマンティクスを効果的にキャプチャするビジョンバックボーンでこれを解決することです。
局所性アライメントとMaskEmbedと呼ばれる新しい微調整手順を提案する。
論文 参考訳(メタデータ) (2024-10-14T21:01:01Z) - Uncertainty-aware Medical Diagnostic Phrase Identification and Grounding [72.18719355481052]
MRG(Messical Report Grounding)と呼ばれる新しい課題について紹介する。
MRGは医療報告から診断フレーズとその対応する接地箱を直接エンドツーエンドで識別することを目的としている。
マルチモーダルな大規模言語モデルを用いて診断フレーズを予測する,堅牢で信頼性の高いフレームワークである uMedGround を提案する。
論文 参考訳(メタデータ) (2024-04-10T07:41:35Z) - Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning [64.1316997189396]
病理組織像のための新しい言語型自己教師学習フレームワーク,階層型言語型自己監督(HLSS)を提案する。
その結果,OpenSRH と TCGA の2つの医用画像ベンチマークにおいて,最先端の性能が得られた。
論文 参考訳(メタデータ) (2024-03-21T17:58:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。