論文の概要: LocAnyMed: Vision-Language Grounding for Multimodal Medical Images
- arxiv url: http://arxiv.org/abs/2608.03322v1
- Date: Tue, 04 Aug 2026 08:29:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.099181
- Title: LocAnyMed: Vision-Language Grounding for Multimodal Medical Images
- Title(参考訳): LocAnyMed:マルチモーダル医療画像のための視覚言語グラウンドディング
- Authors: Zihan Wang, Tong Liu, Zhiwei Wang, Tao Huang, Wentao Jiang, Sihan Ma, Shanshan Ye, Xiaohui Yang, Jing Zhang,
- Abstract要約: 医用ビジュアルグラウンドティングは、医療画像の空間的証拠と自由形式の臨床クエリを結びつける。
マルチモーダルな医用ビジュアルグラウンドディングデータセットであるLocAnyMed-200Kを構築した。
LocAnyMed-CoT-20Kは、解剖学的文脈、視覚的観察、空間的結論を結びつける有理拡張サブセットである。
- 参考スコア(独自算出の注目度): 29.159885559180868
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Medical visual grounding connects free-form clinical queries to spatial evidence in medical images and is an important component of interpretable medical artificial intelligence. However, general-purpose grounding models are predominantly trained on natural images, while existing medical localization resources remain fragmented across imaging modalities, datasets, and task formulations. To address this gap, we construct LocAnyMed-200K, a multimodal medical visual grounding dataset containing approximately 200K image-query-answer examples across computed tomography, optical medical imaging, ultrasound, and X-ray. We harmonize heterogeneous detection and localization resources into a unified free-form instruction format that supports one or multiple bounding boxes, point coordinates, and no-target outputs for negative queries. Full-parameter fine-tuning of LocateAnything-3B on LocAnyMed-200K improves F1@IoU 0.50 from 10.64 to 85.59 on a held-out evaluation split, demonstrating that large-scale domain-specific supervision can equip a general grounding model with effective medical localization capabilities. Beyond spatial coordinates, a clinically interpretable grounding system should also communicate the evidence supporting its prediction. We therefore derive LocAnyMed-CoT-20K, a rationale-augmented subset that connects anatomical context, visual observations, and spatial conclusions through structured reasoning and further improves cross-source generalization through fine-tuning. Together, these resources provide a unified foundation for studying both localization accuracy and rationale quality across heterogeneous medical imaging modalities. The code is publicly available at https://github.com/MiliLab/LocAnyMed.
- Abstract(参考訳): 医用ビジュアルグラウンドティングは、医療画像の空間的証拠と自由形式の臨床クエリを結びつけるものであり、解釈可能な医用人工知能の重要な構成要素である。
しかし、汎用グラウンドモデルは、主に自然画像に基づいて訓練されているのに対し、既存の医学的ローカライゼーションリソースは、画像のモダリティ、データセット、タスクの定式化にまたがって断片化されている。
このギャップに対処するために,約200Kの画像クエリーサンプルを含むマルチモーダルな医用ビジュアルグラウンドデータセットであるLocAnyMed-200Kを構築した。
我々は不均一な検出と局所化資源を1つまたは複数のバウンディングボックス、ポイント座標、および負のクエリのターゲットなし出力をサポートする統一された自由形式命令形式に調和させる。
LocAnyMed-200K上のLocateAnything-3Bのフルパラメータ微調整により、F1@IoU 0.50が10.64から85.59に改善され、大規模なドメイン固有の監督が、効果的な医学的ローカライゼーション機能を備えた一般的な基盤モデルを提供できることを示した。
空間座標以外にも、臨床的に解釈可能な接地システムは、その予測を支持する証拠を伝える必要がある。
そこで我々は、構造的推論を通じて解剖学的文脈、視覚的観察、空間的結論を繋ぐ有理拡張サブセットであるLocAnyMed-CoT-20Kを導出し、微調整によるクロスソース一般化をさらに改善する。
これらの資源は、均一な医用画像モダリティにおける局所化精度と合理化品質の両方を研究するための統一的な基盤を提供する。
コードはhttps://github.com/MiliLab/LocAnyMed.comで公開されている。
関連論文リスト
- MedP-CLIP: Medical CLIP with Region-Aware Prompt Integration [22.87996664536728]
地域対応医療ビジョン言語モデル(VLM)であるMedP-CLIPを提案する。
我々は、精密に構築された大規模データセット上でモデルを事前訓練する。
実験により,MedP-CLIPは各種医療タスクにおいて,ベースライン法よりも有意に優れていた。
論文 参考訳(メタデータ) (2026-04-13T08:53:36Z) - Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development [314.80153557710616]
我々は、1,000以上のオープンアクセスデータセットをカバーする、医療画像データセットの現在における最大の調査を提示する。
私たちの分析では、範囲が狭いタスクにまたがって断片化され、臓器やモダリティに不均一に分散した、質素なスケールのランドスケープを公開しています。
本稿では,メタデータ駆動型融合パラダイム(MDFP)を提案する。
論文 参考訳(メタデータ) (2026-03-29T00:46:53Z) - MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities [89.81463562506637]
医用画像のための最初のリアルタイムオープン語彙検出モデルであるMedROVを紹介する。
対照的な学習とクロスモーダル表現を活用することで、MedROVは既知の構造と新しい構造の両方を効果的に検出する。
論文 参考訳(メタデータ) (2025-11-25T18:59:53Z) - PRS-Med: Position Reasoning Segmentation with Vision-Language Model in Medical Imaging [6.411386758550256]
PRS-Medは、視覚言語モデルとセグメンテーション機能を統合し、正確なセグメンテーションマスクとそれに対応する空間推論出力の両方を生成するフレームワークである。
MMRSデータセットは、医療画像における位置推論データの欠如に対処するために、多様な空間的な質問応答ペアを提供する。
論文 参考訳(メタデータ) (2025-05-17T06:42:28Z) - Unlocking the Power of Spatial and Temporal Information in Medical Multimodal Pre-training [99.2891802841936]
我々は,空間的・時間的微粒なモデリングのためのMed-STフレームワークを提案する。
空間モデリングでは、Med-STはMixture of View Expert (MoVE)アーキテクチャを使用して、正面と横の両方のビューから異なる視覚的特徴を統合する。
時間的モデリングのために,フォワードマッピング分類 (FMC) とリバースマッピング回帰 (RMR) による新たな双方向サイクル整合性目標を提案する。
論文 参考訳(メタデータ) (2024-05-30T03:15:09Z) - Medical Vision-Language Pre-Training for Brain Abnormalities [96.1408455065347]
本稿では,PubMedなどの公共リソースから,医用画像・テキスト・アライメントデータを自動的に収集する方法を示す。
特に,まず大きな脳画像テキストデータセットを収集することにより,事前学習プロセスの合理化を図るパイプラインを提案する。
また,医療領域におけるサブフィギュアをサブキャプションにマッピングするというユニークな課題についても検討した。
論文 参考訳(メタデータ) (2024-04-27T05:03:42Z) - LVM-Med: Learning Large-Scale Self-Supervised Vision Models for Medical
Imaging via Second-order Graph Matching [59.01894976615714]
LVM-Medは、大規模医療データセットに基づいてトレーニングされた、最初のディープネットワークファミリーである。
55の公開データセットから約13万の医療画像を収集しました。
LVM-Medは、多くの最先端の教師付き、自己監督型、基礎モデルよりも経験的に優れている。
論文 参考訳(メタデータ) (2023-06-20T22:21:34Z) - Pathology-Aware Generative Adversarial Networks for Medical Image
Augmentation [0.22843885788439805]
GAN(Generative Adversarial Networks)は、現実的だが斬新なサンプルを生成し、実際の画像分布を効果的にカバーする。
この論文は、医師とのコラボレーションにおいて、そのような新しい応用の臨床的意義を提示することを目的とした4つのGANプロジェクトを含んでいる。
論文 参考訳(メタデータ) (2021-06-03T15:08:14Z) - Few-shot Medical Image Segmentation using a Global Correlation Network
with Discriminative Embedding [60.89561661441736]
医療画像分割のための新しい手法を提案する。
深層畳み込みネットワークを用いた数ショット画像セグメンタを構築します。
深層埋め込みの識別性を高め,同一クラスの特徴領域のクラスタリングを促進する。
論文 参考訳(メタデータ) (2020-12-10T04:01:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。