論文の概要: MIRAGE: Retrieval and Generation of Multimodal Images and Texts for Medical Education
- arxiv url: http://arxiv.org/abs/2605.04772v1
- Date: Wed, 06 May 2026 11:20:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.793492
- Title: MIRAGE: Retrieval and Generation of Multimodal Images and Texts for Medical Education
- Title(参考訳): MIRAGE:医療教育のためのマルチモーダル画像とテキストの検索と生成
- Abstract要約: MIRAGEはマルチモーダル医療用テキスト・画像検索・生成システムである。
ユーザーは信頼できる情報源から臨床的に関連のある画像を見つけて生成することができる。
このシステムは、ローカルな計算資源や専門知識を必要とせず、世界中の医学生が利用できる。
- 参考スコア(独自算出の注目度): 2.765006963244799
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Access to diverse, well-annotated medical images with interactive learning tools is fundamental for training practitioners in medicine and related fields to improve their diagnostic skills and understanding of anatomical structures. While medical atlases are valuable, they are often impractical due to their size and lack of interactivity, whereas online image search may provide mislabeled or incomplete material. To address this, we propose MIRAGE, a multimodal medical text and image retrieval and generation system that allows users to find and generate clinically relevant images from trustworthy sources by mapping both text and images to a shared latent space, enabling semantically meaningful queries. The system is based on a fine-tuned medical version of CLIP (MedICaT-ROCO), trained with the ROCO dataset, obtained from PubMed Central. MIRAGE allows users to give prompts to retrieve images, generate synthetic ones through a medical diffusion model (Prompt2MedImage) and receive enriched descriptions from a large language model (Dolly-v2-3b). It also supports a dual search option, enabling the visual comparison of different medical conditions. A key advantage of the system is that it relies entirely on publicly available pretrained models, ensuring reproducibility and accessibility. Our goal is to provide a free, transparent and easy-to-use didactic tool for medical students, especially those without programming skills. The system features an interface that enables interactive and personalized visual learning through medical image retrieval and generation. The system is accessible to medical students worldwide without requiring local computational resources or technical expertise, and is currently deployed on Kaggle: http://www-vpu.eps.uam.es/mirage
- Abstract(参考訳): 対話型学習ツールを用いた多種多様な医用画像へのアクセスは、医学や関連分野の実践者を訓練し、診断スキルと解剖学的構造を理解するのに不可欠である。
医療用アトラスは有用であるが、サイズや相互作用性の欠如により実用的ではないことが多い。
そこで我々は,MIRAGEを提案する。MIRAGEはマルチモーダルな医療用テキスト・画像検索・生成システムで,テキストと画像の両方を共有潜在空間にマッピングすることで,信頼できる情報源から臨床的に関連のある画像を発見し,生成することができる。
このシステムは、PubMed Centralから得られたROCOデータセットでトレーニングされたCLIP(MedICaT-ROCO)の微調整された医療バージョンに基づいている。
MIRAGEは、画像の検索、医療拡散モデル(Prompt2MedImage)による合成画像の生成、および大規模言語モデル(Dolly-v2-3b)からの豊富な記述の受信を可能にする。
また、二重検索オプションをサポートし、異なる医療条件の視覚的比較を可能にする。
システムの主な利点は、完全に利用可能な事前訓練されたモデルに依存しており、再現性とアクセシビリティを保証することである。
私たちのゴールは、医学生、特にプログラミングスキルのない学生に、無料で、透明で、使いやすい実践ツールを提供することです。
このシステムは、医用画像の検索と生成を通じてインタラクティブでパーソナライズされた視覚学習を可能にするインタフェースを備えている。
このシステムは世界中の医学生にローカルな計算資源や専門知識を必要とせずにアクセスでき、現在Kaggleにデプロイされている。
関連論文リスト
- UniMedVL: Unifying Medical Multimodal Understanding And Generation Through Observation-Knowledge-Analysis [41.864457631668806]
画像理解と生成タスクの同時解析のための医用統合マルチモーダルモデルUniMedVLを紹介する。
UniMedVLは5つの医用画像理解ベンチマークにおいて優れた性能を示し、8つの医用画像モダリティにまたがる生成品質のモデルに適合する。
論文 参考訳(メタデータ) (2025-10-17T14:54:58Z) - RadIR: A Scalable Framework for Multi-Grained Medical Image Retrieval via Radiology Report Mining [64.66825253356869]
本稿では,複数の粒度で画像の類似度を決定するために,高密度ラジオロジーレポートを利用した新しい手法を提案する。
我々は、胸部X線用MIMIC-IRとCTスキャン用CTRATE-IRの2つの総合的な医用画像検索データセットを構築した。
RadIR-CXR と Model-ChestCT という2つの検索システムを開発し,従来の画像画像検索と画像レポート検索に優れた性能を示す。
論文 参考訳(メタデータ) (2025-03-06T17:43:03Z) - A Survey of Medical Vision-and-Language Applications and Their Techniques [48.268198631277315]
医療ビジョン・アンド・ランゲージモデル(MVLM)は、複雑な医療データを解釈するための自然言語インタフェースを提供する能力から、大きな関心を集めている。
本稿では,MVLMの概要と適用した各種医療課題について概観する。
また、これらのタスクに使用するデータセットについても検討し、標準化された評価指標に基づいて異なるモデルの性能を比較した。
論文 参考訳(メタデータ) (2024-11-19T03:27:05Z) - Autoregressive Sequence Modeling for 3D Medical Image Representation [48.706230961589924]
本稿では, 自己回帰シーケンス事前学習フレームワークを用いて, 3次元医用画像表現を学習するための先駆的手法を提案する。
我々は,空間的,コントラスト的,意味的相関に基づく様々な3次元医用画像にアプローチし,トークンシーケンス内の相互接続された視覚トークンとして扱う。
論文 参考訳(メタデータ) (2024-09-13T10:19:10Z) - MedDiT: A Knowledge-Controlled Diffusion Transformer Framework for Dynamic Medical Image Generation in Virtual Simulated Patient [38.2964748653908]
MedDiTは,患者の症状をシミュレートした医療画像を生成するための,知識制御型会話フレームワークである。
MedDiTは、患者の属性と症状を記述した様々な患者知識グラフ(KGs)を統合し、Large Language Models(LLMs)の振る舞いを動的に促進する。
KGの特定患者属性に応じて医用画像を生成するために、よく調整された拡散変換器(DiT)モデルが組み込まれている。
論文 参考訳(メタデータ) (2024-08-22T09:10:29Z) - AliFuse: Aligning and Fusing Multi-modal Medical Data for Computer-Aided Diagnosis [1.64647940449869]
マルチモーダル医療データの整合と融合のためのトランスフォーマーベースのフレームワークであるAlifuseを提案する。
医用画像と非構造化および構造化された臨床記録を視覚と言語トークンに変換する。
Alifuseを使ってアルツハイマー病を分類し、5つのパブリックデータセットで最先端のパフォーマンスを達成し、8つのベースラインを上回ります。
論文 参考訳(メタデータ) (2024-01-02T07:28:21Z) - Unified Medical Image Pre-training in Language-Guided Common Semantic Space [39.61770813855078]
我々はUnified Medical Image Pre-Trainingフレームワーク(UniMedI)を提案する。
UniMedIは、診断レポートを一般的な意味空間として使用し、医療画像の多様なモダリティの統一表現を作成する。
10種類のデータセットにまたがる2次元画像と3次元画像の性能評価を行った。
論文 参考訳(メタデータ) (2023-11-24T22:01:12Z) - LLaVA-Med: Training a Large Language-and-Vision Assistant for
Biomedicine in One Day [85.19963303642427]
本稿では,バイオメディカルイメージのオープンな研究課題に答えられる視覚言語対話アシスタントを訓練するための費用効率のよいアプローチを提案する。
モデルはまず、フィギュア・キャプションのペアを使ってバイオメディカル・ボキャブラリをアライメントし、その後、オープンエンドの会話意味論を習得する。
これにより、バイオメディジンのための大規模言語と視覚アシスタントを15時間以内で(8つのA100で)訓練することができる。
論文 参考訳(メタデータ) (2023-06-01T16:50:07Z) - Sketch-based Medical Image Retrieval [37.009806114204636]
本稿では,スケッチに基づく新しい医用画像検索システムについて紹介する。
医用画像の特徴分解は、医用画像のすべての特徴を分解して、正常な特徴と異常な特徴から再構築することができる。
本システムでは,医療画像の要求に応じて柔軟な画像検索を実現し,医用画像データベースの有用性を拡大する。
論文 参考訳(メタデータ) (2023-03-07T03:41:13Z) - Align, Reason and Learn: Enhancing Medical Vision-and-Language
Pre-training with Knowledge [68.90835997085557]
本稿では,3つの視点から構造化された医療知識を高めるための体系的かつ効果的なアプローチを提案する。
まず、視覚エンコーダと言語エンコーダの表現を知識を通して整列する。
次に,多モード融合モデルに知識を注入し,入力画像とテキストの補足として知識を用いた推論を可能にする。
第3に、知識によって引き起こされるプレテキストタスクを設計することで、画像やテキストの最も重要な情報に重点を置くよう、モデルを指導する。
論文 参考訳(メタデータ) (2022-09-15T08:00:01Z) - Cross-Modal Information Maximization for Medical Imaging: CMIM [62.28852442561818]
病院では、同じ情報を異なるモダリティの下で利用できるようにする特定の情報システムにデータがサイロ化される。
これは、テスト時に常に利用できないかもしれない同じ情報の複数のビューを列車で取得し、使用するためのユニークな機会を提供する。
テスト時にモダリティの低下に耐性を持つマルチモーダル入力の優れた表現を学習することで、利用可能なデータを最大限活用する革新的なフレームワークを提案する。
論文 参考訳(メタデータ) (2020-10-20T20:05:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。