論文の概要: Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology
- arxiv url: http://arxiv.org/abs/2607.14581v1
- Date: Thu, 16 Jul 2026 05:21:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.998834
- Title: Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology
- Title(参考訳): 脳腫瘍学における視覚指導調整のためのマルチLLM協調MRIレポートの作成
- Abstract要約: 我々は3次元MRIスキャンを用いて脳腫瘍学のための3次元画像テキストデータセットを作成する新しい手法を提案する。
新しい3D MRI-textデータセットを活用することで、MRIスキャンをトークンに変換し、テキスト命令で調整するVLMをさらに構築する。
- 参考スコア(独自算出の注目度): 1.4770902450080214
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in large language models (LLMs) and their extension to vision-language models (VLMs) have made it easier to combine text and images for tasks such as report generation. Existing VLMs in medicine typically focus on 2D images (chest X-rays), and their extension to 3D imaging has been difficult because of the lack of paired 3D imaging-text data. Thus, we introduce a new method for creating a 3D image-text dataset for brain oncology using 3D MRI scans of glioma and meningioma cases. We use a cooperative system in which several LLMs work together to generate and check reports, ensuring that they are accurate and clear. By leveraging the new 3D MRI-text dataset, we further build a VLM that converts MRI scans into tokens and aligns them with text instructions. Our VLM performed better in report generation and visual question answering tasks than other 2D and 3D methods. Our method not only improves the quality of reports but also helps with better diagnosis and treatment in brain oncology.
- Abstract(参考訳): 大規模言語モデル(LLM)の最近の進歩と視覚言語モデル(VLM)への拡張により、レポート生成などのタスクのためのテキストと画像の結合が容易になった。
既存の医用VLMは一般的に2D画像(ケストX線)に焦点を合わせており、3D画像への拡張は、ペア化された3D画像テキストデータがないため困難である。
そこで我々はグリオーマと髄膜腫の3次元MRIスキャンを用いて脳腫瘍学のための3次元画像テキストデータセットを作成する方法を提案する。
我々は、複数のLCMが協力してレポートを作成し、チェックし、正確で明確であることを保証する協調システムを用いています。
新しい3D MRI-textデータセットを活用することで、MRIスキャンをトークンに変換し、テキスト命令で調整するVLMをさらに構築する。
我々のVLMは,他の2D法や3D法よりも,レポート生成や視覚的質問応答のタスクにおいて優れていた。
本手法は報告の質を向上するだけでなく,脳腫瘍学の診断や治療にも有効である。
関連論文リスト
- Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis [52.32262701215441]
マルチモーダル大言語モデル(MLLM)は、堅牢な知覚能力、強力なクロスモーダルアライメント、有望な一般化性を示す。
3D医療画像の不足により、既存の3D医療MLLMは、十分に事前訓練された視覚エンコーダと、カスタマイズされた画像の特徴を抽出することができない。
本稿では,テキストプロンプトの指導の下でタスクを識別できるテキストガイド型階層型MoEフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-11T14:36:05Z) - 3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection [0.31351527202068447]
3次元MRIにおける視覚言語表現学習を支援するフレームワークであるMedMAPを提案する。
MedMAPは、モダリティ対応の視覚言語アライメントステージと、多臓器異常検出のための微調整ステージとを備える。
MedMoM-MRI3Dを用いた実験により,MedMAPは3次元MRIによる多臓器異常検出において既存のVLMよりも有意に優れていることが示された。
論文 参考訳(メタデータ) (2026-02-27T03:37:55Z) - Enhancing 3D Medical Image Understanding with Pretraining Aided by 2D Multimodal Large Language Models [5.020980730631682]
既存の3D医療畳み込みとトランスフォーマーベースの自己教師付き学習(SSL)手法は、しばしば深い意味理解を欠いている。
マルチモーダル大規模言語モデル(MLLM)の最近の進歩は、テキスト記述による画像理解を強化するための有望なアプローチを提供する。
Med3DInsightは、3D画像エンコーダと2D MLLMを特別に設計された平面スライス対応トランスモジュールを介して統合する新しい事前学習フレームワークである。
論文 参考訳(メタデータ) (2025-09-11T00:12:59Z) - 3D-CT-GPT: Generating 3D Radiology Reports through Integration of Large Vision-Language Models [51.855377054763345]
本稿では,VQAに基づく医用視覚言語モデルである3D-CT-GPTについて紹介する。
パブリックデータセットとプライベートデータセットの両方の実験により、3D-CT-GPTはレポートの正確さと品質という点で既存の手法を著しく上回っていることが示された。
論文 参考訳(メタデータ) (2024-09-28T12:31:07Z) - Brain3D: Generating 3D Objects from fMRI [78.46936519561298]
被験者のfMRIデータを入力として利用する新しい3Dオブジェクト表現学習手法であるBrain3Dを設計する。
我々は,人間の視覚系の各領域の異なる機能的特徴を,我々のモデルが捉えていることを示す。
予備評価は、Brain3Dがシミュレーションシナリオで障害した脳領域を正常に識別できることを示唆している。
論文 参考訳(メタデータ) (2024-05-24T06:06:11Z) - M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models [49.5030774873328]
これまでの研究は主に2Dの医療画像に焦点を合わせてきた。
120K画像テキスト対と62K命令応答対からなる大規模3次元マルチモーダル医療データセットM3D-Dataを提案する。
また,新しい3次元マルチモーダル・メディカル・ベンチマークであるM3D-Benchを導入し,8つのタスクにまたがる自動評価を容易にする。
論文 参考訳(メタデータ) (2024-03-31T06:55:12Z) - Generative Enhancement for 3D Medical Images [74.17066529847546]
本稿では,3次元医用画像合成の新しい生成手法であるGEM-3Dを提案する。
本手法は2次元スライスから始まり,3次元スライスマスクを用いて患者に提供するための情報スライスとして機能し,生成過程を伝搬する。
3D医療画像をマスクと患者の事前情報に分解することで、GEM-3Dは多目的な3D画像を生成する柔軟な、かつ効果的なソリューションを提供する。
論文 参考訳(メタデータ) (2024-03-19T15:57:04Z) - Med3DInsight: Enhancing 3D Medical Image Understanding with 2D
Multi-Modal Large Language Models [1.64647940449869]
既存の3D畳み込みとトランスフォーマーベースの手法は、画像ボリュームのセマンティックな理解が限られている。
既存の3D画像エンコーダを2D MLLMでマージし,PSAT(Plane-Slice-Aware Transformer)モジュールを介してブリッジするMed3DInsightを提案する。
論文 参考訳(メタデータ) (2024-03-08T08:15:53Z) - XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models [72.8965643836841]
我々は,会話型医療ビジョン言語モデルであるXrayGPTを紹介する。
胸部X線写真に関するオープンエンドの質問を分析し、答えることができる。
自由テキストラジオグラフィーレポートから217kの対話的かつ高品質な要約を生成する。
論文 参考訳(メタデータ) (2023-06-13T17:59:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。