論文の概要: MultiMedVision: Multi-Modal Medical Vision Framework
- arxiv url: http://arxiv.org/abs/2605.09151v1
- Date: Sat, 09 May 2026 20:29:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.088821
- Title: MultiMedVision: Multi-Modal Medical Vision Framework
- Title(参考訳): MultiMedVision: マルチモーダル医療ビジョンフレームワーク
- Abstract要約: 共同2D/3D表現学習のための統合フレームワークであるMultiMedVisionを提案する。
モデルでは3次元回転位置埋め込みと可変長列パッキングを用いて混合モードバッチを処理する。
5倍少ないデータを持つ1つの共有エンコーダを使用して、MultiMedVisionは両方の2Dベンチマークで競合性能を達成する。
- 参考スコア(独自算出の注目度): 4.804608924059296
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Multi-modal medical imaging enables comprehensive diagnostics, yet current foundation models process 2D (e.g. X-ray) and 3D (e.g. CT) data with separate, dimensionality-specific architectures. We present MultiMedVision, a unified framework for joint 2D/3D representation learning built on a Sparse Vision Transformer. Our model uses 3D Rotary Positional Embeddings and variable-length sequence packing to process mixed-modality batches natively within a shared latent space, without modality-specific adapters or treating 3D volumes as 2D slice sequences. Trained with a self-supervised objective on chest X-rays (MIMIC-CXR) and CT scans (CT-RATE), and using a single shared encoder with 5x less data, MultiMedVision achieves competitive performance on both 2D benchmarks (Macro AUROC 0.82 on MIMIC, 0.84 on CheXpert) and 3D tasks (0.85 on CT-RATE). Analysis of the learned representations reveals coexisting modality-specific and shared feature subspaces, demonstrating that unified cross-dimensional representation learning is feasible without sacrificing modality-specific performance.
- Abstract(参考訳): マルチモーダル・メディカルイメージングは包括的診断を可能にするが、現在の基礎モデルでは2D (e g X-ray) と3D (e g CT) のデータを別々の次元特化アーキテクチャで処理している。
Sparse Vision Transformer上に構築された2D/3D共同表現学習のための統合フレームワークであるMultiMedVisionを提案する。
本モデルでは, 3次元回転位置埋め込みと可変長列パッキングを用いて, 3次元ボリュームを2次元スライスシーケンスとして扱うことなく, 共有潜在空間内において混合モードバッチをネイティブに処理する。
胸部X線(MIMIC-CXR)とCTスキャン(CT-RATE)を自監督対象とし、5倍少ないデータを持つ単一の共有エンコーダを用いて、MultiMedVisionは2Dベンチマーク(MIMICではMacro AUROC 0.82、CheXpertでは0.84、CT-RATEでは0.85)と3Dタスク(CT-RATEでは0.85)の両方で競合性能を達成する。
学習した表現の分析は、モダリティ固有の共有特徴部分空間が共存していることを示し、モダリティ固有の性能を犠牲にすることなく、一様表現学習が実現可能であることを示した。
関連論文リスト
- Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis [52.32262701215441]
マルチモーダル大言語モデル(MLLM)は、堅牢な知覚能力、強力なクロスモーダルアライメント、有望な一般化性を示す。
3D医療画像の不足により、既存の3D医療MLLMは、十分に事前訓練された視覚エンコーダと、カスタマイズされた画像の特徴を抽出することができない。
本稿では,テキストプロンプトの指導の下でタスクを識別できるテキストガイド型階層型MoEフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-11T14:36:05Z) - MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models [59.180043227905294]
MedPrunerは、3次元医用画像の効率的な理解のためのトレーニング不要でモデルに依存しない階層的トークンプレーニングフレームワークである。
我々は、MedPrunerによって、MedGemmaのようなモデルが元の性能を維持したり、超えたりすることが可能であり、ビジュアルトークンの5%以下を維持していることを示す。
論文 参考訳(メタデータ) (2026-03-12T07:37:00Z) - Multimodal Visual Surrogate Compression for Alzheimer's Disease Classification [69.87877580725768]
MVSC(Multimodal Visual Surrogate Compression)は、大規模な3D sMRIボリュームをコンパクトな2D機能に圧縮し、適応させることを学ぶ。
MVSCには2つの重要なコンポーネントがある: テキストガイダンスの下でグローバルなクロススライスコンテキストをキャプチャするボリュームコンテキストと、テキストエンハンスでパッチワイズな方法でスライスレベルの情報を集約するAdaptive Slice Fusionモジュール。
論文 参考訳(メタデータ) (2026-01-29T13:05:46Z) - Cross-D Conv: Cross-Dimensional Transferable Knowledge Base via Fourier Shifting Operation [3.69758875412828]
クロスD Conv 演算はフーリエ領域における位相シフトを学習することで次元ギャップを橋渡しする。
本手法は2次元と3次元の畳み込み操作間のシームレスな重み移動を可能にする。
論文 参考訳(メタデータ) (2024-11-02T13:03:44Z) - Spatiotemporal Modeling Encounters 3D Medical Image Analysis:
Slice-Shift UNet with Multi-View Fusion [0.0]
本稿では,2次元CNNにおける3次元特徴をエンコードする2次元モデルSlice SHift UNetを提案する。
より正確にマルチビュー機能は、ボリュームの3次元平面に沿って2次元の畳み込みを実行することで協調的に学習される。
提案手法の有効性は,多モード腹部多臓器軸 (AMOS) と Cranial Vault (BTCV) データセットを越えたマルチアトラスラベリング (Multi-Atlas Labeling Beyond the Cranial Vault) で検証した。
論文 参考訳(メタデータ) (2023-07-24T14:53:23Z) - Joint-MAE: 2D-3D Joint Masked Autoencoders for 3D Point Cloud
Pre-training [65.75399500494343]
Masked Autoencoders (MAE) は、2Dおよび3Dコンピュータビジョンのための自己教師型学習において有望な性能を示した。
自己監督型3次元点雲事前学習のための2D-3DジョイントMAEフレームワークであるJoint-MAEを提案する。
論文 参考訳(メタデータ) (2023-02-27T17:56:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。