論文の概要: Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2607.13860v1
- Date: Wed, 15 Jul 2026 14:05:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.792508
- Title: Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models
- Title(参考訳): 医療用マルチモーダル大言語モデルにおける3次元空間推論の強化に向けて
- Abstract要約: 本稿では,新しいスライスワイズデータ合成パラダイムを用いて構築した大規模構造化推論データセットを提案する。
放射線技師の真の診断ワークフローに触発されたこのパラダイムは、複雑な3D読み取りプロセスを分解して視覚認知をモデル化する。
この戦略は、計算に高価な3D特化事前学習を必要とせずに、深いボリューム理解と高度に解釈可能な臨床論理を解き放つ。
- 参考スコア(独自算出の注目度): 8.949206640442354
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Multimodal Large Language Models (MLLMs) have demonstrated remarkable success in 2D medical image understanding, their extension to 3D volumetric imaging remains hindered by prohibitive annotation costs and dataset opacity. Current data formats, predominantly consisting of rigid Visual Question Answering (VQA) pairs or unstructured final clinical reports, typically fail to capture explicit clinical reasoning. To address this limitation, we introduce a large-scale structured reasoning dataset constructed via a novel slice-wise data synthesis paradigm. Inspired by the genuine diagnostic workflow of radiologists, this paradigm models visual cognition by decomposing the complex 3D reading process, translating global clinical priors into fine-grained, per-slice observations that are subsequently synthesized into an interpretable Chain-of-Thought (CoT). Crucially, this synthesized reasoning framework enforces essential clinical principles: sequential spatial tracking, multi-slice spatial awareness for artifact mitigation, and differential exclusion. To validate this approach, we instruction-tune a standard 2D-pretrained MLLM baseline using the synthesized data to enhance its volumetric comprehension. Comprehensive evaluations across multiple 3D medical benchmarks demonstrate that our method yields significant performance improvements over the 2D baseline. Furthermore, the resulting model exhibits robust spatial reasoning capabilities and rivals resource-intensive native 3D architectures, effectively bridging the performance gap. Ultimately, this data-centric strategy unlocks deep volumetric understanding and highly interpretable clinical logic without requiring computationally expensive 3D-specific pre-training. The complete repository, including datasets and training workflows, is publicly available at https://github.com/2020420145009/hounsfield.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、2次元の医用画像理解において顕著な成功を収めているが、3次元のボリューム画像への拡張は、禁止的なアノテーションコストとデータセットの不透明さによって妨げられている。
現在のデータフォーマットは、主に堅固な視覚質問回答(VQA)ペアまたは非構造的な最終臨床報告で構成されるが、典型的には明確な臨床推論を捉えることができない。
この制限に対処するために,新しいスライスワイズデータ合成パラダイムを用いて構築された大規模構造化推論データセットを提案する。
放射線学者の真の診断ワークフローにインスパイアされたこのパラダイムは、複雑な3D読影過程を分解し、世界的な臨床の先駆者を細かな粒度ごとの観察に翻訳し、その後解釈可能なChain-of-Thought(CoT)へと合成することで視覚認知をモデル化する。
この合成推論フレームワークは、シーケンシャルな空間追跡、アーティファクト緩和のためのマルチスライスな空間認識、および差分排除という、基本的な臨床原則を強制する。
提案手法の有効性を検証するため, 合成データを用いて, 標準の2次元事前学習MLLMベースラインをチューニングし, 容積理解度を向上させる。
複数の3次元医用ベンチマークの総合的な評価は,本手法が2次元ベースラインに対して顕著な性能向上をもたらすことを示す。
さらに、得られたモデルは、堅牢な空間推論能力を示し、資源集約型ネイティブ3Dアーキテクチャと競合し、性能ギャップを効果的に埋める。
最終的に、このデータ中心の戦略は、計算に高価な3D特化事前学習を必要とせずに、深いボリューム理解と高度に解釈可能な臨床論理を解き放つ。
データセットやトレーニングワークフローを含む完全なリポジトリはhttps://github.com/2020420145009/hounsfieldで公開されている。
関連論文リスト
- Volumetric Radiology AI in the Era of Multimodal Large Language Models [62.95443321443533]
ボリュームラジオロジーは、基本的な表現ミスマッチを示します。
現在の大言語モデル(MLLM)は、選択された2次元(2次元)画像、圧縮された視覚表現、またはレポート由来のテキストに条件付けされている。
信頼性の高い放射線学 AIは、タスクに関連する3D情報と、これらの情報にアクセスし、検証し、統合できるシステムを保存する表現を必要とする。
論文 参考訳(メタデータ) (2026-08-20T20:23:41Z) - MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models [59.180043227905294]
MedPrunerは、3次元医用画像の効率的な理解のためのトレーニング不要でモデルに依存しない階層的トークンプレーニングフレームワークである。
我々は、MedPrunerによって、MedGemmaのようなモデルが元の性能を維持したり、超えたりすることが可能であり、ビジュアルトークンの5%以下を維持していることを示す。
論文 参考訳(メタデータ) (2026-03-12T07:37:00Z) - Optimizing 3D Diffusion Models for Medical Imaging via Multi-Scale Reward Learning [7.493047521402676]
本稿では,RL(Reinforcement Learning)を用いた3次元拡散モデルの改良手法を提案する。
2次元スライス・アセスメントと3次元解析を統合した新たな報酬システムによって導かれるPPO(Proximal Policy Optimization)を用いてモデルを微調整する。
以上の結果から,RLフィードバックを組み込むことで,より高品質な分散を実現することが可能であることが示唆された。
論文 参考訳(メタデータ) (2026-03-06T11:30:55Z) - Multimodal Visual Surrogate Compression for Alzheimer's Disease Classification [69.87877580725768]
MVSC(Multimodal Visual Surrogate Compression)は、大規模な3D sMRIボリュームをコンパクトな2D機能に圧縮し、適応させることを学ぶ。
MVSCには2つの重要なコンポーネントがある: テキストガイダンスの下でグローバルなクロススライスコンテキストをキャプチャするボリュームコンテキストと、テキストエンハンスでパッチワイズな方法でスライスレベルの情報を集約するAdaptive Slice Fusionモジュール。
論文 参考訳(メタデータ) (2026-01-29T13:05:46Z) - Lemon: A Unified and Scalable 3D Multimodal Model for Universal Spatial Understanding [80.66591664266744]
Lemonは3Dポイントクラウドパッチと言語トークンを単一のシーケンスとして処理する統合トランスフォーマーアーキテクチャである。
3次元データの複雑さに対処するため,空間的コンテキストを保存するための構造化パッチやトークン化方式を開発した。
Lemonは、総合的な3D理解と推論タスクにまたがって、最先端のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2025-12-14T20:02:43Z) - Spatial-ORMLLM: Improve Spatial Relation Understanding in the Operating Room with Multimodal Large Language Model [1.8302608976873713]
空間ORMLLMは手術室における3次元空間推論のための視覚言語モデルである。
推定アルゴリズムにより抽出された3次元空間知識の豊富な2次元モダリティ入力を組み込む。
専門家のアノテーションやセンサー入力を使わずに、堅牢な3Dシーン推論を提供する。
論文 参考訳(メタデータ) (2025-08-11T17:17:20Z) - Text-to-CT Generation via 3D Latent Diffusion Model with Contrastive Vision-Language Pretraining [1.447808799346751]
本稿では,3次元コントラッシブな視覚-言語事前学習方式と潜在拡散モデルを組み合わせたテキスト-CT生成のための新しいアーキテクチャを提案する。
本手法は,テキストから臨床的に有意なCTボリュームを合成するための,スケーラブルで制御可能なソリューションを提供する。
論文 参考訳(メタデータ) (2025-05-31T16:41:55Z) - GEAL: Generalizable 3D Affordance Learning with Cross-Modal Consistency [50.11520458252128]
既存の3Dアベイランス学習手法は、注釈付きデータに制限があるため、一般化と堅牢性に苦慮している。
本稿では,大規模事前学習型2Dモデルを活用することで,3次元アベイランス学習の一般化と堅牢性を高めるための新しいフレームワークであるGEALを提案する。
GEALは、既存のメソッドと、新しいオブジェクトカテゴリ、および破損したデータにおいて、一貫して優れています。
論文 参考訳(メタデータ) (2024-12-12T17:59:03Z) - MG-3D: Multi-Grained Knowledge-Enhanced 3D Medical Vision-Language Pre-training [7.968487067774351]
3次元医用画像解析は多くの臨床応用において重要である。
3次元医用画像解析では、大規模視覚言語による事前訓練がまだ検討されていない。
大規模データ(47.1K)に基づいて事前学習したMG-3Dを提案する。
論文 参考訳(メタデータ) (2024-12-08T09:45:59Z) - Enhancing Generalizability of Representation Learning for Data-Efficient 3D Scene Understanding [50.448520056844885]
本研究では,実世界のパターンを持つ多様な合成シーンを生成可能なベイズネットワークを提案する。
一連の実験は、既存の最先端の事前学習手法に比べて、我々の手法が一貫した優位性を示す。
論文 参考訳(メタデータ) (2024-06-17T07:43:53Z) - Syn3DWound: A Synthetic Dataset for 3D Wound Bed Analysis [28.960666848416274]
本稿では,2Dおよび3Dアノテーションを用いた高忠実度創傷のオープンソースデータセットであるSyn3DWoundを紹介する。
自動3次元形態計測と2D/3D創傷分割のためのベンチマークフレームワークを提案する。
論文 参考訳(メタデータ) (2023-11-27T13:59:53Z) - Interpretable 2D Vision Models for 3D Medical Images [47.75089895500738]
本研究では,3次元画像処理における中間特徴表現を用いた2次元ネットワークの適応手法を提案する。
我々は、ベンチマークとして3D MedMNISTデータセットと、既存の手法に匹敵する数百の高分解能CTまたはMRIスキャンからなる2つの実世界のデータセットを示す。
論文 参考訳(メタデータ) (2023-07-13T08:27:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。