論文の概要: Volumetric Radiology AI in the Era of Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2608.20549v1
- Date: Thu, 20 Aug 2026 20:23:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.227413
- Title: Volumetric Radiology AI in the Era of Multimodal Large Language Models
- Title(参考訳): マルチモーダル大言語モデルにおけるボリュームラジオロジーAI
- Abstract要約: ボリュームラジオロジーは、基本的な表現ミスマッチを示します。
現在の大言語モデル(MLLM)は、選択された2次元(2次元)画像、圧縮された視覚表現、またはレポート由来のテキストに条件付けされている。
信頼性の高い放射線学 AIは、タスクに関連する3D情報と、これらの情報にアクセスし、検証し、統合できるシステムを保存する表現を必要とする。
- 参考スコア(独自算出の注目度): 62.95443321443533
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Advances in multimodal large language models (MLLMs) are extending radiological artificial intelligence (AI) beyond task-specific image analysis toward multimodal understanding and reasoning. Volumetric radiology, however, presents a fundamental representational mismatch: clinical interpretation often requires full-volume spatial context and acquisition-dependent quantitative information, whereas current MLLMs are commonly conditioned on selected two-dimensional (2D) images, compressed visual representations, or report-derived text. Reliable volumetric radiology AI therefore requires representations that preserve task-relevant three-dimensional (3D) information and systems that can access, verify, and integrate this information across clinical workflows. In this Review, we examine more than 200 publications through July 2026. We organize the literature around volumetric representation and multimodal understanding at the model level, agentic orchestration at the system level, and their links to clinical applications and evaluation. We review volumetric foundation models, language alignment and compression strategies, and agentic systems that extend MLLMs through planning, tools, memory, and workflow interaction. We distinguish settings in which selected 2D views or report-mediated reasoning may suffice from those that warrant native volumetric modeling. We also introduce a Claim-Design-Validation framework to assess whether technical, workflow, and clinical claims are matched by appropriate design and validation. Across the literature, native volumetric modeling and agentic capabilities depend on the spatial, quantitative, contextual, and workflow requirements of the intended task. Clinical credibility requires faithful volumetric representation, traceable system behavior, claim-aligned validation, and clearly defined human oversight in realistic workflows.
- Abstract(参考訳): マルチモーダル大言語モデル(MLLM)の進歩は、タスク固有の画像解析からマルチモーダル理解と推論まで、放射線人工知能(AI)を拡張している。
現在のMLLMは、選択された2次元(2D)画像、圧縮された視覚的表現、またはレポート由来のテキストに通常条件付けされている。
したがって、信頼性の高いボリュームラジオロジーAIは、その情報にアクセスし、検証し、臨床ワークフローにまたがって統合できる、タスク関連3次元情報やシステムを保存する表現を必要とする。
このレビューでは、2026年7月までに200以上の出版物を調べます。
本稿では, モデルレベルでの容積表現とマルチモーダル理解, システムレベルでのエージェントオーケストレーション, 臨床応用と評価との関係に関する文献を整理する。
本稿では,MLLMを計画,ツール,メモリ,ワークフローのインタラクションを通じて拡張する,ボリューム基盤モデル,言語アライメントと圧縮戦略,エージェントシステムについてレビューする。
選択した2Dビューやレポートを介する推論が、ネイティブなボリュームモデリングを保証しているものから十分であるような設定を区別する。
また,技術,ワークフロー,臨床クレームが適切な設計と検証によって適合するかどうかを評価するために,クレーム・デザイン・バリデーション・フレームワークを導入する。
文学全体にわたって、ネイティブのボリュームモデリングとエージェント能力は、意図されたタスクの空間的、量的、文脈的、ワークフローの要求に依存している。
臨床信頼性には、忠実な容積表現、トレース可能なシステム動作、クレーム整合性検証、現実的なワークフローにおける明確な人間の監視が必要である。
関連論文リスト
- Concept-Grounded Reasoning with Prompt-Driven Localization for Interpretable Structured Report Generation [66.62662330558906]
CORALは、空間的接地と概念レベルの監督を統一的な推論プロセスに統合するマルチモーダルフレームワークである。
コーラルは、疾患の局所化とコンセプション・ボトルネックモジュールによる多クラス臨床属性の予測のために、プロンプト駆動型医療セグメンテーションモデルを採用している。
BUS-CoTとIU X線データセットの実験では、診断精度、概念整合性、報告品質が強力な汎用および医療MLLMよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-09-14T10:21:23Z) - MedVA: An End-to-End Neuro-Symbolic Agentic System for Medical Volume Visualization [8.890017714053098]
MedVA(メドバ)は、医療用容積可視化のためのエンドツーエンドのニューロシンボリック・エージェントシステムである。
3つの相補的エージェントによる制限に対処する。
論文 参考訳(メタデータ) (2026-09-14T00:48:16Z) - MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models [83.50100003741628]
ビジョンと言語モデル(VLM)は、バイオメディカルイメージングを変革する大きな可能性を秘めている。
本稿では,MMBU(Massive Multimodal Biomedical Understanding)ベンチマークを紹介する。
今までで最大のビジョンと言語ベンチマークで、35のサブモダリティと豊富な構造化メタデータをカバーしている。
論文 参考訳(メタデータ) (2026-06-04T20:24:47Z) - Agentic Large Language Models for Training-Free Neuro-Radiological Image Analysis [19.715805184063168]
Agentic AIは新しいソリューションを提供し、本質的な3D処理を必要としない。
自動脳MRI解析のための無トレーニングエージェントパイプラインを提案する。
この結果から,エージェントAIは,訓練や微調整を必要とせず,ツール使用による高次神経・放射線画像解析の課題を解決できることが示唆された。
論文 参考訳(メタデータ) (2026-04-17T22:04:16Z) - MedKGEval: A Knowledge Graph-Based Multi-Turn Evaluation Framework for Open-Ended Patient Interactions with Clinical LLMs [19.12790150016383]
MedKGEvalは、臨床用大規模言語モデルのための新しいマルチターン評価フレームワークである。
知識グラフ駆動患者シミュレーション機構は、キュレートされた知識グラフから関連する医療事実を検索する。
ターンレベル評価フレームワークは、各モデル応答を臨床的適切性、事実的正当性、安全性について評価する。
論文 参考訳(メタデータ) (2025-10-14T07:22:26Z) - Intelligent Healthcare Imaging Platform: A VLM-Based Framework for Automated Medical Image Analysis and Clinical Report Generation [0.0]
本稿では,視覚言語モデル(VLM)を活用した医用画像解析のためのインテリジェントマルチモーダルフレームワークを提案する。
このフレームワークはGoogle Gemini 2.5 Flashを統合し、腫瘍を自動的に検出し、CT、MRI、X線、超音波などの複数の画像モダリティで臨床報告を生成する。
論文 参考訳(メタデータ) (2025-09-16T23:15:44Z) - EndoBench: A Comprehensive Evaluation of Multi-Modal Large Language Models for Endoscopy Analysis [62.00431604976949]
EndoBenchは、内視鏡的プラクティスの全スペクトルにわたるMLLMを評価するために特別に設計された最初の包括的なベンチマークである。
我々は、汎用、医療特化、プロプライエタリMLLMを含む23の最先端モデルをベンチマークする。
私たちの実験では、プロプライエタリなMLLMは、オープンソースや医療専門のモデルよりも優れていますが、それでも人間の専門家を追い越しています。
論文 参考訳(メタデータ) (2025-05-29T16:14:34Z) - A Generative Framework for Bidirectional Image-Report Understanding in Chest Radiography [1.2289361708127877]
Multi-Stage Adaptive Vision-Language Tuning (MAViLT)は、視覚に基づく理解のためのマルチモーダル推論と生成を強化するために設計された新しいフレームワークである。
MAViLTは、臨床勾配重み付きトークン化プロセスと階層的な微調整戦略を取り入れており、正確な放射線学レポートを生成し、テキストから現実的なCXRを合成し、視覚に基づく臨床質問に答えることができる。
我々は、MIMIC-CXRとインディアナ大学CXRの2つのベンチマークデータセット上でMAViLTを評価し、すべてのタスクで最先端の結果を得る。
論文 参考訳(メタデータ) (2025-02-09T15:02:57Z) - A Survey of Medical Vision-and-Language Applications and Their Techniques [48.268198631277315]
医療ビジョン・アンド・ランゲージモデル(MVLM)は、複雑な医療データを解釈するための自然言語インタフェースを提供する能力から、大きな関心を集めている。
本稿では,MVLMの概要と適用した各種医療課題について概観する。
また、これらのタスクに使用するデータセットについても検討し、標準化された評価指標に基づいて異なるモデルの性能を比較した。
論文 参考訳(メタデータ) (2024-11-19T03:27:05Z) - Medical Vision-Language Pre-Training for Brain Abnormalities [96.1408455065347]
本稿では,PubMedなどの公共リソースから,医用画像・テキスト・アライメントデータを自動的に収集する方法を示す。
特に,まず大きな脳画像テキストデータセットを収集することにより,事前学習プロセスの合理化を図るパイプラインを提案する。
また,医療領域におけるサブフィギュアをサブキャプションにマッピングするというユニークな課題についても検討した。
論文 参考訳(メタデータ) (2024-04-27T05:03:42Z) - LLM-driven Multimodal Target Volume Contouring in Radiation Oncology [46.23891509553877]
大規模言語モデル(LLM)は、テキスト情報と画像の統合を容易にする。
LLM駆動型マルチモーダルAI,すなわちLLMSegを提案する。
提案モデルでは,従来のユニモーダルAIモデルと比較して,性能が著しく向上していることが実証された。
論文 参考訳(メタデータ) (2023-11-03T13:38:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。