論文の概要: RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding
- arxiv url: http://arxiv.org/abs/2607.22293v1
- Date: Fri, 24 Jul 2026 13:35:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.134611
- Title: RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding
- Title(参考訳): RadSight: 知覚的に信頼性の高いマルチモーダルラジオロジー画像理解を目指して
- Abstract要約: パーセプション・ベンチ(Perception-Bench)は、113万サンプルからなる大規模なベンチマークである。
Perception-Bench を用いた解析の結果,既存のMLLM では,最も基本的な病変を捕捉する能力が欠如していることが判明した。
そこで我々は,デュアル2D/3Dエンコーダアーキテクチャ上に構築された知覚駆動型MLLMであるRadSightを提案する。
- 参考スコア(独自算出の注目度): 29.104092621171606
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Medical multimodal large language models (MLLMs) are increasingly expected to perform complex image understanding tasks, yet their reliability is often compromised by frequent errors in visual interpretation. To systematically trace these failures, we traverse the hierarchy from high-level clinical tasks down to fundamental visual perception. We therefore introduce Perception-Bench, a large-scale benchmark comprising 1.13 million samples that assesses medical MLLMs across six dimensions: attribute judgment, spatial grounding, spatial understanding, disease prediction, anomaly detection, and report generation, spanning both 2D and 3D radiology images. Our analysis on Perception-Bench reveals that existing MLLMs lack the ability to capture even the most basic lesion attributes, such as location, size, and density. This inability to ground clinical outputs in primary visual evidence reveals that the models' diagnostic unreliability is rooted in a critical but overlooked bottleneck in low-level visual perception. Motivated by this, we propose RadSight, a perception-driven MLLM built upon a dual 2D/3D encoder architecture that preserves native imaging spatial structures. RadSight formulates medical image understanding as a four-stage progressive process: visual-language alignment, fine-grained visual perception, clinical diagnosis, and diagnostic interpretation. The model is trained on an 8.37 million perception-oriented corpus using progressive curriculum learning. On Perception-Bench, RadSight consistently outperforms existing MLLMs across all six evaluation dimensions, with particularly strong gains in spatial grounding and clinical diagnosis. It also achieves consistent improvements on public 2D and 3D medical benchmarks, further demonstrating that robust low-level visual perception is a critical foundation for reliable clinical understanding. Code and model will be publicly available.
- Abstract(参考訳): 医療用マルチモーダル大言語モデル(MLLM)は、複雑な画像理解タスクを実行することがますます期待されているが、その信頼性は視覚解釈における頻繁なエラーによって損なわれることが多い。
これらの障害を体系的に追跡するために、我々は、ハイレベルな臨床タスクから基本的な視覚的知覚へと階層構造を継承する。
そこで我々は, 属性判定, 空間的接地, 空間的理解, 疾患予測, 異常検出, レポート生成の6次元にわたる医療MLLMを113万検体で評価する大規模ベンチマークであるPerception-Benchを紹介した。
Perception-Benchの分析から、既存のMLLMでは、位置、サイズ、密度など、最も基本的な病変の属性を捕捉する能力が欠如していることが判明した。
この臨床的アウトプットを一次視覚的証拠に基礎づけることのできないことは、モデルの診断不能が、低レベルの視覚知覚において、批判的ではあるが見過ごされているボトルネックに根ざしていることを示している。
そこで我々は,2D/3Dエンコーダアーキテクチャ上に構築された知覚駆動型MLLMであるRadSightを提案する。
RadSightは、医用画像理解を4段階の進歩過程として定式化している: 視覚言語アライメント、きめ細かい視覚知覚、臨床診断、診断解釈。
このモデルは、プログレッシブカリキュラムラーニングを用いて837万の知覚指向コーパスで訓練されている。
Perception-Benchでは、RadSightは6つの評価次元すべてで既存のMLLMを一貫して上回り、特に空間的接地や臨床診断において大きな進歩を見せている。
また、公共の2Dおよび3D医療ベンチマークにおける一貫した改善も達成し、堅牢な低レベルの視覚知覚が信頼性の高い臨床的理解にとって重要な基盤であることを示す。
コードとモデルは公開されます。
関連論文リスト
- ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding [67.57715989349471]
MLLM(Multimodal large language model)は、臨床実践に革命をもたらす大きな可能性を秘めている。
我々は、総合的な医学的理解のために設計された視覚中心のMLLMであるClinFusionを紹介する。
ClinFusionは、総合的な2Dおよび3Dマルチモーダル・メディカル・ベンチマーク・スイートにまたがって、最先端の新たな状態を設定する。
論文 参考訳(メタデータ) (2026-07-27T17:59:49Z) - Brain-Adapter: A Dual-Stream Vision-Language MIL Framework for Comprehensive 3D CT Diagnosis of Acute Intracranial Pathologies [8.984636910625886]
Brain-Adapterは、新しいデュアルストリームマルチインスタンス学習フレームワークである。
提案手法は,最先端の3Dモデルと標準MIL手法を大幅に上回っている。
論文 参考訳(メタデータ) (2026-06-22T15:41:16Z) - Med-StepBench: A Hierarchical Reasoning Framework for Evaluating Hallucinations in Medical Vision-Language Models [8.20487574753681]
既存の幻覚ベンチマークは、主に1ショットの診断質問を伴う2Dイメージングに焦点を当てている。
我々は3DオンコロジーPET/CTにおける段階的幻覚検出のための最初の大規模ベンチマークであるMed-StepBenchを紹介する。
論文 参考訳(メタデータ) (2026-05-11T05:26:59Z) - Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis [52.32262701215441]
マルチモーダル大言語モデル(MLLM)は、堅牢な知覚能力、強力なクロスモーダルアライメント、有望な一般化性を示す。
3D医療画像の不足により、既存の3D医療MLLMは、十分に事前訓練された視覚エンコーダと、カスタマイズされた画像の特徴を抽出することができない。
本稿では,テキストプロンプトの指導の下でタスクを識別できるテキストガイド型階層型MoEフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-11T14:36:05Z) - Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models [62.932580559941414]
VLM(Vision-Language Models)は、しばしば「ハロシン化(hallucinate)」する。
本稿では,静的な出力誤差からモデル計算認知の動的病理へ再キャストし,幻覚を診断するための新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2026-03-16T17:20:38Z) - Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge [66.67024684187915]
LVLM(Large Vision Language Models)は、眼科における自動診断の可能性を秘めている。
彼らの臨床展開は、ドメイン固有の知識の欠如によって著しく妨げられている。
EyExInは、Deep Expert Injectionメカニズムを通じて専門知識で網膜VLMを固定するように設計されたフレームワークである。
論文 参考訳(メタデータ) (2026-03-07T09:43:49Z) - Data-Efficient Fine-Tuning of Vision-Language Models for Diagnosis of Alzheimer's Disease [3.46857682956989]
医用視覚言語モデル(Med-VLMs)は、レポート生成や視覚的質問応答といったタスクにおいて印象的な結果を示している。
既存のモデルの多くは、スクラッチからトレーニングするか、大規模な2D画像テキストペアで微調整されるのが一般的である。
我々は3次元MRIに3次元CTベースのMed-VLMを適用するためのデータ効率の良い微調整パイプラインを提案する。
論文 参考訳(メタデータ) (2025-09-09T11:36:21Z) - HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding [11.482339306296204]
本稿では、3次元の視覚的手がかりを有効視知覚と投影によって活用し、正確で堅牢な視覚言語理解を実現する枠組みを提案する。
具体的には、HSENetは、グローバルなボリュームコンテキストと微細な解剖学的詳細の両方を知覚するために、デュアル3Dビジョンエンコーダを使用している。
また,高分解能な3次元空間領域をコンパクトな視覚的トークン集合に凝縮する効率的なマルチモーダルプロジェクタであるSpatial Packerを提案する。
論文 参考訳(メタデータ) (2025-06-11T11:46:57Z) - MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness [50.33343842822694]
MMPerspectiveはマルチモーダルな大言語モデルの視点理解を評価するために設計された最初のベンチマークである。
このベンチマークでは,実世界の2,711の合成画像と5,083の問合せ対でキー機能を調べている。
43の最先端MLLMの総合評価により,重要な限界が明らかになった。
論文 参考訳(メタデータ) (2025-05-26T18:20:22Z) - MG-3D: Multi-Grained Knowledge-Enhanced 3D Medical Vision-Language Pre-training [7.968487067774351]
3次元医用画像解析は多くの臨床応用において重要である。
3次元医用画像解析では、大規模視覚言語による事前訓練がまだ検討されていない。
大規模データ(47.1K)に基づいて事前学習したMG-3Dを提案する。
論文 参考訳(メタデータ) (2024-12-08T09:45:59Z) - Brain3D: Generating 3D Objects from fMRI [78.46936519561298]
被験者のfMRIデータを入力として利用する新しい3Dオブジェクト表現学習手法であるBrain3Dを設計する。
我々は,人間の視覚系の各領域の異なる機能的特徴を,我々のモデルが捉えていることを示す。
予備評価は、Brain3Dがシミュレーションシナリオで障害した脳領域を正常に識別できることを示唆している。
論文 参考訳(メタデータ) (2024-05-24T06:06:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。