論文の概要: Explainable Multimodal Deep Learning Integrating Imaging and Clinical Data for Oral Potentially Malignant Disorder Detection
- arxiv url: http://arxiv.org/abs/2609.04512v1
- Date: Thu, 03 Sep 2026 22:01:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.838996
- Title: Explainable Multimodal Deep Learning Integrating Imaging and Clinical Data for Oral Potentially Malignant Disorder Detection
- Title(参考訳): 画像と臨床データを統合したマルチモーダル深層学習による口腔悪性度診断
- Abstract要約: M2-OPMDNetは、OPMD検出のための構造化された臨床情報と白色光と自己蛍光の口腔内画像を統合する。
臨床に関連のあるリスクファクターと症状を捉えるために、カスタマイズされたアンケートが設計された。
M2-OPMDNetは0.952のAUCを達成した。
- 参考スコア(独自算出の注目度): 14.652837775821794
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Oral potentially malignant disorders (OPMDs) are critical precursors to oral cancer, yet clinical detection remains challenging because of substantial phenotypic heterogeneity and overlap with benign conditions. Although image-based deep learning shows promise for automated screening, visual information alone may be insufficient in real-world settings, where diagnostic decisions also rely on patient-specific risk factors. We developed M2-OPMDNet, a multimodal deep learning framework that integrates co-registered white-light and autofluorescence intraoral images with structured clinical information for OPMD detection. A customized questionnaire was designed to capture clinically relevant risk factors and symptoms in a standardized, reproducible format for integration with image-derived features. Multiple image encoders, including conventional convolutional neural networks and foundation model-based architectures, were evaluated using a prospectively collected dataset reflecting real-world screening conditions. Model interpretability was assessed using SHapley Additive exPlanations (SHAP) to quantify feature- and modality-level contributions. M2-OPMDNet achieved an AUC of 0.952, outperforming unimodal approaches and showing improved performance for visually subtle lesions. SHAP analysis demonstrated that structured clinical variables contributed substantially to risk estimation and complemented imaging features. These results demonstrate that explainable multimodal learning combining white-light and autofluorescence imaging with structured clinical data can provide accurate, transparent, and clinically grounded OPMD detection. M2-OPMDNet offers a scalable framework for real-world oral cancer screening and decision support.
- Abstract(参考訳): 口腔悪性疾患 (OPMDs) は口腔癌の重要な前駆体であるが, 良性疾患と鑑別が困難である。
画像に基づくディープラーニングは、自動スクリーニングを約束するが、診断決定が患者固有のリスクファクタにも依存する現実世界では、視覚情報だけでは不十分である可能性がある。
我々は,M2-OPMDNetを開発した。このM2-OPMDNetは,共同登録した白色光と自己蛍光の口腔内画像とOPMD検出のための構造化臨床情報を統合した多モード深層学習フレームワークである。
画像の特徴と統合するための標準化された再現可能なフォーマットで臨床上の危険因子と症状を抽出するために、カスタマイズされたアンケートが設計された。
従来の畳み込みニューラルネットワークや基礎モデルに基づくアーキテクチャを含む複数の画像エンコーダを,実世界のスクリーニング条件を反映した将来的なデータセットを用いて評価した。
モデル解釈可能性の評価はSHAP(SHapley Additive ExPlanations)を用いて行った。
M2-OPMDNetは0.952のAUCを達成し、一過性アプローチを上回り、視覚的に微妙な病変に対して改善した。
SHAP解析の結果, 構造的臨床変数は, リスク推定と補完画像の特徴に大きく寄与した。
これらの結果から,白色光と自己蛍光画像と構造化された臨床データを組み合わせた多モード学習が,正確な,透明で,臨床に根ざしたOPMD検出を可能にすることが示唆された。
M2-OPMDNetは、現実世界の口腔がんスクリーニングと意思決定サポートのためのスケーラブルなフレームワークを提供する。
関連論文リスト
- Concept-Grounded Reasoning with Prompt-Driven Localization for Interpretable Structured Report Generation [66.62662330558906]
CORALは、空間的接地と概念レベルの監督を統一的な推論プロセスに統合するマルチモーダルフレームワークである。
コーラルは、疾患の局所化とコンセプション・ボトルネックモジュールによる多クラス臨床属性の予測のために、プロンプト駆動型医療セグメンテーションモデルを採用している。
BUS-CoTとIU X線データセットの実験では、診断精度、概念整合性、報告品質が強力な汎用および医療MLLMよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-09-14T10:21:23Z) - Can Multimodal Large Language Models Understand OCT? [3.932595394031011]
マルチモーダル大言語モデル (MLLM) は, 医用画像解析において有意な可能性を証明している。
OCT-Benchは、7つの公開データセットにわたる4,137のOCT画像から構築された10,076の高品質な多重選択質問からなる。
我々は,プロプライエタリモデル,オープンソース汎用モデル,医療ドメインモデルを含む20の代表的なMLLMを体系的に評価する。
論文 参考訳(メタデータ) (2026-07-18T03:08:31Z) - JI-ADF: Joint-Individual Learning with Adaptive Decision Fusion for Multimodal Skin Lesion Classification [1.57333503756856]
皮膚病変の分類は早期皮膚科診断に不可欠である。
既存のコンピュータ支援システムの多くは、主に皮膚鏡画像に頼り、マルチモーダルな証拠を過小評価している。
皮膚内視鏡画像,臨床写真,構造化された患者のメタデータを統合した3モーダル深層学習フレームワークである textbfJI-ADF を提案する。
論文 参考訳(メタデータ) (2026-04-30T02:48:15Z) - Delving Aleatoric Uncertainty in Medical Image Segmentation via Vision Foundation Models [56.29123284262618]
本研究は,視覚基盤モデルの普遍的表現能力を生かして固有データ不確実性を推定することを提案する。
モデルのデコード表現の特徴の多様性を分析し,その特異値エネルギーを定量化し,各クラスに対する意味知覚尺度を定義する。
この基礎に基づいて,本研究は,(1)潜在的にノイズの多いサンプルを排除し,モデル学習品質を向上させるためのアレータリック不確実性認識データフィルタリング機構,(2)意味認識尺度に基づくトレーニング中にクラス固有の損失重みを適応的に調整する動的不確実性認識最適化戦略,およびトレーニング安定性を向上させるラベル認知機構の2つの不確実性駆動型アプリケーション戦略を設計する。
論文 参考訳(メタデータ) (2026-04-13T03:59:54Z) - Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs [63.535652574541764]
MLLM(Multimodal Large Language Models)は医用画像解析において顕著な可能性を示した。
消化器内視鏡におけるそれらの応用は、現在、2つの重要な限界によって妨げられている。
本稿では,これらの課題に対処する新しい臨床認知アライメント(CogAlign)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-21T07:47:37Z) - Quasi-multimodal-based pathophysiological feature learning for retinal disease diagnosis [4.437523386839875]
多モードデータ合成と融合を統合した統合フレームワークが網膜疾患の分類とグレーディングのために提案されている。
提案する学習システムは,画像空間と特徴空間の両方の可視化を通して,徹底的に解釈される。
この研究は網膜疾患スクリーニングの精度と効率を高めるだけでなく、様々な医用画像モダリティにまたがるデータ拡張のためのスケーラブルなフレームワークも提供する。
論文 参考訳(メタデータ) (2026-02-03T15:13:57Z) - A Semantically Enhanced Generative Foundation Model Improves Pathological Image Synthesis [82.01597026329158]
本稿では,組織合成のための相関調整フレームワーク(CRAFTS)について紹介する。
CRAFTSは、生物学的精度を確保するためにセマンティックドリフトを抑制する新しいアライメント機構を組み込んでいる。
本モデルは,30種類の癌にまたがる多彩な病理像を生成する。
論文 参考訳(メタデータ) (2025-12-15T10:22:43Z) - A Clinically-Grounded Two-Stage Framework for Renal CT Report Generation [4.408787333571913]
本稿では,自動腎CTレポート作成のための枠組みを提案する。
ステージ1では、マルチタスク学習モデルが、各2次元画像から構造化された臨床特徴を検出する。
ステージ2では、視覚言語モデルが画像と検出された特徴に条件付けされた自由テキストレポートを生成する。
論文 参考訳(メタデータ) (2025-06-30T07:45:02Z) - Metrics that matter: Evaluating image quality metrics for medical image generation [48.85783422900129]
本研究は、脳MRIデータを用いて、一般的に使用される非参照画像品質指標を包括的に評価する。
本研究は, ノイズ, 分布変化, および臨床的に関係のある不正確さを模倣した形態的変化を含む, 様々な課題に対する計量感度を評価する。
論文 参考訳(メタデータ) (2025-05-12T01:57:25Z) - Towards Accurate and Interpretable Neuroblastoma Diagnosis via Contrastive Multi-scale Pathological Image Analysis [16.268045905735818]
病理画像分類に適したコントラスト学習に基づくマルチスケール機能融合モデルであるCMSwinKANを提案する。
マルチスケールの特徴を融合させ、対照的な学習戦略を活用することで、CMSwinKANは臨床医の包括的なアプローチを模倣する。
その結果、CMSwinKANは、既存の最先端の病理モデルよりも、大規模なデータセットで事前訓練されたモデルよりもパフォーマンスがよいことが示された。
論文 参考訳(メタデータ) (2025-04-18T15:39:46Z) - Malignancy Prediction and Lesion Identification from Clinical
Dermatological Images [65.1629311281062]
臨床皮膚画像から機械学習に基づく悪性度予測と病変の同定を検討する。
まず, サブタイプや悪性度に関わらず画像に存在するすべての病変を同定し, その悪性度を推定し, 凝集により, 画像レベルの悪性度も生成する。
論文 参考訳(メタデータ) (2021-04-02T20:52:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。