論文の概要: Unlocking the Power of Medical Tabular Data via Semantic-Aware Multimodal Pre-training
- arxiv url: http://arxiv.org/abs/2608.10522v1
- Date: Tue, 11 Aug 2026 05:57:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.921442
- Title: Unlocking the Power of Medical Tabular Data via Semantic-Aware Multimodal Pre-training
- Title(参考訳): セマンティック・アウェア・マルチモーダル・プレトレーニングによる医療用タブラルデータの解錠
- Authors: Yingsheng Liu, Haiming Li, Jingmin Zhu, Jiajun Sun, Victoria Mar, Monika Janda, H. Peter Soyer, Zongyuan Ge, Zhen Yu,
- Abstract要約: 本稿では,本質的な2次元データ構造を明示的にモデル化する新しい意味認識フレームワークを提案する。
まず,診断の重要度の異なる機能間階層に対処し,重要度を考慮した適応型マスキングを提案する。
第二に、機能内連続性-離散性双対性に対処し、ソフトラベル離散化モジュールを提案する。
大規模皮膚科(SLICE-3D, HOP)および眼科(EyePACS)データセットによる新しい最先端(SOTA)の確立
- 参考スコア(独自算出の注目度): 17.088964553556163
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While vision-language models dominate medical representation learning, unstructured text lacks the dense, quantitative diagnostic phenotypes inherent in structured clinical tables. However, existing multimodal pre-training methods underutilize this potential due to semantic-agnostic designs that treat tabular inputs as flat vectors and employ unstable continuous regression objectives. To overcome this, we propose a novel semantic-aware framework explicitly modeling the intrinsic two-dimensional structure of tabular data. First, addressing the inter-feature hierarchy of varying diagnostic importance, we introduce Importance-Aware Adaptive Masking to construct a label-free curriculum prioritizing salient features. Second, addressing the intra-feature continuity-discreteness duality, we propose a Soft-Label Discretized Module that replaces unstable numerical regression with stable distribution matching, thereby mathematically preserving ordinal relationships. Extensive experiments across large-scale dermatology (SLICE-3D, HOP) and ophthalmology (EyePACS) datasets establish a new state-of-the-art (SOTA), demonstrating exceptional robustness and cross-domain generalizability.
- Abstract(参考訳): 視覚言語モデルが医学的表現学習を支配している一方で、構造化された臨床表に固有の、密度の高い定量的な表現型が欠如している。
しかし、既存のマルチモーダル事前学習法は、表の入力を平坦なベクトルとして扱い、不安定な連続回帰目的を生かす意味に依存しない設計のため、この可能性を利用する。
そこで本稿では,表データの固有2次元構造を明示的にモデル化するセマンティック・アウェア・フレームワークを提案する。
まず, 診断的重要性の異なる機能間階層に対処し, 重要な特徴を優先するラベルフリーカリキュラムを構築するために, 重要適応マスキングを導入する。
次に, 不安定な数値回帰を安定分布マッチングに置き換え, 順序関係を数学的に保存するSoft-Label Disretized Moduleを提案する。
大規模皮膚科(SLICE-3D, HOP)と眼科(EyePACS)のデータセットにわたる広範囲な実験により、新しい最先端(SOTA)が確立された。
関連論文リスト
- Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models [8.949206640442354]
本稿では,新しいスライスワイズデータ合成パラダイムを用いて構築した大規模構造化推論データセットを提案する。
放射線技師の真の診断ワークフローに触発されたこのパラダイムは、複雑な3D読み取りプロセスを分解して視覚認知をモデル化する。
この戦略は、計算に高価な3D特化事前学習を必要とせずに、深いボリューム理解と高度に解釈可能な臨床論理を解き放つ。
論文 参考訳(メタデータ) (2026-07-15T14:05:58Z) - AdaSurvMamba: Dynamic Fusion and Semantic Scanning for Multimodal Survival Analysis [57.942670844512016]
我々はAdaSurvMambaをマルチモーダルサバイバル分析の新しい適応フレームワークとして紹介する。
このフレームワークは、クロスモーダル相互作用強度を動的に変調するDual-Scale Importance-Aware Reconstruction (DSIR)モジュールを備えている。
5つのTCGAコホートに対する実験は、既存の方法よりも一貫した利得を示している。
論文 参考訳(メタデータ) (2026-06-28T11:36:31Z) - Context-driven Missing-Modality Learning for Robust Medical Diagnosis with Image-Tabular Data [38.54068135443487]
本稿では,コンテキスト駆動型ミス・モダリティ学習フレームワークを提案する。
連続的にモダリティ合成とセマンティックアライメントを行い、堅牢な診断を実現する。
最先端のSOTA(State-of-the-art)法では、それぞれ1.26%、0.97%、1.32%のAVG AUCの改善を実現している。
論文 参考訳(メタデータ) (2026-05-25T15:44:26Z) - Vision-Core Guided Contrastive Learning for Balanced Multi-modal Prognosis Prediction of Stroke [4.272151451487239]
本稿では,虚血性脳梗塞に対する新しい3モーダル融合モデルを提案する。
脳MRIから半構造化診断テキストを自動的に生成するために,Large Language Model (LLM) を用いる。
また、ビジョンコンディションドデュアルアライメント・フュージョンモジュールと呼ばれるコアコンポーネントを設計する。
論文 参考訳(メタデータ) (2026-05-14T11:28:57Z) - Resilient Vision-Tabular Multimodal Learning under Modality Missingness [1.696842238811138]
マルチモーダルディープラーニングは医療応用において大きな可能性を秘めている。
既存のアプローチの多くは、完全にモダリティの可用性を暗黙的に仮定している。
共同視覚・タブラリ学習のためのマルチモーダルトランスフォーマーフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-12T12:14:13Z) - Multi-View Synergistic Learning with Vision-Language Adaption for Low-Resource Biomedical Image Classification [59.24009931000134]
MVSL(Multi-View Synergistic Learning)は、適応パラダイム、表現の粒度、疾患の意味的関係に対処する統合フレームワークである。
MVSLは、視覚的およびテキスト的エンコーダの適応を分離し、それぞれの表現特性を尊重する。
さらに、グローバルなイメージセマンティクスと局所的な病変レベルの証拠の両方を明示的にモデル化するために、多粒性コントラスト学習を導入する。
MVSLは、いくつかのショットとゼロショットの分類設定において、最先端のメソッドを一貫して上回る。
論文 参考訳(メタデータ) (2026-04-27T02:41:27Z) - MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models [59.180043227905294]
MedPrunerは、3次元医用画像の効率的な理解のためのトレーニング不要でモデルに依存しない階層的トークンプレーニングフレームワークである。
我々は、MedPrunerによって、MedGemmaのようなモデルが元の性能を維持したり、超えたりすることが可能であり、ビジュアルトークンの5%以下を維持していることを示す。
論文 参考訳(メタデータ) (2026-03-12T07:37:00Z) - Unleashing the Power of Image-Tabular Self-Supervised Learning via Breaking Cross-Tabular Barriers [18.773799048193826]
CITabは、強力なマルチモーダルな特徴表現を多言語的に学習するように設計されている。
我々は3つの公開データコホートにまたがってアルツハイマー病診断タスクの評価を行った。
論文 参考訳(メタデータ) (2025-12-16T02:47:08Z) - MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings [75.0617088717528]
MoCaは、トレーニング済みのVLMバックボーンを効果的な双方向埋め込みモデルに変換するためのフレームワークである。
MoCaは、MMEBとViDoRe-v2ベンチマークのパフォーマンスを継続的に改善し、新しい最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-06-29T06:41:00Z) - PMT: Progressive Mean Teacher via Exploring Temporal Consistency for Semi-Supervised Medical Image Segmentation [51.509573838103854]
医用画像セグメンテーションのための半教師付き学習フレームワークであるプログレッシブ平均教師(PMT)を提案する。
我々のPMTは、トレーニングプロセスにおいて、堅牢で多様な特徴を学習することで、高忠実な擬似ラベルを生成する。
CT と MRI の異なる2つのデータセットに対する実験結果から,本手法が最先端の医用画像分割法より優れていることが示された。
論文 参考訳(メタデータ) (2024-09-08T15:02:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。