論文の概要: Advancing Multimodal Fusion on Heterogeneous Medical Data with Hybrid Geometry Attention
- arxiv url: http://arxiv.org/abs/2607.19086v1
- Date: Tue, 21 Jul 2026 13:23:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.433769
- Title: Advancing Multimodal Fusion on Heterogeneous Medical Data with Hybrid Geometry Attention
- Title(参考訳): ハイブリッド幾何アテンションによる異種医療データへのマルチモーダル融合の促進
- Authors: Joy Dhar, Manish Kumar Pandey, Nayyar Zaidi, Chen Chen, Maryam Haghighat, Ferdous Sohel, Puneet Goyal,
- Abstract要約: 我々は,HyFuse(HyFuse)と呼ばれる新しいハイブリット・ジオメトリ・アウェア・フュージョン(HyFuse)レイヤを通じて,様々なモダリティを統合する新しいMFLフレームワークを提案する。
CUREは主要なマルチモーダル核融合法より優れ、性能は3.97%向上し、計算コストは87.8%低下した。
- 参考スコア(独自算出の注目度): 12.882258262859528
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal fusion learning (MFL) has shown great potential in the medical domain, where we are faced with disparate data modalities such as imaging, clinical records, and omics. However, existing MFL strategies face several major challenges. First, they struggle to capture complex cross-modal interactions effectively, which in turn limits performance improvements. Second, they incur high computational costs, restricting their applicability in resource-constrained healthcare AI applications. Finally, they are often designed and evaluated for narrow, fixed modality configurations (e.g., imaging-only, or specific pairs such as image and omics), which limits evidence of their adaptability and generalizability to broader collections of heterogeneous medical modalities. To address these challenges, we propose a novel MFL framework - Cascaded Unified Representation Learning for Efficient Fusion Network (CURE) - a lightweight and scalable framework that progressively integrates various modalities through a novel efficient Hybrid Geometry Aware Fusion layer (HyFuse), where each HyFuse layer is sequentially learned for each modality, making the framework adaptable and generalizable. Within HyFuse, an efficient residual convolution module captures rich multi-scale features to ensure cost-effective learning, while a hybrid-space aware attention mixer learns coarse-to-fine structural cues to better preserve cross-modal relationships. Complementary learnable late-fusion and shared information refinement modules are then employed to learn robust modality-order-invariant shared representations, which in turn yields consistent performance improvements. Extensive evaluations on 16 public datasets show that CURE outperforms leading multimodal fusion methods, boosting performance by up to 3.97% and lowering computational costs by up to 87.8%, ensuring more effective and reliable predictions.
- Abstract(参考訳): マルチモーダル・フュージョン・ラーニング (MFL) は医療分野で大きな可能性を秘めており, 画像, 臨床記録, オミクスなどの異なるデータモダリティに直面している。
しかし、既存のMFL戦略はいくつかの大きな課題に直面している。
まず、複雑なクロスモーダルなインタラクションを効果的に捉えるのに苦労し、パフォーマンスの改善を制限します。
第2に、リソース制約のある医療AIアプリケーションに適用性を制限するため、高い計算コストがかかる。
最後に、それらは狭く固定されたモダリティ構成(例えば、画像のみ、画像やオミクスのような特定のペア)のために設計され、評価され、不均一な医療モダリティのより広範なコレクションへの適応性と一般化性の証拠を制限する。
これらの課題に対処するために,我々は,新しいMFLフレームワーク - Cascaded Unified Representation Learning for Efficient Fusion Network (CURE) を提案する。
HyFuse内では、効率的な残留畳み込みモジュールがコスト効率の確保のためにリッチなマルチスケールの特徴をキャプチャし、一方、ハイブリッドスペース対応のアテンションミキサーは、粗い構造的手がかりを学習して、相互関係をよりよく保存する。
補完的な学習可能な遅延融合と共有情報洗練モジュールを使用して、堅牢なモダリティ-順序-不変な共有表現を学習し、一貫した性能改善をもたらす。
16の公開データセットの大規模な評価によると、CUREはマルチモーダル融合法を先導し、パフォーマンスを3.97%向上し、計算コストを87.8%低下させ、より効果的で信頼性の高い予測を確実にする。
関連論文リスト
- Resilient Vision-Tabular Multimodal Learning under Modality Missingness [1.696842238811138]
マルチモーダルディープラーニングは医療応用において大きな可能性を秘めている。
既存のアプローチの多くは、完全にモダリティの可用性を暗黙的に仮定している。
共同視覚・タブラリ学習のためのマルチモーダルトランスフォーマーフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-12T12:14:13Z) - AlignMamba-2: Enhancing Multimodal Fusion and Sentiment Analysis with Modality-Aware Mamba [56.52470564147458]
マルチモーダル融合と感情分析のための効率的かつ効率的なフレームワークである textbfAlignMamba-2 を提案する。
提案手法では, 最適輸送距離と最大平均離散度の両方を用いてモデルを正規化する2つのアライメント戦略を導入する。
さらに重要なことは、モダリティに特有かつモダリティに偏ったエキスパートによるMixture-of-Expertsアーキテクチャを採用したModality-Aware Mamba層を設計することです。
論文 参考訳(メタデータ) (2026-03-19T03:47:21Z) - When Does Multimodal Learning Help in Healthcare? A Benchmark on EHR and Chest X-Ray Fusion [16.683852533321666]
機械学習は、臨床的な意思決定を支援することを約束するが、マルチモーダルな学習が実際にいつ役に立つのかは不明だ。
我々は、MIMIC-IVとMIMIC-CXRの標準化コホート上で、電子健康記録(EHR)と胸部X線(CXR)のマルチモーダル融合のベンチマークを行う。
この研究は、異なる融合戦略がどう比較されるか、既存の手法がモダリティの欠如にどれほど頑健であるか、マルチモーダルモデルがアルゴリズムの公正性を達成するかどうかなど、いくつかの重要な洞察を明らかにした。
論文 参考訳(メタデータ) (2026-02-27T02:38:35Z) - HyPCA-Net: Advancing Multimodal Fusion in Medical Image Analysis [0.0]
ハイブリッド並列フュージョンカスケード注意ネットワーク(HyPCA-Net)を提案する。
HyPCA-Netは、2つの新しいブロックから構成される: (a) モダリティ固有の表現をキャプチャするための計算効率の良い残差適応型学習注意ブロック、(b) 多様なモダリティをまたいだ堅牢な共有表現の学習を目的としたデュアルビューカスケードアテンションブロック。
実験の結果、HyPCA-Netは既存の先行手法よりも大幅に優れており、性能は最大5.2%向上し、計算コストは最大73.1%削減された。
論文 参考訳(メタデータ) (2026-02-18T07:47:49Z) - Effective and Robust Multimodal Medical Image Analysis [2.0518682437126095]
マルチモーダル・フュージョン・ラーニング(MFL)は、皮膚がんや脳腫瘍の予測といった医療問題に対処する大きな可能性を示している。
既存のMFLメソッドには3つの重要な制限がある。
本稿では,2つの要素を組み込んだMAIL(Multi-Attention Integration Learning)ネットワークを提案する。
論文 参考訳(メタデータ) (2026-02-17T04:23:46Z) - REMIND: Rethinking Medical High-Modality Learning under Missingness--A Long-Tailed Distribution Perspective [10.304297174213293]
本稿では,任意のモダリティの組み合わせに対して,グループ固有のマルチモーダル融合関数を学習するグループ特化Mixture-of-Expertsアーキテクチャを提案する。
我々の中核となる考え方は、任意のモダリティの組み合わせに対して、グループ固有の多モード融合関数を辛抱強く学習する、新しいグループ特殊化Mixture-of-Expertsアーキテクチャを提案することである。
論文 参考訳(メタデータ) (2026-02-09T10:16:37Z) - scMRDR: A scalable and flexible framework for unpaired single-cell multi-omics data integration [53.683726781791385]
単一セルマルチオミクス(ScMRDR)と呼ばれるスケーラブルでフレキシブルな生成フレームワークを導入する。
本手法は, バッチ補正, モダリティアライメント, 生体信号保存の観点から, ベンチマークデータセット上での優れた性能を実現する。
論文 参考訳(メタデータ) (2025-10-28T21:28:39Z) - Amplifying Prominent Representations in Multimodal Learning via Variational Dirichlet Process [55.91649771370862]
ディリクレ過程(DP)混合モデルは、最も顕著な特徴を増幅できる強力な非パラメトリック法である。
本稿では,DP駆動型マルチモーダル学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-23T16:53:24Z) - impuTMAE: Multi-modal Transformer with Masked Pre-training for Missing Modalities Imputation in Cancer Survival Prediction [75.43342771863837]
我々は,効率的なマルチモーダル事前学習戦略を備えた新しいトランスフォーマーに基づくエンドツーエンドアプローチである impuTMAE を紹介する。
マスクされたパッチを再構築することで、モダリティの欠如を同時に示唆しながら、モダリティ間の相互作用とモダリティ内相互作用を学習する。
本モデルは,TGA-GBM/LGGとBraTSデータセットを用いたグリオーマ生存予測のために,異種不完全データに基づいて事前訓練を行った。
論文 参考訳(メタデータ) (2025-08-08T10:01:16Z) - NEARL-CLIP: Interacted Query Adaptation with Orthogonal Regularization for Medical Vision-Language Understanding [51.63264715941068]
textbfNEARL-CLIP (iunderlineNteracted quunderlineEry underlineAdaptation with ounderlineRthogonaunderlineL regularization)は、VLMベースの新しい相互モダリティ相互作用フレームワークである。
論文 参考訳(メタデータ) (2025-08-06T05:44:01Z) - Auto-FedRL: Federated Hyperparameter Optimization for
Multi-institutional Medical Image Segmentation [48.821062916381685]
Federated Learning(FL)は、明示的なデータ共有を避けながら協調的なモデルトレーニングを可能にする分散機械学習技術である。
本稿では,Auto-FedRLと呼ばれる,効率的な強化学習(RL)に基づくフェデレーションハイパーパラメータ最適化アルゴリズムを提案する。
提案手法の有効性は,CIFAR-10データセットと2つの実世界の医用画像セグメンテーションデータセットの不均一なデータ分割に対して検証される。
論文 参考訳(メタデータ) (2022-03-12T04:11:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。