論文の概要: CL-DMDF:Dynamic Multimodal Data Fusion Model Based on Contrastive Learning
- arxiv url: http://arxiv.org/abs/2606.02659v1
- Date: Mon, 01 Jun 2026 07:12:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-03 22:00:04.49721
- Title: CL-DMDF:Dynamic Multimodal Data Fusion Model Based on Contrastive Learning
- Title(参考訳): CL-DMDF:コントラスト学習に基づく動的マルチモーダルデータ融合モデル
- Authors: Dong Li, Lingling Zhang, Binghao Han, Linlin Ding, Yue Kou,
- Abstract要約: コントラスト学習(CL-DMDF)に基づく動的マルチモーダルデータ融合モデルを提案する。
CL-DMDFは、信頼性の高い注意スコアを計算するために、特徴次元とモダリティ次元の両方で機能する新しい注意機構を導入している。
3つのデータセットで行った実験は、多様なマルチモーダル核融合タスクにおけるCL-DMDFの有効性を示した。
- 参考スコア(独自算出の注目度): 9.12225899477751
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal data fusion involves integrating and analyzing information from multiple modalities to uncover latent correlations and complementary patterns, thereby enhancing data processing and decision-making. While existing methods for structured multimodal inputs are typically designed around specific tasks and assume fully observed modalities, real-world applications often suffer from uncertain or missing modality inputs due to various factors. Some traditional models overly emphasize local interactions within missing modalities, neglecting the global complementary cues embedded in multimodal representations. To overcome these limitations, we propose a Dynamic Multimodal Data Fusion model based on Contrastive Learning (CL-DMDF). CL-DMDF introduces a novel attention mechanism that operates across both feature and modality dimensions to compute reliable attention scores, effectively reflecting importance at each level. The CL-DMDF further incorporates an entity-centroid contrastive learning module that constructs centroid-based positive samples from entity features to enhance discriminative learning. Additionally, an adaptive fusion module is employed to improve the efficiency and accuracy of dynamic fusion strategies. Extensive experiments conducted on three datasets demonstrate the effectiveness of the CL-DMDF across diverse multimodal fusion tasks.
- Abstract(参考訳): マルチモーダルデータ融合は、複数のモーダルからの情報を統合して分析することで、遅延相関や相補的なパターンを解明し、データ処理と意思決定を強化する。
構造化マルチモーダル入力の既存の方法は、通常特定のタスクを中心に設計され、完全に観察されたモダリティを仮定するが、現実のアプリケーションは様々な要因により不確実または欠落したモダリティ入力に悩まされることが多い。
伝統的なモデルは、欠落したモダリティ内の局所的相互作用を過度に強調し、マルチモーダル表現に埋め込まれた大域的な相補的手がかりを無視している。
このような制約を克服するために,コントラスト学習(CL-DMDF)に基づく動的マルチモーダルデータフュージョンモデルを提案する。
CL-DMDFは、各レベルにおける重要性を効果的に反映し、信頼性の高い注意スコアを計算するために、特徴次元とモダリティ次元の両方にわたって機能する新しい注意機構を導入している。
CL-DMDFはさらに、識別学習を強化するために、エンティティ特徴からセントロイドベースの正のサンプルを構築するエンティティセントロイドコントラスト学習モジュールを組み込んでいる。
さらに、動的核融合戦略の効率と精度を向上させるために適応核融合モジュールが使用される。
3つのデータセットで実施された大規模な実験は、多様なマルチモーダル核融合タスクにおけるCL-DMDFの有効性を示した。
関連論文リスト
- AlignMamba-2: Enhancing Multimodal Fusion and Sentiment Analysis with Modality-Aware Mamba [56.52470564147458]
マルチモーダル融合と感情分析のための効率的かつ効率的なフレームワークである textbfAlignMamba-2 を提案する。
提案手法では, 最適輸送距離と最大平均離散度の両方を用いてモデルを正規化する2つのアライメント戦略を導入する。
さらに重要なことは、モダリティに特有かつモダリティに偏ったエキスパートによるMixture-of-Expertsアーキテクチャを採用したModality-Aware Mamba層を設計することです。
論文 参考訳(メタデータ) (2026-03-19T03:47:21Z) - Reconstructing Content via Collaborative Attention to Improve Multimodal Embedding Quality [59.651410243721045]
CoCoAは、マルチモーダル埋め込み最適化のための協調注意に基づくコンテンツ再構成事前学習パラダイムである。
EOSをベースとした再構築タスクを導入し、対応するEOS>埋め込みからの入力を再構成するようモデルに促す。
MMEB-V1の実験では、Qwen2-VLとQwen2.5-VLをベースにしたCoCoAが埋め込み品質を著しく向上することを示した。
論文 参考訳(メタデータ) (2026-03-02T05:34:45Z) - Decoupled Multimodal Fusion for User Interest Modeling in Click-Through Rate Prediction [6.663141182602147]
ユーザ関心モデリングのためのIDベースの協調表現とマルチモーダル表現とのきめ細かい相互作用を可能にするために,Decoupled Multimodal Fusion (DMF)を提案する。
我々は、異なる埋め込み空間にまたがるセマンティックギャップをブリッジするターゲット認識機能を構築し、それらをサイド情報として活用し、ユーザ関心モデリングの有効性を高める。
DMFは国際的なeコマースプラットフォームの製品レコメンデーションシステムにデプロイされ、CTCVRの5.30%とGMVの7.43%の相対的な改善を実現している。
論文 参考訳(メタデータ) (2025-10-13T07:06:26Z) - Complementarity-driven Representation Learning for Multi-modal Knowledge Graph Completion [0.0]
我々はMixture of Complementary Modality Experts (MoCME)という新しいフレームワークを提案する。
MoCMEはComplementarity-guided Modality Knowledge Fusion (CMKF)モジュールとEntropy-guided Negative Sampling (EGNS)メカニズムで構成されている。
私たちのMoCMEは最先端のパフォーマンスを達成し、既存のアプローチを超越しています。
論文 参考訳(メタデータ) (2025-07-28T08:35:11Z) - Completed Feature Disentanglement Learning for Multimodal MRIs Analysis [36.32164729310868]
特徴不整合(FD)に基づく手法はマルチモーダルラーニング(MML)において大きな成功を収めた
本稿では,特徴デカップリング時に失われた情報を復元する完全特徴分散(CFD)戦略を提案する。
具体的には、CFD戦略は、モダリティ共有とモダリティ固有の特徴を識別するだけでなく、マルチモーダル入力のサブセット間の共有特徴を分離する。
論文 参考訳(メタデータ) (2024-07-06T01:49:38Z) - U3M: Unbiased Multiscale Modal Fusion Model for Multimodal Semantic Segmentation [63.31007867379312]
U3M: An Unbiased Multiscale Modal Fusion Model for Multimodal Semanticsを紹介する。
我々は,グローバルな特徴とローカルな特徴の効果的な抽出と統合を保証するために,複数のスケールで機能融合を採用している。
実験により,本手法は複数のデータセットにまたがって優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2024-05-24T08:58:48Z) - Multimodal Representation Learning by Alternating Unimodal Adaptation [73.15829571740866]
MLA(Multimodal Learning with Alternating Unimodal Adaptation)を提案する。
MLAは、それを交互に一助学習プロセスに変換することで、従来の共同マルチモーダル学習プロセスを再構築する。
共有ヘッドを通じてモーダル間相互作用をキャプチャし、異なるモーダル間で連続的な最適化を行う。
実験は5つの多様なデータセットで行われ、完全なモダリティを持つシナリオと、欠落したモダリティを持つシナリオを含む。
論文 参考訳(メタデータ) (2023-11-17T18:57:40Z) - Unified Multi-modal Unsupervised Representation Learning for
Skeleton-based Action Understanding [62.70450216120704]
教師なしの事前訓練は骨格に基づく行動理解において大きな成功を収めた。
我々はUmURLと呼ばれる統一マルチモーダル非教師なし表現学習フレームワークを提案する。
UmURLは効率的な早期融合戦略を利用して、マルチモーダル機能を単一ストリームで共同でエンコードする。
論文 参考訳(メタデータ) (2023-11-06T13:56:57Z) - Quantifying & Modeling Multimodal Interactions: An Information
Decomposition Framework [89.8609061423685]
本稿では,入力モーダル性と出力タスクを関連付けた冗長性,特異性,シナジーの度合いを定量化する情報理論手法を提案する。
PID推定を検証するために、PIDが知られている合成データセットと大規模マルチモーダルベンチマークの両方で広範な実験を行う。
本研究では,(1)マルチモーダルデータセット内の相互作用の定量化,(2)マルチモーダルモデルで捉えた相互作用の定量化,(3)モデル選択の原理的アプローチ,(4)実世界のケーススタディの3つにその有用性を示す。
論文 参考訳(メタデータ) (2023-02-23T18:59:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。