論文の概要: MIDAS: Mutual Information Disentanglement with Uncertainty-Aware Fusion for Incomplete Multimodal Sentiment Analysis
- arxiv url: http://arxiv.org/abs/2608.09986v1
- Date: Thu, 06 Aug 2026 10:16:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.74031
- Title: MIDAS: Mutual Information Disentanglement with Uncertainty-Aware Fusion for Incomplete Multimodal Sentiment Analysis
- Title(参考訳): MIDAS:不完全マルチモーダル感性分析のための不確かさ認識融合による相互情報分散
- Abstract要約: 現実世界のアプリケーションは、しばしば不完全あるいは破損したモダリティに遭遇する。
本研究では,不確実性を考慮した相互情報分散(Multual Information Disentanglement)という統合フレームワークを提案する。
MIDASは不完全条件下でのマルチモーダル表現を再構成する。
- 参考スコア(独自算出の注目度): 33.787241290130574
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most existing multimodal sentiment analysis approaches assume access to complete multimodal inputs. However, real-world applications frequently encounter incomplete or corrupted modalities, posing a critical challenge. Although several methods have been proposed to tackle this issue, they mainly rely on data imputation and heuristic coordination constraints, which fail to effectively extract and leverage task-relevant information from the incomplete multimodal data. To address this challenge, we propose a unified framework termed Mutual Information Disentanglement with uncertainty-Aware fuSion (MIDAS), which effectively restructures multimodal representations under incomplete conditions. MIDAS adopts a variational modeling strategy to represent each modality with multivariate Gaussian latent variables and further decomposes them into shared and exclusive factors. To obtain reliable representations, we design a minimax objective that minimizes the mutual information between shared and exclusive spaces for stable disentanglement, while maximizing the mutual information among shared spaces across modalities to enhance semantic alignment. In addition, an uncertainty-aware fusion mechanism is introduced, where posterior variance is leveraged as a reliability indicator to adaptively weight latent features during fusion, ensuring robust integration even when modalities are incomplete. Extensive experiments on three widely used datasets show that MIDAS achieves strong and consistent performance gains over competitive baselines across a wide range of incomplete settings, demonstrating its effectiveness and robustness for incomplete data scenarios.
- Abstract(参考訳): 既存のマルチモーダル感情分析手法の多くは、完全なマルチモーダル入力へのアクセスを前提としている。
しかし、現実世界のアプリケーションは、しばしば不完全あるいは腐敗したモダリティに遭遇し、重大な課題を生じさせる。
この問題に対処するためにいくつかの手法が提案されているが、主にデータ計算とヒューリスティック調整の制約に依存しており、不完全なマルチモーダルデータからタスク関連情報を効果的に抽出・活用することができない。
この課題に対処するため,不完全条件下でのマルチモーダル表現を効果的に再構成するMIDAS(Mutual Information Disentanglement with uncertainty-Aware fusion)という統合フレームワークを提案する。
MIDASは変分モデリング戦略を採用し、多変量ガウス潜在変数を用いて各モダリティを表現し、それらを共有および排他的因子に分解する。
信頼性の高い表現を得るために,共有空間と排他空間の相互情報を最小限に抑えつつ,共有空間間の相互情報の最大化を行い,セマンティックアライメントを高めるミニマックスオブジェクトを設計する。
さらに、不確実性を考慮した核融合機構を導入し、後部分散を信頼性指標として利用して、融合中に潜伏する特徴を適応的に重み付けし、モダリティが不完全である場合でもロバストな積分を確保する。
3つの広く使用されているデータセットに対する大規模な実験により、MIDASは幅広い不完全な設定において、競争ベースラインよりも強力で一貫したパフォーマンス向上を実現し、不完全なデータシナリオの有効性と堅牢性を示している。
関連論文リスト
- Simultaneous Long-tailed Recognition and Multi-modal Fusion for Highly Imbalanced Multi-modal Data [9.797319790710711]
クラス不均衡データの長期分布は、ディープラーニングモデルにとって根本的な課題である。
マルチモーダル入力を明示的に処理するロングテール認識のための新しいフレームワークを提案する。
提案手法は,異種データを統一表現に融合することにより,マルチエキスパートアーキテクチャをマルチモーダル設定に拡張する。
論文 参考訳(メタデータ) (2026-05-11T12:56:53Z) - URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection [17.19666367498091]
マルチモーダルサルカズム検出(MSD)は,テキストと画像間の意味的不一致から皮肉な意図を識別することを目的としている。
本稿では,対話や融合におけるモダリティの信頼性を明示的にモデル化する統一フレームワークであるUncertainty-aware Robust Multimodal Fusion (URMF)を提案する。
URMFは、強い単調、マルチモーダル、MLLMベースのベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-04-08T06:50:43Z) - Progressive Representation Learning for Multimodal Sentiment Analysis with Incomplete Modalities [26.613566093134065]
マルチモーダル・センティメント・アナリティクスは、テキスト、音響、視覚的手がかりを統合することで人間の感情を推測する。
既存のアプローチでは、すべてのモダリティが完全であるのに対して、現実のアプリケーションは、ノイズやハードウェアの障害、あるいはモダリティの欠如につながるプライバシー制限にしばしば遭遇する。
我々は、不確実なモダリティ条件下でMSA用に設計されたプログレッシブ表現学習フレームワークPRLFを提案する。
論文 参考訳(メタデータ) (2026-03-10T02:45:02Z) - SGMA: Semantic-Guided Modality-Aware Segmentation for Remote Sensing with Incomplete Multimodal Data [31.146366498415784]
マルチモーダルセマンティックセグメンテーションは、リモートセンシング地球観測のための多様なセンサーからの補完情報を統合する。
IMSSは3つの主要な課題に直面している:マルチモーダル不均衡、支配的なモダリティが脆弱なモダリティを抑えること、スケール、形状、方向のクラス内変化、矛盾するキーと矛盾するセマンティック応答を生み出すクロスモーダル不均一。
本稿では,セマンティック・ガイド・モダリティ・アウェア(SGMA)フレームワークを提案する。セマンティック・モダリティ・アウェア(SGMA)フレームワークは,クラス内変動の低減とセマンティックガイダンスによる相互不整合の緩和を図りつつ,バランスの取れたマルチモーダル学習を実現する。
論文 参考訳(メタデータ) (2026-03-03T01:28:21Z) - I$^3$-MRec: Invariant Learning with Information Bottleneck for Incomplete Modality Recommendation [56.55935146424585]
textbfIncomplete textbfModality textbfRecommendation の textbfInformation ボトルネック原理を用いて学習する textbfI$3$-MRec を紹介する。
それぞれのモダリティを異なる意味環境として扱うことで、I$3$-MRecは、優先指向の表現を学習するために不変リスク最小化(IRM)を採用する。
I$3$-MRecは、様々なモダリティ欠落シナリオにおいて、既存の最先端MSSメソッドを一貫して上回る
論文 参考訳(メタデータ) (2025-08-06T09:29:50Z) - Evidential Deep Partial Multi-View Classification With Discount Fusion [24.139495744683128]
Evidential Deep partial Multi-View Classification (EDP-MVC) と呼ばれる新しいフレームワークを提案する。
欠落したビューに対処するためにK-means命令を使用し、マルチビューデータの完全なセットを作成します。
この暗示されたデータ内の潜在的な衝突や不確実性は、下流の推論の信頼性に影響を与える可能性がある。
論文 参考訳(メタデータ) (2024-08-23T14:50:49Z) - Missing Modality Prediction for Unpaired Multimodal Learning via Joint Embedding of Unimodal Models [6.610033827647869]
実世界のシナリオでは、完全なマルチモーダルデータを一貫して取得することは重大な課題である。
これはしばしば、特定のモダリティのデータが欠落しているモダリティの問題につながる。
自己教師型共同埋め込み学習手法を用いて, パラメータ効率のよい未学習モデルの微調整を行う新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-07-17T14:44:25Z) - Confidence-aware multi-modality learning for eye disease screening [58.861421804458395]
眼疾患スクリーニングのための新しい多モード顕在核融合パイプラインを提案する。
モダリティごとに信頼度を測り、マルチモダリティ情報をエレガントに統合する。
パブリックデータセットと内部データセットの両方の実験結果は、我々のモデルが堅牢性に優れていることを示している。
論文 参考訳(メタデータ) (2024-05-28T13:27:30Z) - Multimodal Fusion on Low-quality Data: A Comprehensive Survey [110.22752954128738]
本稿では,野生におけるマルチモーダル核融合の共通課題と最近の進歩について考察する。
低品質データ上でのマルチモーダル融合で直面する4つの主な課題を同定する。
この新たな分類によって、研究者はフィールドの状態を理解し、いくつかの潜在的な方向を特定することができる。
論文 参考訳(メタデータ) (2024-04-27T07:22:28Z) - Cross-Attention is Not Enough: Incongruity-Aware Dynamic Hierarchical
Fusion for Multimodal Affect Recognition [69.32305810128994]
モダリティ間の同調性は、特に認知に影響を及ぼすマルチモーダル融合の課題となる。
本稿では,動的モダリティゲーティング(HCT-DMG)を用いた階層型クロスモーダルトランスを提案する。
HCT-DMG: 1) 従来のマルチモーダルモデルを約0.8Mパラメータで上回り、2) 不整合が認識に影響を及ぼすハードサンプルを認識し、3) 潜在レベルの非整合性をクロスモーダルアテンションで緩和する。
論文 参考訳(メタデータ) (2023-05-23T01:24:15Z) - Exploiting modality-invariant feature for robust multimodal emotion
recognition with missing modalities [76.08541852988536]
我々は、欠落したモダリティ・イマジネーション・ネットワーク(IF-MMIN)に不変な特徴を用いることを提案する。
提案モデルは,不確実なモダリティ条件下で,すべてのベースラインを上回り,全体の感情認識性能を不変に向上することを示す。
論文 参考訳(メタデータ) (2022-10-27T12:16:25Z) - Trustworthy Multimodal Regression with Mixture of Normal-inverse Gamma
Distributions [91.63716984911278]
このアルゴリズムは、異なるモードの適応的統合の原理における不確かさを効率的に推定し、信頼できる回帰結果を生成する。
実世界のデータと実世界のデータの両方に対する実験結果から,多モード回帰タスクにおける本手法の有効性と信頼性が示された。
論文 参考訳(メタデータ) (2021-11-11T14:28:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。