論文の概要: SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits
- arxiv url: http://arxiv.org/abs/2607.08573v1
- Date: Thu, 09 Jul 2026 15:06:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.574651
- Title: SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits
- Title(参考訳): SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits
- Abstract要約: この論文はXAI誘導型適応核融合(xgaf)を再考する。
我々は,不平等な特徴次元を持つ専門家に対して,SHAP帰属還元の効果に着目した。
CMU-MOSEI 3級感情認識ではsum-abs xgafは0.6519wfに達し、初期核融合(0.6485)と後期核融合(0.5696)をわずかに超えた。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal emotion and sentiment recognition is commonly addressed by early fusion, which concatenates modalities before classification, or late fusion, which combines independently trained unimodal predictors. Early fusion can be accurate but monolithic, while late fusion is modular but may lose cross-modal interactions. This paper revisits XAI-guided adaptive fusion (\xgaf), a tree-based mixture of unimodal and cross-modal experts whose sample-level weights are derived from TreeSHAP attribution magnitudes. We focus on the effect of SHAP attribution reduction when experts have unequal feature dimensionalities. In this setting, mean-abs and median-abs reductions can suppress high-dimensional cross-modal experts, whereas sum-abs reduction preserves total attribution mass. On MELD 7-class emotion recognition, sum-abs \xgaf{} nearly matches early fusion across three face-sequence aggregators; the Transformer variant reaches 0.5983 \wf{}, compared with 0.6018 for early fusion and 0.4598 for probability-average late fusion. McNemar testing shows no significant difference between sum-abs \xgaf{} and early fusion on MELD ($p=1.000$), while \xgaf{} remains significantly better than late fusion ($p<0.0001$). On CMU-MOSEI 3-class sentiment recognition, sum-abs \xgaf{} reaches 0.6519 \wf{}, slightly exceeding early fusion (0.6485) and late fusion (0.5696). Ablation studies show that the main gain comes from adding cross-modal experts, especially the trimodal expert, rather than from complex per-sample routing. Diagnostics further show that mean-abs and median-abs weights are nearly uniform, while sum-abs weights concentrate on the trimodal expert. Thus, the main contribution is a transparent empirical analysis of how SHAP reduction, expert dimensionality, and cross-modal expert design affect modular multimodal fusion.
- Abstract(参考訳): マルチモーダル感情と感情認識は、分類の前にモダリティを結合する早期融合(英語版)や、独立に訓練された単調予測器を組み合わせた後期融合(英語版)によって一般的に対処される。
初期の核融合は正確だがモノリシックであり、後期核融合はモジュラーであるが、異種間相互作用を失う可能性がある。
本稿では,XAI誘導型適応核融合(\xgaf)について再検討する。
我々は,不平等な特徴次元を持つ専門家に対して,SHAP帰属還元の効果に着目した。
この設定では、平均アプスと中央アプスの削減は高次元のクロスモーダルの専門家を抑圧しうるが、総アプスの削減は総アトリビューション質量を保存する。
MELD 7 クラスの感情認識では、sum-abs \xgaf{} は3つの顔系列のアグリゲータ間の早期融合とほぼ一致し、Transformer の変種は0.5983 \wf{} に達する。
McNemar テストでは、sum-abs \xgaf{} と MELD の初期融合 (p=1.000$) の間に有意な差は見られず、一方 \xgaf{} は後期融合 (p<0.0001$) よりもかなり良いままである。
CMU-MOSEI 3級感情認識では、sum-abs \xgaf{} は 0.6519 \wf{} に達し、初期核融合 (0.6485) と後期核融合 (0.5696) よりわずかに多い。
アブレーション研究によると、主な利益は、複雑なサンプル単位のルーティングではなく、クロスモーダルの専門家、特にトリモーダルの専門家を追加することにある。
さらに診断は、平均脂肪と中央脂肪の重量がほぼ均一であることを示し、合計脂肪の重量はトリモーダルの専門家に集中している。
したがって、主な貢献は、SHAP還元、エキスパート次元、およびクロスモーダルエキスパート設計がモジュラーマルチモーダル融合にどのように影響するかについての透過的な経験的分析である。
関連論文リスト
- Mitigating Strong-Modality Collapse in Multimodal Learning via Inverted Asymmetric Fusion [0.0]
モーダル間の相互の注意を強制しない逆非対称核融合を提案する。
テキスト優位データセット (MultiHuSE, UR-FUNNY) と音声視覚優位データセット (MUStARD) の3つの指標を用いてIAFを評価する。
論文 参考訳(メタデータ) (2026-08-27T09:39:09Z) - TIER-MoE: Trust-Informed Expert Routing via Conditional Modality Risk for Multimodal Fusion in Biomedical Classification [17.05370605692998]
提案するTIER-MoEはリスク誘導型サブスペース・オブ・エキスパートモデルであり,サンプル固有のモダリティの信頼性を規定する。
TIER-MoEは,アルツハイマー病,皮膚・レジオン悪性度,網膜分類の4つの公用多モードバイオメディカルデータセットで評価した。
論文 参考訳(メタデータ) (2026-07-29T14:55:55Z) - Rethinking Multi-Branch and Cross-Backbone Fusion for Vehicle Re-Identification in the Foundation-Model Era [22.36803510099264]
マルチブランチアーキテクチャとCNNトランスフォーマー融合は、車種再識別(Re-ID)を改善する効果的な方法として長年検討されてきた。
調整されたレシピで訓練された単一のDINOv3-pretrained ConvNeXtは、VeRi-Wild Smallで88.19 mAP、VeRi-Wild Largeで77.47 mAPを達成する。
さらに、非対称凍結アンカー戦略を用いて、ConvNeXtとVision Transformer表現を組み合わせたクロスバックボーン融合について検討する。
論文 参考訳(メタデータ) (2026-07-24T08:10:53Z) - Multimodal Emotion Recognition via Causal-Diffusion Bridge (Affect-Diff) [0.0]
ハッピーは65.9%であり、3つのエクマンカテゴリーは7%以下である。
Affect-Diff, a Causal-Diffusion Bridge that address this through three jointly trained mechanism。
3,292個のCMU-MOSEIサンプルにおいて,Affect-Diffは最強基線に対する18%の相対的改善である精度0.384の検証を達成した。
論文 参考訳(メタデータ) (2026-05-07T18:29:26Z) - Architecture-Agnostic Modality-Isolated Gated Fusion for Robust Multi-Modal Prostate MRI Segmentation [0.0]
多重化前立腺MRIは、T2パラメトリック(T2W)、見かけ拡散係数(ADC)、高b値拡散強調(HBV)配列を組み合わせる。
実際には、拡散配列は、T2Wよりも、取得のばらつき、動き、アーティファクトの影響を受けることが多い。
我々は、学習ゲーティングステージの前に、個別のモダリティ固有の符号化ストリームを維持するために、Modality-Isolated Gated Fusion (MIGF)を提案する。
論文 参考訳(メタデータ) (2026-04-12T15:54:21Z) - Beyond Surface Artifacts: Capturing Shared Latent Forgery Knowledge Across Modalities [52.189426539304065]
本稿では,従来の「機能融合」から「モダリティ一般化」に再定義するパラダイムシフトを提案する。
モーダリティ固有のスタイルを明示的に分離することにより,MAFは必須かつ非モーダルな潜在フォージェリー知識を正確に抽出する。
論文 参考訳(メタデータ) (2026-04-09T03:35:21Z) - Complementarity-Supervised Spectral-Band Routing for Multimodal Emotion Recognition [60.20529806857076]
マルチモーダル感情認識は、テキスト、ビデオ、音声などの手がかりを融合させ、個人の感情状態を理解する。
従来の手法では、機械的に独立な単調なパフォーマンスに依存することと、感情タスクで要求されるきめ細かい表現と相反する粗粒の融合という2つの主な制限に直面していた。
我々は,マルチスケールバンド分解とエキスパートコラボレーションを通じて,微細な相補的特徴をモデル化するために,Atsukoという名前のComplementarity-Supervised Multi-Band Expert Networkを提案する。
論文 参考訳(メタデータ) (2026-03-07T03:58:48Z) - How Intermodal Interaction Affects the Performance of Deep Multimodal Fusion for Mixed-Type Time Series [3.6958071416494414]
MTTS(Mixed-type Time Series)は、医療、金融、環境モニタリング、ソーシャルメディアなど、多くの分野で一般的なバイモーダルデータである。
マルチモーダル融合による両モードの統合はMTTSの処理において有望なアプローチである。
MTTS予測のための深層多モード融合手法の総合評価を行った。
論文 参考訳(メタデータ) (2024-06-21T12:26:48Z) - Uncertainty-Encoded Multi-Modal Fusion for Robust Object Detection in
Autonomous Driving [8.991012799672713]
本稿では,単一モードの不確かさをLiDAR-camera融合に明示的に組み込む不確実性符号化混合(UMoE)を提案する。
UMoEの最大性能は10.67%、3.17%、そして5.40%である。
論文 参考訳(メタデータ) (2023-07-30T04:00:41Z) - Deep Equilibrium Multimodal Fusion [88.04713412107947]
多重モーダル融合は、複数のモーダルに存在する相補的な情報を統合し、近年多くの注目を集めている。
本稿では,動的多モード核融合プロセスの固定点を求めることにより,多モード核融合に対する新しいDeep equilibrium (DEQ)法を提案する。
BRCA,MM-IMDB,CMU-MOSI,SUN RGB-D,VQA-v2の実験により,DEC融合の優位性が示された。
論文 参考訳(メタデータ) (2023-06-29T03:02:20Z) - Cross-Attention is Not Enough: Incongruity-Aware Dynamic Hierarchical
Fusion for Multimodal Affect Recognition [69.32305810128994]
モダリティ間の同調性は、特に認知に影響を及ぼすマルチモーダル融合の課題となる。
本稿では,動的モダリティゲーティング(HCT-DMG)を用いた階層型クロスモーダルトランスを提案する。
HCT-DMG: 1) 従来のマルチモーダルモデルを約0.8Mパラメータで上回り、2) 不整合が認識に影響を及ぼすハードサンプルを認識し、3) 潜在レベルの非整合性をクロスモーダルアテンションで緩和する。
論文 参考訳(メタデータ) (2023-05-23T01:24:15Z) - MMLatch: Bottom-up Top-down Fusion for Multimodal Sentiment Analysis [84.7287684402508]
マルチモーダル融合に対する最近のディープラーニングアプローチは、ハイレベルおよびミドルレベルの潜在モダリティ表現のボトムアップ融合に依存している。
人間の知覚モデルでは、高レベルの表現が感覚入力の知覚に影響を及ぼすトップダウン融合の重要性を強調している。
本稿では,ネットワークトレーニング中のフォワードパスにおけるフィードバック機構を用いて,トップダウンのクロスモーダルインタラクションをキャプチャするニューラルネットワークを提案する。
論文 参考訳(メタデータ) (2022-01-24T17:48:04Z) - Bi-Bimodal Modality Fusion for Correlation-Controlled Multimodal
Sentiment Analysis [96.46952672172021]
Bi-Bimodal Fusion Network (BBFN) は、2対のモダリティ表現で融合を行う新しいエンドツーエンドネットワークである。
モデルは、モダリティ間の既知の情報不均衡により、2つのバイモーダルペアを入力として取る。
論文 参考訳(メタデータ) (2021-07-28T23:33:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。