論文の概要: EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation
- arxiv url: http://arxiv.org/abs/2607.18336v1
- Date: Sun, 19 Jul 2026 18:09:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.186519
- Title: EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation
- Title(参考訳): EmoEUS:会話におけるマルチモーダル感情認識のための不確実性スーパービジョン
- Abstract要約: マルチモーダル感情認識のための明確な不確実性監視フレームワークであるEmoEUSを提案する。
EmoEUSは、学習された分散推定を用いてモダリティを動的に重み付けすることで、不確実性を考慮したマルチモーダル融合を行う。
IEMOCAPとMELDの実験は、EmoEUSが最先端の手法を一貫して上回っていることを示している。
- 参考スコア(独自算出の注目度): 58.055014746373054
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal emotion recognition in conversation (MERC) can leverage multimodal and contextual cues to boost recognition performance. However, existing fusion approaches in MERC often ignore modality-specific uncertainty across utterances caused by conflicting cues, varying noise, and missing modality-specific signals. We propose EmoEUS, an explicit uncertainty supervision framework for MERC. EmoEUS performs uncertainty-aware multimodal fusion by dynamically weighting modalities using learned variance estimates. We also introduce an explicitly supervised loss that aligns each utterance's predicted variance with the distance between the utterance's distributional representation and its emotion- and modality-specific cluster center. Experiments on IEMOCAP and MELD show that EmoEUS consistently outperforms state-of-the-art methods.
- Abstract(参考訳): 会話におけるマルチモーダル感情認識(MERC)は、マルチモーダルおよび文脈的手がかりを利用して認識性能を向上させることができる。
しかし、既存のMERCの融合アプローチは、矛盾する手がかり、ノイズの変化、モーダリティ固有の信号の欠如による発話におけるモーダリティ固有の不確かさを無視することが多い。
我々は,MERCの明確な不確実性監視フレームワークであるEmoEUSを提案する。
EmoEUSは、学習された分散推定を用いてモダリティを動的に重み付けすることで、不確実性を考慮したマルチモーダル融合を行う。
また、各発話の予測分散を、発話の分布表現と、その感情とモダリティに比例したクラスタ中心との距離に合わせるように、明示的に教師付きされた損失を導入する。
IEMOCAPとMELDの実験は、EmoEUSが常に最先端の手法より優れていることを示している。
関連論文リスト
- EII-SCL: Harnessing Emotional Inertia for Multimodal Emotion Recognition in Conversation [51.04910642896281]
会話におけるマルチモーダル感情認識(MERC)は、対話に多モーダル情報と文脈情報を統合することで正確な予測を行う。
現在のMERCアプローチは、情動シフトにおける文脈的感情的慣性の影響を見落とし、準最適パフォーマンスをもたらす。
本研究では, 時間的ウィンドウ内に慣性の影響のあるサンプルを構築することで, コントラスト学習モジュール (EII-SCL) を提案する。
論文 参考訳(メタデータ) (2026-07-19T18:09:54Z) - MRUF: Multi-granularity Routing with Uncertainty-Aware Fusion for Robust Multimodal Sentiment Analysis [20.73891715749963]
本稿では,多粒性ルーティングと不確実性を考慮したキャリブレーションを組み合わせた信頼性を考慮した融合手法を提案する。
MRUFは、感情関連表現を要約し、サブスペースとモダリティレベルのルーティングを実行し、モーダリティのルーティングを調整し、アウト・ワン・エラーの増加でモーダリティのルーティングを監督し、発話レベルのモダリティの重要性を推定する。
論文 参考訳(メタデータ) (2026-07-12T06:32:54Z) - EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness [17.292747703126796]
EmoMMは、モダリティの整合性、矛盾、欠落したサブセットを特徴とする包括的なベンチマークである。
本稿では,モダリティ・コンフリクトを検出し,推論時のアテンション・ステアリングを実行する軽量な機構である,コンフリクト対応ヘッドレベル・アテンション・ステアリング(CHASE)を提案する。
論文 参考訳(メタデータ) (2026-05-01T18:35:49Z) - SURE: Synergistic Uncertainty-aware Reasoning for Multimodal Emotion Recognition in Conversations [15.80542007124167]
会話におけるマルチモーダル感情認識(MERC)は、ノイズに頑健であり、文脈的推論をモデル化しながら、マルチモーダル信号を統合する必要がある。
我々は、堅牢性と文脈モデリングを改善するMERCのためのSURE(Synergistic Uncertainty-aware Reasoning)を提案する。
論文 参考訳(メタデータ) (2026-04-02T11:32:15Z) - Complementarity-Supervised Spectral-Band Routing for Multimodal Emotion Recognition [60.20529806857076]
マルチモーダル感情認識は、テキスト、ビデオ、音声などの手がかりを融合させ、個人の感情状態を理解する。
従来の手法では、機械的に独立な単調なパフォーマンスに依存することと、感情タスクで要求されるきめ細かい表現と相反する粗粒の融合という2つの主な制限に直面していた。
我々は,マルチスケールバンド分解とエキスパートコラボレーションを通じて,微細な相補的特徴をモデル化するために,Atsukoという名前のComplementarity-Supervised Multi-Band Expert Networkを提案する。
論文 参考訳(メタデータ) (2026-03-07T03:58:48Z) - Explaining multimodal LLMs via intra-modal token interactions [55.27436637894534]
MLLM(Multimodal Large Language Models)は、様々な視覚言語タスクにおいて顕著な成功を収めているが、その内部決定機構は十分に理解されていない。
モーダル内相互作用を利用した解釈可能性の向上を提案する。
論文 参考訳(メタデータ) (2025-09-26T14:39:13Z) - Latent Distribution Decoupling: A Probabilistic Framework for Uncertainty-Aware Multimodal Emotion Recognition [7.25361375272096]
マルチモーダル・マルチラベル感情認識は,マルチモーダルデータにおける複数の感情の存在を同時に認識することを目的としている。
既存の研究では、マルチモーダルデータに固有のノイズであるテクスブファレラティック不確実性の影響を見落としている。
本稿では,不確かさ認識フレームワークを用いた潜在感情分布分解法を提案する。
論文 参考訳(メタデータ) (2025-02-19T18:53:23Z) - Cross-Attention is Not Enough: Incongruity-Aware Dynamic Hierarchical
Fusion for Multimodal Affect Recognition [69.32305810128994]
モダリティ間の同調性は、特に認知に影響を及ぼすマルチモーダル融合の課題となる。
本稿では,動的モダリティゲーティング(HCT-DMG)を用いた階層型クロスモーダルトランスを提案する。
HCT-DMG: 1) 従来のマルチモーダルモデルを約0.8Mパラメータで上回り、2) 不整合が認識に影響を及ぼすハードサンプルを認識し、3) 潜在レベルの非整合性をクロスモーダルアテンションで緩和する。
論文 参考訳(メタデータ) (2023-05-23T01:24:15Z) - Exploiting modality-invariant feature for robust multimodal emotion
recognition with missing modalities [76.08541852988536]
我々は、欠落したモダリティ・イマジネーション・ネットワーク(IF-MMIN)に不変な特徴を用いることを提案する。
提案モデルは,不確実なモダリティ条件下で,すべてのベースラインを上回り,全体の感情認識性能を不変に向上することを示す。
論文 参考訳(メタデータ) (2022-10-27T12:16:25Z) - COLD Fusion: Calibrated and Ordinal Latent Distribution Fusion for
Uncertainty-Aware Multimodal Emotion Recognition [14.963637194500029]
本稿では、感情予測に対するモダリティワイドな不確実性を定量化する不確実性認識型オーディオ視覚融合手法を提案する。
音声視覚潜在分布の分散ベクトルに正規ランク付け制約を課す。
AVEC 2019 CESとIEMOCAPの2つの感情認識コーパスについて評価したところ、音声視覚的感情認識は、よく校正され、よくランク付けされた潜伏不確実性対策の恩恵を受ける可能性が示唆された。
論文 参考訳(メタデータ) (2022-06-12T20:25:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。