論文の概要: To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition
- arxiv url: http://arxiv.org/abs/2605.04877v1
- Date: Wed, 06 May 2026 13:11:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.826677
- Title: To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition
- Title(参考訳): ファウズ・アンド・ドロップ? マルチモーダル感情認識におけるモダリティ・コンフリクト解消のためのデュアルパス学習
- Abstract要約: マルチモーダル感情認識(MER)は、テキスト、音声、視覚を組み合わせることで恩恵を受けるが、標準的な融合は、モダリティが相反する場合に失敗することが多い。
我々は,いつフューズするか,いつモダリティを落とすのかを学習する統合フレームワークであるDual-Path Conflict Resolution (DCR)を提案する。
- 参考スコア(独自算出の注目度): 87.22988227382329
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal emotion recognition (MER) benefits from combining text, audio, and vision, yet standard fusion often fails when modalities conflict. Crucially, conflicts differ in resolvability: benign conflicts stem from missing, weak, or ambiguous cues and can be mitigated by cross-modal calibration, while severe conflicts arise from intrinsically contradictory (e.g., sarcasm) or misleading signals, for which forced fusion may amplify errors. Recognizing this, we propose Dual-Path Conflict Resolution (DCR), a unified framework that learns when to fuse and when to drop modalities. Path I (Affective Fusion Distiller, AFD) performs reverse distillation from audio/visual teachers to a textual student using temporally weighted class evidence, thereby enhancing representation-level calibration and improving fusion when alignment is beneficial. Path II (Affective Discernment Agent, ADA) formulates MER as a contextual bandit that selects among fusion and unimodal predictions based on a dual-view state and a calibration-aware reward, enabling decision-level arbitration under irreconcilable conflicts without requiring per-modality reliability labels. By taking into account the full multimodal context and coupling soft calibration with hard arbitration, DCR reconciles conflicts that can be aligned while bypassing misleading modalities when fusion is harmful. Across five benchmarks covering both dialogue-level and clip-level MER, DCR consistently outperforms competitive baselines or achieves highly competitive results. Further ablations, conflict-specific subset evaluation, and modality-selection analysis verify that AFD and ADA are complementary and jointly improve robust conflict-aware emotion recognition.
- Abstract(参考訳): マルチモーダル感情認識(MER)は、テキスト、音声、視覚を組み合わせることで恩恵を受けるが、標準的な融合は、モダリティが相反する場合に失敗することが多い。
対立は解決可能性において異なる: 良性の衝突は、欠落、弱さ、曖昧な手がかりから生じ、クロスモーダルキャリブレーションによって緩和できる一方、激しい衝突は本質的な矛盾(例:サルカズム)または誤解を招く信号から生じ、強制融合はエラーを増幅する。
これを認識して、我々は、いつフューズするか、いつモダリティをドロップするかを学ぶ統一的なフレームワークであるDual-Path Conflict Resolution (DCR)を提案する。
パスI(Affective Fusion Distiller, AFD)は、時間重み付けされたクラスエビデンスを用いて、音声/視覚教師からテキスト学生への逆蒸留を行い、アライメントが有用である場合に、表現レベルの校正を強化し、融合を改善する。
Path II(Affective Discernment Agent, ADA)は、MERを、二重ビュー状態とキャリブレーション対応の報酬に基づいて融合および単調予測の中から選択するコンテキスト的帯域として定式化し、モダリティ毎の信頼性ラベルを必要とせずに、不一致の競合の下で決定レベルの仲裁を可能にする。
完全なマルチモーダルコンテキストを考慮し、ソフトキャリブレーションとハード仲裁を結合することにより、DCRは核融合が有害な場合に、誤解を招くモダリティを回避しながら整合できる競合を和らげる。
対話レベルのMERとクリップレベルのMERの両方をカバーする5つのベンチマークで、DCRは一貫して競争のベースラインを上回り、競争の激しい結果を得る。
さらに, AFD と ADA が相補的であり, 強い対立認識の感情認識を改善することが確認された。
関連論文リスト
- CONFER: Conflict-Aware Evidence Negotiation for Regime-Calibrated Weak Supervision in Multimodal Emotion Recognition [2.587219755021037]
弱い教師付きマルチモーダル感情認識のためのグラフベース競合認識型エビデンス交渉フレームワーク
ConFERは、過去のアウトオブフォールドのパフォーマンスと現在のサンプルの不確実性から推定される予測的信念、境界ベースの不確実性、実行時の信頼性を備えたノードとして、各モダリティ専門家を表現している。
ConFER は AMIGOS-V の textbf0.873 精度と MAHNOB-V の textbf0.854 精度を厳密なLOSO 評価で達成する。
論文 参考訳(メタデータ) (2026-08-08T02:42:00Z) - CARGO-VL: Counterfactual Arbitration with Risk-Constrained Group Optimization for Vision-Language Models [2.038560872025072]
視覚言語システムは、画像と検索されたテキストを組み合わせるが、これらの情報源は意見の相違や、共同で回答をサポートしない可能性がある。
CARGO-VL(CARGO-VL)は、一致、画像補正、テキスト訂正、および両筆(A/V/T/N)エビデンス状態をカバーする、一致した変種を最適化するグループ相対フレームワークである。
また,4条件のコンフリクトトレーニングリソースであるXMC(eXtended Modal Conflict)をコントリビュートし,CMC-BenchとModality-Biasの移行を評価する。
論文 参考訳(メタデータ) (2026-08-05T06:47:46Z) - Modality Agreement- and Conflict-Aware Prototype Hypergraph Learning for Multimodal Intent Understanding [2.2012643583422347]
本稿では,マルチモーダルな合意と対立を表現する階層型プロトタイプ・ハイパーグラフフレームワークを提案する。
MACH (Modality Agreement- and Conflict-aware prototype Hypergraph) は、マルチモーダルなコンセンサスとコンフリクトを別個のリレーショナル構造として表現する。
論文 参考訳(メタデータ) (2026-08-04T10:55:51Z) - Regime-Aware Peer Specialization for Robust RAG under Heterogeneous Knowledge Conflicts [46.1469246256932]
我々は、レシシック・アウェアのピア・スペシャライゼーション・フレームワークであるRAPS-DAを提案する。
サンプルレベルでは、紛争はグラウンド、仲裁、レジスタンスの3つの体制に分けられる。
トークンレベルでは、二重層セレクタは、教師間不一致、生徒間分岐、および学生エントロピーを用いて、非形式的または不安定なトークンをフィルタリングする。
論文 参考訳(メタデータ) (2026-06-29T16:25:13Z) - ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence [48.938290419832335]
我々は、モデル応答が、その基盤となる文書における矛盾する証拠をどのように認識するかを定量化する新しいメトリクスであるConflictScoreを紹介する。
我々のフレームワークは, 反応を原子的クレームに分解し, それぞれのクレームに対して各クレームをラベル付けし, それらのラベルを2つの補完的尺度に集約する。
論文 参考訳(メタデータ) (2026-06-24T23:00:09Z) - Mitigating Context-Memory Conflicts in LLMs through Dynamic Cognitive Reconciliation Decoding [51.242997961841276]
大規模言語モデルは事前学習を通じてパラメトリック知識を蓄積する。
知識の衝突は、時代遅れまたは誤ったパラメトリック知識が文脈における外部知識と衝突する際に起こる。
既存の手法は、対照的な復号化を通じて知識の衝突に対処するが、競合のないシナリオでは静的アプローチが出力分布を妨害する。
本稿では,動的認知和解復号法(DCRD)を提案する。
論文 参考訳(メタデータ) (2026-05-12T14:29:45Z) - URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection [17.19666367498091]
マルチモーダルサルカズム検出(MSD)は,テキストと画像間の意味的不一致から皮肉な意図を識別することを目的としている。
本稿では,対話や融合におけるモダリティの信頼性を明示的にモデル化する統一フレームワークであるUncertainty-aware Robust Multimodal Fusion (URMF)を提案する。
URMFは、強い単調、マルチモーダル、MLLMベースのベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-04-08T06:50:43Z) - Diagnosing Knowledge Conflict in Multimodal Long-Chain Reasoning [78.86309644343295]
長い連鎖推論におけるマルチモーダルな大言語モデル(MLLM)は、異なる知識源が矛盾する信号を提供するときにしばしば失敗する。
我々は、これらの失敗を知識の衝突という統一概念の下で形式化し、入力レベルの客観的衝突とプロセスレベルの効果的な衝突を区別する。
本研究は,知識衝突下でのマルチモーダル推論のメカニズムを考察し,長CoT障害の診断と制御を可能にする。
論文 参考訳(メタデータ) (2026-02-16T07:10:44Z) - CLASH: A Benchmark for Cross-Modal Contradiction Detection [15.134491772506196]
CLASHはマルチモーダル矛盾検出のための新しいベンチマークである。
COCOイメージは、制御対象レベルの矛盾や属性レベルの矛盾を含む矛盾したキャプションと組み合わせられる。
論文 参考訳(メタデータ) (2025-11-24T15:09:07Z) - Compose and Fuse: Revisiting the Foundational Bottlenecks in Multimodal Reasoning [49.17801010041155]
MLLM(Multimodal large language model)は、テキスト、ビジョン、オーディオなどの多様な入力を統合することで推論を強化することを約束する。
しかし、追加のモダリティがパフォーマンスを損なうかどうかについての報告は相反する。
我々は、多モーダル推論を6つの相互作用パターンに分類し、事実がどのようにモダリティに分散され、論理的に組み合わせられるかを決定する。
論文 参考訳(メタデータ) (2025-09-28T08:46:11Z) - CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation [24.952907733127223]
クロスモーダルアライメント・蒸留(CAD)を用いたビデオディープフェイク検出のための一般的なフレームワークを提案する。
1)高レベルのセマンティックシンセシスにおける矛盾を識別するクロスモーダルアライメント(例:リップ音声ミスマッチ)、2)モダリティ特異的な法医学的痕跡(例:合成音声のスペクトル歪み)を保存しながらミスマッチを緩和するクロスモーダル蒸留(例:合成音声のスペクトル歪み)である。
論文 参考訳(メタデータ) (2025-05-21T08:11:07Z) - Multi-level Conflict-Aware Network for Multi-modal Sentiment Analysis [6.168616672805216]
マルチモーダル感情分析のための新しいマルチレベルコンフリクト・アウェア・ネットワーク(MCAN)を提案する。
MCANは段階的にアライメントとコンフリクトの構成要素を、一様および二様表現から分離する。
コンフリクトモデリングブランチでは、表現レベルと予測出力レベルの両方で差分制約を行う。
論文 参考訳(メタデータ) (2025-02-13T09:14:36Z) - AdaCAD: Adaptively Decoding to Balance Conflicts between Contextual and Parametric Knowledge [57.66282463340297]
知識の衝突は、大きな言語モデルの文脈における情報と、そのパラメータに格納された知識との相違から生じる。
コンフリクトの度合いに基づいて動的に調整の重みを推定する,AdaCADと呼ばれる細粒度なインスタンスレベルのアプローチを提案する。
ADACADは静的コントラストベースラインよりも平均QA精度14.21%(絶対)のデコードベースラインを一貫して上回り、要約の事実性を6.19倍(AlignScore)向上させることを示す。
論文 参考訳(メタデータ) (2024-09-11T16:35:18Z) - Cross-Attention is Not Enough: Incongruity-Aware Dynamic Hierarchical
Fusion for Multimodal Affect Recognition [69.32305810128994]
モダリティ間の同調性は、特に認知に影響を及ぼすマルチモーダル融合の課題となる。
本稿では,動的モダリティゲーティング(HCT-DMG)を用いた階層型クロスモーダルトランスを提案する。
HCT-DMG: 1) 従来のマルチモーダルモデルを約0.8Mパラメータで上回り、2) 不整合が認識に影響を及ぼすハードサンプルを認識し、3) 潜在レベルの非整合性をクロスモーダルアテンションで緩和する。
論文 参考訳(メタデータ) (2023-05-23T01:24:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。