論文の概要: Dynamic Gated Cross-Modal Fusion with Sarcastic-aware Contrastive Regularization for Multimodal Sarcasm Detection
- arxiv url: http://arxiv.org/abs/2608.19942v1
- Date: Thu, 20 Aug 2026 12:02:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.558831
- Title: Dynamic Gated Cross-Modal Fusion with Sarcastic-aware Contrastive Regularization for Multimodal Sarcasm Detection
- Title(参考訳): マルチモーダルサーカスム検出のためのSarcastic-aware Contrastive Regularizationを用いた動的Gated Cross-Modal Fusion
- Abstract要約: マルチモーダルサルカズム検出は、マルチモーダルコンテンツからサーカティックインテントを特定することを目的としている。
新しいフレームワークは動的Gated Cross-Modal FusionとSarcastic-aware Contrastive Regularizationを統合している。
- 参考スコア(独自算出の注目度): 8.747820204756566
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal sarcasm detection aims to identify sarcastic intent from multimodal content, where inconsistencies between literal meaning and contextual cues often signal irony. This task has attracted increasing research attention. However, accurate detection remains challenging due to instance-dependent modality contributions and misleading semantic consistency, where surface-level alignment masks underlying contradictory intent. Existing methods often rely on fixed fusion strategies and treat sarcasm as generic cross-modal mismatch, limiting their ability to capture subtle sarcasm cues and instance-specific modality interactions. To address these challenges, we propose a novel MSD framework that integrates Dynamic Gated Cross-Modal Fusion with Sarcastic-aware Contrastive Regularization (SaCR). Specifically, a bidirectional gated interaction module performs cross-modal feature filtering and adaptively calibrates textual and visual contributions at the instance level. A dynamic fusion gate further balances modality importance to generate more robust multimodal representations. Furthermore, SaCR is introduced as a label-aware contrastive regularization objective that encourages semantic consistency for non-sarcastic samples while suppressing misleading consistency in sarcastic cases. The proposed framework is trained end-to-end with a multi-objective learning strategy that jointly optimizes multimodal classification and auxiliary unimodal supervision. Extensive experiments on MMSD and MMSD2.0 demonstrate that the proposed method consistently outperforms strong baselines.
- Abstract(参考訳): マルチモーダル・サルカズム検出は、意味と文脈的手がかりの矛盾がしばしば皮肉を引き起こす多モーダルコンテンツから皮肉な意図を識別することを目的としている。
この課題は研究の注目を集めている。
しかし、表面レベルのアライメントマスクが矛盾する意図の下にある、インスタンス依存のモダリティ寄与と誤解を招くセマンティック一貫性のため、正確な検出は依然として困難である。
既存の方法は、しばしば固定された融合戦略に頼り、サルカズムを一般的なクロスモーダルなミスマッチとして扱い、微妙なサルカズムの手がかりとインスタンス固有のモダリティの相互作用を捉える能力を制限する。
これらの課題に対処するために、動的Gated Cross-Modal FusionとSarcastic-aware Contrastive Regularization (SaCR)を統合した新しいMSDフレームワークを提案する。
具体的には、双方向ゲート相互作用モジュールがクロスモーダル特徴フィルタリングを行い、インスタンスレベルでテキストおよび視覚的コントリビューションを適応的に校正する。
動的融合ゲートは、より堅牢なマルチモーダル表現を生成するためにモダリティの重要性をさらにバランスさせる。
さらに、SCRは、非皮肉なサンプルのセマンティック一貫性を助長し、皮肉なケースでは誤解を招く一貫性を抑えるラベル対応のコントラスト正規化目的として導入された。
提案フレームワークは,マルチモーダル分類と補助的一助的監督を協調的に最適化する多目的学習戦略を用いて,エンドツーエンドで訓練される。
MMSDとMMSD2.0の大規模な実験により、提案手法は強いベースラインを一貫して上回ることを示した。
関連論文リスト
- AdaSurvMamba: Dynamic Fusion and Semantic Scanning for Multimodal Survival Analysis [57.942670844512016]
我々はAdaSurvMambaをマルチモーダルサバイバル分析の新しい適応フレームワークとして紹介する。
このフレームワークは、クロスモーダル相互作用強度を動的に変調するDual-Scale Importance-Aware Reconstruction (DSIR)モジュールを備えている。
5つのTCGAコホートに対する実験は、既存の方法よりも一貫した利得を示している。
論文 参考訳(メタデータ) (2026-06-28T11:36:31Z) - PC-MNet: Dual-Level Congruity Modeling for Multimodal Sarcasm Detection via Polarity-Modulated Attention [32.62063298936575]
この研究は、人間のコミュニケーションにおける微妙な実用的不整合をモデル化するための、堅牢で分離されたパラダイムを提供する。
textttMUStARDベンチマークと、その素早い相関緩和型バランスデータセットの実験は、我々のアプローチが新しい最先端のパフォーマンスを達成することを実証している。
論文 参考訳(メタデータ) (2026-05-04T10:47:17Z) - Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning [65.15766304205657]
In-context Learning (ICL) は、大規模なモデルをいくつかの例を使ってタスクに適応させるが、視覚言語モデル(VLM)への拡張は脆弱である。
我々の分析によると、基本的な限界は帰納的ギャップにあり、モデルはしばしば欠陥のある推論から正しい答えを導き出す。
帰納的帰納的プロセスとしてマルチモーダル ICL を再構成する枠組みを導入する。
論文 参考訳(メタデータ) (2026-05-04T09:18:19Z) - URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection [17.19666367498091]
マルチモーダルサルカズム検出(MSD)は,テキストと画像間の意味的不一致から皮肉な意図を識別することを目的としている。
本稿では,対話や融合におけるモダリティの信頼性を明示的にモデル化する統一フレームワークであるUncertainty-aware Robust Multimodal Fusion (URMF)を提案する。
URMFは、強い単調、マルチモーダル、MLLMベースのベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-04-08T06:50:43Z) - SGMA: Semantic-Guided Modality-Aware Segmentation for Remote Sensing with Incomplete Multimodal Data [31.146366498415784]
マルチモーダルセマンティックセグメンテーションは、リモートセンシング地球観測のための多様なセンサーからの補完情報を統合する。
IMSSは3つの主要な課題に直面している:マルチモーダル不均衡、支配的なモダリティが脆弱なモダリティを抑えること、スケール、形状、方向のクラス内変化、矛盾するキーと矛盾するセマンティック応答を生み出すクロスモーダル不均一。
本稿では,セマンティック・ガイド・モダリティ・アウェア(SGMA)フレームワークを提案する。セマンティック・モダリティ・アウェア(SGMA)フレームワークは,クラス内変動の低減とセマンティックガイダンスによる相互不整合の緩和を図りつつ,バランスの取れたマルチモーダル学習を実現する。
論文 参考訳(メタデータ) (2026-03-03T01:28:21Z) - MuVaC: AVariational Causal Framework for Multimodal Sarcasm Understanding in Dialogues [21.146757458620105]
サーカスム解析にはマルチモーダルサルカスム検出(MSD)とマルチモーダルサルカスム説明(MuSE)が必要である
サルカズムを理解するための認知機構を模倣する変分因果推論フレームワークである MuVaC を提案する。
論文 参考訳(メタデータ) (2026-01-28T10:19:42Z) - Explaining multimodal LLMs via intra-modal token interactions [55.27436637894534]
MLLM(Multimodal Large Language Models)は、様々な視覚言語タスクにおいて顕著な成功を収めているが、その内部決定機構は十分に理解されていない。
モーダル内相互作用を利用した解釈可能性の向上を提案する。
論文 参考訳(メタデータ) (2025-09-26T14:39:13Z) - DADM: Dual Alignment of Domain and Modality for Face Anti-spoofing [58.62312400472865]
マルチモーダル・フェイス・アンチ・スプーフィング (FAS) が顕著な研究対象となっている。
相互情報に基づくモダリティ間のアライメントモジュールを提案する。
サブドメイン超平面とモダリティ角マージンの両方を整列する双対アライメント最適化法を用いる。
論文 参考訳(メタデータ) (2025-03-01T10:12:00Z) - Multi-View Incongruity Learning for Multimodal Sarcasm Detection [40.10921890527881]
マルチモーダルサルカズム検出(MSD)は下流の様々なタスクに不可欠である。
既存のMSD法は、素早い相関に依存する傾向がある。
本稿では,マルチモーダルサルカズム検出のためのコントラスト学習(MICL)によるマルチモーダルイングルリティの統合手法を提案する。
論文 参考訳(メタデータ) (2024-12-01T10:29:36Z) - Modality Prompts for Arbitrary Modality Salient Object Detection [57.610000247519196]
本論文は、任意のモーダリティ・サリエント物体検出(AM SOD)の課題について述べる。
任意のモダリティ、例えばRGBイメージ、RGB-Dイメージ、RGB-D-Tイメージから有能なオブジェクトを検出することを目的としている。
AM SODの2つの基本的な課題を解明するために,新しいモード適応トランス (MAT) を提案する。
論文 参考訳(メタデータ) (2024-05-06T11:02:02Z) - Cross-Attention is Not Enough: Incongruity-Aware Dynamic Hierarchical
Fusion for Multimodal Affect Recognition [69.32305810128994]
モダリティ間の同調性は、特に認知に影響を及ぼすマルチモーダル融合の課題となる。
本稿では,動的モダリティゲーティング(HCT-DMG)を用いた階層型クロスモーダルトランスを提案する。
HCT-DMG: 1) 従来のマルチモーダルモデルを約0.8Mパラメータで上回り、2) 不整合が認識に影響を及ぼすハードサンプルを認識し、3) 潜在レベルの非整合性をクロスモーダルアテンションで緩和する。
論文 参考訳(メタデータ) (2023-05-23T01:24:15Z) - Object Segmentation by Mining Cross-Modal Semantics [68.88086621181628]
マルチモーダル特徴の融合と復号を導くために,クロスモーダル・セマンティックスをマイニングする手法を提案する。
具体的には,(1)全周減衰核融合(AF),(2)粗大デコーダ(CFD),(3)多層自己超越からなる新しいネットワークXMSNetを提案する。
論文 参考訳(メタデータ) (2023-05-17T14:30:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。