論文の概要: RMS@CC-MMD 2026: Multimodal Misogyny Detection via Geometric Interaction and Multi-View Consensus
- arxiv url: http://arxiv.org/abs/2607.22709v1
- Date: Mon, 20 Jul 2026 17:18:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.835202
- Title: RMS@CC-MMD 2026: Multimodal Misogyny Detection via Geometric Interaction and Multi-View Consensus
- Title(参考訳): RMS@CC-MMD 2026:幾何学的相互作用とマルチビュー・コンセンサスによるマルチモーダルミソジニー検出
- Authors: Md. Ajwad Hossain,
- Abstract要約: 本稿では,ICMI 2026におけるCC-MMDグランドチャレンジのために開発されたGeoMVCについて述べる。
静的な特徴結合の限界に対処するために、幾何相互作用層は、アダマール製品を介して相互にアライメントをモデル化する。
我々は、マルチビュー・コンセンサス・ストラテジーを通じて、ノイズの多いOCRとコード混在による分散シフトを緩和する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The proliferation of internet memes has introduced new complexities to automated content moderation, particularly in detecting misogyny. Memes often rely on a semantic clash between visual and textual modalities, where hateful intent is implicit and culturally grounded. This paper presents GeoMVC (Geometric Interaction and Multi-View Consensus), developed for the CC-MMD Grand Challenge at ICMI 2026. To address the limitations of static feature concatenation, a Geometric Interaction Layer is proposed that models cross-modal alignment via Hadamard products and cosine similarity between frozen visual and textual embeddings. We further mitigate distribution shifts caused by noisy OCR and code-mixed transliteration through a Multi-View Consensus strategy, aggregating predictions across raw, length-filtered, and English-translated text views. The system achieved Rank 2 in the Malayalam partition (Macro F1: 0.892) and Rank 3 in the Chinese partition (Macro F1: 0.895) on Task A, while securing Rank 5 in the Tamil partition (Macro F1: 0.521). A detailed error analysis on the development partition highlights open challenges in modeling localized transliteration and code-mixed sarcasm across Dravidian and Chinese cultural contexts.
- Abstract(参考訳): インターネットミームの普及は、特に誤検出において、コンテンツモデレーションの自動化に新たな複雑さをもたらしている。
ミームはしばしば視覚的モダリティとテキスト的モダリティのセマンティックな衝突に頼っている。
本稿では,ICMI 2026におけるCC-MMDグランドチャレンジのために開発されたGeoMVC(Geometric Interaction and Multi-View Consensus)について述べる。
静的な特徴結合の限界に対処するため、幾何学的相互作用層は、アダマール生成物によるクロスモーダルアライメントと、凍結した視覚とテキストの埋め込みのコサイン類似性をモデル化する。
我々はさらに、ノイズの多いOCRによる分散シフトと、マルチビュー・コンセンサス(Multi-View Consensus)戦略によるコードミキシング(code-mixed transliteration)を緩和し、原文、長文、英文のテキストビューにまたがる予測を集約する。
マラヤラム区では2位(マクロF1:0.892)、中国区では3位(マクロF1:0.895)、タミル区では5位(マクロF1:0.521)となった。
開発区分に関する詳細なエラー分析では、ローカライズされた文字化と、ドラヴィダ語と中国文化の文脈におけるコード混合サルカズムをモデル化する際のオープンな課題が強調されている。
関連論文リスト
- MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment [11.058901579901699]
Universal Multimodal Retrieval (UMR) は、様々なモダリティ(視覚やテキストなど)を共有埋め込み空間にマッピングして検索することを目的としている。
既存のUMR法は、マーベルのようなアーリーフュージョンアプローチとUniVL-DRのようなレイトフュージョンアプローチの2つのカテゴリに分けられる。
我々は,(1)効果的なマルチモーダル統合のためのフュージョン・イン・デコーダアーキテクチャ,(2)単一モダリティ・ミックスインとランダムキャプション・ドロップアウトによる堅牢なトレーニング,という2つの重要なイノベーションを紹介する。
論文 参考訳(メタデータ) (2026-04-23T06:29:42Z) - MEME-Fusion@CHiPSAL 2026: Multimodal Ablation Study of Hate Detection and Sentiment Analysis on Nepali Memes [0.0]
本稿では,CHiPSAL 2026共有タスクに対して,サブタスクAとサブタスクBの両方に対処するシステムを提案する。
視覚符号化のためのCLIPと多言語テキスト表現のためのBGE-M3を組み合わせたハイブリッド・モーダル・アテンション融合アーキテクチャを提案する。
テキストのみのベースラインであるSubtask Aの5.9%のF1マクロ改善を実現した。
論文 参考訳(メタデータ) (2026-04-13T07:37:14Z) - GDCNet: Generative Discrepancy Comparison Network for Multimodal Sarcasm Detection [7.415126751461174]
マルチモーダルsarcasm Detection (MSD) は、モダリティ間の意味的不一致をモデル化することによって、画像とテキストのペア内のsarcasmを識別することを目的としている。
本稿では,GDCNet(Generative Discrepancy Comparison Network)を提案する。
GDCNetは、生成した目的記述と原文間の意味的・感情的不一致を、視覚的・テキスト的忠実度の測定とともに計算する。
論文 参考訳(メタデータ) (2026-01-28T13:51:34Z) - TC-MGC: Text-Conditioned Multi-Grained Contrastive Learning for Text-Video Retrieval [1.8434042562191815]
本稿では,TC-MGC と呼ばれるテキスト記述型マルチグラインドコントラストフレームワークを提案する。
本モデルでは,単語の重み付けとテキストの重み付けに係わる集約されたフレームとビデオ表現を生成するために,言語ビデオのアテンションブロックを用いる。
実証的に、TC-MGCは複数のテキストビデオ検索ベンチマークで競合する結果を得る。
論文 参考訳(メタデータ) (2025-04-07T03:33:14Z) - Multi-task Visual Grounding with Coarse-to-Fine Consistency Constraints [15.541287957548771]
本稿では,粗大な一貫性制約を持つビジュアルグラウンドアーキテクチャを提案する。
暗黙的かつ明示的なモデリングアプローチを2段階のフレームワークに統合する。
最先端のREC法とRIS法を実質的なマージンで大幅に上回っている。
論文 参考訳(メタデータ) (2025-01-12T04:30:13Z) - Multi-modal Generation via Cross-Modal In-Context Learning [50.45304937804883]
複雑なマルチモーダルプロンプトシーケンスから新しい画像を生成するMGCC法を提案する。
我々のMGCCは、新しい画像生成、マルチモーダル対話の促進、テキスト生成など、多種多様なマルチモーダル機能を示している。
論文 参考訳(メタデータ) (2024-05-28T15:58:31Z) - Spatial Semantic Recurrent Mining for Referring Image Segmentation [63.34997546393106]
高品質なクロスモーダリティ融合を実現するために,Stextsuperscript2RMを提案する。
これは、言語特徴の分散、空間的意味的再帰的分離、パーセマンティック・セマンティック・バランシングという三部作の作業戦略に従う。
提案手法は他の最先端アルゴリズムに対して好適に機能する。
論文 参考訳(メタデータ) (2024-05-15T00:17:48Z) - Multi-Grained Multimodal Interaction Network for Entity Linking [65.30260033700338]
マルチモーダルエンティティリンクタスクは、マルチモーダル知識グラフへの曖昧な言及を解決することを目的としている。
MELタスクを解決するための新しいMulti-Grained Multimodal InteraCtion Network $textbf(MIMIC)$ frameworkを提案する。
論文 参考訳(メタデータ) (2023-07-19T02:11:19Z) - Object Segmentation by Mining Cross-Modal Semantics [68.88086621181628]
マルチモーダル特徴の融合と復号を導くために,クロスモーダル・セマンティックスをマイニングする手法を提案する。
具体的には,(1)全周減衰核融合(AF),(2)粗大デコーダ(CFD),(3)多層自己超越からなる新しいネットワークXMSNetを提案する。
論文 参考訳(メタデータ) (2023-05-17T14:30:11Z) - MuRAG: Multimodal Retrieval-Augmented Generator for Open Question
Answering over Images and Text [58.655375327681774]
我々は,Multimodal Retrieval-Augmented Transformer (MuRAG)を提案する。
MuRAGは外部の非パラメトリックマルチモーダルメモリにアクセスして言語生成を増強する。
以上の結果から, MuRAGは最先端の精度を達成し, 既存のモデルよりも10~20%精度が高いことがわかった。
論文 参考訳(メタデータ) (2022-10-06T13:58:03Z) - Hierarchical Local-Global Transformer for Temporal Sentence Grounding [58.247592985849124]
本稿では,時間文グラウンドリングのマルチメディア問題について検討する。
与えられた文問合せに従って、トリミングされていないビデオ内の特定のビデオセグメントを正確に決定することを目的としている。
論文 参考訳(メタデータ) (2022-08-31T14:16:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。