論文の概要: EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection
- arxiv url: http://arxiv.org/abs/2607.22016v1
- Date: Fri, 24 Jul 2026 06:28:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.060342
- Title: EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection
- Title(参考訳): EVL-MCoT:Hamful Meme Detectionのための高機能ビジョンランゲージマルチCoT
- Authors: Hao Yang, Jin Wang, Xuejie Zhang,
- Abstract要約: MEMEはインターネット上で広く使われており、しばしば皮肉や皮肉の強い要素を担っている。
既存の手法は、視覚とテキストを同時に抽出するデュアルストリーム視覚言語モデルに焦点を当てている。
これらの制約に対処するために,視覚言語型マルチCoT (EVL-MCoT) アプローチを提案する。
- 参考スコア(独自算出の注目度): 13.261187830239797
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: MEMEs are widely used on the internet and often carry strong elements of sarcasm or irony. Understanding their hidden meanings typically requires a joint interpretation of text and vision. Existing methods focus on the dual-stream vision-language model to extract the visual and text simultaneously, which lacks background information and prior knowledge about the comprehensive explanation of MEME. One feasible option is to adopt chain-of-thought (CoT). However, the simple CoT approach lacks multi-perspective thinking, which may compromise the reliability of the resulting answers. Moreover, it often relies on shallow feature fusion, lacking the fusion of local details and fine-grained visual-prompt text alignment. This limitation prevents a deeper understanding of the intricate connections between the visual and the text. Herein, an enhanced vision-language multi-CoT (EVL-MCoT) approach is proposed to address these limitations. By promoting multi-CoT, EVL-MCoT enhances consistency and reduces bias in the decision-making process. Additionally, we design a prototype-guided and context-guided decoding framework, which incorporates visual prototypes to guide the fusion process and enables the model to align textual and visual information more precisely. We achieve promising results on the HatefulMemes and MultiOff datasets. The source code has been publicly released and is available at https://github.com/BGWH123/EVL-MCoT.
- Abstract(参考訳): MEMEはインターネット上で広く使われており、しばしば皮肉や皮肉の強い要素を担っている。
隠された意味を理解するには、典型的には、テキストとビジョンを共同で解釈する必要がある。
既存の手法は、背景情報やMEMEの包括的説明に関する事前知識が欠如している視覚とテキストを同時に抽出するデュアルストリーム視覚言語モデルに重点を置いている。
実現可能な選択肢の1つは、チェーン・オブ・ソート(CoT)を採用することである。
しかし、単純なCoTアプローチでは、複数のパースペクティブな思考が欠如しており、結果として得られる回答の信頼性を損なう可能性がある。
さらに、局所的な詳細ときめ細かいビジュアル・プロンプトのテキストアライメントの融合が欠如しているため、浅い特徴融合に依存することが多い。
この制限は、視覚とテキストの間の複雑なつながりの深い理解を妨げる。
ここでは、これらの制限に対処するために、拡張視覚言語マルチCoT (EVL-MCoT) アプローチを提案する。
複数CoTを促進することにより、EVL-MCoTは一貫性を高め、意思決定プロセスにおけるバイアスを低減する。
さらに,融合プロセスのガイドとして視覚プロトタイプを組み込んだプロトタイプ誘導・コンテキスト誘導復号化フレームワークを設計し,テキスト情報と視覚情報をより正確に整合させることができる。
我々はHatefulMemesとMultiOffのデータセットで有望な結果を得る。
ソースコードはhttps://github.com/BGWH123/EVL-MCoTで公開されている。
関連論文リスト
- Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention [12.669087812857533]
テキスト要約と代表画像選択を共同で行う統合フレームワークを提案する。
SPeCTrA-Sumは自己回帰的要約、クロスモーダルアライメント、DPPに基づく蒸留を組み合わせた多目的損失を用いて訓練される。
実験により,本システムはより正確で視覚的な要約を生成し,より代表的な画像を選択する。
論文 参考訳(メタデータ) (2026-05-12T08:28:47Z) - MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment [11.058901579901699]
Universal Multimodal Retrieval (UMR) は、様々なモダリティ(視覚やテキストなど)を共有埋め込み空間にマッピングして検索することを目的としている。
既存のUMR法は、マーベルのようなアーリーフュージョンアプローチとUniVL-DRのようなレイトフュージョンアプローチの2つのカテゴリに分けられる。
我々は,(1)効果的なマルチモーダル統合のためのフュージョン・イン・デコーダアーキテクチャ,(2)単一モダリティ・ミックスインとランダムキャプション・ドロップアウトによる堅牢なトレーニング,という2つの重要なイノベーションを紹介する。
論文 参考訳(メタデータ) (2026-04-23T06:29:42Z) - Enhancing Visual In-Context Learning by Multi-Faceted Fusion [6.852150407828682]
単発核融合を超越した新しい枠組みを導入し, 共同核融合の実現を目指す。
提案手法は,3つの文脈表現分岐を生成し,それぞれがトップクオリティプロンプトの異なる組み合わせから情報を統合することによって生成する。
前景のセグメンテーション、単一対象の検出、画像のカラー化など様々なタスクの実験は、その強力なクロスタスクの一般化を強調している。
論文 参考訳(メタデータ) (2026-01-15T06:25:09Z) - Entity-Guided Multi-Task Learning for Infrared and Visible Image Fusion [14.3937321254743]
Infrared and visible image fusion (EGMT) のためのEntity-Guided Multi-Task Learning という新しい融合手法を提案する。
大規模視覚言語モデルにより生成された画像キャプションからエンティティレベルのテキスト情報を抽出する原理的手法を提案する。
並列マルチタスク学習アーキテクチャを構築し、画像融合とマルチラベル分類タスクを統合する。
また、視覚的特徴とエンティティレベルのテキスト的特徴のきめ細かい相互作用を容易にするために、エンティティ誘導型クロスモーダルインタラクティブモジュールも開発されている。
論文 参考訳(メタデータ) (2026-01-05T08:00:03Z) - Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach [99.80480649258557]
DiTFuseは命令駆動のフレームワークで、単一のモデル内でセマンティクスを意識した融合を実行する。
パブリックなIVIF、MFF、MEFベンチマークの実験では、より優れた量的および質的な性能、よりシャープなテクスチャ、より優れたセマンティック保持が確認されている。
論文 参考訳(メタデータ) (2025-12-08T05:04:54Z) - TeSG: Textual Semantic Guidance for Infrared and Visible Image Fusion [55.34830989105704]
Infrared and visible image fusion (IVF) は、画像モダリティの相補的な情報を組み合わせることを目的としている。
テキスト意味論は,マスクの意味レベルとテキスト意味レベルという2つのレベルで導入する。
画像合成プロセスのガイドとなる赤外線・可視画像融合のためのテクスチュアル・セマンティック・ガイダンスを提案する。
論文 参考訳(メタデータ) (2025-06-20T03:53:07Z) - Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought [72.28041169759454]
大規模視覚言語モデル(LVLM)の性能と解釈性を改善するマルチモーダル・チェーン・オブ・シント(MCoT)
我々は,MCoTフォーマットによらず,画像情報を推論プロセスに伝達する視覚的思考を取り入れることで,MCoTがLVLMを促進することを示す。
また、視覚的思考の内部的な性質を探求し、視覚的思考が入力画像と深いトランスフォーマー層への推論の間の仲介として機能することを発見した。
論文 参考訳(メタデータ) (2025-05-21T13:29:58Z) - Text Speaks Louder than Vision: ASCII Art Reveals Textual Biases in Vision-Language Models [93.46875303598577]
視覚言語モデル(VLM)は、マルチモーダル情報処理において急速に進歩しているが、競合する信号の整合性は未解明のままである。
この研究は、VLMがASCIIアートをどう処理するかを考察する。
論文 参考訳(メタデータ) (2025-04-02T10:47:07Z) - Fuse & Calibrate: A bi-directional Vision-Language Guided Framework for Referring Image Segmentation [8.383431263616105]
FCNetは,視覚と言語の両方が役割を担っている,双方向誘導融合方式のフレームワークである。
具体的には、視覚誘導方式を用いて初期マルチモーダル融合を行い、キービジョン情報に焦点を当てたマルチモーダル特徴を得る。
次に,言語誘導型キャリブレーションモジュールを提案し,これらのマルチモーダル特徴をキャリブレーションし,入力文の文脈を確実に理解する。
論文 参考訳(メタデータ) (2024-05-18T07:21:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。