論文の概要: MemeCULT-1K: Benchmarking South Asian Cultural Context and Humor Understanding of Multimodal Models
- arxiv url: http://arxiv.org/abs/2609.01772v1
- Date: Tue, 01 Sep 2026 18:43:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.879296
- Title: MemeCULT-1K: Benchmarking South Asian Cultural Context and Humor Understanding of Multimodal Models
- Title(参考訳): MemeCULT-1K: 南アジア文化文脈のベンチマークとマルチモーダルモデルの広義理解
- Authors: Tawsif Tashwar Dipto, Mehedi Ahamed, Radib Bin Kabir, Mueeze Al Mushabbir, Mohammed Saidul Islam, Mir Rayat Imtiaz Hossain, Md Tahmid Rahman Laskar, Sabbir Ahmed,
- Abstract要約: 我々はベンガル語、英語、ヒンディー語で1000の南アジアミームのベンチマークであるMemeCULT-1Kを紹介する。
我々は、ミームオンリーとコンテキストアウェアの2つの設定で、13の人気のあるビジョン言語モデル(VLM)を評価した。
きめ細かい誤差解析により、クローズドソースモデルは、主にエンティティと参照の誤識別に失敗し、一方、オープンソースモデルは、より広い文化的知識ギャップによってボトルネックになっていることが明らかになった。
- 参考スコア(独自算出の注目度): 7.9152408875072275
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Meme understanding goes beyond recognizing visual content or literal text; it requires implicit cultural knowledge and pragmatic inference that most vision-language models still lack. We introduce MemeCULT-1K, a multilingual benchmark of 1,000 South Asian memes in Bengali, English, and Hindi, where each meme is paired with a cultural context note and three human-written explanations, along with a supplementary set of 54 Bengali regional dialect memes. We evaluate thirteen popular Vision Language Models (VLMs) under two settings: meme-only and context-aware. Providing minimal cultural context yields consistent gains across all models and languages: mean SBERT similarity improves from 44.6 to 56.4 (+11.8), BLEURT from 37.3 to 42.3 (+5.0), and LLM-as-a-Judge scores from 2.57 to 3.43 out of 5 (+0.86). Fine-grained error analysis reveals that closed-source models fail mainly on entity and reference misidentification, while open-source models are bottlenecked by broader cultural knowledge gaps, with linguistic and phonological failures proving the most context-resistant across both. These results highlight the difficulty of culturally grounded meme understanding and motivate future work on explicit cultural knowledge integration. Our dataset and code are publicly available at TawsifDipto17/MemeCULT-1K.
- Abstract(参考訳): ミーム理解は、視覚的内容やリテラルテキストの認識に留まらず、ほとんどの視覚言語モデルにまだ欠けているという暗黙の文化的知識と実践的な推論を必要とする。
我々は,ベンガル語,英語,ヒンディー語で1000の南アジアのミームの多言語ベンチマークであるMemeCULT-1Kを紹介した。
我々は、ミームオンリーとコンテキストアウェアの2つの設定で、13の人気のあるビジョン言語モデル(VLM)を評価した。
SBERTの類似性は44.6から56.4(+11.8)、BLEURTは37.3から42.3(+5.0)、LM-as-a-Judgeスコアは5のうち2.57から3.43(+0.86)に改善されている。
きめ細かい誤差分析により、クローズドソースモデルは、主にエンティティと参照の誤識別に失敗し、一方、オープンソースモデルは、より広い文化的知識ギャップによってボトルネックを受けており、言語的および音韻的失敗は、双方で最も文脈に抵抗することを示す。
これらの結果は、文化的に根ざしたミーム理解の難しさを浮き彫りにして、明示的な文化的知識統合に関する今後の研究を動機づけるものである。
データセットとコードはTawsifDipto17/MemeCULT-1Kで公開されています。
関連論文リスト
- MemeBridge: A Dataset for Benchmarking and Mitigating the Bidirectional Cultural Gap in Meme Interpretation [16.37143301773968]
本稿では,米国産ミームを中心としたキュレートデータセットであるMemeBridgeを紹介する。
ここでの文脈は、背景信念、規範、ミーム理解を形成する共有前提を含む暗黙の文化的知識を指す。
我々は、米国参加者の予想される誤解がしばしば不正確であることを観察する。
論文 参考訳(メタデータ) (2026-08-31T23:38:23Z) - CultureForest: Understanding and Evaluating Cultural Norm Grounded Reasoning in LLMs [59.09971492475217]
TextitCultural Norm Grounded ReasoningのベンチマークであるCultureForestを紹介する。
CultureForestは8つのドメインで5,378のサンプルと53の国/リージョンで構成されている。
大規模な実験では、トップ層モデルでさえ、オープンな設定で大幅に劣化していることが明らかになった。
論文 参考訳(メタデータ) (2026-06-01T08:25:12Z) - Many Dialects, Many Languages, One Cultural Lens: Evaluating Multilingual VLMs for Bengali Culture Understanding Across Historically Linked Languages and Regional Dialects [1.6884607868633077]
9つのドメインで1,152枚の手動でキュレートされた画像から構築されたこのベンチマークは、視覚的な質問応答とキャプションをサポートする。
実験の結果,標準バングラのみの評価が真のモデル能力を過大評価していることがわかった。
ドメイン全体において、主なボトルネックは、視覚的な基盤ではなく、文化的知識の欠如である。
論文 参考訳(メタデータ) (2026-03-22T10:55:08Z) - MMA-ASIA: A Multilingual and Multimodal Alignment Framework for Culturally-Grounded Evaluation [91.22008265721952]
MMA-ASIAは、アジア8か国と10か国を対象とする人為的、多言語的、マルチモーダルなベンチマークに重点を置いている。
これは、テキスト、画像(視覚的質問応答)、音声の3つのモードにまたがる入力レベルで整列された最初のデータセットである。
i) 国間の文化的認識格差、(ii) 言語間の整合性、(iii) 言語間の整合性、(iv) 文化知識の一般化、(v) 基礎的妥当性を評価する5次元評価プロトコルを提案する。
論文 参考訳(メタデータ) (2025-10-07T14:12:12Z) - Grounding Multilingual Multimodal LLMs With Cultural Knowledge [48.95126394270723]
本稿では,MLLMを文化的知識に根ざしたデータ中心型アプローチを提案する。
CulturalGroundは、42の国と39の言語にまたがる2200万の高品質で文化的に豊かなVQAペアで構成されている。
我々は,MLLM CulturalPangeaをCulturalGround上で学習し,汎用性を維持するために,標準の多言語指導訓練データをインターリーブする。
論文 参考訳(メタデータ) (2025-08-10T16:24:11Z) - Fluent but Foreign: Even Regional LLMs Lack Cultural Alignment [24.871503011248777]
大規模な言語モデル(LLM)は世界中で使用されているが、西洋文化の傾向を示す。
我々は,6つの指標と6つのグローバルLLMを2次元(値とプラクティス)で評価する。
タスク全体では、Indicモデルはグローバルモデルよりもインド標準とよく一致しない。
論文 参考訳(メタデータ) (2025-05-25T01:59:23Z) - Multi3Hate: Multimodal, Multilingual, and Multicultural Hate Speech Detection with Vision-Language Models [11.82100047858478]
マルチモーダルおよびマルチ言語並列ヘイトスピーチデータセットを作成し、マルチ3Hateと呼ばれるマルチカルチャーアノテータセットで注釈付けする。
5つの言語(英語、ドイツ語、スペイン語、ヒンディー語、マンダリン)にまたがる300のミームサンプルを含んでいる。
文化的背景がデータセットにおけるマルチモーダルヘイトスピーチのアノテーションに大きく影響することを示し、各国間の平均的なペアワイド合意は、ランダムに選択されたアノテータグループよりもわずか74%低い。
論文 参考訳(メタデータ) (2024-11-06T13:06:43Z) - Not All Countries Celebrate Thanksgiving: On the Cultural Dominance in
Large Language Models [89.94270049334479]
本稿では,大規模言語モデル(LLM)における文化的優位性について述べる。
LLMは、ユーザーが非英語で尋ねるときに期待する文化とは無関係な、不適切な英語文化関連の回答を提供することが多い。
論文 参考訳(メタデータ) (2023-10-19T05:38:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。