論文の概要: BanglaMemeX: Advancing Cultural Metaphoric Image Interpretation in Bangla with a Multimodal Explainable Dataset
- arxiv url: http://arxiv.org/abs/2609.08029v1
- Date: Mon, 07 Sep 2026 22:27:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 19:46:13.86095
- Title: BanglaMemeX: Advancing Cultural Metaphoric Image Interpretation in Bangla with a Multimodal Explainable Dataset
- Title(参考訳): BanglaMemeX:マルチモーダルな説明可能なデータセットによるバングラの文化メタフォリック画像解釈の促進
- Authors: Md. Sadman Sakib, Zisan Mahmud, Md. Fahim Arefin, Md Fahim,
- Abstract要約: インターネットのミームは、画像、オーバーレイドテキスト、皮肉、社会文化的知識の間の暗黙の相互作用から意味が生まれる、困難な状況を示す。
文化に根ざしたマルチモーダルベンチマークであるBanglaMemeXを紹介し, 3000個のBanglaミームに多次元ラベルを付加した。
本研究は,言語的・文化的な分布変化の背景として,文化的に意識されたマルチモーダルシステムの必要性を浮き彫りにしたものである。
- 参考スコア(独自算出の注目度): 2.8823932597429196
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision Language Models have achieved strong performance on multimodal benchmarks, yet their ability to reason about culturally grounded and metaphor-rich content remains insufficiently studied. Internet memes present a challenging setting where meaning emerges from implicit interactions between image, overlaid text, sarcasm, and shared socio-cultural knowledge rather than literal visual recognition. This challenge is amplified in low-resource languages such as Bangla, where code-mixing, stylized scripts, and culturally specific symbolism introduce substantial distribution shift. In this work, we introduce BanglaMemeX, a culturally grounded multimodal benchmark comprising 3,000 Bangla memes annotated with multi-dimensional labels (humor, sarcasm, offensiveness, motivational intent, and overall sentiment) and human-written explanations that explicitly describe textual and visual metaphors. We systematically evaluate modern VLMs on both classification and explanation generation, revealing that current models struggle to interpret implicit cultural cues despite reasonable surface-level accuracy. Our results highlight the need for culturally-aware multimodal systems capable of grounded reasoning under linguistic and cultural distribution shift.
- Abstract(参考訳): 視覚言語モデルは、マルチモーダル・ベンチマークにおいて強力なパフォーマンスを達成しているが、文化的基盤とメタファーに富んだコンテンツを推論する能力は、まだ十分に研究されていない。
インターネットのミームは、画像、オーバーレイドテキスト、皮肉、社会文化的知識の共有といった暗黙の相互作用から意味が生まれるという困難な状況を示す。
この課題は、Banglaのような低リソース言語で増幅されており、コードミックス、スタイリングされたスクリプト、文化的に特定のシンボルがかなりの分散シフトをもたらす。
本研究は,BanglaMemeXという,3千個のBanglaミームを多次元ラベル(暗黙,攻撃性,モチベーションの意図,全体感)に注釈付けし,テキストや視覚的メタファーを明示した人文による説明を含む,文化的基盤化されたマルチモーダル・ベンチマークを紹介する。
分類と説明生成の両面から最新のVLMを体系的に評価し, 妥当な表面レベルでの精度にもかかわらず, 現在のモデルでは暗黙的な文化的手がかりの解釈に苦慮していることを明らかにした。
本研究は,言語的・文化的な分布変化の背景として,文化的に意識されたマルチモーダルシステムの必要性を浮き彫りにしたものである。
関連論文リスト
- MemeBridge: A Dataset for Benchmarking and Mitigating the Bidirectional Cultural Gap in Meme Interpretation [16.37143301773968]
本稿では,米国産ミームを中心としたキュレートデータセットであるMemeBridgeを紹介する。
ここでの文脈は、背景信念、規範、ミーム理解を形成する共有前提を含む暗黙の文化的知識を指す。
我々は、米国参加者の予想される誤解がしばしば不正確であることを観察する。
論文 参考訳(メタデータ) (2026-08-31T23:38:23Z) - ArtECulture: Benchmarking Culture-Conditioned Visual Emotion Understanding in Multimodal Large Language Models [36.2474208478776]
本稿では,あるイメージの文化特有の感情知覚を予測するタスクである,文化条件の視覚的感情理解を紹介する。
ArtECultureは、6,792点のアートワークと文化固有の感情ラベルと、英語、中国語、アラビア語の文化にまたがる説明を含むベンチマークである。
論文 参考訳(メタデータ) (2026-08-04T09:05:41Z) - When Meaning Travels: A Granular Lens on Hybrid-MoE's Role in Idiomatic Understanding for Language Models [11.355899871129559]
本稿では, ヒンディー語, ベンガル語, タイ語などの低資源の東南アジア諸言語において, 図形的・文化的意味を保ち続ける航法を示す。
このような複雑さに対処するため、3,533個の多言語イディオムからなる再構成された多モーダルコーパスであるVarnikaを提案する。
論文 参考訳(メタデータ) (2026-06-01T04:28:44Z) - IDIOLEX: Unified and Continuous Representations for Idiolectal and Stylistic Variation [88.98544786373212]
既存の文表現は主に、その表現方法ではなく、ある文が何を言っているかを符号化する。
本研究は,意味内容から分離したスタイルと方言をキャプチャする文表現を開発する。
IDIOLEX(IDIOLEX)は,文の証明から文の内容の言語的特徴までを統括するモデルを訓練するためのフレームワークである。
論文 参考訳(メタデータ) (2026-04-06T14:17:24Z) - AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking [59.15472057710525]
AVMeme Examは、音声、歌、音楽、サウンドエフェクトにまたがる、1000以上の象徴的なインターネットの音とビデオの人間による評価ベンチマークである。
各ミームは、表面コンテンツからコンテキスト、感情、使用法、世界知識への理解レベルを評価するユニークなQ&Aと組み合わせられる。
このベンチマークを用いて,最先端のマルチモーダル言語モデル (MLLM) を人間の参加者とともに体系的に評価した。
論文 参考訳(メタデータ) (2026-01-25T01:40:15Z) - Where Culture Fades: Revealing the Cultural Gap in Text-to-Image Generation [43.352493955825736]
現在のT2Iモデルは、多言語的なプロンプトの下で、文化的に中立な結果や英語に偏った結果をもたらすことが多い。
本稿では,培養感受性シグナルを少数の固定層内の小さなニューロン群に局在させる探索法を提案する。
論文 参考訳(メタデータ) (2025-11-21T14:40:50Z) - BLEnD-Vis: Benchmarking Multimodal Cultural Understanding in Vision Language Models [54.16874020794336]
視覚言語モデル(VLM)における日常的文化的知識の堅牢性を評価するためのベンチマークであるBLEnD-Visを紹介する。
BLEnD-Visは16の領域にまたがる文化的根拠を持つ313の質問テンプレートを構築し、3つの整列した複数選択形式を生成する。
その結果得られたベンチマークは、4,916の画像と、人間のアノテーションで検証された21,000以上のMultiple-choice Question (MCQ)インスタンスで構成されている。
論文 参考訳(メタデータ) (2025-10-13T09:10:05Z) - Cultural Bias Matters: A Cross-Cultural Benchmark Dataset and Sentiment-Enriched Model for Understanding Multimodal Metaphors [26.473849906627677]
中国語と英語のメタファーを横断的に研究するためのデータセットであるMultiMMを紹介する。
本稿では、感情埋め込みを統合し、文化的背景における比喩的理解を高めるベースラインモデルである感性強化メタファー検出(SEMD)を提案する。
論文 参考訳(メタデータ) (2025-06-08T04:02:50Z) - CaMMT: Benchmarking Culturally Aware Multimodal Machine Translation [47.54347964192231]
本稿では,5800枚以上の画像のベンチマークであるCaMMTと,英語と地域語でのパラレルキャプションを紹介する。
自動的および人的評価により、視覚的コンテキストは一般的に翻訳品質を改善する。
論文 参考訳(メタデータ) (2025-05-30T10:42:44Z) - See It from My Perspective: How Language Affects Cultural Bias in Image Understanding [60.70852566256668]
視覚言語モデル(VLM)は、多くの言語における画像に関するクエリに応答することができる。
画像理解におけるVLMの西洋的偏見を特徴付け,この格差の中で言語が果たす役割について検討する。
論文 参考訳(メタデータ) (2024-06-17T15:49:51Z) - Multi-lingual and Multi-cultural Figurative Language Understanding [69.47641938200817]
図形言語は人間のコミュニケーションに浸透するが、NLPでは比較的過小評価されている。
Hindi, Indonesian, Javanese, Kannada, Sundanese, Swahili, Yorubaの7つの多様な言語に関するデータセットを作成しました。
我々のデータセットから,各言語は,同じ領域から派生した言語間で最も高い重なり合いを持つ,図形表現の文化的・地域的概念に依存していることが明らかとなった。
全ての言語は、事前学習データと微調整データの可用性を反映した性能の変化により、英語と比較して大きな欠陥がある。
論文 参考訳(メタデータ) (2023-05-25T15:30:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。