論文の概要: M2H2: A Multimodal Multiparty Hindi Dataset For Humor Recognition in
Conversations
- arxiv url: http://arxiv.org/abs/2108.01260v1
- Date: Tue, 3 Aug 2021 02:54:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2021-08-04 19:39:07.496690
- Title: M2H2: A Multimodal Multiparty Hindi Dataset For Humor Recognition in
Conversations
- Title(参考訳): m2h2:会話におけるユーモア認識のためのマルチモーダルヒンディー語データセット
- Abstract要約: テレビシリーズ『Shrimaan Shrimati Phir Se』の13話から6,191発の発声を含む会話におけるマルチモーダル・マルチパーティ・ヒンディー・ヒューム(M2H2)認識のためのデータセットを提案する。
それぞれの発話はユーモア/非感情ラベルでアノテートされ、音響、視覚、テキストのモダリティを含む。
M2H2データセットにおける実験結果から,マルチモーダル情報はユーモア認識のための単調な情報を補完することが示された。
- 参考スコア(独自算出の注目度): 72.81164101048181
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Humor recognition in conversations is a challenging task that has recently
gained popularity due to its importance in dialogue understanding, including in
multimodal settings (i.e., text, acoustics, and visual). The few existing
datasets for humor are mostly in English. However, due to the tremendous growth
in multilingual content, there is a great demand to build models and systems
that support multilingual information access. To this end, we propose a dataset
for Multimodal Multiparty Hindi Humor (M2H2) recognition in conversations
containing 6,191 utterances from 13 episodes of a very popular TV series
"Shrimaan Shrimati Phir Se". Each utterance is annotated with humor/non-humor
labels and encompasses acoustic, visual, and textual modalities. We propose
several strong multimodal baselines and show the importance of contextual and
multimodal information for humor recognition in conversations. The empirical
results on M2H2 dataset demonstrate that multimodal information complements
unimodal information for humor recognition. The dataset and the baselines are
available at http://www.iitp.ac.in/~ai-nlp-ml/resources.html and
https://github.com/declare-lab/M2H2-dataset.
- Abstract(参考訳): 会話における感情認識は、多モーダルなセッティング(テキスト、音響、視覚など)を含む対話理解の重要性から、近年人気を集めている課題である。
ユーモアのデータセットはほとんど英語で書かれている。
しかし、多言語コンテンツが著しく伸びているため、多言語情報アクセスをサポートするモデルやシステムの構築には大きな需要がある。
そこで本研究では,テレビシリーズ『Shrimaan Shrimati Phir Se』の13話から6,191発の発声を含む会話におけるマルチモーダル・マルチパーティHindi Humor(M2H2)認識データセットを提案する。
それぞれの発話はユーモア/非感情ラベルでアノテートされ、音響、視覚、テキストのモダリティを含む。
本稿では,会話におけるユーモア認識のためのコンテキスト情報とマルチモーダル情報の重要性を示す。
M2H2データセットにおける実験結果から,マルチモーダル情報はユーモア認識のための単調な情報を補完することが示された。
データセットとベースラインはhttp://www.iitp.ac.in/~ai-nlp-ml/resources.htmlとhttps://github.com/declare-lab/M2H2-datasetで入手できる。
関連論文リスト
- MultiHuSE: A Multimodal Dataset for Humour Styles and Emotions [0.0]
MultiHuSEは、人口統計学的に多彩な50人のアクターが1,463のテキストサンプルを実行する2,407本のハイデフィニションビデオからなるマルチモーダルデータセットである。
このデータセットは、同じテキストの複数のアクター解釈をユニークにキャプチャし、表現多様性の体系的な分析を可能にする。
ベースライン実験により、マルチモーダル融合はユーモアスタイルの分類において一様アプローチより優れていることが示された。
論文 参考訳(メタデータ) (2026-09-10T09:50:00Z) - Dial HEALTHDIAL for Advice: A Multilingual and Multi-Parallel Spoken Dialogue Dataset for Knowledge-Grounded Information Seeking [72.66384771245389]
本研究では,RAGに基づく音声対話システムの開発と評価を目的とした大規模・多言語・マルチ並列データセットであるHEALTHDIALを紹介する。
このデータセットは、WHO(World Health Organization)の信頼できるコンテンツに基づく6000の情報検索対話(言語毎1500語)と、多様な方言の母語話者から記録された163時間のユーザスピーチで構成されている。
論文 参考訳(メタデータ) (2026-05-28T15:47:09Z) - Multilingual Humour-Aware Retrieval with Dense and Re-Ranking Models [0.4640835690336653]
Team DUTH は CLEF 2025 JOKER Task 1 ベンチマークを用いて,多言語対応の情報検索を研究している。
提案手法は,多言語XLM-RoBERTaに基づく高密度検索と,ニューラルリランクを含む追加のシステム変種を組み合わせたものである。
論文 参考訳(メタデータ) (2026-05-24T16:50:15Z) - TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild [102.11425887660327]
音声技術は急速に進歩し、世界中の多様な人口に役立っている。
多くの言語は限られた資源のために表現されていない。
台湾の台義における実世界の発話意図データセットであるtextbfTaigiSpeechを紹介した。
論文 参考訳(メタデータ) (2026-03-23T01:44:45Z) - Towards Explainable Bilingual Multimodal Misinformation Detection and Localization [64.37162720126194]
BiMiは、地域レベルのローカライゼーション、言語間および言語間整合性検出、誤情報解析のための自然言語説明を共同で行うフレームワークである。
BiMiBenchは、実際のニュース画像とサブタイトルを体系的に編集するベンチマークである。
BiMiは、分類精度が+8.9で、ローカライゼーション精度が+15.9で、BERTScoreを+2.5で上回る。
論文 参考訳(メタデータ) (2025-06-28T15:43:06Z) - Can xLLMs Understand the Structure of Dialog? Exploring Multilingual Response Generation in Complex Scenarios [8.131774353504472]
マルチパーティポッドキャスト対話をベースとした,高品質な並列多言語データセットであるXMPを紹介する。
データセットの各サンプルには、社会、文化、政治、エンターテイメントなど、幅広いトピックを議論する少なくとも3人の参加者が含まれている。
このような複雑な対話シナリオに適用した場合、LLMの従来認識されていた多言語機能に重大な制限が生じる。
論文 参考訳(メタデータ) (2025-01-20T04:33:03Z) - M2DS: Multilingual Dataset for Multi-document Summarisation [0.5071800070021028]
MDS(Multi-document Summarisation)は、顧客レビュー、学術論文、医療および法律文書、ニュース記事を含む多様なデータセットを提供する。
しかし、これらのデータセットの英語中心の性質は、今日のグローバル化されたデジタルランドスケープにおいて、多言語データセットの顕著な空白を生み出している。
本稿では、M2DSについて、その特異な多言語的側面を強調し、我々のデータセットで評価された最先端のMDSモデルからのベースラインスコアを含む。
論文 参考訳(メタデータ) (2024-07-17T06:25:51Z) - Emotion and Intent Joint Understanding in Multimodal Conversation: A Benchmarking Dataset [74.74686464187474]
Emotion and Intent Joint Understanding in Multimodal Conversation (MC-EIU)は、マルチモーダルな会話履歴に現れる意味情報をデコードすることを目的としている。
MC-EIUは多くのヒューマン・コンピュータ・インタフェースのテクノロジーを実現している。
MC-EIUデータセットは,7つの感情カテゴリー,9つの意図カテゴリ,3つのモダリティ,すなわちテキスト,音響,視覚的内容,および英語とマンダリンの2つの言語を特徴とする。
論文 参考訳(メタデータ) (2024-07-03T01:56:00Z) - Multi3WOZ: A Multilingual, Multi-Domain, Multi-Parallel Dataset for
Training and Evaluating Culturally Adapted Task-Oriented Dialog Systems [64.40789703661987]
Multi3WOZは、新しいマルチ言語、マルチドメイン、マルチ並列ToDデータセットである。
大規模で、4つの言語で文化的に適応したダイアログを提供する。
最終データセットを生成する複雑なボトムアップデータ収集プロセスについて述べる。
論文 参考訳(メタデータ) (2023-07-26T08:29:42Z) - MMT: A Multilingual and Multi-Topic Indian Social Media Dataset [1.0413233169366503]
ソーシャルメディアは異文化間コミュニケーションにおいて重要な役割を担っている。
多くはコードミキシングと多言語形式で行われる。
我々はTwitterから収集した大規模多言語・マルチトピックデータセット(MMT)を紹介する。
論文 参考訳(メタデータ) (2023-04-02T21:39:00Z) - TextMI: Textualize Multimodal Information for Integrating Non-verbal
Cues in Pre-trained Language Models [5.668457303716451]
マルチモーダルな行動分析タスクのための汎用的,競争的なベースラインとして,TextMIを提案する。
我々のアプローチは、モデルの複雑さを著しく減らし、モデルの判断に解釈可能性を追加し、様々なタスクに適用できます。
論文 参考訳(メタデータ) (2023-03-27T17:54:32Z) - TikTalk: A Video-Based Dialogue Dataset for Multi-Modal Chitchat in Real
World [97.58623810402563]
我々はTikTalkと呼ばれるビデオベースのマルチモーダル対話データセットを導入する。
人気ビデオ共有プラットフォームから38Kのビデオを収集し、その下のユーザーから367Kの会話を投稿した。
ユーザーはビデオのマルチモーダルな体験に基づいて自発的な会話をし、現実世界のchitchatコンテキストを再現する。
論文 参考訳(メタデータ) (2023-01-14T10:18:22Z) - LVP-M3: Language-aware Visual Prompt for Multilingual Multimodal Machine
Translation [94.33019040320507]
マルチモーダル機械翻訳(MMT)は、視覚的特徴を持つテキストのみの翻訳を強化することに焦点を当てている。
最近の進歩は、各言語ペアごとに別々のモデルをトレーニングすることに苦慮している。
7つの言語をカバーする2つのMultilingual MMTベンチマークデータセットを確立することで,Multilingual MMTタスクを提案する。
論文 参考訳(メタデータ) (2022-10-19T12:21:39Z) - M3ED: Multi-modal Multi-scene Multi-label Emotional Dialogue Database [139.08528216461502]
マルチモーダルマルチシーンマルチラベル感情対話データセットM3EDを提案する。
M3EDには56の異なるテレビシリーズの990のダイアドの感情対話があり、合計9,082回、24,449発の発声がある。
我々の知る限りでは、M3EDは中国語における最初のマルチモーダル感情対話データセットである。
論文 参考訳(メタデータ) (2022-05-09T06:52:51Z) - Multi-modal Sarcasm Detection and Humor Classification in Code-mixed
Conversations [14.852199996061287]
我々は,会話対話におけるマルチモーダルサルカズム検出とユーモア分類のための,ヒンディー語と英語の混成データセットMaSaCを開発した。
発話分類のための新しい注目度の高いニューラルアーキテクチャであるMSH-COMICSを提案する。
論文 参考訳(メタデータ) (2021-05-20T18:33:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。