論文の概要: Multilingual Multi-Label Emotion Classification at Scale with Synthetic Data
- arxiv url: http://arxiv.org/abs/2604.12633v1
- Date: Tue, 14 Apr 2026 12:04:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-15 19:11:32.425509
- Title: Multilingual Multi-Label Emotion Classification at Scale with Synthetic Data
- Title(参考訳): 合成データを用いた多言語マルチラベル感情分類
- Authors: Vadim Borisov,
- Abstract要約: 我々は23言語にまたがる100万以上の多ラベルサンプルからなる大規模合成学習コーパスを構築した。
DistilBERT (135Mパラメータ) から XLM-R-Large (560Mパラメータ) までの6つの多言語トランスフォーマーエンコーダを訓練・比較する。
GoEmotions (英語) とSemEval-2018 Task 1 E-c (英語,アラビア語,スペイン語) を用いて, ゼロショットの全モデルを評価する。
- 参考スコア(独自算出の注目度): 2.3424047967193826
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Emotion classification in multilingual settings remains constrained by the scarcity of annotated data: existing corpora are predominantly English, single-label, and cover few languages. We address this gap by constructing a large-scale synthetic training corpus of over 1M multi-label samples (50k per language) across 23 languages: Arabic, Bengali, Dutch, English, French, German, Hindi, Indonesian, Italian, Japanese, Korean, Mandarin, Polish, Portuguese, Punjabi, Russian, Spanish, Swahili, Tamil, Turkish, Ukrainian, Urdu, and Vietnamese, covering 11 emotion categories using culturally-adapted generation and programmatic quality filtering. We train and compare six multilingual transformer encoders, from DistilBERT (135M parameters) to XLM-R-Large (560M parameters), under identical conditions. On our in-domain test set, XLM-R-Large achieves 0.868 F1-micro and 0.987 AUC-micro. To validate against human-annotated data, we evaluate all models zero-shot on GoEmotions (English) and SemEval-2018 Task 1 E-c (English, Arabic, Spanish). On threshold-free ranking metrics, XLM-R-Large matches or exceeds English-only specialist models, tying on AP-micro (0.636) and LRAP (0.804) while surpassing on AUC-micro (0.810 vs. 0.787), while natively supporting all 23 languages. The best base-sized model is publicly available at https://huggingface.co/tabularisai/multilingual-emotion-classification
- Abstract(参考訳): 多言語設定における感情分類は、注釈付きデータの不足によって制限され続けており、既存のコーパスは主に英語であり、シングルラベルであり、少数の言語をカバーしている。
このギャップは、アラビア語、ベンガル語、オランダ語、英語、フランス語、ドイツ語、ヒンディー語、インドネシア語、イタリア語、日本語、韓国語、マンダリン語、ポーランド語、ポルトガル語、プンジャビ語、ロシア語、スペイン語、スワヒリ語、タミル語、トルコ語、ウクライナ語、ウルドゥー語、ベトナム語、11の感情カテゴリーを、文化的に適応した世代とプログラムによる品質フィルタリングを用いて、23言語にまたがる100万以上のマルチラベルサンプル(言語当たり50k)からなる大規模な総合的なトレーニングコーパスを構築することで解決される。
同一条件下で, DistilBERT (135Mパラメータ) から XLM-R-Large (560Mパラメータ) までの6つの多言語トランスフォーマーエンコーダを訓練・比較する。
我々のドメイン内テストセットでは、XLM-R-ラージは0.868 F1-microと0.987 AUC-microを達成した。
人間の注釈付きデータに対して、GoEmotions(英語)とSemEval-2018 Task 1 E-c(英語、アラビア語、スペイン語)でゼロショットのモデルを評価する。
XLM-R-ラージはAP-micro (0.636) とLRAP (0.804) に対応し、AUC-micro (0.810 vs. 0.787) を上回り、23言語全てをネイティブにサポートしている。
最高のベースサイズモデルはhttps://huggingface.co/tabularisai/multilingual-emotion-classificationで公開されています。
関連論文リスト
- Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech [61.759910921200834]
言語間の文エンコーダは通常、数百の言語をカバーしている。
我々はOmniSONARを紹介した。OmniSONARは全言語、言語横断、言語横断の文埋め込みモデルである。
論文 参考訳(メタデータ) (2026-03-17T14:47:35Z) - mmBERT: A Modern Multilingual Encoder with Annealed Language Learning [57.58071656545661]
mmBERTは、多言語テキストの3Tトークンで事前訓練されたエンコーダのみの言語モデルである。
データに1700以上の低リソース言語を追加しています。
分類および検索タスクにおける従来のモデルよりも, mmBERTの方が優れていたことを示す。
論文 参考訳(メタデータ) (2025-09-08T17:08:42Z) - NeoBabel: A Multilingual Open Tower for Visual Generation [32.79724699684266]
我々は,新しい多言語画像生成フレームワークNeoBabelを紹介する。
英語、中国語、オランダ語、フランス語、ヒンディー語、ペルシア語という6つの言語をサポートしている。
それは、強い英語能力を維持しながら、最先端の多言語のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-07-08T16:19:45Z) - Paramanu: A Family of Novel Efficient Generative Foundation Language Models for Indian Languages [3.9018931027384056]
インド語のための新しい言語モデル(LM)のファミリーである「Paramanu」を提示する。
10の言語(アッサム語、バングラ語、ヒンディー語、コンカニ語、マイティシ語、マラティ語、オディア語、サンスクリット語、タミル語、テルグ語)を5文字でカバーしている。
モデルは、コンテキストサイズが1024の1つのGPUで事前トレーニングされており、サイズは13.29万(M)から367.5Mまで様々である。
論文 参考訳(メタデータ) (2024-01-31T17:58:10Z) - Breaking Language Barriers in Multilingual Mathematical Reasoning: Insights and Observations [59.056367787688146]
本稿では, マルチリンガル数学推論 (xMR) LLM の探索と学習の先駆者である。
我々は10の異なる言語を含む最初の多言語数学推論命令データセットMGSM8KInstructを構築した。
翻訳を利用して、10個の異なる言語を含む最初の多言語数学推論命令データセットMGSM8KInstructを構築した。
論文 参考訳(メタデータ) (2023-10-31T08:09:20Z) - PolyLM: An Open Source Polyglot Large Language Model [57.64420154135178]
我々は6400億(B)トークンでトレーニングされた多言語大言語モデル(LLM)であるPolyLMについて述べる。
その多言語的能力を高めるために,1) バイリンガルデータをトレーニングデータに統合し,2) 事前学習中に英語以外のデータの比率を30%から60%に引き上げるカリキュラム学習戦略を採用する。
さらに,モデル微調整のために,132.7Kの多言語命令を自動的に生成する多言語自己指示手法を提案する。
論文 参考訳(メタデータ) (2023-07-12T09:00:37Z) - SMaLL-100: Introducing Shallow Multilingual Machine Translation Model
for Low-Resource Languages [102.50127671423752]
本稿では,100言語をカバーするM2M-100(12B)機械翻訳モデルの蒸留版であるSMaLL-100を紹介する。
我々はSMALL-100を全ての言語対を均一にサンプリングすることで訓練し、低リソース言語の性能を維持することに重点を置いている。
我々のモデルはM2M-100(1.2B)に匹敵する結果を得るが、推論では3.6倍小さく、4.3倍高速である。
論文 参考訳(メタデータ) (2022-10-20T22:32:29Z) - Language-agnostic BERT Sentence Embedding [14.241717104817713]
単言語および言語間表現の学習に最適な方法を組み合わせることで,多言語文の埋め込みを学習する方法を検討する。
事前学習した多言語言語モデルを導入することで,性能向上に必要な並列トレーニングデータの量を大幅に削減できることを示す。
論文 参考訳(メタデータ) (2020-07-03T17:58:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。