論文の概要: MERaLiON-GR: Speech Gender Recognition Model for English and SEA Languages
- arxiv url: http://arxiv.org/abs/2608.04433v1
- Date: Wed, 05 Aug 2026 04:22:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.721885
- Title: MERaLiON-GR: Speech Gender Recognition Model for English and SEA Languages
- Title(参考訳): MERaLiON-GR:英語とSEA言語のための音声ジェンダー認識モデル
- Authors: Qiongqiong Wang, Ai Ti Aw, Nancy F. Chen, Ying Lay Chiu, Yang Ding, Yingxu He, Ridong Jiang, Zhuohan Liu, Yanfeng Lu, Yi Ma, Muhammad Huzaifah, Nabilah Binte Md Johan, Nattadaporn Lertcheva, Pham Minh Duc, Sailor Hardik Bhupendra, Siti Umairah Binte Mohammad Salleh, Shuo Sun, Tarun Kumar Vangani, Jeremy H. M. Wong, Jinyang Wu, Longyin Zhang,
- Abstract要約: 本稿では,ジェンダー認識システムMERaLiON-GRを提案する。
英語と東南アジア語で二分分類(女性/男性)を行う。
- 参考スコア(独自算出の注目度): 46.09005317642768
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present MERaLiON-GR, a speech gender recognition system that performs binary classification (female / male) on English and Southeast Asian (SEA) languages. The model finetunes MERaLiON-SpeechEncoder-2, a large conformer based transformer pre-trained on a broad speech corpus, and applies parameter efficient fine-tuning via Low-Rank Adaptation (LoRA) to adapt the encoder to the gender recognition task, and appends a multi-scale ECAPA-TDNN down stream network with attention pooling and a lightweight linear classifier. Extensive evaluations across multilingual Singaporean and Southeast Asian languages (English, Chinese, Malay, Tamil, Thai, Vietnamese, Indonesian, and Khmer) show that MERaLiON-GR consistently surpasses the state-of-the-art gender recognition model Vox-Profile and a large Audio-LLM, in both full-utterance and segment level evaluation modes. The results underscore the value of dedicated speech models in achieving accurate paralinguistic understanding and strong cross-lingual generalization.
- Abstract(参考訳): 本稿では,英語と東南アジア語(SEA)の2進分類(女性/男性)を行う言語性認識システムMERaLiON-GRを提案する。
モデルファインチューンMERaLiON-SpeechEncoder-2は、広範音声コーパスで事前訓練された大コンバータベースのトランスフォーマーであり、ローランド適応(LoRA)を介してパラメータ効率の良い微調整を適用し、エンコーダを性別認識タスクに適応させ、マルチスケールのECPA-TDNNダウンストリームネットワークにアテンションプーリングと軽量線形分類器を付加する。
多言語シンガポール語と東南アジア語(英語、中国語、マレー語、タミル語、タイ語、ベトナム語、インドネシア語、クメール語)の広範な評価は、MERaLiON-GRが全発話およびセグメントレベルの評価モードにおいて、最先端の性別認識モデルであるVox-Profileと大きなAudio-LLMを一貫して上回っていることを示している。
この結果から, 高精度なパラ言語的理解と強い言語間一般化を実現する上で, 専用の音声モデルの有効性が示唆された。
関連論文リスト
- GigaAM Multilingual: Foundation Model for Underrepresented Languages [63.406165255277195]
We present GigaAM Multilingual, a Conformer encoder pre-trained on 200M hours of audio using a HuBERT-style objective。
我々は,事前学習時のクラスタレベルのデータバランス戦略と,微調整時のドメイン認識サンプリング手法を導入し,見出し言語の優位性を緩和する。
論文 参考訳(メタデータ) (2026-07-11T15:48:03Z) - MERaLiON-SER: Robust Speech Emotion Recognition Model for English and SEA Languages [1.8158194662712928]
本稿では,英語と東南アジア語に対する頑健な音声感情認識モデルであるMERaLiON-SERを提案する。
本モデルでは,重み付きカテゴリーのクロスエントロピーとコンコーダンス相関係数の損失を組み合わせたハイブリッド目標を用いて学習を行った。
我々は,MERaLiON-SERがオープンソース音声エンコーダと大規模オーディオ-LLMを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2025-11-07T01:28:40Z) - Breaking Language Barriers or Reinforcing Bias? A Study of Gender and Racial Disparities in Multilingual Contrastive Vision Language Models [28.944990804599893]
M-CLIP, NLLB-CLIP, CAPIVARA-CLIP, and the debiased SigLIP-2。
人種と性別の偏見を定量化し、ステレオタイプ増幅を測定する。
論文 参考訳(メタデータ) (2025-05-20T10:14:00Z) - SeaLLMs -- Large Language Models for Southeast Asia [76.50157503379086]
東南アジア(SEA)言語に焦点を当てた,革新的な言語モデルであるSeaLLMを紹介した。
SeaLLMはLlama-2モデルに基づいて構築され、さらに拡張語彙、特殊命令、アライメントチューニングによる事前訓練が継続されている。
包括的評価により,SeaLLM-13bモデルは言語タスクやアシスタントスタイルの指示追従能力に優れた性能を示した。
論文 参考訳(メタデータ) (2023-12-01T17:17:56Z) - LAMASSU: Streaming Language-Agnostic Multilingual Speech Recognition and
Translation Using Neural Transducers [71.76680102779765]
自動音声認識(ASR)と音声翻訳(ST)はどちらもモデル構造としてニューラルトランスデューサを使用することができる。
ニューラルトランスデューサを用いた多言語音声認識および翻訳モデルであるLAMASSUを提案する。
論文 参考訳(メタデータ) (2022-11-05T04:03:55Z) - Unsupervised Cross-lingual Representation Learning for Speech
Recognition [63.85924123692923]
XLSRは、複数の言語における音声の生波形から1つのモデルを事前学習することで、言語間音声表現を学習する。
我々は、マスク付き潜在音声表現よりも対照的なタスクを解くことで訓練されたwav2vec 2.0を構築した。
実験により、言語間事前学習はモノリンガル事前訓練よりも著しく優れていることが示された。
論文 参考訳(メタデータ) (2020-06-24T18:25:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。