論文の概要: LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish
- arxiv url: http://arxiv.org/abs/2606.31947v2
- Date: Thu, 02 Jul 2026 16:10:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.50373
- Title: LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish
- Title(参考訳): LuxEmo:ルクセンブルク語のための表現型テキスト音声コーパス
- Abstract要約: 本稿では,Luxembourgishのための21時間会話表現音声コーパスLuxEmoを紹介する。
本稿では,音声活動の検出,認知,言語識別,LuxASRに基づくセグメンテーション,自動感情予測,語彙的手がかり,対象人間レビューを組み合わせた半自動キュレーションワークフローを提案する。
- 参考スコア(独自算出の注目度): 1.0590698823137754
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: State-of-the-art speech datasets predominantly focus on widely spoken languages, often overlooking low-resource languages such as Luxembourgish, which remain underrepresented in speech technology research. In this work, we introduce LuxEmo, a 21-hour conversational expressive speech corpus for Luxembourgish with 4 emotion categories. LuxEmo is derived from Radio Télévision Luxembourg (RTL) youth broadcasts, using automated detection followed by human validation. We propose a semi-automatic curation workflow combining voice activity detection, denoising, language identification, LuxASR-based segmentation, automatic emotion prediction, lexical cues, and targeted human review. Additionally, we benchmark five expressive TTS systems covering German-based cross-lingual transfer, multilingual Luxembourgish support, Luxembourgish adaptation, and non-parametric prosody transfer. Performance is evaluated using both objective metrics and human evaluation.
- Abstract(参考訳): 最先端の音声データセットは主に広く話されている言語に焦点を合わせており、Luxembourgishのような低リソース言語を見落としていることが多い。
本研究では,Luxembourgishのための21時間会話表現音声コーパスLuxEmoを紹介する。
LuxEmoはRTL(Radio Télévision Luxembourg)の青少年放送から派生したもので、自動検出と人間の検証が続く。
本稿では,音声活動の検出,認知,言語識別,LuxASRに基づくセグメンテーション,自動感情予測,語彙的手がかり,対象人間レビューを組み合わせた半自動キュレーションワークフローを提案する。
さらに,ドイツ語による言語間移動,多言語によるルクセンブルク語サポート,ルクセンブルク語適応,非パラメトリック韻律変換を含む5つの表現型TTSシステムのベンチマークを行った。
パフォーマンスは客観的指標と人的評価の両方を用いて評価される。
関連論文リスト
- VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs [54.75016325571445]
音声大言語モデル (LLM) は, 音声の感情認識において, 生成インタフェースを介する大きな可能性を示す。
クローズドセットからオープンテキスト生成へのシフトは、ゼロショット性を導入し、プロンプトに非常に敏感な評価を与える。
本稿では,VoxEmoについて紹介する。VoxEmoは音声LLMのための15言語に35の感情コーパスを含む総合的なSERベンチマークである。
論文 参考訳(メタデータ) (2026-03-09T21:10:34Z) - PRiSM: Benchmarking Phone Realization in Speech Models [70.82595415252682]
音声認識(PR)は言語に依存しない言語間音声処理と音声解析のためのアトミックインタフェースとして機能する。
PRiSMは、音声知覚における盲点を明らかにするために設計された、最初のオープンソースベンチマークである。
論文 参考訳(メタデータ) (2026-01-20T15:00:36Z) - LuxIT: A Luxembourgish Instruction Tuning Dataset from Monolingual Seed Data [2.383798778903081]
LuxITは、この課題を緩和するために開発されたLuxembourgishのための新しい単言語命令チューニングデータセットである。
我々は,Luxembourgishの習熟度を示すために選択されたDeepSeek-R1-0528を用いて,Luxembourgish原文のコーパスからデータセットを合成した。
論文 参考訳(メタデータ) (2025-10-28T14:02:55Z) - Can Prompting LLMs Unlock Hate Speech Detection across Languages? A Zero-shot and Few-shot Study [59.30098850050971]
この研究は、8つの非英語言語にわたるLLMのプロンプトに基づく検出を評価する。
実世界の評価セットのほとんどにおいて、ゼロショットと少数ショットが微調整エンコーダモデルに遅れを生じさせる一方で、ヘイトスピーチ検出のための関数的テストのより優れた一般化を実現していることを示す。
論文 参考訳(メタデータ) (2025-05-09T16:00:01Z) - Text Generation Models for Luxembourgish with Limited Data: A Balanced Multilingual Strategy [7.59001382786429]
本稿では,Luxembourgishに着目した低表現言語のための言語モデル開発における課題について論じる。
本稿では,限定されたルクセンブルク語データと同等量のドイツ語とフランス語データを組み合わせた,T5アーキテクチャに基づく新しいテキスト生成モデルを提案する。
評価のために,Luxembourgishにとって最初のテキスト生成ベンチマークであるLuxGenを紹介する。
論文 参考訳(メタデータ) (2024-12-12T16:23:12Z) - LuxBank: The First Universal Dependency Treebank for Luxembourgish [0.38447712214412116]
ルクセンブルク語(Luxembourgish)は、西ゲルマンの約40万人が話している言語である。
ルクセンブルクにおける最初のユニバーサル依存(UD)ツリーバンクであるLuxBankを紹介する。
論文 参考訳(メタデータ) (2024-11-07T15:50:40Z) - Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages [49.6922490267701]
我々は,自己教師型音声エンコーダのコード切替能力を評価するために,ゼロリソースコード切替音声ベンチマークを導入した。
本稿では,音声エンコーダのコードスイッチング能力を評価するために,離散単位に基づく言語モデリングのベースラインシステムを紹介する。
論文 参考訳(メタデータ) (2023-10-04T17:58:11Z) - MixSpeech: Cross-Modality Self-Learning with Audio-Visual Stream Mixup
for Visual Speech Translation and Recognition [51.412413996510814]
視覚音声の訓練を正規化するために音声音声を利用する多目的自己学習フレームワークであるMixSpeechを提案する。
MixSpeechは雑音の多い環境での音声翻訳を強化し、AVMuST-TED上でのBLEUスコアを+1.4から+4.2に改善した。
論文 参考訳(メタデータ) (2023-03-09T14:58:29Z) - Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec
Language Modeling [92.55131711064935]
本稿では,言語間音声合成のための言語間ニューラルネットワークモデル VALL-E X を提案する。
VALL-E Xは、強い文脈内学習能力を継承し、ゼロショット言語間テキスト音声合成やゼロショット音声音声音声翻訳タスクに応用できる。
未知の話者の声、感情、音響環境を保ちながら、ソース言語の1つの発話をプロンプトとして、ターゲット言語で高品質な音声を生成することができる。
論文 参考訳(メタデータ) (2023-03-07T14:31:55Z) - MoLE : Mixture of Language Experts for Multi-Lingual Automatic Speech
Recognition [12.23416994447554]
我々はMixture-of-Language-Expert(MoLE)という多言語音声認識ネットワークを提案する。
MoLEは、任意の言語で入力された音声から言語表現を分析し、軽量な言語トークン化器で言語固有の専門家を活性化する。
信頼性に基づいて、アクティベートされた専門家と言語に依存しない専門家を集約し、言語条件の埋め込みを表現する。
論文 参考訳(メタデータ) (2023-02-27T13:26:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。