論文の概要: Towards Digital Preservation of Efik: TTS for a Low-Resource African Language
- arxiv url: http://arxiv.org/abs/2607.04515v1
- Date: Sun, 05 Jul 2026 21:37:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.96562
- Title: Towards Digital Preservation of Efik: TTS for a Low-Resource African Language
- Title(参考訳): Efikのデジタル保存に向けて:低リソースアフリカ言語のためのTS
- Abstract要約: ナイジェリア南東部で約300万の第二言語話者と150万の母国語話者によって話される声調言語であるEfikは、音声合成研究において未だに不足している。
本研究は,Efikにおいて,2,632発の単話者コーパスを計3時間で導入し,エンドツーエンドのテキスト・音声による最初の文書化研究である。
ネイティブスピーカーは、MOS、Nat-MOS、A-MOSを使用してシステムを評価した。MMS-TTSは3.80 +/- 0.63の最高MOSを達成し、より安定した長母音を生成するが、音節エラーは継続した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Efik, a tonal language spoken by about 3 million second language speakers and 1.5 million native speakers in Southeastern Nigeria, remains underrepresented in speech synthesis research. We present the first documented end-to-end text-to-speech study for Efik, introducing a curated single speaker corpus of 2,632 utterances totaling three hours and a comparative evaluation of four neural models (VITS, MMS-TTS, SpeechT5, and Orpheus-TTS) under low resource conditions. Native speakers evaluated the systems using MOS, Nat-MOS, and A-MOS. MMS-TTS achieved the highest MOS of 3.80 +/- 0.63 and produced more stable long form speech, though tonal errors persisted. Other models showed greater tonal and prosodic inconsistencies. These results provide a reproducible baseline and highlight the need for larger corpora and tone aware modeling for tonal African languages.
- Abstract(参考訳): ナイジェリア南東部で約300万の第二言語話者と150万の母国語話者によって話される声調言語であるEfikは、音声合成研究において未だに不足している。
本研究は,Efik における2,632発の1話者コーパスと4つのニューラルモデル (VITS, MMS-TTS, SpeechT5, Orpheus-TTS) の低資源環境下での比較評価を行った。
ネイティブスピーカーは、MOS、Nat-MOS、A-MOSを使用してシステムを評価した。
MMS-TTSは3.80 +/-0.63のMOSを達成し、より安定した長文音声を生成するが、音節エラーは継続した。
他のモデルでは、声調と韻律の矛盾が大きかった。
これらの結果は再現可能なベースラインを提供し、トーナルアフリカの言語に対するより大きなコーパスとトーンを意識したモデリングの必要性を強調している。
関連論文リスト
- Fine-Tuning Whisper for Automatic Speech Recognition in Baniwa: A Preliminary Study [0.0]
本研究は,バニワにおける音声認識のためのWhisperの適応に関する予備的研究である。
実験は言語文書プロジェクトから得られた手書き記録1,373枚のコーパスを用いて行った。
単語誤り率(WER)と文字誤り率(CER)を用いた教師付き学習を用いてWhisper Small Modelを微調整した。
論文 参考訳(メタデータ) (2026-08-26T17:29:47Z) - Ethio-ASR: Joint Multilingual Speech Recognition and Language Identification for Ethiopian Languages [24.06509721677588]
Ethio-ASRは5つのエチオピア語で共同で訓練された多言語CTCに基づく自動音声認識(ASR)モデルである。
これらの言語は、アフロアシア語族のセム語族、クシ語族、オマティック語族に属する。
我々は、最近リリースされたWAXALコーパス上で、事前訓練された音声エンコーダを用いてモデルを訓練し、強い多言語ベースラインに対して評価する。
論文 参考訳(メタデータ) (2026-03-24T18:55:45Z) - Bolbosh: Script-Aware Flow Matching for Kashmiri Text-to-Speech [2.00542420408131]
カシミリ語は700万人ほどが話しているが、音声技術には批判的だ。
Kashmiri用に設計された,オープンソースのニューラルネットワークシステムについて紹介する。
論文 参考訳(メタデータ) (2026-03-08T07:34:15Z) - An Initial Investigation of Language Adaptation for TTS Systems under Low-resource Scenarios [76.11409260727459]
本稿では,最近のSSLベースの多言語TSシステムであるZMM-TTSの言語適応性について検討する。
本研究では,事前学習言語と対象言語との音声学的な類似性が,対象言語の適応性能に影響を及ぼすことを示す。
論文 参考訳(メタデータ) (2024-06-13T08:16:52Z) - Textless Speech-to-Speech Translation With Limited Parallel Data [51.3588490789084]
PFBはテキストレスのS2STモデルをトレーニングするためのフレームワークで、数十時間の並列音声データしか必要としない。
3つのドメインで英語、ドイツ語、マラティー語、英語の翻訳をトレーニングし、評価する。
論文 参考訳(メタデータ) (2023-05-24T17:59:05Z) - Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers [92.55131711064935]
テキストから音声合成(TTS)のための言語モデリング手法を提案する。
具体的には、市販のニューラルオーディオモデルから派生した離散符号を用いて、ニューラルネットワークモデル(Vall-E)を訓練する。
Vall-Eは、コンテキスト内学習機能を導入し、高品質なパーソナライズされた音声の合成に使用できる。
論文 参考訳(メタデータ) (2023-01-05T15:37:15Z) - Towards Building Text-To-Speech Systems for the Next Billion Users [18.290165216270452]
そこで我々は,ドラヴィダ語とインド・アーリア語に対する音響モデル,ボコーダ,補足的損失関数,訓練スケジュール,話者および言語多様性の選択について検討した。
我々は,13言語を対象としたTSモデルをトレーニングし,評価し,各言語における既存のモデルを大幅に改善するモデルを見出した。
論文 参考訳(メタデータ) (2022-11-17T13:59:34Z) - SANE-TTS: Stable And Natural End-to-End Multilingual Text-to-Speech [0.3277163122167433]
SANE-TTS は安定かつ自然な多言語 TTS モデルである。
言語間合成における音声自然性を改善する話者正規化損失を導入する。
本モデルでは, 音源話者によらず, 適度なリズムの音声を生成する。
論文 参考訳(メタデータ) (2022-06-24T07:53:05Z) - SOMOS: The Samsung Open MOS Dataset for the Evaluation of Neural
Text-to-Speech Synthesis [50.236929707024245]
SOMOSデータセットは、単にニューラルテキスト音声(TTS)サンプルからなる最初の大規模平均世論スコア(MOS)データセットである。
パブリックドメイン音声データセットであるLJ音声の合成発話20Kから成っている。
論文 参考訳(メタデータ) (2022-04-06T18:45:20Z) - A Text-to-Speech Pipeline, Evaluation Methodology, and Initial
Fine-Tuning Results for Child Speech Synthesis [3.2548794659022398]
音声合成は、現在のTTS(text-to-speech)モデルが人間の自然な音声を生成できるようになったため、長い道のりを経ている。
本研究では,子どもの音声データセットを用いて,最先端のニューラルネットワークモデルを構築するためのトレーニングパイプラインを開発し,検証した。
論文 参考訳(メタデータ) (2022-03-22T09:34:21Z) - Towards Language Modelling in the Speech Domain Using Sub-word
Linguistic Units [56.52704348773307]
音節や音素を含む言語単位に基づくLSTMに基づく新しい生成音声LMを提案する。
限られたデータセットでは、現代の生成モデルで要求されるものよりも桁違いに小さいので、我々のモデルはバブリング音声を近似する。
補助的なテキストLM,マルチタスク学習目標,補助的な調音特徴を用いた訓練の効果を示す。
論文 参考訳(メタデータ) (2021-10-31T22:48:30Z) - AdaSpeech 3: Adaptive Text to Speech for Spontaneous Style [111.89762723159677]
AdaSpeech 3 は,順応性のある TTS システムである。
AdaSpeech 3は自然なFPとリズムを自発的なスタイルで合成し、従来の適応TSシステムよりもずっと優れたMOSとSMOSスコアを達成する。
論文 参考訳(メタデータ) (2021-07-06T10:40:45Z) - LRSpeech: Extremely Low-Resource Speech Synthesis and Recognition [148.43282526983637]
データコストの低い言語のためのTLSおよびASRシステムであるLSpeechを開発した。
実験言語(英語)と真の低リソース言語(リトアニア語)で実験を行い,LRSpeechの有効性を検証する。
現在、より稀な言語でTSをサポートするために、商用のクラウド音声サービスにLSpeechをデプロイしています。
論文 参考訳(メタデータ) (2020-08-09T08:16:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。