論文の概要: The ÌròyìnSpeech Text Corpus: 24,905 Curated Yorùbá Sentences for Speech and Language Technology
- arxiv url: http://arxiv.org/abs/2610.05366v2
- Date: Tue, 06 Oct 2026 19:02:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.415916
- Title: The ÌròyìnSpeech Text Corpus: 24,905 Curated Yorùbá Sentences for Speech and Language Technology
- Title(参考訳): 24,905 音声・言語技術のためのヨールバー文の定式化
- Abstract要約: rynSpeechは42時間80スピーカーのYorb読み取り音声コーパスで、オーディオは2024年からELRAによって配布されている。
本稿は,24,905の独特な,手書きの,ヨルブの音調マーク付き文について述べる。
- 参考スコア(独自算出の注目度): 7.558006174663938
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: ÌròyìnSpeech is a 42-hour, 80-speaker Yorùbá read-speech corpus whose audio has been distributed by ELRA since 2024. This paper describes the release of its text component: 24,905 unique, hand-verified, tone-marked Yorùbá sentences (275,897 tokens; 15,687 types), curated in 2022 as recording prompts. Roughly 11,000 sentences were adapted from openly licensed news material; the remainder were written in-house to broaden coverage beyond the religious translation that dominates existing Yorùbá corpora. Every sentence was checked by hand for tone-mark accuracy, edited for read-aloud clarity and a neutral register, and localised so that non-Yorùbá personal and place names appear in Yorùbá form. Preparing the text for release surfaced systematic Unicode normalisation failures affecting more than 60% of lines (with precomposed and decomposed forms of the same letter co-occurring within single sentences) which we document and correct. The corpus supports diacritic restoration, grapheme-to-phoneme conversion, TTS front-end development and orthographic research, and serves as a validated prompt set for new recording.
- Abstract(参考訳): シュルィン・スペーチは、2024年からELRAが音声を配布している42時間80スピーカーのヨルバー・リード・スペーチ・コーパスである。
本論文では,2022年に録音プロンプトとしてキュレートされた24,905個,手検証,音符マーク付きヨルバ文(275,897トークン,15,687タイプ)のテキストコンポーネントのリリースについて述べる。
約11,000の文が公開ライセンスのニュース素材から翻訳され、残りは、既存のヨルバ・コーポラを支配している宗教翻訳を超えてカバー範囲を広げるために、社内で書かれた。
全ての文は音符の正確さを手作業でチェックし、読み書きの明快さと中性レジスターを編集し、非ヨルバの個人名と地名がヨルバの形で現れるように局所化した。
リリースのためのテキストを作成すると、私たちが文書化して修正した60%以上の行(同じ文で共起する同じ文字の事前および分解形式を含む)に影響を及ぼす、体系的なUnicode正規化の失敗が表面化した。
コーパスは、ダイアクリティカルな復元、グラファイムから音素への変換、TSフロントエンド開発および正書法研究をサポートし、新しい録音のための検証されたプロンプトセットとして機能する。
関連論文リスト
- BanglaKontho: Closing the Long-Form Gap in Bangla Text-to-Speech [0.0]
パブリックバングラ音声コーパスは、音声認識のために収集された短い読み上げ音声によって支配される。
専門的なオーディオブックの録音から20時間のTTSコーパスであるBanglaKonthoを提示する。
論文 参考訳(メタデータ) (2026-09-24T07:24:01Z) - NADI 2026: The Second Multidialectal Arabic Speech Processing Shared Task [58.96707725438922]
自動音声認識(ASR)、音声対話識別(SDID)、テキスト音声翻訳(TTS)、音声言語翻訳(SLT)、音声言語理解(SLU)の5つのタスクと8つのサブタスクからなる。
Nadir 2026は、低帯域幅、混合ダイアレクト、コードスイッチ、アウト・オブ・ドメイン、ゼロショット設定による現実的な評価を強調している。
論文 参考訳(メタデータ) (2026-09-22T21:37:54Z) - Open Korean Historical Corpus: A Millennia-Scale Diachronic Collection of Public Domain Texts [52.754009498236684]
我々は1,300年と6つの言語からなるデータセットであるOpen Korean Historical Corpusを紹介した。
このコーパスには7世紀から2025年までの19の資料から1800万の文書と50億のトークンが含まれている。
この研究は、韓国語の歴史を捉えることで、量的二時間分析の基盤となる資源を提供する。
論文 参考訳(メタデータ) (2025-10-28T15:43:26Z) - VoiceBank-2023: A Multi-Speaker Mandarin Speech Corpus for Constructing
Personalized TTS Systems for the Speech Impaired [2.0769413971386723]
台湾は2020年にVoiceBankingプロジェクトを開始し、筋萎縮性側索硬化症患者にパーソナライズされたマンダリンTSシステムを提供するための完全なサービスセットを構築した。
本稿では, コーパス設計, コーパス記録, データ浄化, コーパスの補正, および, 開発したパーソナライズ TTS システムの評価について報告する。
論文 参考訳(メタデータ) (2023-08-27T07:35:30Z) - SeamlessM4T: Massively Multilingual & Multimodal Machine Translation [90.71078166159295]
音声から音声への翻訳,音声からテキストへの翻訳,テキストからテキストへの翻訳,最大100言語の自動音声認識をサポートする単一モデルSeamlessM4Tを紹介する。
我々は、音声とテキストの両方に英語を翻訳できる最初の多言語システムを開発した。
FLEURSでは、SeamlessM4Tが複数のターゲット言語への翻訳の新しい標準を設定し、音声からテキストへの直接翻訳において、以前のSOTAよりも20%BLEUの改善を実現している。
論文 参考訳(メタデータ) (2023-08-22T17:44:18Z) - ÌròyìnSpeech: A multi-purpose Yorùbá Speech Corpus [7.97238074132292]
IroyinSpeechは、高品質で現代のヨルブの音声データの量を増やしたいという願望に影響された新しいコーパスである。
オープン・ライセンスCC-BY-4.0でニュース・クリエイティブ・ライティング・ドメインから約23,000のテキストをキュレートした。
論文 参考訳(メタデータ) (2023-07-29T20:42:50Z) - BibleTTS: a large, high-fidelity, multilingual, and uniquely African
speech corpus [7.050790497916012]
BibleTTSは、サハラ以南のアフリカで話されている10の言語のための、大規模で高品質でオープンな音声データセットである。
コーパスは最大86時間、スタジオ品質48kHzのシングルスピーカーを言語ごとに記録する。
論文 参考訳(メタデータ) (2022-07-07T19:35:43Z) - GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of
Transcribed Audio [88.20960848885575]
GigaSpeechは英語の多分野音声認識コーパスで、教師あり訓練に適した高品質なラベル付きオーディオが1万時間ある。
約4万時間の音声が、まずオーディオブック、ポッドキャスト、YouTubeから収集され、読み書きと自発的な話し方の両方をカバーする。
システムトレーニングのために、GigaSpeechは10h, 250h, 1000h, 2500h, 10000hの5つのサブセットを提供する。
論文 参考訳(メタデータ) (2021-06-13T04:09:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。