論文の概要: A Situational Speech Synthesizer for Yoruba: System Design, Phonological Rule Architecture, and Orthographic Extensions for Contour
- arxiv url: http://arxiv.org/abs/2607.18317v1
- Date: Fri, 17 Jul 2026 20:13:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.180583
- Title: A Situational Speech Synthesizer for Yoruba: System Design, Phonological Rule Architecture, and Orthographic Extensions for Contour
- Title(参考訳): ヨルバのための状況音声合成装置:システム設計、音韻規則アーキテクチャ、輪郭用オーソグラフィ拡張
- Authors: Kola Tubosun, Adedayo Oluokun, Hafiz Adewuyi, Dadepo Aderemi,
- Abstract要約: TTSYoruba(トゥスヨルバ)は、ヨルバの音声合成システムである。
このシステムは、音符入りのヨルバテキストを入力として取り、音声出力を生成する。
- 参考スコア(独自算出の注目度): 0.13999481573773073
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present TTSYoruba, a rule-based concatenative diphone speech synthesizer for Yoruba, deployed at online as part of the YorubaName.com open dictionary of Yoruba personal names. The system takes tone-marked Yoruba text as input and produces audio output by applying a hand-crafted phonological rule system to a recorded inventory of 651 diphone units spanning five tonal variants of every consonant-vowel combination in the language. We describe the phonological architecture of the system in detail, including our complete tonal file-selection logic, our treatment of the three-way nasal disambiguation problem (oral /n/, nasalized vowel, and syllabic nasal), and the derivation of contextual rising and falling tones from level-tone input. We also present, as an orthographic contribution, the adoption of the caron and circumflex, which are symbols with prior standing in Yoruba phonological transcription, as standard single-vowel contour tone markers, integrated into the TTS normalization pipeline and the WriteYoruba keyboard input tool. The system's performance was evaluated through a listener study (N=50), with detailed results on Mean Opinion Scores (MOS) presented in Section 6. Keywords: Yoruba, text-to-speech, low-resource languages, diphone synthesis, contour tones, African language NLP, rule-based synthesis
- Abstract(参考訳): 本稿では,Yoruba の個人名公開辞書である YorubaName.com の一部としてオンラインに展開した Yoruba 用の規則ベース連結ダイホン音声合成器 TTSYoruba を紹介する。
このシステムは、音符を印字した「よるば」テキストを入力として、音符と母音の組み合わせの5つの音節の変種にまたがる651のダイフォーンユニットに手作りの音韻規則システムを適用して、音声出力を生成する。
本稿では,全音節選択論理,三方向鼻音明瞭化問題(口頭/n/,鼻音化母音,音節化鼻音)の処理,音階音入力による文脈的上昇・下降音の導出など,システムの音韻的構造について詳述する。
また,正規化パイプラインとWriteYorubaキーボード入力ツールに組み込まれた標準単母音コンター音符マーカーとして,ヨルバ音韻転写に先行する記号であるCaronとcircflexの採用も,正書法的な寄与として提示した。
第6節で提示された平均オピニオンスコア(MOS)について,聴取者調査(N=50)により評価した。
キーワード:Yoruba, text-to-speech, low-resource Language, diphone synthesis, contour tone, African Language NLP, rule-based synthesis
関連論文リスト
- PSP: An Interpretable Per-Dimension Accent Benchmark for Indic Text-to-Speech [0.0]
音素置換プロファイル(Phonme Substitution Profile)は、Indic TTSの音素単位のアクセントベンチマークである。
PSPはアクセントを6つの相補的次元に分解する: 反射崩壊率(RR)、吸入フィデリティ(AF)、母音長フィデリティ(ZF)、フレシェオーディオ距離(FAD)、韻律的シグネチャディペンデンス(PSD)。
論文 参考訳(メタデータ) (2026-04-28T10:28:32Z) - VIBEVOICE-ASR Technical Report [95.57263110940973]
VibeVoice-ASRは、ロングフォームオーディオにおけるコンテキスト断片化とマルチスピーカー複雑性の課題に対処する。
50以上の言語をサポートし、明示的な言語設定を必要としない。
論文 参考訳(メタデータ) (2026-01-26T06:11:51Z) - LinTO Audio and Textual Datasets to Train and Evaluate Automatic Speech Recognition in Tunisian Arabic Dialect [0.9772968596463595]
本稿では,チュニジア・アラビア方言の音韻的・語彙的特徴を捉えたLinTOデータセットを提案する。
これらのデータセットには、さまざまなソースからのさまざまなテキストと、多様な話者を特徴とする実世界のオーディオサンプルが含まれている。
論文 参考訳(メタデータ) (2025-04-03T14:05:56Z) - Disambiguation of Chinese Polyphones in an End-to-End Framework with Semantic Features Extracted by Pre-trained BERT [81.99600765234285]
ポリフォニック文字の発音を予測するためのエンドツーエンドフレームワークを提案する。
提案手法は,Transformers(BERT)モデルとニューラルネットワーク(NN)に基づく分類器から,事前訓練された双方向エンコーダ表現からなる。
論文 参考訳(メタデータ) (2025-01-02T06:51:52Z) - Algorithms For Automatic Accentuation And Transcription Of Russian Texts In Speech Recognition Systems [0.0]
本稿では,ロシア語テキストの自動アクセント化と音韻転写のためのルールベースシステムの概要について述べる。
開発したシステムの2つの部分、アクセントと文字起こしは、入力句の正しい音韻表現を実現するために異なるアプローチを用いている。
開発ツールキットはPython言語で書かれており、興味のある研究者はGitHubからアクセスできる。
論文 参考訳(メタデータ) (2024-10-03T14:43:43Z) - Grammar Induction from Visual, Speech and Text [91.98797120799227]
本研究は、新しい視覚音声テキスト文法誘導タスク(textbfVAT-GI)を導入する。
言語文法がテキストを超えて存在するという事実に触発されて、テキストは文法帰納において支配的なモダリティであってはならないと論じる。
そこで本稿では,豊富なモーダル特化機能と補完機能を有効文法解析に活用した,ビジュアル・オーディオ・テキスト・インサイド・アウトサイド・オートエンコーダ(textbfVaTiora)フレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-01T02:24:18Z) - MUST&P-SRL: Multi-lingual and Unified Syllabification in Text and
Phonetic Domains for Speech Representation Learning [0.76146285961466]
言語特徴抽出の方法論として,複数の言語における単語の自動分割に着目した手法を提案する。
本手法は,テキストと音声の両領域において,テキストから音素の書き起こしを抽出すること,ストレスマーク,統合された自動音節分類に重点を置いている。
このシステムはオープンソースのコンポーネントとリソースで構築された。
論文 参考訳(メタデータ) (2023-10-17T19:27:23Z) - Differentiable Allophone Graphs for Language-Universal Speech
Recognition [77.2981317283029]
言語ユニバーサル音声認識システムを構築するには、言語間で共有可能な音声の音韻単位を生成する必要がある。
本稿では,音素転写と音声-音素マッピングのみから,音素レベルの監視を導出するための一般的な枠組みを提案する。
我々は,各言語に対する可読確率的音声-音素マッピングを用いた普遍的な電話ベース音声認識モデルを構築した。
論文 参考訳(メタデータ) (2021-07-24T15:09:32Z) - Automatic Speech Recognition in Sanskrit: A New Speech Corpus and
Modelling Insights [25.666767669695044]
サンスクリット語で表現される言語的特徴を忠実に捉えた78時間のASRデータセットをリリースする。
単語中の1つの母音から次の母音への文字列をキャプチャする,音節レベルの単位選択にインスパイアされた新しいモデリング単位を提案する。
我々はこれらの知見をサンスクリットASRから拡張し、他の2つのIndic言語であるGujaratiとTeluguでASRシステムを構築する。
論文 参考訳(メタデータ) (2021-06-02T18:06:32Z) - Phoneme Recognition through Fine Tuning of Phonetic Representations: a
Case Study on Luhya Language Varieties [77.2347265289855]
音韻アノテーションに基づく多言語認識手法であるAllosaurus を用いた音素認識に焦点を当てた。
挑戦的な実世界シナリオで評価するために,我々は,ケニア西部とウガンダ東部のluhya言語クラスタの2つの種類であるbukusuとsaamiaの音声認識データセットをキュレートした。
私たちは、アロサウルスの微調整がわずか100発話であっても、電話のエラー率を大幅に改善することが分かりました。
論文 参考訳(メタデータ) (2021-04-04T15:07:55Z) - AlloVera: A Multilingual Allophone Database [137.3686036294502]
AlloVeraは、218のアロフォンから14言語のための音素へのマッピングを提供する。
我々は、AlloVeraで構築された「ユニバーサル」アロフォンモデルであるAllosaurusが、音声書き起こしタスクにおいて「ユニバーサル」音声モデルと言語特化モデルより優れていることを示す。
論文 参考訳(メタデータ) (2020-04-17T02:02:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。