論文の概要: Scaling phoneme-based TTS augmentation for ASR: A unified pipeline and controlled study
- arxiv url: http://arxiv.org/abs/2608.26697v1
- Date: Thu, 27 Aug 2026 06:53:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.27862
- Title: Scaling phoneme-based TTS augmentation for ASR: A unified pipeline and controlled study
- Title(参考訳): ASRのための音素ベースTS拡張のスケーリング:統一パイプラインと制御された研究
- Abstract要約: スクラッチからトレーニングした多言語TSモデルを中心に構築した,音素ベースTTS-to-ASR拡張パイプラインを提案する。
このパイプラインは、言語固有のGrapheme-to-phoneme変換、参照音声フィルタリング、候補テキストの選択、合成、マッチしたASR継続を組み合わせている。
- 参考スコア(独自算出の注目度): 8.990924552624199
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Synthetic speech provides scalable supervision for automatic speech recognition (ASR), but its benefit depends on the selected texts, reference speech, and amount of synthesized data. We present a unified phoneme-based TTS-to-ASR augmentation pipeline built around a multilingual TTS model trained from scratch using the F5-TTS architecture with language-ID conditioning. The pipeline combines language-specific grapheme-to-phoneme conversion, reference-speech filtering, candidate-text selection, synthesis, and matched ASR continuation. We further propose phoneme-frequency-guided selection (PFGS), which ranks candidate sentences using phoneme frequencies estimated from real ASR training labels. Experiments with separate monolingual ASR systems for Arabic, French, Italian, and Portuguese span 13 test sets. Across the synthesis-scale sweep, random augmentation improves over matched real-only continuation on 11 test sets. Under a nominal 60% synthesis budget, PFGS improves over real-only training on 12 test sets and over random selection on 9. Its largest relative word error rate (WER) reduction against random selection is 19.3%. With target texts and synthesis counts fixed, reference-speech filtering reduces absolute WER by 0.29 and 0.59 points on Italian and French Common Voice, respectively. These results identify synthesis scale, candidate-text content, and reference quality as important control variables in TTS-based ASR augmentation.
- Abstract(参考訳): 合成音声は、自動音声認識(ASR)のためのスケーラブルな監視を提供するが、その利点は、選択されたテキスト、参照音声、合成データの量に依存する。
我々は,言語ID条件付きF5-TTSアーキテクチャを用いて,スクラッチから学習した多言語TSモデルを中心に構築された統一音素ベースTTS-to-ASR拡張パイプラインを提案する。
このパイプラインは、言語固有のGrapheme-to-phoneme変換、参照音声フィルタリング、候補テキストの選択、合成、マッチしたASR継続を組み合わせている。
さらに、実ASR学習ラベルから推定される音素周波数を用いて、候補文をランク付けする音素周波数誘導選択(PFGS)を提案する。
アラビア語、フランス語、イタリア語、ポルトガル語の単言語ASRシステムによる実験は、13の試験セットにまたがる。
合成スケールのスイープ全体にわたって、ランダムな拡張は11のテストセットで一致した実数のみの継続よりも改善される。
名目上の60%の合成予算の下では、PFGSは12のテストセットのリアルタイムトレーニングと9.0のランダムセレクションよりも改善されている。
ランダム選択に対する最大の相対単語誤り率(WER)は19.3%である。
ターゲットテキストと合成数が固定されているため、参照音声フィルタリングは、イタリア語とフランス語でそれぞれ0.29点と0.59点の絶対WERを減少させる。
これらの結果は、TSベースのASR拡張における重要な制御変数として、合成スケール、候補テキスト内容、参照品質を同定する。
関連論文リスト
- VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement Learning-Based Test-Time Adaptation [35.0242994611344]
VoiceTTAは、事前訓練されたゼロショットTSモデルの音声模倣を改善する強化学習ベースのテスト時間適応(TTA)手法である。
実験は、一般的でない音声のプロンプトを大幅に改善し、最先端のベースラインを上回った。
論文 参考訳(メタデータ) (2026-06-25T02:18:24Z) - Improving Code-Switching Speech Recognition with TTS Data Augmentation [58.34842693152991]
本稿では,この不足に対処する効果的なデータ拡張手法として,多言語テキスト音声(TTS)モデルについて検討する。
我々は、SEAMEデータセット上の多言語CosyVoice2 TTSモデルを微調整し、中国語と英語の合成音声を生成する。
論文 参考訳(メタデータ) (2026-01-02T10:11:51Z) - A Self-Refining Framework for Enhancing ASR Using TTS-Synthesized Data [46.73430446242378]
本稿では,ラベルのないデータセットのみを用いて,ASR性能を向上させる自己精錬フレームワークを提案する。
台湾語マンダリン音声における枠組みの有効性を実証する。
論文 参考訳(メタデータ) (2025-06-10T17:30:32Z) - Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM [48.71951982716363]
テキスト音声合成(TTS)モデルは自動音声認識(ASR)システムを強化するために広く採用されている。
我々は,大規模言語モデル(LLM)と高度なゼロショットTSを利用する新しいASRデータ拡張手法であるHard-Synthを提案する。
我々のアプローチでは、追加のテキストデータに頼ることなく、書き直しによる多様なドメイン内テキストを生成するためにLLMを用いる。
論文 参考訳(メタデータ) (2024-11-20T09:49:37Z) - Towards Selection of Text-to-speech Data to Augment ASR Training [20.115236045164355]
ニューラルネットワークをトレーニングして、合成データの実際の音声との類似性を計測する。
音声認識性能を高めるためには, 実音声とはかなりの相似性を持つ合成サンプルを組み込むことが重要である。
論文 参考訳(メタデータ) (2023-05-30T17:24:28Z) - Code-Switching Text Generation and Injection in Mandarin-English ASR [57.57570417273262]
業界で広く使われているストリーミングモデルTransformer-Transducer(T-T)の性能向上のためのテキスト生成とインジェクションについて検討する。
まず、コードスイッチングテキストデータを生成し、テキスト-to-Speech(TTS)変換または暗黙的に音声とテキストの潜在空間を結び付けることによって、T-Tモデルに生成されたテキストを明示的に注入する戦略を提案する。
実際のマンダリン・イングリッシュ音声の1,800時間を含むデータセットを用いて訓練したT-Tモデルの実験結果から,生成したコードスイッチングテキストを注入する手法により,T-Tモデルの性能が著しく向上することが示された。
論文 参考訳(メタデータ) (2023-03-20T09:13:27Z) - When Is TTS Augmentation Through a Pivot Language Useful? [26.084140117526488]
我々は,高出力のピボット言語のための訓練されたTSシステムを用いて,ターゲット言語からテキストを実行することによって,合成音声を生成することを提案する。
数千の合成TSテキスト音声ペアを使用し、実際のデータを複製して最適な結果を得る。
これらの発見の応用は、2つの低リソース言語に対してそれぞれ64.5%と45.0%の文字誤り低減率(CERR)を改善する。
論文 参考訳(メタデータ) (2022-07-20T13:33:41Z) - LRSpeech: Extremely Low-Resource Speech Synthesis and Recognition [148.43282526983637]
データコストの低い言語のためのTLSおよびASRシステムであるLSpeechを開発した。
実験言語(英語)と真の低リソース言語(リトアニア語)で実験を行い,LRSpeechの有効性を検証する。
現在、より稀な言語でTSをサポートするために、商用のクラウド音声サービスにLSpeechをデプロイしています。
論文 参考訳(メタデータ) (2020-08-09T08:16:33Z) - You Do Not Need More Data: Improving End-To-End Speech Recognition by
Text-To-Speech Data Augmentation [59.31769998728787]
我々は、ASRトレーニングデータベース上にTSシステムを構築し、合成音声でデータを拡張し、認識モデルを訓練する。
テストクリーンはWER 4.3%,他のテストクリーンは13.5%で、このシステムはLibriSpeechトレインクリーン100で訓練されたエンドツーエンドASRの競争結果を確立している。
論文 参考訳(メタデータ) (2020-05-14T17:24:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。