論文の概要: Deterministic Prompting for Speaker-Stable Low-Resource Greek TTS
- arxiv url: http://arxiv.org/abs/2609.10022v1
- Date: Wed, 09 Sep 2026 10:55:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.99587
- Title: Deterministic Prompting for Speaker-Stable Low-Resource Greek TTS
- Title(参考訳): 話者安定型低電源型ギリシャTTSのための決定論的プロンプト
- Abstract要約: 現代のTSシステムは、高リソース言語では人間の品質にアプローチするが、クリーンな音声データが不足すると劣化する。
本稿では、オーディオブックをWhisperXアライメントとフィルタリングによりTS対応データに変換するデータキュレーション手法を提案する。
ギリシャ語に転送可能な事前学習を符号化したプロンプトベースの多言語モデルであるParler-TTS (880M) を微調整する。
- 参考スコア(独自算出の注目度): 43.77306988076469
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern TTS systems approach human quality for high-resource languages but degrade when clean speech data is scarce. Modern Greek exemplifies this, lacking the curated corpora behind state-of-the-art synthesis. We propose a data curation recipe that transforms audiobook recordings into TTS-ready data via WhisperX alignment and filtering. Then we fine-tune Parler-TTS (880M), a prompt-based multilingual model whose pre-training encodes phonetic priors transferable to Greek. During development, we find that LLM-generated style prompts introduce speaker drift at inference. Replacing them with deterministic prompts resolves this, and a speaker-specific LoRA stage trained on 3.5 h of single-speaker data anchors identity while updating ~5% of parameters. Our system achieves WER 10.7% (2.9 above the ASR floor), MOS-I 4.00 (vs. 4.36 human speech), and near-human speaker consistency (MOS-C 4.24 vs. 4.30), showing that robust single-speaker Greek TTS is achievable with limited curated data.
- Abstract(参考訳): 現代のTSシステムは、高リソース言語では人間の品質にアプローチするが、クリーンな音声データが不足すると劣化する。
現代のギリシアの例は、最先端の合成の背後にある硬化したコーパスを欠いている。
本稿では、オーディオブックをWhisperXアライメントとフィルタリングによりTS対応データに変換するデータキュレーション手法を提案する。
次に,ギリシャ語に転送可能な事前学習を符号化したプロンプトベース多言語モデルであるParler-TTS (880M) を微調整する。
開発中、LLM生成スタイルは、推論時に話者のドリフトを誘導する。
決定論的プロンプトで置き換えることでこれを解決し、単一話者データの3.5hで訓練された話者固有のLoRAステージは、パラメータの約5%を更新しながらアイデンティティをアンカーする。
我々のシステムは、WER 10.7% (ASRフロアより2.9)、MOS-I 4.00 (vs. 4.36)、MOS-C 4.24 vs. 4.30)、およびほぼ人間に近い話者整合性(MOS-C 4.24 vs. 4.30)を達成した。
関連論文リスト
- Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder [14.769480661437774]
14言語をサポートするゼロショット音声合成システムConfucius4-TTSを提案する。
音声プロンプトの書き起こしを必要とせず、言語内および言語間参照クローンを実行する。
公開ベンチマークにおいて高い知性と話者類似性を実現する。
論文 参考訳(メタデータ) (2026-08-12T04:48:29Z) - ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis [3.763275651955603]
既存のペルシア語のデータセットは、典型的には英語のデータセットよりも小さい。
ParsVoice はペルシャ語で最大の音声コーパスで、テキストから音声への応用に特化して設計された。
論文 参考訳(メタデータ) (2025-10-12T19:33:11Z) - Enhancing the Stability of LLM-based Speech Generation Systems through
Self-Supervised Representations [14.437646262239612]
自己教師型音声変換(VC)アーキテクチャは、話者IDや記録条件などの定常的な特徴とは独立して、コンテンツなどのトランジッショナルな特徴を符号化し、話者不整合表現を作成するために使用することができる。
テキスト・トゥ・スポーチ(TTS)のためのLLMの訓練に話者区別符号を使用すると、LLMは人間と同様にテキストからのみ音声の内容とスタイルを生成することができ、一方、話者識別はVCモデルのデコーダによって提供される。
結果から,LLMの自己教師表現による訓練が4.7ppの改善をもたらすことが明らかとなった。
論文 参考訳(メタデータ) (2024-02-05T15:08:19Z) - Rapid Speaker Adaptation in Low Resource Text to Speech Systems using
Synthetic Data and Transfer learning [6.544954579068865]
本稿では,高ソース言語データと合成データを用いたトランスファー学習手法を提案する。
我々は、低リソースのインドのヒンディー語で高品質な単一話者TSシステムの訓練に3段階のアプローチを採用する。
論文 参考訳(メタデータ) (2023-12-02T10:52:00Z) - SeamlessM4T: Massively Multilingual & Multimodal Machine Translation [90.71078166159295]
音声から音声への翻訳,音声からテキストへの翻訳,テキストからテキストへの翻訳,最大100言語の自動音声認識をサポートする単一モデルSeamlessM4Tを紹介する。
我々は、音声とテキストの両方に英語を翻訳できる最初の多言語システムを開発した。
FLEURSでは、SeamlessM4Tが複数のターゲット言語への翻訳の新しい標準を設定し、音声からテキストへの直接翻訳において、以前のSOTAよりも20%BLEUの改善を実現している。
論文 参考訳(メタデータ) (2023-08-22T17:44:18Z) - Few-Shot Cross-Lingual TTS Using Transferable Phoneme Embedding [55.989376102986654]
本稿では,言語間テキスト-音声間問題に対処するための移動可能な音素埋め込みフレームワークについて,数ショット設定で検討する。
本稿では,音素ベースのTSモデルと,異なる言語からの音素を学習潜在空間に投影するコードブックモジュールからなるフレームワークを提案する。
論文 参考訳(メタデータ) (2022-06-27T11:24:40Z) - AdaSpeech 4: Adaptive Text to Speech in Zero-Shot Scenarios [143.47967241972995]
高品質音声合成のためのゼロショット適応型TSシステムであるAdaSpeech 4を開発した。
話者特性を体系的にモデル化し、新しい話者の一般化を改善する。
微調整なしでは、AdaSpeech 4は複数のデータセットのベースラインよりも声質と類似性が向上する。
論文 参考訳(メタデータ) (2022-04-01T13:47:44Z) - Textless Speech-to-Speech Translation on Real Data [49.134208897722246]
本研究では、ある言語から別の言語への翻訳が可能なテキストなし音声音声翻訳システム(S2ST)を提案する。
マルチ話者ターゲット音声をモデル化し、実世界のS2STデータを用いてシステムを訓練する際の課題に対処する。
論文 参考訳(メタデータ) (2021-12-15T18:56:35Z) - Learning Speaker Embedding from Text-to-Speech [59.80309164404974]
我々は,エンドツーエンドのTacotron 2 TTSと話者埋め込みネットワークを,自己指導型で共同で訓練した。
本研究は,手書き文字とASR書き起こし文字のトレーニングについて検討した。
教師なしTS埋め込みは、LibriTTSデータセットのi-vectorに関して、EERを2.06%改善した。
論文 参考訳(メタデータ) (2020-10-21T18:03:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。