論文の概要: GRAFT: Grafted Reference Audio for Fine-grained Pronunciation in Zero-shot Text-to-Speech
- arxiv url: http://arxiv.org/abs/2607.02633v1
- Date: Thu, 02 Jul 2026 14:40:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.374495
- Title: GRAFT: Grafted Reference Audio for Fine-grained Pronunciation in Zero-shot Text-to-Speech
- Title(参考訳): GRAFT:ゼロショット音声音声におけるきめ細かい発音のための参照オーディオ
- Abstract要約: 本稿では,テキストから音声へのニューラル言語モデリングのための単語単位の発音条件付け機構であるGRAFTを提案する。
GRAFTは、選択された単語の発音を短い音声サンプルから制御し、モデル独自の音声トークンを符号化する。
5言語の客観的ベンチマークでは、GRAFTは同じテキストのみのバックボーンに対してターゲット単語の音素誤り率を22~39%削減する。
- 参考スコア(独自算出の注目度): 0.21173245847195934
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present GRAFT, a per-word pronunciation conditioning mechanism for text-to-speech neural codec language modeling. Existing systems reach high intelligibility and naturalness but inherit the ambiguity of text and mispronounce rare proper nouns, loanwords and technical terms. Even phoneme-conditioned models offer no direct acoustic handle for per-word pronunciation. GRAFT controls the pronunciation of a chosen word from a short spoken sample of it, encoded with the model's own speech tokenizer and bound to the word's position in the prompt. Voice conversion during training-data construction disentangles the hint speaker from the target speaker, so the hint may come from any voice while the output stays in the target voice. In a blind English listening study, human raters rank GRAFT first by a clear margin, judging its rendering of the difficult word closest to a reference recording of that word. On a five-language objective benchmark, GRAFT reduces target-word phoneme error rate by 22-39% over the identical text-only backbone and outperforms competitive open-source zero-shot systems, both phoneme- and text-conditioned, on target-word pronunciation, while preserving speaker similarity and naturalness.
- Abstract(参考訳): 本稿では,テキストから音声へのニューラルコーデック言語モデリングのための単語単位の発音条件付け機構であるGRAFTを提案する。
既存のシステムは高い知性と自然性に達するが、テキストの曖昧さを継承し、希少な固有名詞、借用語、技術的用語を誤認する。
音素条件付きモデルでさえ、単語ごとの発音を直接音響ハンドルは提供しない。
GRAFTは、選択された単語の発音を短い音声サンプルから制御し、モデル自身の音声トークン化器でエンコードし、プロンプト中の単語の位置にバインドする。
訓練データ構築中の音声変換は、ターゲット話者からヒント話者を遠ざけるので、出力がターゲット音声に留まっている間、ヒントは任意の音声から来る可能性がある。
ブラインド・イングリッシュ・リスニング・スタディでは、人間のラッカーはまずGRAFTを明確なマージンでランク付けし、その単語の参照記録に最も近い難解な単語の描画を判断した。
GRAFTは、ターゲット単語の音素誤り率を、同一のテキストのみのバックボーンよりも22~39%削減し、ターゲット単語の発音において、音素とテキスト条件の両方で競合するオープンソースゼロショットシステムより優れており、話者の類似性と自然性を保っている。
関連論文リスト
- KIT's Submission to Cross-Lingual Voice Cloning in IWSLT 2026 [61.29502937013759]
言語間音声のクローニングは、ソース言語参照から話者識別を保ちながら、ターゲット言語で音声を生成することを目的としている。
鍵となる課題は、アクセントの変化とドメイン固有の語彙の存在において、知性と自然性を維持することである。
我々は、多言語テキスト音声モデル、FishAudio-S2-Proを構築し、言語制御を改善しアクセントリークを低減するために、言語タグプロンプトを導入する。
論文 参考訳(メタデータ) (2026-06-05T13:09:21Z) - Syllabic-Structure Decoder for Automatic Speech Recognition in Vietnamese [8.447993256993428]
我々はベトナム語の特徴から、ASRのためのSyllabic-Structure Decoderを提案する。
提案手法では,音節の音韻的構成を明示的に把握し,コンパクトな音韻インベントリから有効な音節構造をデコーダで生成する。
論文 参考訳(メタデータ) (2026-05-27T02:51:09Z) - Pronunciation Deviation Analysis Through Voice Cloning and Acoustic Comparison [1.6710607386696872]
発声音声と発声音声の最大音響偏差は誤認識の可能性を示唆している。
提案手法は, ユーザの音声を適切な発音で合成し, フレーム単位の比較を行い, 問題セグメントを特定する。
論文 参考訳(メタデータ) (2025-07-15T04:58:19Z) - Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation [4.314729314139958]
音声と韻律のラベルを与えられた音声と音声のペアにアノテートする方法を提案する。
音韻ラベリングにおける誤りの訂正に辞書事前知識を用いた復号方式を用いる。
提案手法を用いてアノテートしたラベルで訓練したTTSモデルにより合成された音声の自然性は,手動のアノテーションで訓練したモデルに匹敵することを示す。
論文 参考訳(メタデータ) (2025-06-09T11:10:24Z) - Towards Unsupervised Speech Recognition Without Pronunciation Models [57.222729245842054]
本稿では,ペア音声とテキストコーパスを使わずにASRシステムを開発するという課題に取り組む。
音声合成とテキスト・テキスト・マスクによるトークン埋込から教師なし音声認識が実現可能であることを実験的に実証した。
この革新的なモデルは、レキシコンフリー環境下での以前の教師なしASRモデルの性能を上回る。
論文 参考訳(メタデータ) (2024-06-12T16:30:58Z) - VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment [101.2489492032816]
VALL-E Rは、堅牢で効率的なゼロショットテキスト音声合成システムである。
この研究は、失語症に罹患した人々のためのスピーチの作成を含む有意義なプロジェクトに適用される可能性がある。
論文 参考訳(メタデータ) (2024-06-12T04:09:44Z) - Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec
Language Modeling [92.55131711064935]
本稿では,言語間音声合成のための言語間ニューラルネットワークモデル VALL-E X を提案する。
VALL-E Xは、強い文脈内学習能力を継承し、ゼロショット言語間テキスト音声合成やゼロショット音声音声音声翻訳タスクに応用できる。
未知の話者の声、感情、音響環境を保ちながら、ソース言語の1つの発話をプロンプトとして、ターゲット言語で高品質な音声を生成することができる。
論文 参考訳(メタデータ) (2023-03-07T14:31:55Z) - SoundChoice: Grapheme-to-Phoneme Models with Semantic Disambiguation [10.016862617549991]
本稿では,単語レベルで操作するのではなく文全体を処理可能な新しいGrapheme-to-Phoneme(G2P)アーキテクチャであるSoundChoiceを提案する。
SoundChoiceは、LibriSpeechとWikipediaのデータを用いて全文の書き起こしで2.65%のPhoneme Error Rate(PER)を達成する。
論文 参考訳(メタデータ) (2022-07-27T01:14:59Z) - Wav2Seq: Pre-training Speech-to-Text Encoder-Decoder Models Using Pseudo
Languages [58.43299730989809]
本稿では,音声データに対するエンコーダ・デコーダモデルの両部分を事前学習するための,最初の自己教師型アプローチであるWav2Seqを紹介する。
我々は、コンパクトな離散表現として擬似言語を誘導し、自己教師付き擬似音声認識タスクを定式化する。
このプロセスは独自のものであり、低コストの第2段階のトレーニングとして適用することができる。
論文 参考訳(メタデータ) (2022-05-02T17:59:02Z) - Zero-Shot Text-to-Speech for Text-Based Insertion in Audio Narration [62.75234183218897]
話者の訓練データなしで自然かつ一貫性のあるターゲット音声を生成する一段階の文脈認識フレームワークを提案する。
変換器をベースとしたデコーダを用いて,編集音声のメルスペクトルを生成する。
これは最近のゼロショット TTS エンジンを大きなマージンで上回っている。
論文 参考訳(メタデータ) (2021-09-12T04:17:53Z) - STEPs-RL: Speech-Text Entanglement for Phonetically Sound Representation
Learning [2.28438857884398]
本稿では、音声とテキストの絡み合いを利用して単語表現を学習する、新しいマルチモーダルディープニューラルネットワークアーキテクチャを提案する。
STEPs-RLは、対象の音声単語の音声シーケンスを予測するために教師付き方法で訓練される。
我々のモデルにより生成された潜在表現は、89.47%の精度でターゲット音素列を予測することができた。
論文 参考訳(メタデータ) (2020-11-23T13:29:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。