論文の概要: DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech
- arxiv url: http://arxiv.org/abs/2607.04140v1
- Date: Sun, 05 Jul 2026 06:45:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.838439
- Title: DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech
- Title(参考訳): DELTA-TTS:テキストから音声への拡散言語モデルへの自己回帰モデルの適用
- Authors: Junwon Moon, Seungbeom Kim, Yejin Lee, Hoseong Ahn, Sewoong Park, Heeseung Kim, Kyuhong Shim,
- Abstract要約: 自動回帰(AR)テキスト音声合成(TTS)モデルは、個別の音声トークンを逐次生成し、推論を遅くし、局所的な誤りや幻覚を伝播することによって堅牢性を低下させることができる。
本稿では,DELTA-TTSを提案する。DELTA-TTSは,事前訓練されたAR TTSモデルを離散拡散言語モデル(dLLM)に変換する軽量なLoRAベースの適応フレームワークである。
DELTA-TTSは、音声の局所構造をより正確に把握するために、局所音響コンテキストを注入する畳み込みモジュールと、1/t$重み付きトレーニング目標と時間シフト推論スケジュールを組み込んだ。
- 参考スコア(独自算出の注目度): 15.682357754148548
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Autoregressive (AR) text-to-speech (TTS) models generate discrete speech tokens sequentially, which makes inference slow and can degrade robustness by propagating local errors and hallucinations. This limitation stems from their left-to-right AR commitment: each token must be determined before future speech-token context is available. However, such ordering is not an inherent requirement for TTS, as the full input text is available before synthesis. In this paper, we introduce DELTA-TTS, a lightweight LoRA-based adaptation framework that converts a pretrained AR TTS model into a discrete diffusion language model (dLLM) for confidence-ordered speech-token decoding. To better capture the local structure of speech, DELTA-TTS incorporates a convolution module that injects local acoustic context, together with a $1/t$-weighted training objective and a time-shifted inference schedule that defer low-confidence positions to later steps. Trained on only $585$ hours of LibriTTS, DELTA-TTS achieves a $\textbf{1.75}\%$ WER on Seed-TTS test-en, outperforming its AR backbone while generating tokens $\textbf{3.3}\times$ faster. Further analysis shows that DELTA-TTS produces sharper text--speech alignment, increases overall decoding confidence, and mitigates hallucinations observed in AR generation.
- Abstract(参考訳): 自動回帰(AR)テキスト音声合成(TTS)モデルは、個別の音声トークンを逐次生成し、推論を遅くし、局所的な誤りや幻覚を伝播することによって堅牢性を低下させることができる。
この制限は、左から右へのARコミットメントに起因している: 各トークンは、将来の音声認識コンテキストが利用可能になる前に決定されなければならない。
しかし、このような順序付けはTSに固有の要件ではなく、完全な入力テキストは合成前に利用可能である。
本稿では,DELTA-TTSについて紹介する。DELTA-TTSは,事前訓練されたAR TTSモデルを,信頼順序付き音声音声の復号化のための離散拡散言語モデル(dLLM)に変換する軽量なLoRAベースの適応フレームワークである。
DELTA-TTSは、音声の局所構造をより正確に把握するために、局所音響コンテキストを注入する畳み込みモジュールと、1/t$のトレーニング目標と、低信頼位置を後段に遅延させる時間シフト推論スケジュールを組み込んでいる。
わずか585ドルのLibriTTSでトレーニングされたDELTA-TTSは、Seed-TTS test-enで$\textbf{1.75}\%$ WERを達成し、トークンを$\textbf{3.3}\times$高速に生成しながら、ARバックボーンのパフォーマンスを向上した。
さらに分析したところ、DELTA-TTSはよりシャープなテキストアライメントを生成し、全体的な復号性を高め、AR生成で観察される幻覚を緩和することが示された。
関連論文リスト
- Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis [64.12708207721276]
本稿では,AR と NAR を統一した新しい擬似自己回帰(PAR)言語モデリング手法を提案する。
PAR 上に構築した PALLE は 2 段階の TTS システムであり, PAR を初期生成に利用し, NAR を改良する。
実験では、LibriTTSでトレーニングされたPALLEが、大規模データでトレーニングされた最先端システムを上回っていることが示された。
論文 参考訳(メタデータ) (2025-04-14T16:03:21Z) - DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors [8.419383213705789]
本稿では,Diffusion Transformer (DiT) ベースのTSモデルであるDiTTo-TTSを導入し,LDMベースのTSがドメイン固有の要因を伴わずに最先端の性能を達成できるかどうかを検討する。
最小修正のDiTは、U-Netよりも優れており、音声長予測器による可変長モデリング、音声潜在表現のセマンティックアライメントなどの条件は、さらなる拡張の鍵となる。
論文 参考訳(メタデータ) (2024-06-17T11:25:57Z) - RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis [84.57932472551889]
RALL-Eは、音声合成のための堅牢な言語モデリング手法である。
RALL-Eは、ゼロショットTSのWERを、それぞれ5.6%$(リランクなし)から2.5%$と1.0%$に改善した。
論文 参考訳(メタデータ) (2024-04-04T05:15:07Z) - ParrotTTS: Text-to-Speech synthesis by exploiting self-supervised
representations [27.157701195636477]
ParrotTTSは、モジュール化されたテキスト音声合成モデルである。
単一の話者からの書き起こしを使って、効果的にマルチスピーカーの変種を訓練することができる。
低リソース設定で新しい言語に適応し、自己管理バックボーンのトレーニング中に見えない言語に一般化する。
論文 参考訳(メタデータ) (2023-03-01T17:23:12Z) - Guided-TTS:Text-to-Speech with Untranscribed Speech [22.548875263927396]
我々は、未転写音声データから音声を生成することを学習する高品質TTSモデルである Guided-TTS を提案する。
音声合成において,無条件DDPMの生成過程を音素分類を用いて導き,メル-スペクトログラムを生成する。
論文 参考訳(メタデータ) (2021-11-23T10:05:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。