論文の概要: Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs
- arxiv url: http://arxiv.org/abs/2607.21042v1
- Date: Thu, 23 Jul 2026 08:24:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.333778
- Title: Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs
- Title(参考訳): 高速インデックスTTS-2:GPUによる自己回帰ゼロショットテキスト音声合成の高速化とストリーミング
- Authors: Muyang Du, Shuang Yu, Junjie Lai,
- Abstract要約: IndexTTS-2は、GPT、フローマッチング拡散変換器、ボコーダからなる最先端の自己回帰型TSモデルである。
高品質にもかかわらず、推論速度はストリーミングやサポートなしでは、ほとんどリアルタイムに届かない。
我々は,IndexTTS-2のすべてのニューラルネットワークコンポーネントをGPU上で運用するために高速化するFaster IndexTTS-2を提案する。
- 参考スコア(独自算出の注目度): 6.875322067946555
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autoregressive text-to-speech models achieve strong naturalness but suffer from slow inference due to sequential token generation, limiting their deployment in production applications that require low latency. IndexTTS-2 is a state-of-the-art autoregressive TTS model consisting of a GPT, a flow-matching Diffusion Transformer, and a vocoder. Despite its high synthesis quality, its inference speed barely reaches real-time without streaming or batching support. We present Faster IndexTTS-2, which accelerates all neural network components of IndexTTS-2 for production deployment on GPUs using NVIDIA TensorRT and TensorRT-LLM. Faster IndexTTS-2 also enables streaming synthesis for latency-sensitive interactive applications, and batched inference across all components to maximize GPU utilization. Experiments on the Seed-TTS benchmark for both English and Chinese demonstrate up to 5.0$\times$ speedup on the autoregressive GPT and 3.6$\times$ end-to-end, with minimal degradation in word error rate, speaker similarity, and naturalness. Our methodology provides a practical reference for efficiently accelerating similar autoregressive speech models on GPUs.
- Abstract(参考訳): 自己回帰型テキスト音声合成モデルは、強い自然性を実現するが、シーケンシャルトークン生成による推論の遅さに悩まされ、低レイテンシを必要とする本番アプリケーションへのデプロイメントが制限される。
IndexTTS-2は、GPT、フローマッチング拡散変換器、ボコーダからなる最先端の自己回帰型TSモデルである。
高い合成品質にもかかわらず、推論速度はストリーミングやバッチサポートなしでは、ほとんどリアルタイムで到達しない。
本稿では,NVIDIA TensorRT と TensorRT-LLM を用いた GPU 上での製品展開のために,IndexTTS-2 のすべてのニューラルネットワークコンポーネントを高速化する Faster IndexTTS-2 を提案する。
より高速なIndexTTS-2では、レイテンシに敏感なインタラクティブアプリケーションのためのストリーミング合成や、GPU使用率を最大化するための全コンポーネントにわたるバッチ推論も実現している。
英語と中国語のSeed-TTSベンチマークの実験では、自動回帰GPTの5.0$\times$スピードアップと3.6$\times$エンド・ツー・エンドで、単語エラー率、話者類似度、自然度が最小限に低下している。
提案手法は,GPU上での類似の自己回帰音声モデルを効率的に高速化するための実用的な参照を提供する。
関連論文リスト
- FreyaTTS Technical Report [0.0]
本稿では,Freya-TTSについて紹介する。
AudioVAE2(16kHzのエンコード、48kHzのデコード)の凍結した連続潜伏空間で動作し、モデルがテキストからラテントマッピングに集中できるようにしている。
バンドマッチングワードエラー率(WER)は8.0%、文字エラー率(CER)は3.0%で、かなり大きなオープンソースシステムより優れています。
論文 参考訳(メタデータ) (2026-07-10T15:36:30Z) - Pushing the Limits of On-Device Streaming ASR: A Compact, High-Accuracy English Model for Low-Latency Inference [5.685908474026849]
エッジデバイス上での高品質な自動音声認識(ASR)は、GPUアクセラレーションなしでCPUで完全に動作している間に、精度、レイテンシ、メモリフットプリントを共同で最適化するモデルを必要とする。
我々は,エンコーダデコーダ,トランスデューサ,LDMベースのパラダイムを包含し,バッチ,チャンク,ストリーミング推論モードで評価する,最先端のASRアーキテクチャの体系的研究を行った。
推奨構成であるint4 k-quant変種は、8つの標準ベンチマークで平均8.20%のストリーミングWERを実現し、0.56秒のアルゴリズムレイテンシでCPU上でのリアルタイムよりも快適に動作します。
論文 参考訳(メタデータ) (2026-04-16T00:04:32Z) - StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation [65.90400162290057]
生成モデルは、コンテンツの作り方、スタイル、配信方法を再定義することで、ライブストリーミング業界を変革している。
ビデオ拡散の最近の進歩は、オフライン生成のための時間的一貫性とサンプリング効率を著しく改善した。
ライブオンラインストリーミングは厳しいサービスレベル(SLO)の下で動作します。 タイム・ツー・ファーストフレームは最小限でなければなりません。
論文 参考訳(メタデータ) (2025-11-10T18:51:28Z) - Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis [64.12708207721276]
本稿では,AR と NAR を統一した新しい擬似自己回帰(PAR)言語モデリング手法を提案する。
PAR 上に構築した PALLE は 2 段階の TTS システムであり, PAR を初期生成に利用し, NAR を改良する。
実験では、LibriTTSでトレーニングされたPALLEが、大規模データでトレーニングされた最先端システムを上回っていることが示された。
論文 参考訳(メタデータ) (2025-04-14T16:03:21Z) - SupertonicTTS: Towards Highly Efficient and Streamlined Text-to-Speech System [10.156665325783583]
SupertonicTTSは、効率的な音声合成のために設計された新しい音声合成システムである。
我々は、軽量アーキテクチャを実現するために、低次元の潜伏空間、潜伏空間の時間圧縮、およびConvNeXtブロックを用いる。
実験の結果、SupertonicTTSは、44Mパラメータしか持たない現代のゼロショットTSモデルに匹敵する性能を示した。
論文 参考訳(メタデータ) (2025-03-29T14:59:32Z) - MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis [56.25862714128288]
本稿では,イノベーティブなスパースアライメントアルゴリズムを備えたゼロショット音声合成(TTS)システムであるtextitMegaTTS 3を提案する。
具体的には,検索空間を制限せずにアライメントの困難さを軽減するために,MegaTTS 3にスパースアライメント境界を提供する。
実験により、MegaTTS 3は最先端のゼロショットTTS音声品質を実現し、アクセント強度を柔軟に制御できることが示されている。
論文 参考訳(メタデータ) (2025-02-26T08:22:00Z) - SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models [64.40250409933752]
我々は、SimpleSpeech 2.0と呼ばれるシンプルで効率的な非自己回帰(NAR)TSフレームワークを実装することで、過去の出版物の上に構築した。
SimpleSpeech 2は、自己回帰(AR)法と非自己回帰(NAR)法の両方の長所を効果的に組み合わせている。
我々は,従来の作業と他の大規模TSモデル(SOTA)と比較して,生成性能と生成速度が大幅に向上したことを示す。
論文 参考訳(メタデータ) (2024-08-25T17:07:39Z) - Efficient Incremental Text-to-Speech on GPUs [1.35346836945515]
Instant Request Pooling と Module-wise Dynamic を用いて,GPU 上でリアルタイムインクリメンタル TTS を実行する方法を提案する。
提案手法は,1つのNVIDIA A10 GPU上で,100QPS以下で80ms未満の低レイテンシで高品質な音声を生成可能であることを示す。
論文 参考訳(メタデータ) (2022-11-25T07:43:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。