論文の概要: TontaubeV1: Streaming Text-to-Speech with Hierarchical Codec Modeling and Bounded Context
- arxiv url: http://arxiv.org/abs/2609.08703v1
- Date: Tue, 08 Sep 2026 13:03:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.652603
- Title: TontaubeV1: Streaming Text-to-Speech with Hierarchical Codec Modeling and Bounded Context
- Title(参考訳): TontaubeV1:階層型コーデックモデリングとコンテキスト境界によるテキスト音声のストリーミング
- Abstract要約: TontaubeV1は、単一のコンシューマGPUからのストリーミングを可能にしながら、自然な韻律を保存するモデルである。
本設計では,セマンティックストリームの生成時に,韻律構造がほぼ確立されていると仮定する。
このモデルは、音声コンディショニングのために最大1分間のレファレンスオーディオを受け入れ、主に英語とドイツ語向けに設計されている。
- 参考スコア(独自算出の注目度): 0.04583541422554719
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-to-speech systems often face a trade-off between natural prosody and efficient inference: higher perceptual quality typically comes at increased computational cost and latency. We present TontaubeV1, a model that preserves natural prosody while enabling streaming from a single consumer GPU. Speech is encoded by the hierarchical DualCodec representation at 12.5 Hz, which separates a semantic stream from successive acoustic refinements. Our design assumes that prosodic structure is largely established when the semantic stream is generated, and allocates capacity accordingly: a Qwen3-1.7B-derived transformer predicts that stream and thereby the utterance duration, while three progressively smaller Qwen3-0.6B-derived transformers each add one acoustic refinement. Text is tokenized per character rather than by subword. Paired text and audio markers at shared positions support long-form generation with bounded context, and overlapping DualCodec reconstructions are mapped into the VibeVoice acoustic latent space and decoded causally, enabling streaming despite DualCodec's noncausal decoder. The model accepts up to one minute of reference audio for voice conditioning and is designed primarily for English and German, with additional multilingual support. The four predictors total 2.9B parameters; on a single RTX 5090 the streaming path reaches approximately 200 ms to first audio. In separate non-streaming measurements, the end-to-end real-time factor (RTF) is 0.08 for one input and the aggregate RTF is 0.02 across eight concurrent inputs. On our LLM-as-a-judge audiobook-reading benchmark, TontaubeV1 matches ElevenLabs Flash v2.5 and outperforms Fish Audio S2 Pro, the April 2026 Gradium API, and Cartesia Sonic 3 on prosody. The model weights are released on Hugging Face under the Tontaube Community Model License 1.0.
- Abstract(参考訳): テキストから音声へのシステムは、しばしば自然な韻律と効率的な推論のトレードオフに直面している。
TontaubeV1は、単一のコンシューマGPUからのストリーミングを可能にしながら、自然な韻律を保存するモデルである。
音声は12.5Hzの階層的デュアルコーデック表現によって符号化される。
Qwen3-1.7B由来の変換器は、そのストリームを予測し、発話長を推定し、3つのより小さなQwen3-0.6B由来の変換器は、それぞれ1つの音響改良を加える。
テキストはサブワードではなく文字ごとにトークン化される。
共有位置におけるペアテキストとオーディオマーカーは、コンテキスト境界による長文生成をサポートし、重複するDualCodec再構成は、VibeVoice音響潜在空間にマッピングされ、因果的に復号化され、DualCodecの非因果デコーダにもかかわらずストリーミングを可能にする。
このモデルは音声コンディショニングのために最大1分間のレファレンスオーディオを受け取り、主に英語とドイツ語向けに設計され、さらに多言語サポートが加えられている。
4つの予測器は合計2.9Bパラメータであり、1つのRTX 5090では、ストリーミングパスが最初のオーディオに約200msに達する。
別途の非ストリーミング計測では、1入力に対してRTF(End-to-end Real-time Factor)は0.08であり、アグリゲートRTFは8つの同時入力に対して0.02である。
LLM-as-a-judge Audiobook-readingベンチマークでは、TontaubeV1がElevenLabs Flash v2.5にマッチし、2026年4月のGradium API、Cartesia Sonic 3のプロソディーより優れています。
モデルウェイトは、Tontaube Community Model License 1.0の下でHugging Faceでリリースされている。
関連論文リスト
- Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers [11.102698205402675]
Siri Expressive Voicesはリッチで会話型の音声をリアルタイムで合成する。
デトケナイザは、ファンデーションモデルによって出力されるセマンティックオーディオトークンを、Apple Matrix Coprocessor(AMX)の厳密な計算およびメモリ予算内で高忠実なオーディオに変換する。
Diffusion Transformer (DiT)スタイルの1つの再利用可能な深度デコーダは、すべてのRVQレベルを自動回帰的に生成し、以前のマルチデコーダアーキテクチャの専用レベルデコーダを置き換える。
論文 参考訳(メタデータ) (2026-07-26T19:20:01Z) - FreyaTTS Technical Report [0.0]
本稿では,Freya-TTSについて紹介する。
AudioVAE2(16kHzのエンコード、48kHzのデコード)の凍結した連続潜伏空間で動作し、モデルがテキストからラテントマッピングに集中できるようにしている。
バンドマッチングワードエラー率(WER)は8.0%、文字エラー率(CER)は3.0%で、かなり大きなオープンソースシステムより優れています。
論文 参考訳(メタデータ) (2026-07-10T15:36:30Z) - Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models [68.51256516936338]
Wan-Streamerは、ローストリーミングインタラクションのためのエンドツーエンドのインタラクティブ基盤モデルである。
音声とビデオは、入力と出力の両方を単一のTransformerシーケンスでシームレスにモデル化する。
およそ200msのモデル側レスポンスレイテンシと、合計550msのインタラクションレイテンシを実現している。
論文 参考訳(メタデータ) (2026-06-23T18:01:03Z) - Speed by Simplicity: A Single-Stream Architecture for Fast Audio-Video Generative Foundation Model [52.79436545460808]
本稿では,人中心生成のためのオープンソースオーディオビデオ生成基盤モデルdaVinci-MagiHumanを紹介する。
DaVinci-MagiHumanは、単一ストリームトランスフォーマーを使用して、同期ビデオとオーディオを共同で生成する。
中国語(マンダリン語とカントン語)、英語、日本語、韓国語、ドイツ語、フランス語の多言語音声生成をサポートする。
論文 参考訳(メタデータ) (2026-03-23T13:49:06Z) - Voxtral Realtime [134.66962524291424]
Voxtral Realtimeはストリーミング自動音声認識モデルである。
オフラインの書き込み品質は、秒以下のレイテンシで一致します。
私たちはApache 2.0ライセンスの下でモデルウェイトをリリースしています。
論文 参考訳(メタデータ) (2026-02-11T19:17:10Z) - Qwen3-TTS Technical Report [64.94647392030824]
本稿では,Qwen3-TTSシリーズについて述べる。
Qwen3-TTSは最先端の3秒間音声クローニングと記述ベースの制御をサポートする。
Qwen3-TTSは、2つの音声トークンとともに、リアルタイム合成のためのデュアルトラックLMアーキテクチャを採用している。
論文 参考訳(メタデータ) (2026-01-22T03:51:43Z) - Qwen3-Omni Technical Report [105.11829337290249]
Qwen3-Omniは、テキスト、画像、オーディオ、ビデオ間で最先端のパフォーマンスを維持する単一のマルチモーダルモデルである。
Qwen3-OmniはQwenシリーズ内の同一サイズのシングルモーダルモデルのパフォーマンスと一致し、特にオーディオタスクに優れる。
119言語でのテキストインタラクション、19言語での音声理解、および10言語での音声生成をサポートする。
論文 参考訳(メタデータ) (2025-09-22T13:26:24Z) - TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling [13.05578634768109]
テキスト対応拡散変換器音声コーデック(TaDiCodec)について紹介する。
TaDiCodecは拡散オートエンコーダによる量子化と再構成にエンドツーエンドの最適化を採用している。
フレームレートは6.25Hzで、それに対応する圧縮は0.0875kbpsで、1層コードブックで24kHzの音声を処理できる。
論文 参考訳(メタデータ) (2025-08-22T20:45:03Z) - FastLTS: Non-Autoregressive End-to-End Unconstrained Lip-to-Speech
Synthesis [77.06890315052563]
我々は、低レイテンシで非拘束音声から高品質な音声を直接合成できる非自己回帰的エンドツーエンドモデルであるFastLTSを提案する。
実験により,本モデルは3秒の入力シーケンスにおける現在の自己回帰モデルと比較して,音声生成の19.76倍の高速化を実現していることがわかった。
論文 参考訳(メタデータ) (2022-07-08T10:10:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。