論文の概要: Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis
- arxiv url: http://arxiv.org/abs/2609.03992v1
- Date: Thu, 03 Sep 2026 15:30:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.141711
- Title: Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis
- Title(参考訳): 音声ダビングと全二重対話合成のためのアライメントフリーテキストオーディオボックス
- Abstract要約: Text-ABは、フローでトレーニングされたTransformer上に構築され、3次元に沿ってText Audioboxシステムから離脱する。
テキストエンコーダから生のテキストを消費し、クロスアテンションを通じてテキストアライメントを学習する。
最大1分間の音声のワンショット生成と、マルチディフシンセシス方式による任意のロングフォーム生成をサポートする。
- 参考スコア(独自算出の注目度): 33.45440959616487
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present Alignment-Free Text-Audiobox (Text-AB), a unified framework for high-quality voice dubbing and full-duplex dialogue synthesis. Building on a Diffusion Transformer trained with a flow-matching objective, Text-AB departs from the Audiobox system along three dimensions. First, it operates in a latent diffusion framework using DAC-VAE features that encode 48 kHz waveforms into a 25 Hz latent sequence, giving over 10x higher compression than previous EnCodec representations while improving resynthesis quality. Second, Text-AB is alignment-free: it consumes raw text via an off-the-shelf text encoder and learns text-speech alignment through cross-attention, removing the need for forced alignment and explicit duration prediction. Third, we scale model and data substantially, pretraining a 3B-parameter model on 480k hours of monolingual speech, followed by supervised fine-tuning on three downstream tasks: cross-lingual voice dubbing, full-duplex dialogue synthesis, and emotional full-duplex dialogue synthesis. At inference, Text-AB supports one-shot generation for up to ~1 min of speech and arbitrarily long-form generation via a multi-diffusion scheme, plus a multi-stage reranking strategy that enhances quality based on automated metrics. On a real-world dubbing benchmark, Text-AB delivers a step-change improvement over the latest internal dubbing system, with large gains in prosody similarity, voice similarity, naturalness, and shareability. For full-duplex dialogue synthesis, it approaches human recordings on short-form conversations and substantially outperforms the latest internal model on long-form human-likeness and expressivity, while natively modeling turn-taking, back-channeling, and emotional dynamics. For emotional dialogue synthesis, emotion conditioning significantly improves emotion alignment and emotional interaction quality over the unconditioned baseline.
- Abstract(参考訳): 高品質な音声ダビングと全二重対話合成のための統合フレームワークであるAlignment-Free Text-Audiobox(Text-AB)を提案する。
フローマッチングの目標でトレーニングされた拡散変換器上に構築されたText-ABは,3次元のオーディオボックスシステムから離脱する。
まず、DAC-VAE機能を使用して遅延拡散フレームワークで動作し、48kHzの波形を25Hzの遅延シーケンスに符号化し、再生品質を改善しながら、以前のEnCodec表現よりも10倍高い圧縮を与える。
第2に、Text-ABはアライメントフリーで、オフザシェルのテキストエンコーダを介して生テキストを消費し、クロスアテンションを通じてテキスト音声アライメントを学習し、強制アライメントや明示的な期間予測の必要性を取り除く。
第3に,単言語音声の480k時間における3Bパラメータモデルの事前学習を行い,さらに,言語間音声ダビング,全二重対話合成,感情的全二重対話合成という3つの下流タスクの微調整を行った。
推測では、Text-ABは最大1分間の音声のワンショット生成と、多段拡散方式による任意のロングフォーム生成をサポートし、さらに自動メトリクスに基づく品質向上のためのマルチステージリグレード戦略をサポートする。
実世界のダビングベンチマークでは、Text-ABは最新の内部ダビングシステムに対して段階的に改善され、韻律の類似性、音声の類似性、自然性、共有性が大きく向上した。
全二重対話合成では、短い形式の会話における人間の録音にアプローチし、ターンテイキング、バックチャンネル、感情のダイナミクスをネイティブにモデル化しながら、人間の表情と表現性に関する最新の内部モデルを大幅に上回っている。
感情の対話合成では、感情条件付けは無条件のベースライン上での感情のアライメントと感情の相互作用品質を著しく改善する。
関連論文リスト
- Borderless Long Speech Synthesis [30.36601404142387]
エージェント中心, 境界なし長音声合成のためのボーダーレス長音声合成フレームワークを提案する。
単一の狭いタスクをターゲットにするのではなく、VoiceDesigner、マルチスピーカー合成、インストラクションTS、長文テキスト合成にまたがる統一的な機能セットとして設計されている。
論文 参考訳(メタデータ) (2026-03-20T09:37:54Z) - AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation [24.799628787198397]
AudioGen-Omniは、入力ビデオとコヒーレントに同期した高忠実度オーディオ、音声、歌を生成する。
ジョイントトレーニングパラダイムは、大規模ビデオテキストオーディオコーパスを統合している。
密度フレームレベルの表現は、AdaLNベースのジョイントアテンション機構を用いて融合する。
推測時間は8秒間1.91秒であり、効率と一般性の両方で大幅に改善されている。
論文 参考訳(メタデータ) (2025-08-01T16:03:57Z) - DrVoice: Parallel Speech-Text Voice Conversation Model via Dual-Resolution Speech Representations [62.00227663434538]
DRVOICE-7BはOpenAudioBenchとBig Bench Audioベンチマーク上で新しい最先端(SOTA)を確立する。
本稿では,共同自己回帰モデルに基づくパラレル音声音声対話モデルであるDrVoiceを提案する。
論文 参考訳(メタデータ) (2025-06-11T02:57:22Z) - CoVoMix2: Advancing Zero-Shot Dialogue Generation with Fully Non-Autoregressive Flow Matching [78.01028753403575]
CoVoMix2はゼロショットマルチトーカー対話生成のためのフレームワークである。
フローマッチングに基づく生成モデルを用いて、マルチストリームの転写からメルスペクトルを予測する。
提案手法は,MoonCastやSesameといった強力なベースラインを,音声品質,話者の整合性,推論速度で上回り,最先端の性能を実現する。
論文 参考訳(メタデータ) (2025-06-01T07:51:45Z) - CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models [74.80386066714229]
改良されたストリーミング音声合成モデルCosyVoice 2を提案する。
具体的には,音声トークンのコードブック利用を改善するために,有限スカラー量子化を導入する。
我々は,様々な合成シナリオをサポートするために,チャンク対応因果フローマッチングモデルを開発した。
論文 参考訳(メタデータ) (2024-12-13T12:59:39Z) - A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation [48.84039953531355]
同時音声翻訳のための新しい非自己回帰生成フレームワーク(NAST-S2X)を提案する。
NAST-S2Xは、音声テキストと音声音声タスクを統合エンドツーエンドフレームワークに統合する。
3秒未満の遅延で高品質な同時解釈を実現し、オフライン生成において28倍のデコードスピードアップを提供する。
論文 参考訳(メタデータ) (2024-06-11T04:25:48Z) - Make-A-Voice: Unified Voice Synthesis With Discrete Representation [77.3998611565557]
Make-A-Voiceは、個別表現から音声信号を合成・操作するための統合されたフレームワークである。
我々は,Make-A-Voiceは,競合するベースラインモデルと比較して,音質とスタイルの類似性が優れていることを示す。
論文 参考訳(メタデータ) (2023-05-30T17:59:26Z) - NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot
Speech and Singing Synthesizers [90.83782600932567]
残差ベクトル化器を備えたニューラルオーディオ予測器を応用して量子化潜在ベクトルを得るTSシステムであるNaturalSpeech 2を開発した。
本研究では,NaturalSpeech 2を44K時間の音声・歌唱データを持つ大規模データセットに拡張し,未知話者の音声品質を評価する。
NaturalSpeech 2は、0ショット設定で、韻律/音節の類似性、合成、音声品質の点で、従来のTSシステムよりはるかに優れている。
論文 参考訳(メタデータ) (2023-04-18T16:31:59Z) - Zero-Shot Long-Form Voice Cloning with Dynamic Convolution Attention [0.0]
本稿では,数秒間の参照音声からターゲット音声を再生可能な,注意に基づく音声合成システムを提案する。
長期発話への一般化は、ダイナミック・コンボリューション・アテンション(Dynamic Convolution Attention)と呼ばれるエネルギーベースのアテンション機構を用いて実現される。
音声の自然性、話者の類似性、アライメントの整合性、長い発話を合成する能力などの観点から、音声クローニングシステムの実装を比較した。
論文 参考訳(メタデータ) (2022-01-25T15:06:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。