論文の概要: Unlocking Fine-Grained and Within-Utterance Speaking Style Control in Prompt-Based Text-to-Speech Models
- arxiv url: http://arxiv.org/abs/2605.27376v1
- Date: Thu, 09 Apr 2026 01:06:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 07:09:36.502823
- Title: Unlocking Fine-Grained and Within-Utterance Speaking Style Control in Prompt-Based Text-to-Speech Models
- Title(参考訳): Prompt-based Text-to-Speech Model における細粒度および発話内スタイル制御の解法
- Authors: Jaehoon Kang, Yejin Lee, Yoonji Park, Kyuhong Shim,
- Abstract要約: 一つの発話において,発話と時間変化の異なるスタイル遷移の連続的なスタイル属性を実現する手法を提案する。
提案音声は, 最大36Hzのピッチ変化, 最大1.6音節/秒の速度変化において, 99-100%の成功率を達成した。
- 参考スコア(独自算出の注目度): 11.115821694268716
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: While prompt-based text-to-speech (TTS) models enable natural language-driven speaking style control, they often provide limited fine-grained control and apply a single global style across an utterance. This restricts practical use cases that require continuous style attribute interpolation across utterances and time-varying style transitions within a single utterance. In this paper, we propose novel techniques to achieve both capabilities in existing prompt-based TTS models. For inter-utterance style interpolation, we compute direction vectors between contrastive style prompts in the embedding space and perform simple interpolation, enabling smooth transitions between style characteristics. For intra-utterance style transition, we first identify a strong attention bias toward early tokens in autoregressive TTS decoders, causing the initial audio realization to dominate subsequent generation. To mitigate this effect, we introduce KV-cache swapping and sliding-window attention masking. Experiments demonstrate that our proposed inter-utterance interpolation achieves a 99-100% success rate in gender conversion, up to 36 Hz pitch variation, and up to 1.6 syllables-per-second speed change. Our intra-utterance transition maintains a speaker similarity of 0.81-0.91 and achieves perceptual smoothness scores of 3.48-4.48.
- Abstract(参考訳): prompt-based text-to-speech (TTS) モデルは自然言語による話し方制御を可能にするが、しばしば細粒度制御が制限され、発話全体にわたって単一のグローバルスタイルを適用する。
これは、1つの発話内で、発話を横断する連続的なスタイル属性の補間と、時間的に変化するスタイル遷移を必要とする実用的なユースケースを制限する。
本稿では,既存のプロンプトベースTSモデルにおいて,両方の機能を実現するための新しい手法を提案する。
発話スタイル補間のために,埋め込み空間におけるコントラッシブなスタイルプロンプト間の方向ベクトルを計算し,簡単な補間を行い,スタイル特性間のスムーズな遷移を可能にする。
発話内遷移では、まず自己回帰型TSデコーダの早期トークンに対する強い注意バイアスを同定し、初期音声認識がその後の世代を支配した。
この効果を緩和するために,KV-cacheスワッピングとスライディングウインドウ・アテンションマスキングを導入する。
実験により,提案した音声補間は,最大36Hzのピッチ変化,最大1.6音節/秒の速度変化など,性別変換において99-100%の成功率を達成した。
我々の発話内遷移は、0.81-0.91の話者類似性を維持し、知覚の滑らか度スコアは3.48-4.48である。
関連論文リスト
- HiStyle: Hierarchical Style Embedding Predictor for Text-Prompt-Guided Controllable Speech Synthesis [17.743822016045446]
制御可能な音声合成とは、特定の韻律的・パラ言語的属性を操作することによって、発話スタイルを正確に制御することを指す。
テキストのプロンプトに条件付けされたスタイル埋め込みを階層的に予測する2段階型埋め込み予測器であるHiStyleを提案する。
論文 参考訳(メタデータ) (2025-09-30T06:31:12Z) - ReverBERT: A State Space Model for Efficient Text-Driven Speech Style Transfer [0.0]
テキスト駆動音声スタイル転送のための効率的なフレームワークであるemphReverBERTを提案する。
画像領域の技法とは異なり,本手法は音声空間で動作し,音声特徴の離散フーリエ変換を統合する。
ベンチマーク音声コーパスの実験では、emphReverBERTは自然性、表現性、計算効率の点でベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2025-03-26T21:11:17Z) - MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis [56.25862714128288]
本稿では,イノベーティブなスパースアライメントアルゴリズムを備えたゼロショット音声合成(TTS)システムであるtextitMegaTTS 3を提案する。
具体的には,検索空間を制限せずにアライメントの困難さを軽減するために,MegaTTS 3にスパースアライメント境界を提供する。
実験により、MegaTTS 3は最先端のゼロショットTTS音声品質を実現し、アクセント強度を柔軟に制御できることが示されている。
論文 参考訳(メタデータ) (2025-02-26T08:22:00Z) - DPI-TTS: Directional Patch Interaction for Fast-Converging and Style Temporal Modeling in Text-to-Speech [43.45691362372739]
テキスト・トゥ・音声(DPI-TTS)のための方向的パッチ・インタラクション法を提案する。
DPI-TTSは低周波数から高周波数のフレーム・バイ・フレームプログレッシブ・推論・アプローチを採用しており、音響特性とより密に一致している。
実験により,本手法はトレーニング速度を約2倍に向上し,ベースラインモデルよりも大幅に向上することが示された。
論文 参考訳(メタデータ) (2024-09-18T09:36:55Z) - Pruning Self-Attention for Zero-Shot Multi-Speaker Text-to-Speech [26.533600745910437]
本稿では,TSモデルの一般化能力を向上させるために,スパースアテンション(sparse attention)と呼ばれる変圧器の効率的なプルーニング法を提案する。
また,モデルがしきい値を自動的に学習することのできる,新しい微分可能なプルーニング手法を提案する。
論文 参考訳(メタデータ) (2023-08-28T21:25:05Z) - GenerSpeech: Towards Style Transfer for Generalizable Out-Of-Domain
Text-to-Speech Synthesis [68.42632589736881]
本稿では,OODカスタム音声の高忠実度ゼロショットスタイル転送に向けたテキスト音声合成モデルGenerSpeechを提案する。
GenerSpeechは、2つのコンポーネントを導入することで、音声のバリエーションをスタイルに依存しない部分とスタイル固有の部分に分解する。
ゼロショット方式の転送について評価したところ,GenerSpeechは音質やスタイルの類似性の観点から,最先端のモデルを上回っていることがわかった。
論文 参考訳(メタデータ) (2022-05-15T08:16:02Z) - Fine-grained style control in Transformer-based Text-to-speech Synthesis [78.92428622630861]
本稿では,Transformer-based text-to-speech synthesis (TransformerTTS) におけるきめ細かいスタイル制御を実現する新しいアーキテクチャを提案する。
参照音声から局所的スタイルトークン(LST)の時系列を抽出することにより、発話スタイルをモデル化する。
実験により, きめ細かいスタイル制御では, 自然性, 知能性, スタイル伝達性が向上することが示された。
論文 参考訳(メタデータ) (2021-10-12T19:50:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。