論文の概要: CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations
- arxiv url: http://arxiv.org/abs/2606.25403v1
- Date: Wed, 24 Jun 2026 05:02:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.228575
- Title: CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations
- Title(参考訳): Cross Accent-TTS: 対角話者とアクセント表現による言語間アクセント・インテンシティ制御可能なテキスト音声合成
- Authors: Ram Annamdevula, Ankit Tatawat, Ashishkumar P. Gudmalwar, Nirmesh J. Shah, Pankaj Wasnik,
- Abstract要約: CrossAccentTTSは、アクセント制御と変換を可能にするフレームワークである。
Indic MultilingualとL2-arcticデータセットの実験では、CrossAccent-TTSがアクセント強度を正確に制御できることが示されている。
- 参考スコア(独自算出の注目度): 9.312579603351827
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Accent conversion and controllability remain fundamental challenges in cross-lingual text-to-speech (TTS), particularly for low-resource and phonetically diverse Indic languages. While recent large language model (LLM)-based TTS systems exhibit strong cross-lingual generalization, they provide limited explicit control over accent characteristics and intensity. In this paper, we propose CrossAccentTTS, a framework that enables both accent control and conversion while preserving speaker identity. Specifically, we introduce an Accent Intensity Controller (AIC) that injects weighted language embeddings into the accent subspace, allowing smooth interpolation between accents and fine-grained modulation of accent strength at inference time. Experiments on the Indic Multilingual and L2-arctic datasets shows that CrossAccent-TTS achieves precise control of accent intensity, outperforming strong baselines in accent similarity and controllability by maintaining speaker similarity and naturalness.
- Abstract(参考訳): アクセント変換と制御性は、言語間テキスト合成(TTS)における基本的な課題であり、特に低リソースおよび音声学的に多様なIndic言語において重要である。
最近の大規模言語モデル(LLM)ベースのTSシステムは、強い言語間一般化を示すが、アクセント特性と強度に対する限定的な制御を提供する。
本稿では,アクセント制御と変換を両立させるフレームワークであるCrossAccentTTSを提案する。
具体的には、アクセント部分空間に重み付けされた言語埋め込みを注入し、アクセント間のスムーズな補間と、推論時のアクセント強度の微調整を可能にするアクセント強度制御器(AIC)を導入する。
Indic Multilingual および L2-arctic データセットの実験により、CrossAccent-TTS はアクセント強度の正確な制御を実現し、アクセント類似性および制御性において強いベースラインを上回り、話者類似性と自然性を維持する。
関連論文リスト
- KIT's Submission to Cross-Lingual Voice Cloning in IWSLT 2026 [61.29502937013759]
言語間音声のクローニングは、ソース言語参照から話者識別を保ちながら、ターゲット言語で音声を生成することを目的としている。
鍵となる課題は、アクセントの変化とドメイン固有の語彙の存在において、知性と自然性を維持することである。
我々は、多言語テキスト音声モデル、FishAudio-S2-Proを構築し、言語制御を改善しアクセントリークを低減するために、言語タグプロンプトを導入する。
論文 参考訳(メタデータ) (2026-06-05T13:09:21Z) - Learning-free L2-Accented Speech Generation using Phonological Rules [46.06717601946553]
音韻規則と多言語TSモデルを組み合わせたアクセント付きテキスト音声合成フレームワークを提案する。
これらの規則は音素系列に適用され、音素レベルでアクセントを変換する。
音韻制約から生じる子音,母音,音節構造の体系的差異をモデル化し,スペイン語およびインド英語の規則セットを設計する。
論文 参考訳(メタデータ) (2026-03-08T09:22:55Z) - Accent Vector: Controllable Accent Manipulation for Multilingual TTS Without Accented Data [45.10765052993173]
マルチリンガルTSにおけるアクセント操作を可能にする制御可能な表現であるtextitAccent Vectorを提案する。
textitAccent Vectorは、異なる言語の母国語でTTSシステムを微調整することによって導出される。
ベクトルのスケーリングと補間によりアクセント強度のきめ細かい制御を実現し,混合アクセント音声を生成する。
論文 参考訳(メタデータ) (2026-03-08T08:48:42Z) - Quantifying Speaker Embedding Phonological Rule Interactions in Accented Speech Synthesis [44.55147169458465]
アクセント付き音声合成における話者埋め込みと言語的に動機付けられた音韻規則の相互作用を分析する。
実験により、規則と埋め込みを組み合わせることで、より真正なアクセントが得られることが示された。
本研究は,アクセント制御のためのレバーとして,および音声生成における歪み評価のための枠組みとして,ルールを強調した。
論文 参考訳(メタデータ) (2026-01-20T19:25:33Z) - Accent conversion using discrete units with parallel data synthesized from controllable accented TTS [56.18382038512251]
アクセント変換(AC)の目的は、コンテンツと話者のアイデンティティを保ちながら、アクセントを変換することである。
従来の手法では、推論中に参照発話が必要であったり、話者のアイデンティティを十分に保持していなかったり、ネイティブでないアクセントごとにのみトレーニング可能な1対1のシステムを使用していた。
本稿では,これらの問題を克服するために,多くのアクセントをネイティブに変換する,有望なACモデルを提案する。
論文 参考訳(メタデータ) (2024-09-30T19:52:10Z) - Explicit Intensity Control for Accented Text-to-speech [65.35831577398174]
TTSの過程におけるアクセントの強度の制御は、非常に興味深い研究方向である。
近年の作業は、話者とアクセント情報をアンタングルし、そのアクセント強度を制御するために損失重量を調整するために、話者対アダルロスを設計している。
本稿では,アクセント付きTSのための直感的かつ明示的なアクセント強度制御方式を提案する。
論文 参考訳(メタデータ) (2022-10-27T12:23:41Z) - Controllable Accented Text-to-Speech Synthesis [76.80549143755242]
我々は、推論中にアクセントとその強度を制御できるニューラルネットワークTSアーキテクチャを提案する。
これは、明示的な強度制御を伴うアクセント付きTS合成の最初の研究である。
論文 参考訳(メタデータ) (2022-09-22T06:13:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。