論文の概要: Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech
- arxiv url: http://arxiv.org/abs/2609.01016v1
- Date: Tue, 01 Sep 2026 10:07:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.548987
- Title: Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech
- Title(参考訳): フレーズローカライズされた言語コントラストガイダンス: コードスイッチングテキスト音声の学習自由な局所的アクセント制御
- Authors: Che Hyun Lee, Sangkwon Park, Donghun Kang, Dongwook Lee, Youngho Cho, Heeseung Kim, Sungroh Yoon,
- Abstract要約: そこで本研究では,テキストから音声まで,ネイティブアクセントをコードに切り替えたフレーズに復元する学習自由推論フレームワークを提案する。
本稿では,外部アライメントを伴わない句境界を求める自己注意探索手法を提案する。
多様な言語ペアにわたって、LCGはアクセントリークを抑制しながら、コードスイッチされたフレーズのネイティブ性を強く向上させる。
- 参考スコア(独自算出の注目度): 47.27636239794203
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current speech synthesis struggles with code-switching, which mixes a foreign language phrase into a primary language utterance, causing the phrase to be spoken with the primary language's accent rather than its native one. We propose Phrase-Localized Language-Contrastive Guidance (LCG), a training-free inference framework that restores a native accent to code-switched phrases in cross-lingual text-to-speech. LCG replaces the single language guidance applied across the whole utterance with a separate guidance for each region, so each part is guided by its own language. To choose where to apply this localized guidance, we propose a self-attention probing technique that finds the phrase boundaries without external alignments. Together, these components generate speech in which each region carries the accent of its own language, requiring no fine-tuning or auxiliary models. Across diverse language pairs, LCG robustly increases the nativeness of the code-switched phrase while suppressing accent leakage, and preserving overall speaker identity and naturalness.
- Abstract(参考訳): 現在の音声合成は、外国語のフレーズを一次言語の発声に混ぜるコードスイッチングに苦慮しており、そのフレーズは原語のアクセントではなく、一次言語のアクセントで話される。
本稿では,言語間のテキスト合成において,ネイティブアクセントをコード変更句に復元する学習自由度推論フレームワークであるPhrase-Localized Language-Contrastive Guidance (LCG)を提案する。
LCGは、全発話に適用される単一の言語ガイダンスを、各領域の別々のガイダンスで置き換える。
この局所的なガイダンスをどこに適用するかを選択するために、外部アライメントを伴わずに句境界を見つける自己注意探索手法を提案する。
これらのコンポーネントは共に、各リージョンが独自の言語のアクセントを持ち、微調整や補助的なモデルを必要としない音声を生成する。
多様な言語対にわたって、LCGはアクセントリークを抑制しながら、コードスイッチされたフレーズのネイティブ性を高め、話者のアイデンティティと自然性を維持する。
関連論文リスト
- L-Proto: Language-Aware Episodic Prototypical Training for Multilingual Speaker Verification [49.128847336227636]
本稿では,L-Protoを提案する。
TidyVoice Challengeベンチマークの実験では、従来の微調整およびランダムなエピソードサンプリングよりも一貫した性能向上が示されている。
論文 参考訳(メタデータ) (2026-06-16T01:57:41Z) - KIT's Submission to Cross-Lingual Voice Cloning in IWSLT 2026 [61.29502937013759]
言語間音声のクローニングは、ソース言語参照から話者識別を保ちながら、ターゲット言語で音声を生成することを目的としている。
鍵となる課題は、アクセントの変化とドメイン固有の語彙の存在において、知性と自然性を維持することである。
我々は、多言語テキスト音声モデル、FishAudio-S2-Proを構築し、言語制御を改善しアクセントリークを低減するために、言語タグプロンプトを導入する。
論文 参考訳(メタデータ) (2026-06-05T13:09:21Z) - Fine-Tuned Self-Supervised Speech Representations for Language
Diarization in Multilingual Code-Switched Speech [4.39549503760707]
大規模自己教師型アーキテクチャ(WavLM)から抽出した微調整音声表現を用いた連続多言語ダイアリザを開発した。
南アフリカ語5言語(isiZulu, isiXa, Seswana, Sesotho, English)からなるコード交換コーパスを実験した。
論文 参考訳(メタデータ) (2023-12-15T09:40:41Z) - MUST&P-SRL: Multi-lingual and Unified Syllabification in Text and
Phonetic Domains for Speech Representation Learning [0.76146285961466]
言語特徴抽出の方法論として,複数の言語における単語の自動分割に着目した手法を提案する。
本手法は,テキストと音声の両領域において,テキストから音素の書き起こしを抽出すること,ストレスマーク,統合された自動音節分類に重点を置いている。
このシステムはオープンソースのコンポーネントとリソースで構築された。
論文 参考訳(メタデータ) (2023-10-17T19:27:23Z) - Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec
Language Modeling [92.55131711064935]
本稿では,言語間音声合成のための言語間ニューラルネットワークモデル VALL-E X を提案する。
VALL-E Xは、強い文脈内学習能力を継承し、ゼロショット言語間テキスト音声合成やゼロショット音声音声音声翻訳タスクに応用できる。
未知の話者の声、感情、音響環境を保ちながら、ソース言語の1つの発話をプロンプトとして、ターゲット言語で高品質な音声を生成することができる。
論文 参考訳(メタデータ) (2023-03-07T14:31:55Z) - Towards Zero-Shot Code-Switched Speech Recognition [44.76492452463019]
ゼロショット設定の下で,効率的な符号切替自動音声認識システム (ASR) の構築を目指す。
そこで本研究では,各単言語モジュールの音声セグメントを単言語スクリプトで不特定に書き起こすことにより,各単言語モジュールを単純化することを提案する。
本手法をエンドツーエンドの微分可能なニューラルネットワークに適用し、マンダリン英語SEAMEテストセットにおけるゼロショットCS ASRの有効性を実証する。
論文 参考訳(メタデータ) (2022-11-02T19:52:54Z) - Code-Switching without Switching: Language Agnostic End-to-End Speech
Translation [68.8204255655161]
我々は音声認識と翻訳を一貫したエンドツーエンドの音声翻訳問題として扱う。
LASTを両方の入力言語で訓練することにより、入力言語に関係なく、音声を1つのターゲット言語にデコードする。
論文 参考訳(メタデータ) (2022-10-04T10:34:25Z) - That Sounds Familiar: an Analysis of Phonetic Representations Transfer
Across Languages [72.9927937955371]
我々は、他言語に存在するリソースを用いて、多言語自動音声認識モデルを訓練する。
我々は,多言語設定における全言語間での大幅な改善と,多言語設定におけるスターク劣化を観察した。
分析の結果、ひとつの言語に固有の電話でさえ、他の言語からのトレーニングデータを追加することで大きなメリットがあることがわかった。
論文 参考訳(メタデータ) (2020-05-16T22:28:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。