論文の概要: Complex-Text Robustness Evaluation and Failure Diagnosis for Low-Resource Multilingual Text-to-Speech
- arxiv url: http://arxiv.org/abs/2609.11545v1
- Date: Thu, 10 Sep 2026 13:41:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.373714
- Title: Complex-Text Robustness Evaluation and Failure Diagnosis for Low-Resource Multilingual Text-to-Speech
- Title(参考訳): 低音源多言語テキスト音声の複素テキストロバスト性評価と故障診断
- Authors: Tianlun Zuo, Ziyu Zhang, Tingzhi Mao, Zhonghua Fu, Lei Xie,
- Abstract要約: 低リソース多言語テキスト音声システム(TTS)は、言語の範囲を拡大しているが、複雑なテキスト入力による堅牢性はまだ不十分である。
本稿では,低リソースマルチリンガルTSのための複雑なテキストロバストネス診断フレームワークを提案する。
タイ語、ベトナム語、スワヒリ語、インドネシア語向けに多言語頑健性試験スキームが設計されており、通常の文と複数の複雑なテキスト入力をカバーしている。
- 参考スコア(独自算出の注目度): 10.008502036976243
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Low-resource multilingual text-to-speech (TTS) systems have expanded language coverage, but their robustness under complex text inputs remains insufficiently diagnosed. Existing evaluations mainly focus on naturalness, speaker similarity, and content consistency using regular test sentences, while providing limited insight into how multilingual TTS systems fail when handling challenging inputs such as numbers, dates, named entities, long sentences, code-switched expressions, and punctuation-related structures. This paper proposes a complex-text robustness diagnosis framework for low-resource multilingual TTS. We evaluate robustness from three dimensions: content consistency, language consistency, and generation stability. A multilingual robustness testing scheme is designed for Thai, Vietnamese, Swahili, and Indonesian, covering ordinary sentences and multiple types of complex text inputs. We further introduce automatic diagnostic metrics, including character error rate, language identification accuracy, and duration abnormal rate. To support input-level risk analysis before speech generation, we propose a lightweight Text Risk Score (TRS), which estimates synthesis risk from interpretable text features without manual annotation or model training. Experiments on three representative multilingual TTS systems, including OmniVoice, VoxCPM2, and MMS-TTS, show that complex text inputs expose systematic failure patterns that are not fully reflected by ordinary short-sentence evaluation. Different systems exhibit distinct vulnerabilities in number normalization, named entity handling, long-text generation, and code-switched input processing. Furthermore, TRS shows a positive correlation with content errors and duration abnormalities, demonstrating its usefulness as a low-cost pre-synthesis indicator for complex-text risk diagnosis in low-resource multilingual TTS.
- Abstract(参考訳): 低リソース多言語テキスト音声システム(TTS)は、言語の範囲を拡大しているが、複雑なテキスト入力による堅牢性はまだ不十分である。
既存の評価は、通常のテスト文を用いた自然性、話者類似性、コンテンツ一貫性に重点を置いている一方で、数字、日付、名前付きエンティティ、長文、コード切替式、句読点関連構造といった挑戦的な入力を扱う際に、多言語TTSシステムがいかに失敗するかについての限られた洞察を提供している。
本稿では,低リソースマルチリンガルTSのための複雑なテキストロバストネス診断フレームワークを提案する。
コンテンツ整合性,言語整合性,生成安定性の3次元からロバスト性を評価する。
タイ語、ベトナム語、スワヒリ語、インドネシア語向けに多言語頑健性試験スキームが設計されており、通常の文と複数の複雑なテキスト入力をカバーしている。
さらに,文字誤り率,言語識別精度,時間異常率などの自動診断指標を導入する。
音声生成前の入力レベルのリスク分析を支援するために,手動のアノテーションやモデルトレーニングを使わずに,解釈可能なテキスト特徴から合成リスクを推定する軽量テキストリスクスコア(TRS)を提案する。
OmniVoice、VoxCPM2、MMS-TTSを含む3つの代表的な多言語TSシステムの実験は、複雑なテキスト入力が通常の短文評価で完全に反映されていない系統的な故障パターンを表現していることを示している。
異なるシステムは、番号正規化、名前付きエンティティハンドリング、長文生成、コード切替入力処理において、異なる脆弱性を示す。
さらに、TRSは、コンテンツエラーと持続時間異常に正の相関を示し、低リソース多言語TSにおける複雑なテキストリスク診断のための低コストな事前合成指標としての有用性を示した。
関連論文リスト
- IndicDetect: Evaluating Cross-Lingual LLM-Generated Text Detection for Hindi, Telugu, and Tamil [32.21285778019889]
我々は,ヒンディー語,テルグ語,タミル語におけるAI生成テキスト検出のベンチマークを示す。
IndicDetectは、現実的な分布シフトの下で検出器の堅牢性を評価するように設計されている。
論文 参考訳(メタデータ) (2026-08-30T17:21:55Z) - SFMS-ALR: Script-First Multilingual Speech Synthesis with Adaptive Locale Resolution [0.0]
文内多言語音声合成 (code-switching TTS) は、急激な言語シフト、様々なスクリプト、言語間の不一致の韻律による大きな課題である。
本稿では,適応的局所分解を用いたスクリプトファースト多言語合成(SFMS-ALR)を提案する。
論文 参考訳(メタデータ) (2025-10-27T21:39:07Z) - Enhancing Robustness of Autoregressive Language Models against Orthographic Attacks via Pixel-based Approach [51.95266411355865]
自己回帰言語モデルは、正書法攻撃に弱い。
この脆弱性は、サブワードトークン化器とその埋め込みに固有の語彙外問題に起因している。
本稿では,単語を個々の画像としてレンダリングすることで,テキストベースの埋め込みをピクセルベースの表現に置き換える,画素ベースの生成言語モデルを提案する。
論文 参考訳(メタデータ) (2025-08-28T20:48:38Z) - PromotionGo at SemEval-2025 Task 11: A Feature-Centric Framework for Cross-Lingual Multi-Emotion Detection in Short Texts [1.210852962855694]
本稿では,SemEval 2025 Task 11: Bridging the Gap in Text-based Emotion Detectionについて述べる。
本稿では,文書表現と学習アルゴリズムを動的に適用し,言語固有の性能を最適化する機能中心フレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-11T11:21:18Z) - Human-in-the-Loop Generation of Adversarial Texts: A Case Study on Tibetan Script [12.108238610034961]
本稿では,HTL-GATという対話型システムについて紹介する。
チベット文字のケーススタディを通じて, HITL-GATの有用性を実証する。
論文 参考訳(メタデータ) (2024-12-17T02:29:54Z) - Vulnerability of LLMs to Vertically Aligned Text Manipulations [130.54118945532898]
垂直テキスト入力は、数学計算や単語ベースのスドクパズルなど、様々な現実世界のアプリケーションでよく見られる。
近年の研究では、エンコーダベースのモデルで単語を垂直に整列させるような入力形式の変更は、テキスト分類タスクにおいて大幅に精度を低下させることが示されている。
論文 参考訳(メタデータ) (2024-10-26T00:16:08Z) - Decomposed Prompting: Probing Multilingual Linguistic Structure Knowledge in Large Language Models [54.58989938395976]
本稿では,シーケンスラベリングタスクに対する分割プロンプト手法を提案する。
提案手法は,38言語を対象としたUniversal Dependencies part-of-speech Taggedについて検証する。
論文 参考訳(メタデータ) (2024-02-28T15:15:39Z) - Not Enough Labeled Data? Just Add Semantics: A Data-Efficient Method for
Inferring Online Health Texts [0.0]
低リソースの健康NLPタスクをモデル化する手段として,抽象表現(AMR)グラフを用いる。
AMRは、多文入力を表現し、複雑な用語から抽象化し、長距離関係をモデル化するため、オンラインの健康テキストをモデル化するのに適している。
本実験は,テキスト埋め込みをセマンティックグラフ埋め込みで拡張することにより,6つの低リソースなNLPタスクの性能を向上させることができることを示す。
論文 参考訳(メタデータ) (2023-09-18T15:37:30Z) - Code-Switching Text Generation and Injection in Mandarin-English ASR [57.57570417273262]
業界で広く使われているストリーミングモデルTransformer-Transducer(T-T)の性能向上のためのテキスト生成とインジェクションについて検討する。
まず、コードスイッチングテキストデータを生成し、テキスト-to-Speech(TTS)変換または暗黙的に音声とテキストの潜在空間を結び付けることによって、T-Tモデルに生成されたテキストを明示的に注入する戦略を提案する。
実際のマンダリン・イングリッシュ音声の1,800時間を含むデータセットを用いて訓練したT-Tモデルの実験結果から,生成したコードスイッチングテキストを注入する手法により,T-Tモデルの性能が著しく向上することが示された。
論文 参考訳(メタデータ) (2023-03-20T09:13:27Z) - Evaluating the Morphosyntactic Well-formedness of Generated Texts [88.20502652494521]
L'AMBRE – テキストのモルフォシンタク的整形性を評価する指標を提案する。
形態的に豊かな言語に翻訳するシステムのダイアクロニックスタディを通じて,機械翻訳作業におけるメトリックの有効性を示す。
論文 参考訳(メタデータ) (2021-03-30T18:02:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。