論文の概要: Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study
- arxiv url: http://arxiv.org/abs/2608.02235v1
- Date: Mon, 03 Aug 2026 13:49:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.582572
- Title: Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study
- Title(参考訳): テキスト音声システムのドメイン特性評価:マルチメトリックベンチマークによる検討
- Authors: Ali Jafar, Amal Sarmad, Shifa Yousaf, Maryam Bashir,
- Abstract要約: 本稿では,現代のTSシステムのシステム評価のための再現可能なマルチメトリックベンチマークフレームワークを提案する。
Indic-Parler-TTS, MMS-TTS, Microsoft Edge TTS, Google Gemini TTSの4つの最先端TSシステムを評価した。
その結果、音声領域間でのTTS性能のかなりの変動が明らかとなり、感情的な音声は、常に最大の合成課題を提示する。
- 参考スコア(独自算出の注目度): 1.224954637705144
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Recent advances in neural text-to-speech (TTS) systems have substantially improved speech naturalness and intelligibility across many languages. However, comprehensive evaluation methodologies that jointly assess perceptual quality, speaker similarity, and acoustic fidelity across diverse speech domains remain limited, particularly for low-resource and underrepresented languages. This paper presents a reproducible, multi-metric benchmarking framework for systematic evaluation of modern TTS systems through domain-specific analysis. The proposed framework integrates complementary subjective and objective evaluation protocols and is demonstrated through a comprehensive case study on a representative low-resource language spanning four speech domains: Formal, Conversational, Literary/Storytelling, and Emotional. Four state-of-the-art TTS systems -- Indic-Parler-TTS, MMS-TTS, Microsoft Edge TTS, and Google Gemini TTS -- are evaluated using MUSHRA listening tests, ABX discrimination tests, speaker similarity scoring with Resemblyzer, and acoustic analyses based on mel-cepstral distortion (MCD) and F0 RMSE over 960 audio pairs. Results reveal substantial variation in TTS performance across speech domains, with emotional speech consistently presenting the greatest synthesis challenge (mean MCD 12.03 dB; mean F0 RMSE 889 cents), while conversational speech achieves the highest overall acoustic fidelity. Beyond the empirical findings, this work provides a reproducible evaluation framework, publicly releasing evaluation scripts, result tables, and executable Colab notebooks to support standardized benchmarking and future research on TTS evaluation for low-resource languages.
- Abstract(参考訳): ニューラルテキスト音声合成システム(TTS)の最近の進歩は、多くの言語で音声の自然さと知性を大幅に改善している。
しかし,低リソース・低表現言語では,様々な言語領域における知覚品質,話者類似性,音響忠実度を共同評価する包括的評価手法が限られている。
本稿では、ドメイン固有解析を用いて、現代のTSシステムの体系的評価を行うための再現可能なマルチメトリックベンチマークフレームワークを提案する。
提案フレームワークは、補完的な主観的・客観的評価プロトコルを統合し、形式的・会話的・文学的・ストラテリング的・感情的という4つの言語領域にまたがる代表的低リソース言語に関する包括的ケーススタディによって実証される。
Indic-Parler-TTS, MMS-TTS, Microsoft Edge TTS, Google Gemini TTSの4つの最先端TTSシステムについて,MUSHRAリスニングテスト,ABX判別テスト,Resemblyzerを用いた話者類似性スコア,メルケプストラム歪み(MCD)とF0 RMSEによる960以上の音響解析を用いて評価を行った。
その結果、音声領域間でのTTS性能のかなりの変動が明らかとなり、感情音声は最高合成課題(平均MCD 12.03dB、平均F0 RMSE 889セント)を常に提示する一方、会話音声は全体的な音響的忠実度が最も高い。
実証的な結果の他に、この研究は再現可能な評価フレームワークを提供し、評価スクリプト、結果テーブル、実行可能なColabノートを公開し、標準化されたベンチマークをサポートし、低リソース言語のTS評価に関する将来の研究をサポートする。
関連論文リスト
- RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems [5.434878413067881]
テキスト音声(TTS)、音声音声(STS)、音声理解(SU)、音声認識(ASR)による音声AI評価のための多次元ベンチマークであるReal World Voice EQ Benchを紹介する。
評価の結果, 性能は高次元比であることが示唆された。
論文 参考訳(メタデータ) (2026-07-16T11:15:16Z) - Assessing the Ability of Neural TTS Systems to Model Consonant-Induced F0 Perturbation [30.798688471243413]
本研究では,子音によるf0摂動を再現するニューラルネットワークモデルの性能を評価するための分節レベルの韻律探索フレームワークを提案する。
同じ音声コーパス(LJ音声)で訓練されたTacotron 2とFastSpeech 2を用いて、語彙周波数で階層化された何千もの単語の合成および自然な音声認識を比較する。
その結果,高周波単語の再現精度は高いが,低周波項目への一般化は低かった。
論文 参考訳(メタデータ) (2026-03-22T06:06:47Z) - On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation [88.77441715819366]
大規模生音声で事前訓練された生成音声言語モデルは、適切な内容で音声プロンプトを継続することができる。
本稿では,グローバルトークンの難易度に代えて,多種多様な可能性・生成的評価手法を提案する。
論文 参考訳(メタデータ) (2026-01-09T22:01:56Z) - AHELM: A Holistic Evaluation of Audio-Language Models [78.20477815156484]
マルチモーダルオーディオ言語モデル(ALM)は、インターリーブされた音声とテキストを入力および出力テキストとして取り込む。
AHELMは、PARADEとCoRe-Benchと呼ばれる2つの新しい合成オーディオテキストデータセットを含む、さまざまなデータセットを集約するベンチマークである。
また、モデル間の等価比較を確保するために、プロンプト、推論パラメータ、評価指標を標準化する。
論文 参考訳(メタデータ) (2025-08-29T07:40:39Z) - SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models [60.72029578488467]
SpeechRは、大規模な音声言語モデルにおける音声に対する推論を評価するための統一的なベンチマークである。
事実検索、手続き推論、規範的判断の3つの重要な側面に沿ったモデルを評価する。
11個の最先端のLALMの評価は、高い転写精度が強い推論能力に変換されないことを示している。
論文 参考訳(メタデータ) (2025-08-04T03:28:04Z) - Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese [36.208204572097046]
我々は,多次元中国語コーパスデータセットATT-Corpusとチューリングテストにインスパイアされた評価プロトコルの組み合わせであるAudio Turing Test (ATT)を紹介する。
ATTは評価者に声が人間に聞こえるかどうかを判断するよう依頼する。
また、自動評価のためのオートATTとして、人間の判断データを用いたQwen2-Audio-Instructを微調整する。
論文 参考訳(メタデータ) (2025-05-16T12:57:23Z) - Where are we in audio deepfake detection? A systematic analysis over generative and detection models [59.09338266364506]
SONARはAI-Audio Detection FrameworkとBenchmarkの合成である。
最先端のAI合成聴覚コンテンツを識別するための総合的な評価を提供する。
従来のモデルベース検出システムと基礎モデルベース検出システムの両方で、AIオーディオ検出を均一にベンチマークする最初のフレームワークである。
論文 参考訳(メタデータ) (2024-10-06T01:03:42Z) - TTSDS -- Text-to-Speech Distribution Score [9.380879437204277]
最近発表されたText-to-Speech (TTS) システムは、実際の音声に近い音声を生成する。
本稿では,韻律,話者識別,知性といった複数の要因を組み合わせた合成音声の質を評価することを提案する。
2008年から2024年にかけて開発された35のTTSシステムをベンチマークし, 評価値の非重み付き平均値として計算した結果が人体評価と強く相関していることを示した。
論文 参考訳(メタデータ) (2024-07-17T16:30:27Z) - An Initial Investigation of Language Adaptation for TTS Systems under Low-resource Scenarios [76.11409260727459]
本稿では,最近のSSLベースの多言語TSシステムであるZMM-TTSの言語適応性について検討する。
本研究では,事前学習言語と対象言語との音声学的な類似性が,対象言語の適応性能に影響を及ぼすことを示す。
論文 参考訳(メタデータ) (2024-06-13T08:16:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。