論文の概要: TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis
- arxiv url: http://arxiv.org/abs/2604.22225v1
- Date: Fri, 24 Apr 2026 05:01:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-27 15:36:26.34507
- Title: TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis
- Title(参考訳): TTS-PRISM:細粒度診断のための知覚的推論と解釈可能な音声モデル
- Authors: Xi Wang, Jie Wang, Xingchen Song, Baijun Song, Jingran Xie, Jiahe Shao, Zijian Lin, Di Wu, Meng Meng, Jian Luan, Zhiyong Wu,
- Abstract要約: マンダリンの多次元診断フレームワークであるTS-PRISMを提案する。
まず、安定性と高度な合成にまたがる12次元のスキーマを確立する。
第2に、高品質な診断データセットを構築するために、対向的摂動と専門家アンカーを備えたターゲットパイプラインを設計する。
第3に、スキーマ駆動型インストラクションチューニングは、明確なスコアリング基準と推論を効率的なエンドツーエンドモデルに組み込む。
- 参考スコア(独自算出の注目度): 24.229489019921726
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While generative text-to-speech (TTS) models approach human-level quality, monolithic metrics fail to diagnose fine-grained acoustic artifacts or explain perceptual collapse. To address this, we propose TTS-PRISM, a multi-dimensional diagnostic framework for Mandarin. First, we establish a 12-dimensional schema spanning stability to advanced expressiveness. Second, we design a targeted synthesis pipeline with adversarial perturbations and expert anchors to build a high-quality diagnostic dataset. Third, schema-driven instruction tuning embeds explicit scoring criteria and reasoning into an efficient end-to-end model. Experiments on a 1,600-sample Gold Test Set show TTS-PRISM outperforms generalist models in human alignment. Profiling six TTS paradigms establishes intuitive diagnostic flags that reveal fine-grained capability differences. TTS-PRISM is open-source, with code and checkpoints at https://github.com/xiaomi-research/tts-prism.
- Abstract(参考訳): 生成的テキスト音声(TTS)モデルは人間レベルの品質にアプローチするが、モノリシックなメトリクスはきめ細かいアコースティックアーティファクトの診断に失敗し、知覚的崩壊を説明する。
そこで本研究では,マンダリンの多次元診断フレームワークであるTS-PRISMを提案する。
まず、安定性と高度な表現性にまたがる12次元のスキーマを確立する。
第2に、高品質な診断データセットを構築するために、対向的摂動とエキスパートアンカーを備えたターゲット合成パイプラインを設計する。
第3に、スキーマ駆動型インストラクションチューニングは、明確なスコアリング基準と推論を効率的なエンドツーエンドモデルに組み込む。
1,600サンプルのゴールドテストセットの実験では、TS-PRISMは人間のアライメントにおいてジェネラリストモデルより優れていた。
6つのTSパラダイムのプロファイリングは、微粒な機能差を示す直感的な診断フラグを確立する。
TTS-PRISMはオープンソースで、コードとチェックポイントはhttps://github.com/xiaomi-research/tts-prismにある。
関連論文リスト
- Assessing the Ability of Neural TTS Systems to Model Consonant-Induced F0 Perturbation [30.798688471243413]
本研究では,子音によるf0摂動を再現するニューラルネットワークモデルの性能を評価するための分節レベルの韻律探索フレームワークを提案する。
同じ音声コーパス(LJ音声)で訓練されたTacotron 2とFastSpeech 2を用いて、語彙周波数で階層化された何千もの単語の合成および自然な音声認識を比較する。
その結果,高周波単語の再現精度は高いが,低周波項目への一般化は低かった。
論文 参考訳(メタデータ) (2026-03-22T06:06:47Z) - EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge [25.51206687438354]
我々は6つのTSシナリオをカバーする包括的なベンチマークである$textitEmergentTTS-Evalを紹介した。
我々のフレームワークはテストケースの生成と評価の両方を自動化するので、ベンチマークが容易にアクセスできます。
我々は、EmergentTTS-Eval上で、11Labs、Deepgram、OpenAIの4o-mini-TTSといった最先端のオープンソースおよびプロプライエタリなTSシステムを評価した。
論文 参考訳(メタデータ) (2025-05-29T02:36:24Z) - Where are we in audio deepfake detection? A systematic analysis over generative and detection models [59.09338266364506]
SONARはAI-Audio Detection FrameworkとBenchmarkの合成である。
最先端のAI合成聴覚コンテンツを識別するための総合的な評価を提供する。
従来のモデルベース検出システムと基礎モデルベース検出システムの両方で、AIオーディオ検出を均一にベンチマークする最初のフレームワークである。
論文 参考訳(メタデータ) (2024-10-06T01:03:42Z) - Pruning Self-Attention for Zero-Shot Multi-Speaker Text-to-Speech [26.533600745910437]
本稿では,TSモデルの一般化能力を向上させるために,スパースアテンション(sparse attention)と呼ばれる変圧器の効率的なプルーニング法を提案する。
また,モデルがしきい値を自動的に学習することのできる,新しい微分可能なプルーニング手法を提案する。
論文 参考訳(メタデータ) (2023-08-28T21:25:05Z) - A Vector Quantized Approach for Text to Speech Synthesis on Real-World
Spontaneous Speech [94.64927912924087]
我々は、YouTubeやポッドキャストから現実の音声を使ってTSシステムを訓練する。
最近のText-to-Speechアーキテクチャは、複数のコード生成とモノトニックアライメントのために設計されている。
近年のテキスト・トゥ・スペーチ・アーキテクチャは,いくつかの客観的・主観的尺度において,既存のTSシステムより優れていることを示す。
論文 参考訳(メタデータ) (2023-02-08T17:34:32Z) - Unsupervised Data Selection for TTS: Using Arabic Broadcast News as a
Case Study [44.07589545984369]
本稿では、自動データ選択と事前学習/微調整戦略を含む、TS構築のための完全に教師なしの手法を提案する。
我々は,データの選択を慎重に行うことで,TSシステムの効率が向上することを示す。
評価の結果,CERは3.9%,CERは1.3%であった。
論文 参考訳(メタデータ) (2023-01-22T10:41:58Z) - On the Interplay Between Sparsity, Naturalness, Intelligibility, and
Prosody in Speech Synthesis [102.80458458550999]
スパーティイとその後の合成音声に対する効果のトレードオフについて検討する。
以上の結果から, 終末TTSモデルに限らず, プルーニングされたTTSモデルでも, 自然性や知性に富んだ合成音声を生成できることが示唆された。
論文 参考訳(メタデータ) (2021-10-04T02:03:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。