論文の概要: A Novel Automatic Framework for Speaker Drift Detection in Synthesized Speech
- arxiv url: http://arxiv.org/abs/2604.06327v1
- Date: Tue, 07 Apr 2026 18:05:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-09 17:30:51.169343
- Title: A Novel Automatic Framework for Speaker Drift Detection in Synthesized Speech
- Title(参考訳): 合成音声における話者ドリフト検出のための新しいフレームワーク
- Authors: Jia-Hong Huang, Seulgi Kim, Yi Chieh Liu, Yixian Shen, Hongyi Zhu, Prayag Tiwari, Stevan Rudinac, Evangelos Kanoulas,
- Abstract要約: 近年の拡散型テキスト音声合成(TTS)モデルは、自然性や表現性が高いが、話者のドリフトに悩まされることが多い。
発話レベルの話者整合性よりも二項分類タスクとして定式化することで、話者のドリフトを検出するための最初の自動フレームワークを提案する。
本手法は,合成音声の重なり合う部分のコサイン類似性を計算し,構造表現を持つ大規模言語モデルにドリフトを評価する。
- 参考スコア(独自算出の注目度): 34.33842514204989
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent diffusion-based text-to-speech (TTS) models achieve high naturalness and expressiveness, yet often suffer from speaker drift, a subtle, gradual shift in perceived speaker identity within a single utterance. This underexplored phenomenon undermines the coherence of synthetic speech, especially in long-form or interactive settings. We introduce the first automatic framework for detecting speaker drift by formulating it as a binary classification task over utterance-level speaker consistency. Our method computes cosine similarity across overlapping segments of synthesized speech and prompts large language models (LLMs) with structured representations to assess drift. We provide theoretical guarantees for cosine-based drift detection and demonstrate that speaker embeddings exhibit meaningful geometric clustering on the unit sphere. To support evaluation, we construct a high-quality synthetic benchmark with human-validated speaker drift annotations. Experiments with multiple state-of-the-art LLMs confirm the viability of this embedding-to-reasoning pipeline. Our work establishes speaker drift as a standalone research problem and bridges geometric signal analysis with LLM-based perceptual reasoning in modern TTS.
- Abstract(参考訳): 最近の拡散型テキスト音声モデル(TTS)は、自然性や表現性が高いが、話者のドリフトに悩まされることが多い。
この過度に探索された現象は、特にロングフォームまたはインタラクティブな設定において、合成音声のコヒーレンスを損なう。
発話レベルの話者整合性よりも二項分類タスクとして定式化することで、話者のドリフトを検出するための最初の自動フレームワークを提案する。
合成音声の重なり合う部分のコサイン類似性を計算し、構造化表現を用いた大規模言語モデル(LLM)を誘導し、ドリフトを評価する。
我々は,コサインに基づくドリフト検出の理論的保証を提供し,話者埋め込みが単位球上に有意義な幾何学的クラスタリングを示すことを示す。
評価を支援するため,人為的な話者ドリフトアノテーションを用いた高品質な合成ベンチマークを構築した。
複数の最先端のLCMを用いた実験により、この埋込み型パイプラインの生存可能性が確認された。
我々の研究は、話者ドリフトを独立した研究問題として確立し、現代のTSにおけるLLMに基づく知覚的推論による幾何学的信号解析を橋渡しする。
関連論文リスト
- Who Spoke What When? Evaluating Spoken Language Models for Conversational ASR with Semantic and Overlap-Aware Metrics [99.89493037369071]
音声の重複や遠距離雑音,話者数の変化など,会話の自動音声認識は依然として困難である。
近年のLCMベースのシステムは単一話者のベンチマークでは良好に動作するが、マルチ話者設定におけるロバスト性は不明確である。
重なり、意味的忠実度、話者数、シングルチャンネルとマルチチャネル入力の4つの軸に沿って、LLMベースのアプローチとモジュラーアプローチを体系的に比較する。
論文 参考訳(メタデータ) (2026-03-24T02:01:21Z) - SNAP: Speaker Nulling for Artifact Projection in Speech Deepfake Detection [51.096014381455454]
自己教師付き学習ベースの音声エンコーダは、目に見えない話者を一般化するのに苦労する。
話者の絡み合いは、検出者が人工物に関連する手がかりではなく、話者固有の相関を悪用する原因となる。
我々は、この依存を軽減するために、SNAPという話者無効化フレームワークを紹介した。
論文 参考訳(メタデータ) (2026-03-21T07:05:30Z) - Speech Rhythm-Based Speaker Embeddings Extraction from Phonemes and
Phoneme Duration for Multi-Speaker Speech Synthesis [16.497022070614236]
本稿では,ターゲット話者による発話数を用いて,音素長をモデル化するための音声リズムに基づく話者埋め込み手法を提案する。
提案手法の新たな特徴は、音素とその持続時間から抽出されたリズムに基づく埋め込みであり、発声リズムに関連することが知られている。
論文 参考訳(メタデータ) (2024-02-11T02:26:43Z) - Zero-shot text-to-speech synthesis conditioned using self-supervised
speech representation model [13.572330725278066]
提案手法の新たなポイントは、大量のデータで訓練された音声表現から組込みベクトルを得るためにSSLモデルを直接利用することである。
この不整合埋め込みにより、未知話者の再生性能が向上し、異なる音声によるリズム伝達が実現される。
論文 参考訳(メタデータ) (2023-04-24T10:15:58Z) - A Vector Quantized Approach for Text to Speech Synthesis on Real-World
Spontaneous Speech [94.64927912924087]
我々は、YouTubeやポッドキャストから現実の音声を使ってTSシステムを訓練する。
最近のText-to-Speechアーキテクチャは、複数のコード生成とモノトニックアライメントのために設計されている。
近年のテキスト・トゥ・スペーチ・アーキテクチャは,いくつかの客観的・主観的尺度において,既存のTSシステムより優れていることを示す。
論文 参考訳(メタデータ) (2023-02-08T17:34:32Z) - Combining Automatic Speaker Verification and Prosody Analysis for
Synthetic Speech Detection [15.884911752869437]
本稿では,人間の声の2つの高レベルな意味的特性を組み合わせた合成音声検出手法を提案する。
一方, 話者識別手法に着目し, 自動話者検証タスクの最先端手法を用いて抽出した話者埋め込みとして表現する。
一方、リズム、ピッチ、アクセントの変化を意図した音声韻律は、特殊なエンコーダによって抽出される。
論文 参考訳(メタデータ) (2022-10-31T11:03:03Z) - Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE [36.50265124324876]
本稿では,テキストと音声のペアを必要としない,教師なしの音声合成モデルであるUTTSを提案する。
このフレームワークは、話者の持続時間モデル、音色特徴(アイデンティティ)、TTS推論のための内容の柔軟な選択を提供する。
実験により、UTTSは人間と客観的評価によって測定された高い自然性と知性のある音声を合成できることが示されている。
論文 参考訳(メタデータ) (2022-06-06T11:51:22Z) - Streaming Speaker-Attributed ASR with Token-Level Speaker Embeddings [53.11450530896623]
本稿では,「誰が何を話したか」を認識可能な,ストリーミング話者対応自動音声認識(SA-ASR)モデルを提案する。
本モデルは,最近提案されたマルチトーカー音声をストリーミング形式で書き起こすためのトークンレベルシリアライズアウトプットトレーニング(t-SOT)に基づいている。
提案モデルでは,従来のストリーミングモデルよりも精度が大幅に向上し,最先端のオフラインSA-ASRモデルに匹敵する,あるいは時として優れた結果が得られる。
論文 参考訳(メタデータ) (2022-03-30T21:42:00Z) - Any-to-Many Voice Conversion with Location-Relative Sequence-to-Sequence
Modeling [61.351967629600594]
本稿では,非並列音声変換手法である非並列音声変換法(seq2seq)を提案する。
本手法では,ボトルネック特徴抽出器(BNE)とセック2セック合成モジュールを組み合わせる。
主観的および主観的評価は,提案手法が自然性と話者類似性の両方において優れた音声変換性能を有することを示す。
論文 参考訳(メタデータ) (2020-09-06T13:01:06Z) - Semi-supervised Learning for Multi-speaker Text-to-speech Synthesis
Using Discrete Speech Representation [125.59372403631006]
マルチ話者テキスト音声(TTS)のための半教師付き学習手法を提案する。
マルチスピーカTTSモデルは、離散音声表現を備えたエンコーダデコーダフレームワークを用いて、未転写音声から学習することができる。
提案した半教師あり学習手法は,音声データの一部がうるさい場合にも有効であることがわかった。
論文 参考訳(メタデータ) (2020-05-16T15:47:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。