論文の概要: ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions
- arxiv url: http://arxiv.org/abs/2607.05276v1
- Date: Mon, 06 Jul 2026 16:21:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.238155
- Title: ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions
- Title(参考訳): ProPS: 自然言語記述型話者埋め込み分布のためのプロファイリングプロファイリング
- Abstract要約: ProPSは、自然言語プロンプトに条件付き話者埋め込みの分布を生成するためのフレームワークである。
本稿では,ProPSがプロファイル条件付き分布を生成し,要求された話者属性を保存するxベクトルを生成することを示す。
- 参考スコア(独自算出の注目度): 17.76770343642986
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speaker embeddings, or x-vectors, are widely used to represent speaker identity and speaker-related attributes, but existing embedding extractors are typically descriptive rather than generative: they map an observed speech segment to an x-vector, which is then used for downstream applications. We introduce ProPS, Prompted Profile Synthesis, a framework for generating distributions of speaker embeddings conditioned on natural language prompts such as "a thirties male speaker with an Indian accent". ProPS converts human-written profile descriptions into sentence embeddings and uses a mixture density network trained on a large-scale dataset to predict a Gaussian mixture model in the x-vector space. The model is trained by maximizing the likelihood that real speaker embeddings match the requested profile, and its generated distributions are evaluated by negative log-likelihood on held-out x-vectors and by attribute classification accuracies on sampled synthetic x-vectors. Experiments show that ProPS produces profile-conditioned distributions and generates x-vectors that preserve requested speaker attributes such as age, gender, accent, and prosodic characteristics. This design enables controllable speaker-profile synthesis for speech generation systems like Text-To-Speech (TTS) or Voice Conversion (VC) while anchoring generated distributions in observed speaker-embedding structure.
- Abstract(参考訳): 話者埋め込み(x-vectors)は、話者識別と話者関連属性を表現するために広く使われているが、既存の埋め込み抽出器は、生成ではなく記述的であり、観測された音声セグメントをx-vectorにマッピングし、下流のアプリケーションに使用される。
本稿では,ProPS, Prompted Profile Synthesisを紹介した。これは「インドアクセントを持つ30代男性話者」のような自然言語プロンプトに条件付き話者埋め込みの分布を生成するフレームワークである。
ProPSは、人書きによるプロファイル記述を文の埋め込みに変換し、大規模なデータセットでトレーニングされた混合密度ネットワークを使用して、xベクトル空間におけるガウス混合モデルを予測する。
このモデルは、実話者埋め込みが要求されたプロファイルに合致する確率を最大化することにより訓練され、その分布は、保持されたxベクトル上の負の対数類似度と、サンプル化された合成xベクトル上の属性分類精度により評価される。
実験によると、ProPSはプロファイル条件付き分布を生成し、年齢、性別、アクセント、韻律特性などの要求された話者属性を保存するxベクターを生成する。
本設計により,TTS (Text-To-Speech) やVoice Conversion (Voice Conversion) などの音声生成システムに対して,観測された話者埋め込み構造において生成された分布をアンロックしながら,制御可能な話者強調合成を可能にする。
関連論文リスト
- CoLMbo: Speaker Language Model for Descriptive Profiling [56.57669166980832]
話者認識システムは、しばしば分類タスクに限られ、詳細な話者特性を生成するのに苦労する。
本稿では、話者エンコーダとプロンプトベースの条件付けを統合することで、これらの制約に対処する話者言語モデル(SLM)であるCoLMboを紹介する。
CoLMboはユーザ定義のプロンプトを利用して、新しい話者特性に動的に適応し、カスタマイズされた記述を提供する。
論文 参考訳(メタデータ) (2025-06-11T03:50:16Z) - Rethinking Speaker Embeddings for Speech Generation: Sub-Center Modeling for Capturing Intra-Speaker Diversity [51.250471760075165]
本稿では,学習中に話者単位の複数のサブセンタを利用する新しい話者埋め込みネットワークを提案する。
このサブセンターモデリングにより、埋め込みは話者分類性能を維持しながら、幅広い話者固有のバリエーションを捉えることができる。
論文 参考訳(メタデータ) (2024-07-05T06:54:24Z) - VoxGenesis: Unsupervised Discovery of Latent Speaker Manifold for Speech
Synthesis [43.369048727268506]
VoxGenesisは、教師なし音声合成フレームワークである。
教師なしで潜在話者多様体と有意義な音声編集方向を見つけることができる。
本稿では,VoxGenesisが従来のアプローチとは大きく異なる特徴を持つ,より多彩で現実的な話者を生成することを示す。
論文 参考訳(メタデータ) (2024-03-01T13:39:56Z) - Zero-shot text-to-speech synthesis conditioned using self-supervised
speech representation model [13.572330725278066]
提案手法の新たなポイントは、大量のデータで訓練された音声表現から組込みベクトルを得るためにSSLモデルを直接利用することである。
この不整合埋め込みにより、未知話者の再生性能が向上し、異なる音声によるリズム伝達が実現される。
論文 参考訳(メタデータ) (2023-04-24T10:15:58Z) - Residual Information in Deep Speaker Embedding Architectures [4.619541348328938]
本稿では,最新の高性能DNNアーキテクチャを用いて抽出した6組の話者埋め込みについて解析する。
データセットには46人の話者が同じプロンプトを発信し、プロのスタジオや自宅の環境に記録されている。
その結果、解析された埋め込みの識別力は非常に高いが、分析された全てのアーキテクチャにおいて、残余情報は依然として表現の中に存在することがわかった。
論文 参考訳(メタデータ) (2023-02-06T12:37:57Z) - A unified one-shot prosody and speaker conversion system with
self-supervised discrete speech units [94.64927912924087]
既存のシステムは韻律と言語内容の相関を無視し、変換された音声の自然度を低下させる。
自己教師付き離散音声単位を言語表現として活用するカスケードモジュラーシステムを提案する。
実験により,本システムは,自然性,知性,話者伝達性,韻律伝達性において,従来の手法よりも優れていたことがわかった。
論文 参考訳(メタデータ) (2022-11-12T00:54:09Z) - AdaSpeech 4: Adaptive Text to Speech in Zero-Shot Scenarios [143.47967241972995]
高品質音声合成のためのゼロショット適応型TSシステムであるAdaSpeech 4を開発した。
話者特性を体系的にモデル化し、新しい話者の一般化を改善する。
微調整なしでは、AdaSpeech 4は複数のデータセットのベースラインよりも声質と類似性が向上する。
論文 参考訳(メタデータ) (2022-04-01T13:47:44Z) - Streaming Speaker-Attributed ASR with Token-Level Speaker Embeddings [53.11450530896623]
本稿では,「誰が何を話したか」を認識可能な,ストリーミング話者対応自動音声認識(SA-ASR)モデルを提案する。
本モデルは,最近提案されたマルチトーカー音声をストリーミング形式で書き起こすためのトークンレベルシリアライズアウトプットトレーニング(t-SOT)に基づいている。
提案モデルでは,従来のストリーミングモデルよりも精度が大幅に向上し,最先端のオフラインSA-ASRモデルに匹敵する,あるいは時として優れた結果が得られる。
論文 参考訳(メタデータ) (2022-03-30T21:42:00Z) - Speaker Anonymization with Distribution-Preserving X-Vector Generation
for the VoicePrivacy Challenge 2020 [19.420608243033794]
本稿では,VoicePrivacy Challenge 2020への提出として,分散保存音声匿名化手法を提案する。
提案手法は, 有機話者Xベクトルの相似性分布をより正確に追従するXベクトルを生成する方法を示す。
論文 参考訳(メタデータ) (2020-10-26T09:53:56Z) - Vector-Quantized Timbre Representation [53.828476137089325]
本稿では, スペクトル特性の近似分解を生成的特徴の集合で学習することにより, 個々の音色をより柔軟に合成することを目的とする。
音量分布の量子化表現を学習するために、大音量から切り離された離散潜在空間を持つオートエンコーダを導入する。
オーケストラ楽器と歌唱音声間の音声の翻訳結果と、ボーカルの模倣音から楽器への変換結果について詳述する。
論文 参考訳(メタデータ) (2020-07-13T12:35:45Z) - Probabilistic embeddings for speaker diarization [13.276960253126656]
非常に短い音声区間から抽出された話者埋め込み(xベクトル)は、近年、話者ダイアリゼーションにおける競合性能を示すことが示されている。
我々は,このレシピを,対角線精度行列であるxベクトルと並行して,各音声区間から抽出することによって一般化する。
これらの精度は、高品質な音声セグメントから抽出された場合、埋め込みの値が何であったかの不確かさを定量化する。
論文 参考訳(メタデータ) (2020-04-06T14:51:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。