論文の概要: Can Prosodic Style Be Inferred from Text Alone? Evidence from Unsupervised Acoustic Clusters
- arxiv url: http://arxiv.org/abs/2610.05575v1
- Date: Sun, 04 Oct 2026 22:25:06 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:47:19.031527
- Title: Can Prosodic Style Be Inferred from Text Alone? Evidence from Unsupervised Acoustic Clusters
- Title(参考訳): テキストから韻律的スタイルを推定できるか?教師なし音響クラスタからの証拠
- Abstract要約: 本稿では,文章が十分な情報を持っているという仮定を検証し,その提供に適した韻律形式を選択する。
1200時間会話コーパス内の6人の話者に対して、発話は韻律のみの制御を含む5つの音声モデルの空間に集約される。
- 参考スコア(独自算出の注目度): 8.084839373492601
- License:
- Abstract: Much of expressive text-to-speech research rests on an untested assumption that written text carries enough information to select an appropriate prosodic style for its delivery. Text-predicted style models improve listener preference, and expressive-appropriateness evaluation presupposes that context constrains style, yet neither measures the assumption itself. This paper tests it as a falsifiable hypothesis against style labels derived from acoustics alone. For each of six speakers in a 1,200-hour conversational corpus, utterances are clustered in the spaces of five speech models, including a prosody-only control, and the cluster of held-out utterances is predicted from twelve text embedding models. Three controls are applied: utterance length is erased from the speech embeddings; accuracy is scored against the majority-class floor of unbalanced clusters rather than uniform chance; and a bag-of-words baseline measures word identity alone. Text predicts the cluster above that floor for all six speakers (+0.111 top-3 accuracy), but bag-of-words achieves three quarters of this. Sentence embeddings add only +0.026, largest for encoders not trained for sentence semantics and reversed by tree-based probes for all others. Acoustic clusters are not compact in text embedding space in any of 360 configurations. The prosody-only space weakens the association for five speakers, but not for the speaker showing it most strongly. Text thus informs these delivery clusters mainly through word choice, whether as a cue to prosody or as a marker of topic and recording situation, and reference-free style selection cannot assume more.
- Abstract(参考訳): 表現力のあるテキストから音声への研究の多くは、文章が十分な情報を持っているという未証明の仮定に頼っている。
テキスト予測スタイルモデルはリスナーの嗜好を改善し、表現的適切性評価は文脈制約スタイルを前提としているが、仮定自体を測るものではない。
本稿では,音響のみから派生したスタイルラベルに対して,フェール可能な仮説として検証する。
1200時間会話コーパス内の6人の話者に対して、韻律のみの制御を含む5つの音声モデルの空間に発話がクラスタ化され、12のテキスト埋め込みモデルから保留音声のクラスタが予測される。
音声埋め込みから発話長を消去し、不均衡クラスタの多数階に対して精度を計測し、単語の基底線が単語の同一性のみを測定する。
テキストはその階上の6つのスピーカー(+0.111トップ3の精度)でクラスタを予測しますが、単語のバッグは4分の3を実現しています。
文の埋め込みは+0.026で、文のセマンティクスの訓練を受けていないエンコーダで最大であり、木ベースのプローブで逆転する。
音響クラスタは、360度構成のいずれにおいてもテキスト埋め込み空間ではコンパクトではない。
韻律のみの空間は5人の話者の関連を弱めるが、最も強く示す話者には向いていない。
したがって、テキストは、主に、韻律の手がかりとして、あるいは話題や記録状況の指標として、あるいは参照なしスタイルの選択として、単語の選択を通じて、これらの配信クラスタに通知する。
関連論文リスト
- A stylometric analysis of speaker attribution from speech transcripts [0.5371337604556311]
法医学的な科学者は、身代金の請求、隠蔽記録、自殺届の疑い、匿名のオンライン通信など、未知の話者や作家を特定する必要があることが多い。
音声領域における話者認識は通常、音声の音声的または音響的特性を調べる。
話者が音声を偽装したり、音声合成ソフトを使用すれば、音声特性はもはや信頼できないかもしれない。
論文 参考訳(メタデータ) (2025-12-15T18:55:25Z) - Surprise! Uniform Information Density Isn't the Whole Story: Predicting Surprisal Contours in Long-form Discourse [54.08750245737734]
話者は、階層的に構造化された談話モデル内の位置に基づいて、情報率を変調する。
階層的予測器は談話の情報輪郭の重要な予測器であり,深い階層的予測器は浅い予測器よりも予測力が高いことがわかった。
論文 参考訳(メタデータ) (2024-10-21T14:42:37Z) - Towards Unsupervised Speech Recognition Without Pronunciation Models [57.222729245842054]
本稿では,ペア音声とテキストコーパスを使わずにASRシステムを開発するという課題に取り組む。
音声合成とテキスト・テキスト・マスクによるトークン埋込から教師なし音声認識が実現可能であることを実験的に実証した。
この革新的なモデルは、レキシコンフリー環境下での以前の教師なしASRモデルの性能を上回る。
論文 参考訳(メタデータ) (2024-06-12T16:30:58Z) - Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue [71.15186328127409]
パラリンGPT(Paralin GPT)
モデルは、シリアライズされたマルチタスクフレームワーク内の入力プロンプトとして、テキスト、音声埋め込み、およびパラ言語属性の会話コンテキストを取る。
音声対話データセットとして,感情ラベルをパラ言語属性として含むSwitchboard-1コーパスを利用する。
論文 参考訳(メタデータ) (2023-12-23T18:14:56Z) - Self-supervised Fine-tuning for Improved Content Representations by
Speaker-invariant Clustering [78.2927924732142]
話者不変クラスタリング(Spin)を自己教師付き学習手法として提案する。
Spinは、単一のGPU上で45分間の微調整で、スピーカー情報を切り離し、コンテンツ表現を保存する。
論文 参考訳(メタデータ) (2023-05-18T15:59:36Z) - Controllable speech synthesis by learning discrete phoneme-level
prosodic representations [53.926969174260705]
直感的な離散ラベルを用いたF0と持続時間に対する音素レベル韻律制御のための新しい手法を提案する。
複数話者音声データセットから音素レベルF0と持続時間の特徴を識別するために用いられる教師なし韻律クラスタリングプロセスを提案する。
論文 参考訳(メタデータ) (2022-11-29T15:43:36Z) - Homophone Reveals the Truth: A Reality Check for Speech2Vec [1.2691047660244335]
本稿では,本分野における基礎研究の真正性,すなわちSpeech2Vecについて検討する。
これらの埋め込みがSpeech2Vecモデルによって生成されるという兆候はない。
実験の結果、このモデルは効果的なセマンティック埋め込みを学習できなかった。
論文 参考訳(メタデータ) (2022-09-22T05:32:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。