論文の概要: Using embeddings to predict spoken word duration and pitch in Mandarin monosyllabic words
- arxiv url: http://arxiv.org/abs/2607.02002v1
- Date: Thu, 02 Jul 2026 10:38:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.791391
- Title: Using embeddings to predict spoken word duration and pitch in Mandarin monosyllabic words
- Title(参考訳): マンダリン単音節単語における単語長と音節の埋め込みによる予測
- Abstract要約: 会話音声中のマンダリン単語の時間正規化f0輪郭は、文脈的埋め込み(CE)から予測可能であることが示されている。
本研究は,自然発声コーパスから抽出したマンダリン単音節CV語の7470のトークンに対して,CEが発話長を予測できるかどうかを検討した。
- 参考スコア(独自算出の注目度): 0.4078247440919472
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Time-normalized f0 contours of Mandarin words in conversational speech have been shown to be predictable in part from their contextualized embeddings (CEs). The present study investigates whether CEs also predict spoken word duration for 7470 tokens of Mandarin monosyllabic CV words extracted from a Mandarin corpus of spontaneous speech. We show that CEs indeed are predictive for duration, above chance level, not only at the type level, but also at the level of individual tokens, as indicated by the results obtained with the type-wise and token-wise permutation baselines. We also show that the predicted durations are sufficiently precise to back-transform predicted f0 contours in [0,1] normalized time to contours on the ms time scale. The resulting predicted contours approximate empirical contours and also outperform a permutation baseline.
- Abstract(参考訳): 会話音声中のマンダリン単語の時間正規化f0輪郭は、文脈的埋め込み(CE)から予測可能であることが示されている。
本研究は,自然発声コーパスから抽出したマンダリン単音節CV語の7470のトークンに対して,CEが発話長を予測できるかどうかを検討した。
CEは,型レベルだけでなく,個々のトークンのレベルにおいても,確率レベル以上の持続時間で予測可能であることを示す。
また, 予測期間は[0,1]正規化時間における逆変換f0輪郭からms時間スケールでの輪郭に十分正確であることを示す。
その結果、予測された輪郭は経験的輪郭に近似し、置換基線を上回る。
関連論文リスト
- A Practical Evaluation Method for Long-Form Simultaneous Speech-to-Speech Translation [9.807543197382016]
シマルS2ST (SimulS2ST) はリアルタイム言語間通信を実現する。
長文SimulS2STの実用的評価法を提案する。
論文 参考訳(メタデータ) (2026-06-13T02:20:49Z) - Probing for Reading Times [60.30314214800421]
我々は、英語、ギリシャ語、ヘブライ語、ロシア語、トルコ語における人間の読書時間を表す言語モデル表現を探索する。
その結果,初期層からの表現は,初回固定や視線持続時間などの早期通過の予測において極めて優れていた。
論文 参考訳(メタデータ) (2026-04-20T18:12:59Z) - On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation [88.77441715819366]
大規模生音声で事前訓練された生成音声言語モデルは、適切な内容で音声プロンプトを継続することができる。
本稿では,グローバルトークンの難易度に代えて,多種多様な可能性・生成的評価手法を提案する。
論文 参考訳(メタデータ) (2026-01-09T22:01:56Z) - A new kid on the block: Distributional semantics predicts the word-specific tone signatures of monosyllabic words in conversational Taiwan Mandarin [0.4078247440919472]
単音節単語のピッチの輪郭が自然会話型マンダリンでどのように実現されるかを検討する。
単語の効果は音素認識の強い予測因子であることがわかった。
音声学では、分布意味論はブロック上の新しい子供である。
論文 参考訳(メタデータ) (2025-11-21T15:56:58Z) - Languages in Multilingual Speech Foundation Models Align Both Phonetically and Semantically [58.019484208091534]
事前訓練された言語モデル(LM)における言語間アライメントは、テキストベースのLMの効率的な転送を可能にしている。
テキストに基づく言語間アライメントの発見と手法が音声に適用されるかどうかについては、未解決のままである。
論文 参考訳(メタデータ) (2025-05-26T07:21:20Z) - The realization of tones in spontaneous spoken Taiwan Mandarin: a corpus-based survey and theory-driven computational modeling [1.7723990552388866]
本研究では,マンダリン音節単語の音節認識と2つの音節の組み合わせについて検討した。
その結果、文脈や音素的実現における意味は、標準言語理論が予測するよりもはるかに絡み合っていることがわかった。
論文 参考訳(メタデータ) (2025-03-29T17:39:55Z) - Surprise! Uniform Information Density Isn't the Whole Story: Predicting Surprisal Contours in Long-form Discourse [54.08750245737734]
話者は、階層的に構造化された談話モデル内の位置に基づいて、情報率を変調する。
階層的予測器は談話の情報輪郭の重要な予測器であり,深い階層的予測器は浅い予測器よりも予測力が高いことがわかった。
論文 参考訳(メタデータ) (2024-10-21T14:42:37Z) - Word-specific tonal realizations in Mandarin [0.9249657468385781]
本研究は,音素認識が単語の意味によって部分的に決定されることを示唆している。
まず,台湾・マンダリン自発会話のコーパスに基づいて,従来確立されていたすべての単語形式関連予測器よりも,単語型が音素認識の強力な予測器であることが示される。
次に、文脈固有単語埋め込みを用いた計算モデルを用いて、トークン固有ピッチ輪郭が保持データ上で50%の精度で単語タイプを予測することを示す。
論文 参考訳(メタデータ) (2024-05-11T13:00:35Z) - LongFNT: Long-form Speech Recognition with Factorized Neural Transducer [64.75547712366784]
文レベルの長文特徴を語彙予測器の出力と直接融合するLongFNT-Textアーキテクチャを提案する。
また,LongFNT法の有効性を,相対単語誤り率(WER)が19%,GigaSpeechコーパスが12%,LongFNT法が19%であった。
論文 参考訳(メタデータ) (2022-11-17T08:48:27Z) - M-SpeechCLIP: Leveraging Large-Scale, Pre-Trained Models for
Multilingual Speech to Image Retrieval [56.49878599920353]
本研究は,多言語画像音声検索におけるCLIPとHuBERTの大規模,英語のみの事前学習モデル(CLIPとHuBERT)の利用について検討する。
非英語画像音声検索では、各言語毎に個別のモデルを訓練する場合と、3言語すべてで音声を処理する1つのモデルの両方において、最先端のパフォーマンスを幅広いマージンで上回ります。
論文 参考訳(メタデータ) (2022-11-02T14:54:45Z) - Direct speech-to-speech translation with discrete units [64.19830539866072]
本稿では、中間テキスト生成に頼ることなく、ある言語から別の言語に音声を変換する直接音声音声翻訳(S2ST)モデルを提案する。
そこで本稿では,ラベルなし音声コーパスから学習した自己教師付き離散表現の予測を提案する。
対象のテキスト書き起こしが利用可能となると、同一の推論パスで2つのモード出力(音声とテキスト)を同時に生成できる、共同音声認識とテキストトレーニングを備えたマルチタスク学習フレームワークを設計する。
論文 参考訳(メタデータ) (2021-07-12T17:40:43Z) - Deep Learning for Prominence Detection in Children's Read Speech [13.041607703862724]
子どもの読書記録のラベル付きデータセットを,話者に依存しない著名単語の検出のために検討する。
事前調整されたランダムフォレストアンサンブル予測器をRNNシーケンスに置き換え、潜在的なコンテキスト依存性を利用する。
深層学習を用いて、基本周波数、強度、スペクトル形状の低レベル音響輪郭から単語レベル特徴を得る。
論文 参考訳(メタデータ) (2021-04-12T14:15:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。