論文の概要: Manipulation of oral cancer speech using neural articulatory synthesis
- arxiv url: http://arxiv.org/abs/2203.17072v1
- Date: Thu, 31 Mar 2022 14:40:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2022-04-01 21:43:40.843565
- Title: Manipulation of oral cancer speech using neural articulatory synthesis
- Title(参考訳): 神経合成を用いた口腔癌音声の操作
- Abstract要約: 調音合成システムは、調音軌跡を操作でき、合成された音声が、基底真実の口腔癌音声に存在する問題を再現することができる。
客観的かつ主観的な評価は、このフレームワークが自然性を受け入れており、さらなる調査に値することを示している。
- 参考スコア(独自算出の注目度): 12.537892439672115
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present an articulatory synthesis framework for the synthesis and
manipulation of oral cancer speech for clinical decision making and alleviation
of patient stress. Objective and subjective evaluations demonstrate that the
framework has acceptable naturalness and is worth further investigation. A
subsequent subjective vowel and consonant identification experiment showed that
the articulatory synthesis system can manipulate the articulatory trajectories
so that the synthesised speech reproduces problems present in the ground truth
oral cancer speech.
- Abstract(参考訳): 本稿では,口腔癌音声の合成と操作のための調音合成フレームワークを提案する。
客観的および主観的評価は、この枠組みが許容される自然性を持ち、さらなる調査に値することを示している。
その後の主観的母音と子音識別実験により、調音合成システムは調音軌道を操作でき、合成された音声は、基底真性口腔癌音声に存在する問題を再現できることを示した。
関連論文リスト
- Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS [61.29502937013759]
声道運動と調音疑似ラベルで訓練されたフローマッチングに基づく音声合成モデルを提案する。
提案モデルでは,声の努力や調音の連続的・不整合的な制御を実現するとともに,発話の特定のセグメントを明確にするための単語レベルの強調を可能にする。
論文 参考訳(メタデータ) (2026-06-22T11:14:22Z) - Augmenting Dysarthric Speech Severity Assessment with MOS Supervision [13.782589618988501]
本研究は, 音声合成評価から得られたデータを用いて, 変形性音声評価を強化することを提案する。
実験により,音声合成評価データの微調整は,知性および自然性予測の両方の性能を一貫して向上させることが示された。
論文 参考訳(メタデータ) (2026-06-17T03:29:40Z) - On the Emotion Understanding of Synthesized Speech [63.13411068766772]
感情は音声対話における中核的なパラ言語的特徴である。
現在の音声感情認識(SER)モデルは、合成音声に一般化できない。
生成音声言語モデル(SLM)は、パラ言語的手がかりを無視しながら、テキスト意味論から感情を推測する傾向がある。
論文 参考訳(メタデータ) (2026-03-17T13:11:14Z) - A Speech-to-Video Synthesis Approach Using Spatio-Temporal Diffusion for Vocal Tract MRI [22.92611067883196]
音声信号から声道の視覚を生成するための音声・ビデオ生成フレームワークを提案する。
本フレームワークは,まずRT-/cine-MRIシーケンスと音声サンプルを前処理し,時間的アライメントを実現する。
合成ビデオにおける声道運動の解析と比較により,健常者および舌癌患者の声道運動に関する枠組みについて検討した。
論文 参考訳(メタデータ) (2025-03-15T12:12:50Z) - Spontaneous Style Text-to-Speech Synthesis with Controllable Spontaneous Behaviors Based on Language Models [55.898594710420326]
本稿では,言語モデルに基づく新たな自然音声合成システムを提案する。
自発音声における微妙な韻律変化を捉えるモデルの能力を高めるために, きめ細かい韻律モデリングを導入する。
論文 参考訳(メタデータ) (2024-07-18T13:42:38Z) - Coding Speech through Vocal Tract Kinematics [5.0751585360524425]
調音特徴は声道調音器のキネマティックな形状と音源の特徴の痕跡であり、直感的に解釈可能で制御可能である。
話者埋め込みは音節から効果的に切り離され、アクセントを保ったゼロショット音声変換が可能となる。
論文 参考訳(メタデータ) (2024-06-18T18:38:17Z) - EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech
Resynthesis [49.04496602282718]
テキストなし音声合成のための高品質な表現型音声データセットであるExpressoを紹介する。
このデータセットは、26の自発的表現スタイルで描画された読み上げ音声と即興対話の両方を含む。
自己監督型離散エンコーダの自動計測値を用いて再生品質を評価する。
論文 参考訳(メタデータ) (2023-08-10T17:41:19Z) - How Generative Spoken Language Modeling Encodes Noisy Speech:
Investigation from Phonetics to Syntactics [33.070158866023]
生成音声言語モデリング(GSLM)は、音声分析と合成のための音素ではなく、データから派生した学習シンボルを使用する。
本稿では,GSLMの音声・音声レベルにおける符号化と復号化の有効性について述べる。
論文 参考訳(メタデータ) (2023-06-01T14:07:19Z) - Simple and Effective Unsupervised Speech Synthesis [97.56065543192699]
簡単なレシピに基づく教師なし音声合成システムを提案する。
本手法では, 音声音声とレキシコンのみを用いることで, 人手によるコーパスを必要とせず, 音声合成が可能となる。
論文 参考訳(メタデータ) (2022-04-06T00:19:13Z) - Discretization and Re-synthesis: an alternative method to solve the
Cocktail Party Problem [65.25725367771075]
この研究は、初めて合成に基づくアプローチがこの問題にうまく対応できることを示した。
具体的には,離散シンボルの認識に基づく音声分離/強調モデルを提案する。
離散シンボルの入力による合成モデルを利用することで、離散シンボル列の予測後、各ターゲット音声を再合成することができる。
論文 参考訳(メタデータ) (2021-12-17T08:35:40Z) - LaughNet: synthesizing laughter utterances from waveform silhouettes and
a single laughter example [55.10864476206503]
我々は、波形シルエットを入力として、笑いを合成するLaughNetと呼ばれるモデルを提案する。
その結果,LaughNetは笑い声を適度な品質で合成し,トレーニング例の特徴を保てることがわかった。
論文 参考訳(メタデータ) (2021-10-11T00:45:07Z) - An Objective Evaluation Framework for Pathological Speech Synthesis [36.41726606690864]
そこで本研究では,合成病理音声の一貫した評価のための一般的な枠組みを提案する。
この枠組みは音声の質と可聴性を評価する。
本研究では, 異なるレベルの音声の理解度で, 変形性音声を合成できることを示す。
論文 参考訳(メタデータ) (2021-07-01T08:55:57Z) - Towards Modelling Coherence in Spoken Discourse [48.80477600384429]
話し言葉におけるコヒーレンスは、音声の韻律的および音響的パターンに依存している。
音声に基づくコヒーレンスモデルを用いて音声対話におけるコヒーレンスをモデル化する。
論文 参考訳(メタデータ) (2020-12-31T20:18:29Z) - Laughter Synthesis: Combining Seq2seq modeling with Transfer Learning [6.514358246805895]
本稿では,シーケンス・ツー・シーケンスTTS合成システムに基づく音声笑い合成システムを提案する。
我々は、深層学習モデルを訓練することで、翻訳学習を活用して、アノテーションから音声と笑いの両方を生成することを学習する。
論文 参考訳(メタデータ) (2020-08-20T09:37:28Z) - Analysis and Synthesis of Hypo and Hyperarticulated Speech [11.481208551940998]
本稿では,HMMに基づく音声合成の枠組みにおいて,仮説および高調波音声の分析と合成に焦点をあてる。
我々のニーズに合致する新しいフランス語データベースが作成され、中性、偽、高調音音声の3つの異なる音階で発音される3つの同一セットが含まれた。
調音度は声道特性と声門特性の両方に有意な影響を与え,また発話速度,音声持続時間,電話の変動,声門停止の有無に有意な影響を及ぼすことが示された。
論文 参考訳(メタデータ) (2020-06-07T12:21:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。