論文の概要: Comparing Human and Automatic Recognition of Dutch Dysarthric Continuous Speech: A Case Study
- arxiv url: http://arxiv.org/abs/2606.30237v1
- Date: Mon, 29 Jun 2026 12:47:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.221265
- Title: Comparing Human and Automatic Recognition of Dutch Dysarthric Continuous Speech: A Case Study
- Title(参考訳): オランダ語節節連続音声の人体認識と自動認識の比較 : 症例的検討
- Authors: Yuanyuan Zhang, Dimme de Groot, Jorge Martinez, Odette Scharenborg,
- Abstract要約: 本研究では,人間の聴取者の認識性能と最先端の3つのASRシステムを比較した。
ヒトの聴取者および市販の3つのASRシステムは平均70%以上の単語誤り率(WER)を示す。
変形性関節症音声の微調整により, WERは有意に低下した。
- 参考スコア(独自算出の注目度): 12.672154722709138
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: In our goal to develop personalised dysarthric speech recognition (DSR) models, this study compared the recognition performances of human listeners and those of three state-of-the-art, off-the-shelf ASR systems (Whisper-large-V3, Google Chirp 3, and Omnilingual) on the recognition of Dutch continuous read and spontaneous speech from a single speaker with severe dysarthria. Results showed that both humans listeners and the three off-the-shelf ASR systems exhibit word error rates (WER) exceeding 70% on average, indicating that DSR is highly challenging for both humans and ASR systems. Fine-tuning on the dysarthric speech significantly reduced WER. Although overall WERs are still quite high (>23%), the personalised DSR models outperformed the human listeners, and performance is getting closer to being useful for supporting day-to-day communication of dysarthric speakers. Future research should focus on improving personalized DSR on spontaneous speech and longer utterances in the case of read speech, with a specific focus on particular phonemes.
- Abstract(参考訳): 本研究は,DSRモデルの開発を目的として,重度変形を伴う単一話者からのオランダ語連続読解・自発音声の認識について,ヒトの聴取者の認識性能と市販のASRシステム(Whisper-large-V3, Google Chirp 3, Omnilingual)の認識性能を比較した。
その結果、人間リスナーと市販の3つのASRシステムは平均70%以上の単語誤り率(WER)を示しており、DSRは人間とASRの両方にとって極めて困難であることが示された。
変形性関節症音声の微調整により, WERは有意に低下した。
WERは依然として非常に高い(>23%)が、パーソナライズされたDSRモデルはヒトの聴取者よりも優れており、その性能は、変形性スピーカーの日々のコミュニケーションを支援するのに役立つように近づきつつある。
今後の研究は、自然発話におけるパーソナライズされたDSRの改善と、読み上げ音声の場合の発話の延長に焦点を当て、特定の音素に焦点を当てることである。
関連論文リスト
- Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages [49.31519786009296]
音声変換モデルを英語の変形音声(UASpeech)に微調整し、話者特性と韻律歪みの両方を符号化する。
次に、健康な非英語音声(FLEURS)を非英語の変形性音声に変換する。
生成されたデータは、MMS(Massively Multilingually Speech)と呼ばれる多言語ASRモデルの微調整に使用される。
論文 参考訳(メタデータ) (2025-05-20T20:03:45Z) - Enhancing AAC Software for Dysarthric Speakers in e-Health Settings: An Evaluation Using TORGO [0.13108652488669734]
脳性麻痺 (CP) と筋萎縮性側索硬化症 (ALS) の患者は, 関節症に悩まされ, 変形性関節症, 非典型的発声パターンを呈する。
我々は、Whisper や Wav2vec2.0 のような最先端の音声認識(SOTA)技術が、訓練データがないために非定型話者を疎外することがわかった。
我々の研究は、SOTA ASRとドメイン固有のエラー訂正を活用することを目指している。
論文 参考訳(メタデータ) (2024-11-01T19:11:54Z) - Homogeneous Speaker Features for On-the-Fly Dysarthric and Elderly Speaker Adaptation [71.31331402404662]
本稿では, 変形性関節症と高齢者の話者レベルの特徴を学習するための2つの新しいデータ効率手法を提案する。
話者規則化スペクトルベース埋め込み-SBE特徴は、特別な正規化項を利用して適応における話者特徴の均一性を強制する。
テスト時間適応において、話者レベルのデータ量に敏感であることが示されるVR-LH機能に規定されている特徴ベースの学習隠れユニットコントリビューション(f-LHUC)。
論文 参考訳(メタデータ) (2024-07-08T18:20:24Z) - Accurate synthesis of Dysarthric Speech for ASR data augmentation [5.223856537504927]
Dysarthria は運動性発声障害であり、しばしば発声能力の低下を特徴とする。
本稿では,ASRトレーニングデータ拡張を目的とした新しい音声合成法を提案する。
論文 参考訳(メタデータ) (2023-08-16T15:42:24Z) - An analysis of degenerating speech due to progressive dysarthria on ASR
performance [4.4837870267635]
筋萎縮性側索硬化症(ALS)による発声障害の4例
3つのモデル全てのパフォーマンスは、音声がより損なわれるにつれて大幅に低下した。
A-SDモデルの性能向上には至らなかったが, 音声の劣化にともなって, 早期に発声を録音することは困難であった。
論文 参考訳(メタデータ) (2022-10-31T18:42:41Z) - Exploiting Cross-domain And Cross-Lingual Ultrasound Tongue Imaging
Features For Elderly And Dysarthric Speech Recognition [55.25565305101314]
調音機能は音響信号歪みに不変であり、音声認識システムにうまく組み込まれている。
本稿では,A2Aモデルにおける24時間TaLコーパスの並列音声・超音波舌画像(UTI)データを利用したクロスドメインおよびクロスランガルA2Aインバージョン手法を提案する。
生成した調音機能を組み込んだ3つのタスクの実験は、ベースラインのTDNNとコンフォーマーASRシステムより一貫して優れていた。
論文 参考訳(メタデータ) (2022-06-15T07:20:28Z) - Cross-lingual Self-Supervised Speech Representations for Improved
Dysarthric Speech Recognition [15.136348385992047]
本研究では, 変形性関節症に対するASRシステムの訓練機能として, Wav2Vec を用いた自己教師型音声表現の有用性について検討した。
我々は、Wav2Vec、Hubert、および言語間XLSRモデルから抽出された特徴を持つ音響モデルを訓練する。
結果から,大容量データに事前学習した音声表現は,単語誤り率(WER)を向上する可能性が示唆された。
論文 参考訳(メタデータ) (2022-04-04T17:36:01Z) - Speaker Identity Preservation in Dysarthric Speech Reconstruction by
Adversarial Speaker Adaptation [59.41186714127256]
変形性音声再建(DSR)は,変形性音声の品質向上を目的としている。
話者識別に最適化された話者エンコーダ (SE) について検討した。
我々は,新しいマルチタスク学習戦略,すなわち対人話者適応(ASA)を提案する。
論文 参考訳(メタデータ) (2022-02-18T08:59:36Z) - Investigation of Data Augmentation Techniques for Disordered Speech
Recognition [69.50670302435174]
本稿では,不規則音声認識のための一連のデータ拡張手法について検討する。
正常な音声と無秩序な音声の両方が増強過程に利用された。
UASpeechコーパスを用いた最終話者適応システムと、最大2.92%の絶対単語誤り率(WER)の速度摂動に基づく最良の拡張アプローチ
論文 参考訳(メタデータ) (2022-01-14T17:09:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。