論文の概要: Improving End-to-End Speech Recognition for Dysarthric Speech through In-Domain Data Augmentation
- arxiv url: http://arxiv.org/abs/2606.19797v1
- Date: Thu, 18 Jun 2026 05:00:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:39.656865
- Title: Improving End-to-End Speech Recognition for Dysarthric Speech through In-Domain Data Augmentation
- Title(参考訳): 構内データ拡張による変形性音声のエンドツーエンド音声認識の改善
- Authors: Paban Sapkota, Hemant Kumar Kathania, Sudarsana Reddy Kadiri, Shrikanth Narayanan,
- Abstract要約: 変形性音声認識は、変形性関節症患者の効果的なコミュニケーションを促進するために重要である。
変形性スピーチを正確に認識することは、重度レベルとデータ可用性の制限により、重大な課題を引き起こす。
本研究では, 変形性自動音声認識(ASR)のためのデータ拡張手法について, エンド・ツー・エンドの訓練済みWav2Vec2モデルを微調整することによって検討する。
- 参考スコア(独自算出の注目度): 43.31597557333867
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Dysarthric speech recognition is crucial for facilitating effective communication among individuals with dysarthria. However, accurately recognizing dysarthric speech poses significant challenges due to varying severity levels and limited data availability. In this paper, we explore data augmentation techniques for dysarthric automatic speech recognition (ASR) systems by fine-tuning the End-to-End pre-trained Wav2Vec2 model, with a specific focus on severity levels. To address the challenges of data scarcity and the need for extensive data in fine-tuning pre-trained ASR systems for dysarthric speech, we investigate four prominent data augmentation methods: Speaking-Rate Modification (SRM), Pitch Modification (PM), Formant Modification (FM), and vocal tract Length Perturbation (VTLP), tailored to different aspects of dysarthria. The study uses individually fine-tuned Wav2Vec2 models for each severity class as baseline systems. Additionally, we conducted severity-specific fine-tuning of the ASR model using augmented data. Results demonstrate distinct efficacy patterns for each augmentation technique across severity levels. The best WERs were achieved with SRM ($s$=0.8) for \textit{low} (9.02\%) and \textit{medium} (38.11\%) severities, and with PM ($τ$=0.8) for \textit{high} severity (55.15\%), reflecting relative improvements of 30.02\%, 16.64\%, and 15.47\%, respectively. These results confirm the effectiveness of the augmentation methods in improving dysarthric ASR performance.
- Abstract(参考訳): 変形性音声認識は、変形性関節症患者の効果的なコミュニケーションを促進するために重要である。
しかし, 難易度が変化し, データ可用性が制限されたため, 難易度が高いため, 難易度の高い音声認識が困難である。
本稿では, 変形性自動音声認識(ASR)のためのデータ拡張手法について検討し, 重度レベルに着目したエンド・ツー・エンド訓練Wav2Vec2モデルを微調整する。
SRM, Pitch Modification (PM), Formant Modification (FM), vocal tract Length Perturbation (VTLP) の4つの顕著なデータ拡張手法について検討した。
この研究は、個別に微調整されたWav2Vec2モデルを用いて、各重度クラスをベースラインシステムとして使用する。
さらに,ASRモデルの重度特異な微調整を拡張現実データを用いて行った。
以上の結果より, 重症度にまたがる各増強法の有効性が明らかとなった。
最高の WER は SRM (s$=0.8) for \textit{low} (9.02\%) と \textit{medium} (38.11\%) の重症度、および \textit{high} の重症度 (55.15\%) のPM (τ$=0.8) で達成され、それぞれ 30.02\% と 16.64\% と 15.47\% の相対的な改善が反映された。
以上の結果より, 変形性膝関節症に対するASRの有用性が示唆された。
関連論文リスト
- Systematic Study of Dysarthric Speech Recognition: Spectral Features and Acoustic Models [48.10903631277461]
本稿では,異なる音響モデルに適した音響特性の組み合わせについて,包括的に検討する。
Pitchの組み込みは、特に文認識タスクにおいて、認識性能が顕著に向上している。
我々は,現在最先端の因子化時間遅延ニューラルネットワーク(F-TDNN)モデルの性能向上の可能性を示した。
論文 参考訳(メタデータ) (2026-06-18T04:57:37Z) - Cross-Dataset, Age, and Gender Generalization: A Comprehensive Analysis of Fine-Tuning Strategies for Low-Resource Children's ASR [48.10903631277461]
本稿では,異なる音響モデルに適した音響特性の組み合わせについて,包括的に検討する。
Pitchの組み込みは、特に文認識タスクにおいて、認識性能が顕著に向上している。
我々は,現在最先端の因子化時間遅延ニューラルネットワーク(F-TDNN)モデルの性能向上の可能性を示した。
論文 参考訳(メタデータ) (2026-06-18T04:56:00Z) - Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition [71.87998918300806]
本稿では,TDNNとConformer ASRシステムにSSLプリトレーニングモデルとその機能を統合するアプローチについて検討する。
ドメイン適応型HuBERT、wav2vec2-conformer、マルチ言語型XLSRモデルを統合することで構築されたTDNNシステムは、スタンドアロンの微調整型SSL事前訓練モデルより一貫して優れている。
DementiaBank Pitt の高齢者音声認識出力を用いて,アルツハイマー病の検出精度の向上も行った。
論文 参考訳(メタデータ) (2024-07-03T08:33:39Z) - Accurate synthesis of Dysarthric Speech for ASR data augmentation [5.223856537504927]
Dysarthria は運動性発声障害であり、しばしば発声能力の低下を特徴とする。
本稿では,ASRトレーニングデータ拡張を目的とした新しい音声合成法を提案する。
論文 参考訳(メタデータ) (2023-08-16T15:42:24Z) - Exploiting Cross-domain And Cross-Lingual Ultrasound Tongue Imaging
Features For Elderly And Dysarthric Speech Recognition [55.25565305101314]
調音機能は音響信号歪みに不変であり、音声認識システムにうまく組み込まれている。
本稿では,A2Aモデルにおける24時間TaLコーパスの並列音声・超音波舌画像(UTI)データを利用したクロスドメインおよびクロスランガルA2Aインバージョン手法を提案する。
生成した調音機能を組み込んだ3つのタスクの実験は、ベースラインのTDNNとコンフォーマーASRシステムより一貫して優れていた。
論文 参考訳(メタデータ) (2022-06-15T07:20:28Z) - Personalized Adversarial Data Augmentation for Dysarthric and Elderly
Speech Recognition [30.885165674448352]
本稿では,高齢者および変形性音声認識のための新しい話者依存型(GAN)に基づくデータ拡張手法を提案する。
GANベースのデータ拡張アプローチは、ベースライン速度摂動法を最大0.91%、絶対値3.0%で一貫して上回っている。
LHUCベースの話者適応を適用した後、一貫性のある性能改善が維持される。
論文 参考訳(メタデータ) (2022-05-13T04:29:49Z) - Investigation of Data Augmentation Techniques for Disordered Speech
Recognition [69.50670302435174]
本稿では,不規則音声認識のための一連のデータ拡張手法について検討する。
正常な音声と無秩序な音声の両方が増強過程に利用された。
UASpeechコーパスを用いた最終話者適応システムと、最大2.92%の絶対単語誤り率(WER)の速度摂動に基づく最良の拡張アプローチ
論文 参考訳(メタデータ) (2022-01-14T17:09:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。