論文の概要: Analyzing Speech Condition Effects in Dysarthric ASR: A Layer-wise Probing Study
- arxiv url: http://arxiv.org/abs/2608.01865v1
- Date: Mon, 03 Aug 2026 08:14:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.395472
- Title: Analyzing Speech Condition Effects in Dysarthric ASR: A Layer-wise Probing Study
- Title(参考訳): 変形性膝関節症における音声条件の影響分析 : 階層的調査による検討
- Authors: Darwin Jelestin Muthu, Navya Gupta, Wei Lin Tay, Zhengchen Zhang, Daniel Wang Zhengkui, Rong Tong,
- Abstract要約: マンダリン発声音声におけるトランスフォーマーASRエンコーダのプローブ解析について述べる。
音素境界情報は、すべての層における変形音声に対して弱いままである。
音素識別は上層に向けて回復可能となり、認識困難は最深層に符号化される。
- 参考スコア(独自算出の注目度): 1.9758601658046933
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automatic speech recognition (ASR) performance degrades sharply on dysarthric speech, yet how disordered articulation reshapes a model's internal representations is underexplored. We present a layer-wise probing analysis of a transformer ASR encoder on Mandarin dysarthric speech under three transcript-matched conditions: original dysarthric speech, speaker conditioned zero-shot TTS resynthesis, and unconditioned TTS. The probes reveal a task-dependent hierarchy: phoneme boundary information stays weak for dysarthric speech at every layer, phoneme identity becomes recoverable toward the upper layers, and recognition difficulty is encoded in the deepest layers. Tone-sensitive evaluation shows Mandarin lexical tone is a persistent error source. Cross-condition similarity divergence grows with depth, indicating that disordered speech affects high-level representations more than low-level acoustic features. Guided by these findings, single-layer LoRA at layer 7 and adaptation on subset layers 5-8 achieve performance within 3.5% and 2.48% relative margins of full encoder adaptation, respectively, while upper-layer adaptation is less effective for dysarthric speech. These findings link representation analysis to parameter-efficient fine-tuning and motivate layer-aware adaptation for low-resource Mandarin dysarthric ASR.
- Abstract(参考訳): 自動音声認識(ASR)の性能は, 変形性音声に対して著しく低下するが, 混乱した調音がモデルの内部表現を過小評価している。
マンダリン関節症音声におけるトランスフォーマーASRエンコーダの層単位での探索的解析を行い, 関節症音声, 話者条件付きゼロショットTS再合成, 未条件TSの3つの条件で検討した。
音素境界情報は各層における変形音声の弱さを保ち、音素識別は上位層に対して回復可能となり、認識困難は最深層に符号化される。
音調評価は,マンダリン語彙音が持続誤差源であることを示す。
条件間の類似性の違いは深度とともに増大し、混乱した音声は低レベルの音響特徴よりも高レベルな表現に影響を及ぼすことを示す。
これらの結果から, 単層LoRAの7層への適応と, 5-8層への適応は, 総エンコーダ適応の3.5%, 2.48%の範囲でそれぞれ性能が向上し, 上層適応は発語にはあまり効果がないことがわかった。
これらの知見は,低出力マンダリン変形性ASRに対するパラメータ効率のよい微調整とモチベート層認識の適応とを関連づけた。
関連論文リスト
- From Text Metrics to Model Internals: A Study of Whisper ASR Hallucination Detection [13.55239135877789]
ASRモデルの幻覚は下流のアプリケーションにリスクをもたらす。
本稿では,Whisperの大容量v3幻覚検出法について検討する。
論文 参考訳(メタデータ) (2026-06-22T09:13:04Z) - Dimensionality-Aware Anomaly Detection in Learned Representations of Self-Supervised Speech Models [22.960033047333024]
自己教師付き音声モデル(S3Ms)は、下流での強い性能を達成するが、その学習された表現は、自然と逆の摂動の下では理解し難いままである。
本稿では,WavLM とwav2vec 2.0 のレイヤワイド表現における局所固有次元(LID)を用いたフレームワーク GRIDS を提案する。
論文 参考訳(メタデータ) (2026-05-04T15:18:15Z) - Something from Nothing: Data Augmentation for Robust Severity Level Estimation of Dysarthric Speech [69.86604856129883]
外科的音声品質評価(DSQA)は臨床診断と包括的音声技術において重要である。
本研究では,未ラベルの変形音声と大規模典型的な音声データセットを併用した3段階のフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-16T23:00:07Z) - Prototype-Based Disentanglement for Controllable Dysarthric Speech Synthesis [2.411338616884766]
変形性音声は、高い変動性とラベル付きデータに制限がある。
現在のアプローチは、合成データ拡張や音声再構成に依存している。
本稿では,プロトタイプベースのディスアングルメント TTS フレームワーク ProtoDisent-TTS を提案する。
論文 参考訳(メタデータ) (2026-02-09T14:14:51Z) - Hallucination Benchmark for Speech Foundation Models [33.92968426403491]
自動音声認識(ASR)システムにおける幻覚とは、基礎となる音響入力(すなわち、音声信号)とは全く無関係な神経性ASRモデルによって生成される流動的でコヒーレントな転写を指す。
この明らかな一貫性は、その後の処理段階を誤解させ、特に医療や法のような重要な領域において重大なリスクをもたらす可能性がある。
本稿では,ASRにおける幻覚現象を,語彙,音声,形態,意味の4つの相補軸に沿って体系的に分類し,定量化する最初のベンチマークフレームワークであるSHALLOWを紹介する。
論文 参考訳(メタデータ) (2025-10-18T16:26:16Z) - Homogeneous Speaker Features for On-the-Fly Dysarthric and Elderly Speaker Adaptation [71.31331402404662]
本稿では, 変形性関節症と高齢者の話者レベルの特徴を学習するための2つの新しいデータ効率手法を提案する。
話者規則化スペクトルベース埋め込み-SBE特徴は、特別な正規化項を利用して適応における話者特徴の均一性を強制する。
テスト時間適応において、話者レベルのデータ量に敏感であることが示されるVR-LH機能に規定されている特徴ベースの学習隠れユニットコントリビューション(f-LHUC)。
論文 参考訳(メタデータ) (2024-07-08T18:20:24Z) - Accurate synthesis of Dysarthric Speech for ASR data augmentation [5.223856537504927]
Dysarthria は運動性発声障害であり、しばしば発声能力の低下を特徴とする。
本稿では,ASRトレーニングデータ拡張を目的とした新しい音声合成法を提案する。
論文 参考訳(メタデータ) (2023-08-16T15:42:24Z) - Exploiting Cross-domain And Cross-Lingual Ultrasound Tongue Imaging
Features For Elderly And Dysarthric Speech Recognition [55.25565305101314]
調音機能は音響信号歪みに不変であり、音声認識システムにうまく組み込まれている。
本稿では,A2Aモデルにおける24時間TaLコーパスの並列音声・超音波舌画像(UTI)データを利用したクロスドメインおよびクロスランガルA2Aインバージョン手法を提案する。
生成した調音機能を組み込んだ3つのタスクの実験は、ベースラインのTDNNとコンフォーマーASRシステムより一貫して優れていた。
論文 参考訳(メタデータ) (2022-06-15T07:20:28Z) - Investigation of Data Augmentation Techniques for Disordered Speech
Recognition [69.50670302435174]
本稿では,不規則音声認識のための一連のデータ拡張手法について検討する。
正常な音声と無秩序な音声の両方が増強過程に利用された。
UASpeechコーパスを用いた最終話者適応システムと、最大2.92%の絶対単語誤り率(WER)の速度摂動に基づく最良の拡張アプローチ
論文 参考訳(メタデータ) (2022-01-14T17:09:22Z) - Spectro-Temporal Deep Features for Disordered Speech Assessment and
Recognition [65.25325641528701]
音声スペクトルのSVD分解による深い特徴を埋め込んだ新しいスペクトル時空間ベースを提案する。
UASpeechコーパスで行った実験では、提案された分光時間深部特徴適応システムは、データ拡張の有無にかかわらず、ワードエラー率(WER)を最大263%(相対8.6%)削減することで、ベースラインi-適応を一貫して上回ったことが示唆された。
論文 参考訳(メタデータ) (2022-01-14T16:56:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。