論文の概要: Per-Aetiology Contrastive Severity Embeddings with Phonological Pseudo-Labelling for Multilingual Dysarthric Speech
- arxiv url: http://arxiv.org/abs/2609.21789v2
- Date: Wed, 23 Sep 2026 09:29:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.647791
- Title: Per-Aetiology Contrastive Severity Embeddings with Phonological Pseudo-Labelling for Multilingual Dysarthric Speech
- Title(参考訳): 多言語変形性関節症に対する音韻的擬似ラベルを用いた耳科別比較重度埋め込み
- Abstract要約: 訓練は、訓練のない音韻プロファイリング法から、臨床的にラベル付けされた音声と順序付き擬似ラベルを組み合わせる。
組織ごとのモデルでは、混合ベースラインを3つの対象のエチオロジーすべてで上回っている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most multilingual dysarthria-severity systems either train on a single aetiology-language pair or pool heterogeneous aetiologies into one label space. We test that pooling assumption with four matched HuBERT-base contrastive embedding models under a shared backbone, training recipe, corpus registry and held-out evaluation: one mixed-aetiology baseline and three aetiology-specific models for cerebral palsy (CP), Parkinson's disease (PD) and amyotrophic lateral sclerosis (ALS). Training combines clinically labelled speech with ordinal pseudo-labels from a training-free phonological profiling method [1], [2]. On speaker-disjoint, leakage-filtered held-out subsets, the per-aetiology models outperform the mixed baseline across all three target aetiologies: CP (macro F1 0.829 vs 0.676, +22.6 % relative), PD (0.715 vs 0.511, +40.0 %) and ALS (0.788 vs 0.596, +32.3 %). On CP, adding 144 SAP and 44 CDSD pseudo-labelled speakers lifts macro F1 from 0.786 to 0.829 over a clinical-only CP model (+4.3 percentage points). Training data span three to seven languages per aetiology. We position this as a controlled comparison of label-space design choices and discuss pseudo-label calibration, split hygiene, and confidence-thresholded deployment as important limitations for future work.
- Abstract(参考訳): 大部分の多言語性難聴重度システムは、1つのエトロジー言語対で訓練するか、1つのラベル空間にヘテロジニアスなエトロジーをプールする。
本研究は,脳性麻痺 (CP) とパーキンソン病 (PD) と筋萎縮性側索硬化症 (ALS) の4つの相一致した HuBERT-base によるプール仮定を, 共有バックボーン, トレーニングレシピ, コーパスレジストリ, 保留評価により検討した。
訓練は、訓練のない音韻プロファイリング法[1],[2]から、臨床的にラベル付けされた音声と順序付き擬似ラベルを組み合わせる。
話者分離、漏れフィルター付きホールトアウトサブセットでは、アエティロジーのモデルは、CP (macro F1 0.829 vs 0.676, +22.6 % %)、PD (0.715 vs 0.511, +40.0 %)、ALS (0.788 vs 0.596, +32.3 %) の3つの目標エチオロジーで混合ベースラインを上回っている。
CP では 144 SAP と 44 CDSD の擬似ラベル付きスピーカーが臨床のみの CP モデル (+4.3 ポイント) で、マクロ F1 を 0.786 から 0.829 に引き上げる。
トレーニングデータは、エチオロジー毎に3から7つの言語にまたがる。
我々は、これをラベル空間の設計選択の制御された比較として位置づけ、擬似ラベルの校正、分割衛生、信頼性を保った配置を将来の作業の重要な制限として論じる。
関連論文リスト
- Open ultrasound foundation model for robust segmentation and clinical measurement across heterogeneous settings [66.3653308198376]
SonoCorpusは、24の臨床応用と17の国にまたがる53のパブリックデータセットから、456,963のイメージと1,626,085のエキスパートマスクを統合するオープンリソースである。
SonoBaseは、事前にトレーニングされたインタラクティブセグメンテーション基盤モデルである。
論文 参考訳(メタデータ) (2026-09-16T15:34:21Z) - Phonological Subspace Collapse Is Aetiology-Specific and Cross-Lingually Stable: Evidence from 3,374 Speakers [0.0]
HuBERTをベースとした5言語890話者を対象にした音韻的特徴部分空間に基づく難聴度評価のためのトレーニングフリーフレームワーク。
12言語および5言語にまたがる25言語話者の分析(パーキンソン病、脳性麻痺、ALSダウン症候群、脳卒中)
代表標本における言語間プロファイル形状と安定性のクロスバックボーン
論文 参考訳(メタデータ) (2026-04-23T14:12:27Z) - Training-Free Cross-Lingual Dysarthria Severity Assessment via Phonological Subspace Analysis in Self-Supervised Speech Representations [0.0]
変形性言語重度評価は通常、ラベル付き病的音声から構築された教師付きモデルを必要とする。
音韻的特徴部分空間の劣化を測定することにより, 難聴度を定量化する訓練自由手法を提案する。
教師付き重度モデルは訓練されず、健常な制御音声から特徴方向を推定する。
論文 参考訳(メタデータ) (2026-04-11T09:38:35Z) - PRIME: Prototype-Driven Multimodal Pretraining for Cancer Prognosis with Missing Modalities [86.63247982275396]
PRIMEは、欠落を認識したマルチモーダルな自己教師型事前トレーニングフレームワークである。
部分的に観察されたコホートから頑健で伝達可能な表現を学ぶ。
The Cancer Genome AtlasのPRIMEを32種類の癌に対してラベルフリープレトレーニングで評価した。
論文 参考訳(メタデータ) (2026-04-05T21:14:27Z) - Something from Nothing: Data Augmentation for Robust Severity Level Estimation of Dysarthric Speech [69.86604856129883]
外科的音声品質評価(DSQA)は臨床診断と包括的音声技術において重要である。
本研究では,未ラベルの変形音声と大規模典型的な音声データセットを併用した3段階のフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-16T23:00:07Z) - Beyond Calibration: Confounding Pathology Limits Foundation Model Specificity in Abdominal Trauma CT [8.050646314390763]
基礎モデルを臨床実践に翻訳するには、複合分布シフト下での性能を評価する必要がある。
基礎モデルの特異性欠陥が負のクラスにおける不均一性と関連しているかどうかを検討した。
論文 参考訳(メタデータ) (2026-02-10T23:08:06Z) - A Novel Fusion Architecture for PD Detection Using Semi-Supervised Speech Embeddings [8.996456485141069]
本稿では,パーキンソン病(PD)をWebアプリケーションを用いて収集した英語パングラム発話音声を通して認識する枠組みを提案する。
我々のデータセットには、PDと診断された392人を含む1306人の世界的コホートが含まれている。
We used deep learning embeddeds derived from semi-supervised model, Wav2Vec 2.0, WavLM, ImageBind represented the speech dynamics associated with PD。
論文 参考訳(メタデータ) (2024-05-21T16:06:51Z) - Automatically measuring speech fluency in people with aphasia: first
achievements using read-speech data [55.84746218227712]
本研究の目的は,言語習得の分野で開発された信号処理algorithmの関連性を評価することである。
論文 参考訳(メタデータ) (2023-08-09T07:51:40Z) - Self-supervised contrastive learning of echocardiogram videos enables
label-efficient cardiac disease diagnosis [48.64462717254158]
心エコービデオを用いた自己教師型コントラスト学習手法であるエコーCLRを開発した。
左室肥大症 (LVH) と大動脈狭窄症 (AS) の分類成績は,EchoCLR の訓練により有意に改善した。
EchoCLRは、医療ビデオの表現を学習する能力に特有であり、SSLがラベル付きデータセットからラベル効率の高い疾患分類を可能にすることを実証している。
論文 参考訳(メタデータ) (2022-07-23T19:17:26Z) - Exploiting Cross-domain And Cross-Lingual Ultrasound Tongue Imaging
Features For Elderly And Dysarthric Speech Recognition [55.25565305101314]
調音機能は音響信号歪みに不変であり、音声認識システムにうまく組み込まれている。
本稿では,A2Aモデルにおける24時間TaLコーパスの並列音声・超音波舌画像(UTI)データを利用したクロスドメインおよびクロスランガルA2Aインバージョン手法を提案する。
生成した調音機能を組み込んだ3つのタスクの実験は、ベースラインのTDNNとコンフォーマーASRシステムより一貫して優れていた。
論文 参考訳(メタデータ) (2022-06-15T07:20:28Z) - Multi-Ontology Refined Embeddings (MORE): A Hybrid Multi-Ontology and
Corpus-based Semantic Representation for Biomedical Concepts [0.5812284760539712]
本稿では,複数のオントロジからのドメイン知識を分散意味モデルに組み込むためのフレームワークであるMOREを紹介する。
我々は、MOREのコーパスベースのコンポーネントとして、RadCoreとMIMIC-IIIのフリーテキストデータセットを使用します。
コーパスベースでは,メディカル・サブジェクト・ヘッダー(MeSH)と3つの最先端の類似度尺度を用いる。
論文 参考訳(メタデータ) (2020-04-14T14:38:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。