論文の概要: Benchmarking_Fast_Domain_Adaptation_for_Unsupervised_Speech_Units
- arxiv url: http://arxiv.org/abs/2608.26992v1
- Date: Thu, 27 Aug 2026 11:40:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.373681
- Title: Benchmarking_Fast_Domain_Adaptation_for_Unsupervised_Speech_Units
- Title(参考訳): Benchmarking_Fast_Domain_Adaptation_for_Unsupervised_Speech_Units
- Abstract要約: AESRCデータセットに基づいたベンチマークで、英語のアクセントが10種類あるABX-Accentを紹介します。
これには、それぞれのアクセントに対するゼロリソースチャレンジABX評価メトリクスのアクセントと適応に関する小さな(10時間)のトレーニングセットが含まれています。
新しいベンチマークに適用すると、提案手法は平均23.6%の相対的な改善が得られる。
- 参考スコア(独自算出の注目度): 39.74450851447742
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Representation learning has attracted great atten- tion and managed to reach good performances as a pretraining method for downstream tasks or as a first step towards unsu- pervised speech modeling. Yet, little is known about how such methods deal with out-of-domain speech and how could they be adapted in a few shot to new domains. This is important especially for accented speech where one observes a long tail of accents that diverge from the standard ones. We introduce ABX- Accent, a benchmark based on the AESRC dataset that features 10 different accents of English. It includes a small (< 10 hours) unlabelled training set in each of the accents and adaptations of the Zero Resources Challenge ABX evaluation metrics to each of the accents. We illustrate this benchmark with a baseline model that uses adaptive domain normalization to fine tune a pretrained Contrastive Predictive Coding model on the accents. This method is first developed on LibriSpeech using a male/female split. When applied to the new benchmark, the proposed method yields a relative improvement of 23.6% on across-speaker ABX scores on average compared to non adapted models. The data and metrics will be open sourced upon paper acceptance
- Abstract(参考訳): 表現学習は、ダウンストリームタスクの事前学習方法として、あるいは、修正されていない音声モデリングへの第一歩として、優れたパフォーマンスを得ることができた。
しかし、そのような手法がドメイン外スピーチをどのように扱うのか、新しいドメインにどのように適用できるかについては、ほとんど分かっていない。
これは特にアクセント付き音声において、標準のアクセントから分岐するアクセントの長い尾を観察する場合に重要である。
AESRCデータセットに基づいたベンチマークで、英語のアクセントが10種類あるABX-Accentを紹介します。
これには、各アクセントに対するゼロリソースチャレンジABX評価指標のそれぞれのアクセントと適応に関する小さな ((10時間) 未学習のトレーニングセットが含まれています。
本稿では,適応領域正規化を用いたベースラインモデルを用いて,事前学習したコントラスト予測符号化モデルをアクセント上で微調整する。
この方法は、男性/女性スプリットを用いてLibriSpeech上で最初に開発された。
提案手法は, 提案手法を適用した場合, 非適応モデルと比較すると, 話者間ABXスコアに対して23.6%の相対的な改善が得られた。
データとメトリクスは、論文の受理時にオープンソース化される
関連論文リスト
- SpidR-Adapt: A Universal Speech Representation Model for Few-Shot Adaptation [40.55805997909858]
最小限のラベル付きデータを用いた新しい言語への迅速な適応のためのSpedR-Adaptを提案する。
両レベル最適化フレームワークとして適応処理を定式化するマルチタスク適応型事前学習プロトコルを構築した。
経験的に、SpedR-Adaptは音韻識別性と音声言語モデリングの急速な進歩を実現している。
論文 参考訳(メタデータ) (2025-12-24T14:33:16Z) - CLAIR-A: Leveraging Large Language Models to Judge Audio Captions [73.51087998971418]
機械生成オーディオキャプションの評価は、様々な要因を検討する必要がある複雑なタスクである。
本稿では,大規模言語モデルのゼロショット機能を活用するシンプルで柔軟なCLAIR-Aを提案する。
我々の評価では、CLAIR-Aは従来のメトリクスと比較して品質の人的判断を良く予測する。
論文 参考訳(メタデータ) (2024-09-19T17:59:52Z) - Improving Self-supervised Pre-training using Accent-Specific Codebooks [48.409296549372414]
自己教師型学習のためのアクセント認識適応技術
Mozilla Common Voiceデータセットでは、提案手法は他のアクセント適応手法よりも優れています。
論文 参考訳(メタデータ) (2024-07-04T08:33:52Z) - Improving Speech Recognition for African American English With Audio
Classification [17.785482810741367]
本稿では,少数のドメイン外データを用いて,米国英語短波形音声認識器の頑健性を向上させる新しい手法を提案する。
このデータを微調整すると、MAEの品質を低下させることなくAAEとMAEの間で38.5%の単語誤り率格差が減少する。
論文 参考訳(メタデータ) (2023-09-16T19:57:45Z) - Continual Learning for On-Device Speech Recognition using Disentangled
Conformers [54.32320258055716]
本稿では,LibriVoxオーディオブックから派生した話者固有領域適応のための連続学習ベンチマークを提案する。
本稿では,DistangledCLと呼ばれる計算効率のよい連続学習アルゴリズムを提案する。
実験の結果, DisConformer モデルは一般的な ASR のベースラインよりも有意に優れていた。
論文 参考訳(メタデータ) (2022-12-02T18:58:51Z) - Low-resource Accent Classification in Geographically-proximate Settings:
A Forensic and Sociophonetics Perspective [8.002498051045228]
アクセント付き音声認識とアクセント分類は、音声技術における比較的未探索の研究分野である。
近年の深層学習法とトランスフォーマーを用いた事前学習モデルは,両領域で高い性能を達成している。
そこで本研究では,北イングランドの5つの都市品種から抽出した105の話者記録に基づいて,3つの主アクセントモデリング手法と2つの異なる分類器の組み合わせについて検討した。
論文 参考訳(メタデータ) (2022-06-26T01:25:17Z) - Sequence-level self-learning with multiple hypotheses [53.04725240411895]
我々は、自動音声認識(ASR)のためのアテンションベースシーケンス・ツー・シーケンス(seq2seq)モデルを用いた新しい自己学習手法を開発した。
従来の教師なし学習手法とは対照的に,我々はEmphmulti-task Learning(MTL)フレームワークを採用する。
実験の結果,本手法は,英語データのみを用いてトレーニングしたベースラインモデルと比較して,英文音声データのWERを14.55%から10.36%に削減できることがわかった。
論文 参考訳(メタデータ) (2021-12-10T20:47:58Z) - Evaluating the reliability of acoustic speech embeddings [10.5754802112615]
音声埋め込みは可変長音声列の定サイズ音響表現である。
ここでは,ABX識別と平均精度 (MAP) という2つの一般的な指標を,17の埋め込み手法にまたがる5つの言語で体系的に比較する。
ABXとMAPは相互に相関し,周波数推定を行う。
論文 参考訳(メタデータ) (2020-07-27T13:24:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。