論文の概要: BuzzASR: A Swarm of 100+ Monolingual Speech Recognition Models
- arxiv url: http://arxiv.org/abs/2609.09554v1
- Date: Wed, 09 Sep 2026 00:18:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.849607
- Title: BuzzASR: A Swarm of 100+ Monolingual Speech Recognition Models
- Title(参考訳): BuzzASR: 100以上の単言語音声認識モデル群
- Authors: Shivam Singh, Aditya Yadavalli, Catherine Arnett, Alex Warstadt,
- Abstract要約: 本稿では,102言語で自動音声認識(ASR)に適応した言語特化細調整Whisperモデルの集合であるBuzzASRを紹介する。
我々のモデルはFLEURSとCommon Voiceテストセットを組み合わせた102言語のうち27のオープンソースシステムにおいて最先端のCERを実現している。
- 参考スコア(独自算出の注目度): 10.996463837873725
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce BuzzASR, a collection of language-specialized fine-tuned Whisper models adapted for automatic speech recognition (ASR) in 102 languages. Large end-to-end Transformer-based ASR models such as Whisper have revolutionized ASR, but most prominent models are highly multilingual. As a result, these models often perform poorly on languages less well-represented in their training set. While it has long been known that effective language adaptation can be achieved through simple fine-tuning on monolingual data, this strategy has only been applied to a small number of languages. We massively scale up this simple approach to 102 languages covered in the FLEURS dataset, while also implementing a more complex language adaptation strategy that integrates monolingual tokenizer replacement and data augmentation using text-only fine-tuning. BuzzASR models outperform Whisper-large-v3 on 77 out of 102 languages, reducing character error rates (CER) by a factor of over 2.8 on average. Our models achieve state-of-the-art CER among open-source systems on 27 of 102 languages on the combined FLEURS and Common Voice test set. Our tokenizer replacement strategy yields an average 3.3x improvement in compression rate (characters per token) over Whisper's multilingual BPE, with gains of up to 21.7x. We release all models, code, and detailed results: https://lemn-lab.github.io/buzz-asr
- Abstract(参考訳): 本稿では,102言語で自動音声認識(ASR)に適応した言語特化細調整Whisperモデルの集合であるBuzzASRを紹介する。
Whisperのようなエンド・ツー・エンドのトランスフォーマーベースのASRモデルはASRに革命をもたらしたが、最も顕著なモデルは多言語である。
結果として、これらのモデルはトレーニングセットであまりよく表現されていない言語で性能が良くない。
モノリンガルデータの単純な微調整によって効果的な言語適応が達成できることは古くから知られているが、この戦略は少数の言語にのみ適用されてきた。
FLEURSデータセットでカバーされた102言語に対して,このシンプルなアプローチを大規模にスケールアップするとともに,モノリンガルトークンの置き換えとテキストのみの微調整によるデータ拡張を統合した,より複雑な言語適応戦略を実装した。
BuzzASRは102言語中77言語でWhisper-large-v3を上回り、文字エラー率(CER)を平均2.8倍に下げている。
我々のモデルはFLEURSとCommon Voiceテストセットを組み合わせた102言語のうち27のオープンソースシステムにおいて最先端のCERを実現している。
我々のトークンライザ代替戦略は、Whisperの多言語BPEよりも平均3.3倍の圧縮率(トークン当たりの文字)が向上し、最大21.7倍のゲインが得られる。
すべてのモデル、コード、詳細な結果をリリースします。
関連論文リスト
- Whisper-LM: Improving ASR Models with Language Models for Low-Resource Languages [0.43498389175652036]
本研究は、従来の言語モデルと新しい言語モデルと微調整されたWhisperモデルを統合し、あまり一般的でない言語での性能を高める。
我々は、特に低リソースシナリオにおいて、単語エラー率を大幅に改善したことを示す。
統合はすべてのモデルサイズに確実に貢献するが、改善の程度は様々であり、最適化された言語モデルパラメータの重要性を強調している。
論文 参考訳(メタデータ) (2025-03-30T18:03:52Z) - Enhancing Multilingual ASR for Unseen Languages via Language Embedding Modeling [50.62091603179394]
最も先進的なASRモデルの1つであるWhisperは99の言語を効果的に扱う。
しかし、ウィスパーは未確認の言語と戦っているが、それらは事前訓練には含まれていない。
本研究では,これらの関係を利用して未知言語上でのASR性能を向上させる手法を提案する。
論文 参考訳(メタデータ) (2024-12-21T04:05:43Z) - Efficient Adaptation of Multilingual Models for Japanese ASR [0.0]
本研究では,多言語ASR(Automatic Speech Recognition)モデル,特にOpenAIのWhisper-Tinyを用いて,日本語のパフォーマンス向上について検討する。
日本語固有のデータセットとローランド適応(LoRA)とエンドツーエンド(E2E)トレーニングを使用して、Whisper-Tinyを微調整して、このギャップを埋めた。
その結果,Whisper-Tiny のキャラクタエラーレート (CER) は LoRA では 32.7 から 20.8 に減少し,エンドツーエンドのファインチューニングでは 14.7 に低下し,Whisper-Base の CER は 20。
論文 参考訳(メタデータ) (2024-12-14T06:32:16Z) - Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages [76.95115818308918]
100以上の言語で自動音声認識(ASR)を行う単一大モデルであるUniversal Speech Model (USM)を導入する。
これは300以上の言語にまたがる1200万時間 (M) の大規模なラベル付き多言語データセット上で、モデルのエンコーダを事前トレーニングすることで達成される。
我々は,多言語事前学習とランダム投影量子化と音声-テキスト・モダリティマッチングを用いて,下流多言語ASRおよび音声-テキスト翻訳タスクの最先端性能を実現する。
論文 参考訳(メタデータ) (2023-03-02T07:47:18Z) - From English to More Languages: Parameter-Efficient Model Reprogramming
for Cross-Lingual Speech Recognition [50.93943755401025]
言語間音声認識のためのニューラルモデル再プログラミングに基づく新しいパラメータ効率学習フレームワークを提案する。
我々は、学習可能な事前学習機能強化に焦点を当てた、異なる補助的ニューラルネットワークアーキテクチャを設計する。
提案手法は,既存のASRチューニングアーキテクチャとその拡張性能を自己監督的損失で向上させる。
論文 参考訳(メタデータ) (2023-01-19T02:37:56Z) - Distilling a Pretrained Language Model to a Multilingual ASR Model [3.4012007729454816]
教師のテキストモデルに埋め込まれた豊富な知識を学生の音声モデルに蒸留する。
我々は,100時間未満の音声データを持つCommonVoiceデータセットの低リソース言語20言語に対して,本手法の優位性を示す。
論文 参考訳(メタデータ) (2022-06-25T12:36:11Z) - How Phonotactics Affect Multilingual and Zero-shot ASR Performance [74.70048598292583]
Transformer encoder-decoderモデルは、トレーニング中に提示された言語のIPA転写において、多言語データをうまく活用することが示されている。
我々は,エンコーダデコーダをAMとLMを分離したハイブリッドASRシステムに置き換える。
交叉音韻律のモデル化による利得は限定的であり,強すぎるモデルがゼロショット転送を損なう可能性があることを示す。
論文 参考訳(メタデータ) (2020-10-22T23:07:24Z) - Massively Multilingual ASR: 50 Languages, 1 Model, 1 Billion Parameters [31.705705891482594]
低音源言語における音声認識(ASR)の性能向上を目的とした,複数言語を対象とした単一音響モデルの訓練について検討した。
入力言語を知らずに1つの関節モデルから多言語学習の3つの変種を、この情報を用いて複数の頭部に比較する。
複数の言語でのASRモデルの多言語学習により、認識性能、特に低リソース言語での認識性能が向上することを示す。
論文 参考訳(メタデータ) (2020-07-06T18:43:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。