論文の概要: DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages
- arxiv url: http://arxiv.org/abs/2607.21540v2
- Date: Fri, 24 Jul 2026 18:05:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 12:52:43.790196
- Title: DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages
- Title(参考訳): DONDO:アフリカ言語のためのオープンw2v-BERT音声認識ベースモデル
- Abstract要約: 本稿では,アフリカ言語を対象としたオープンかつパーミッシブな自動音声認識(ASR)ベースモデルであるDONDOについて述べる。
DONDOは、21の単言語モデルと、27の言語変種にまたがる5つの多言語モデルからなる。
すべてのモデルはApache-2.0ライセンスの下でHugging Face KhayaAI組織でリリースされている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present DONDO, a family of open, permissively licensed automatic speech recognition (ASR) base models for African languages, built on the w2v-BERT 2.0 self-supervised speech encoder. DONDO comprises twenty-one monolingual models and five multilingual models spanning twenty-seven language varieties across Ghana, Sierra Leone, Nigeria, Senegal, Kenya and Zimbabwe. Models are fine-tuned primarily on read speech drawn from religious texts, which offer broad, license-clear and orthographically consistent coverage for languages that otherwise lack transcribed audio. We describe a two-step (and, for one family, three-step) learning-rate-annealed fine-tuning procedure that first adapts a shared multilingual model at a high learning rate and then anneals it to recover, and in several cases surpass, strong monolingual baselines. We further describe a lightweight language-conditioning mechanism that injects a one-hot language identity as a sequence of prefix frames prepended to the acoustic features, allowing a single multilingual checkpoint to be steered to a target language at inference. Across the five multilingual families the annealed models reach average word error rates (WER) of 10-13%, closing most of the gap to monolingual models while covering many languages in a single checkpoint. All models are released on the Hugging Face KhayaAI organisation under the Apache-2.0 license (attribution only) so that others may fine-tune them freely, including for commercial use. We provide a conservative estimate that the languages covered are spoken by on the order of one hundred million first-language speakers, and by substantially more when second-language use is included.
- Abstract(参考訳): 我々は,W2v-BERT 2.0自己教師型音声エンコーダ上に構築された,アフリカ言語のためのオープンかつパーミッシブにライセンスされた自動音声認識(ASR)ベースモデルであるDONDOを提案する。
DONDOは21のモノリンガルモデルと、ガーナ、シエラレオネ、ナイジェリア、セネガル、ケニア、ジンバブエにまたがる27の言語にまたがる5つの多言語モデルで構成されている。
モデルは、主に宗教的なテキストから引き出された読み上げ音声に基づいて微調整される。
まず,学習速度で共有多言語モデルに適応し,その後回復し,場合によっては強い単言語ベースラインを超越する2段階(および1つのファミリー,3段階)の学習速度アニールによる微調整手順について述べる。
さらに、音響的特徴に先行するプレフィックスフレームのシーケンスとして、ワンホット言語アイデンティティを注入する軽量な言語条件付け機構を記述し、単一の多言語チェックポイントを推論時にターゲット言語に操ることを可能にする。
5つの多言語ファミリー全体で、アニールされたモデルは平均単語誤り率(WER)が10-13%に達し、単一のチェックポイントで多くの言語をカバーしながらモノリンガルモデルとのギャップの大半を埋める。
すべてのモデルは Apache-2.0 ライセンス (属性のみ) の下で Hugging Face KhayaAI 組織でリリースされている。
我々は、カバーする言語が1億人の第一言語話者の順番で話され、第二言語の使用が組み込まれている場合、はるかに多いという保守的な推定を提供する。
関連論文リスト
- Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models [8.556170587475146]
自己教師付き学習(SSL)は、音声表現学習において大きな進歩を遂げている。
多言語SSLモデルは、個々の言語でモノリンガルのモデルよりも性能が低い傾向にある。
この性能ギャップを低減するために、バイリンガル音声SSLモデルに限られた視覚的グラウンドを導入する。
論文 参考訳(メタデータ) (2025-09-22T08:48:04Z) - Poro 34B and the Blessing of Multilinguality [3.270981284471548]
Poro 34Bは、フィンランド語、英語、プログラミング言語の1兆トークンのために訓練された34億のパラメータモデルである。
フィンランド語における既存モデルの能力を大幅に向上するモデルを,多言語学習アプローチにより生成できることが示される。
論文 参考訳(メタデータ) (2024-04-02T11:34:12Z) - Multilingual self-supervised speech representations improve the speech
recognition of low-resource African languages with codeswitching [65.74653592668743]
微細な自己教師型多言語表現は絶対単語誤り率を最大20%削減する。
訓練データに制限のある状況では、自己教師付き表現を微調整することが、より良いパフォーマンスと実行可能なソリューションである。
論文 参考訳(メタデータ) (2023-11-25T17:05:21Z) - PolyLM: An Open Source Polyglot Large Language Model [57.64420154135178]
我々は6400億(B)トークンでトレーニングされた多言語大言語モデル(LLM)であるPolyLMについて述べる。
その多言語的能力を高めるために,1) バイリンガルデータをトレーニングデータに統合し,2) 事前学習中に英語以外のデータの比率を30%から60%に引き上げるカリキュラム学習戦略を採用する。
さらに,モデル微調整のために,132.7Kの多言語命令を自動的に生成する多言語自己指示手法を提案する。
論文 参考訳(メタデータ) (2023-07-12T09:00:37Z) - Textless Speech-to-Speech Translation With Limited Parallel Data [51.3588490789084]
PFBはテキストレスのS2STモデルをトレーニングするためのフレームワークで、数十時間の並列音声データしか必要としない。
3つのドメインで英語、ドイツ語、マラティー語、英語の翻訳をトレーニングし、評価する。
論文 参考訳(メタデータ) (2023-05-24T17:59:05Z) - Scaling Speech Technology to 1,000+ Languages [66.31120979098483]
MMS(Massively Multilingual Speech)プロジェクトは、タスクに応じてサポート言語を10~40倍増やす。
主な材料は、一般に公開されている宗教文書の読解に基づく新しいデータセットである。
我々は,1,406言語,1,107言語用1つの多言語自動音声認識モデル,同一言語用音声合成モデル,4,017言語用言語識別モデルについて,事前学習したwav2vec 2.0モデルを構築した。
論文 参考訳(メタデータ) (2023-05-22T22:09:41Z) - Distilling a Pretrained Language Model to a Multilingual ASR Model [3.4012007729454816]
教師のテキストモデルに埋め込まれた豊富な知識を学生の音声モデルに蒸留する。
我々は,100時間未満の音声データを持つCommonVoiceデータセットの低リソース言語20言語に対して,本手法の優位性を示す。
論文 参考訳(メタデータ) (2022-06-25T12:36:11Z) - Joint Modeling of Code-Switched and Monolingual ASR via Conditional
Factorization [75.98664099579392]
本稿では,バイリンガル音声認識を構成するモノリンガルとコードスウィッチのサブタスクの可能性を共同でモデル化するための一般的な枠組みを提案する。
単言語およびコード切替コーパス間のバイリンガル・マンダリン・イングリッシュ音声認識における提案手法の有効性を実証する。
論文 参考訳(メタデータ) (2021-11-29T23:14:54Z) - Exploring Teacher-Student Learning Approach for Multi-lingual
Speech-to-Intent Classification [73.5497360800395]
複数の言語をサポートするエンドツーエンドシステムを開発した。
我々は、事前訓練された多言語自然言語処理モデルからの知識を利用する。
論文 参考訳(メタデータ) (2021-09-28T04:43:11Z) - Discovering Representation Sprachbund For Multilingual Pre-Training [139.05668687865688]
多言語事前学習モデルから言語表現を生成し、言語分析を行う。
すべての対象言語を複数のグループにクラスタリングし、表現のスプラックバンドとして各グループに名前を付ける。
言語間ベンチマークで実験を行い、強いベースラインと比較して大幅な改善が達成された。
論文 参考訳(メタデータ) (2021-09-01T09:32:06Z) - CLSRIL-23: Cross Lingual Speech Representations for Indic Languages [0.0]
CLSRIL-23は、23のIndic言語にまたがる生音声から言語間の音声表現を学習する自己教師付き学習ベースモデルである。
wav2vec 2.0の上に構築され、マスク付き潜在音声表現よりも対照的なタスクを訓練することで解決される。
単言語と多言語による事前学習の効果を比較するために,事前学習における言語障害の比較を行った。
論文 参考訳(メタデータ) (2021-07-15T15:42:43Z) - Probing Multilingual Language Models for Discourse [0.0]
XLM-RoBERTaファミリーのモデルが常に最高のパフォーマンスを示していることが分かりました。
また, モデル蒸留は, 文表現の言語間移動能力に悪影響を及ぼす可能性が示唆された。
論文 参考訳(メタデータ) (2021-06-09T06:34:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。