論文の概要: AfriSwitch: A Benchmark for In-the-Wild African Code-Switched Speech Recognition
- arxiv url: http://arxiv.org/abs/2608.26434v1
- Date: Wed, 26 Aug 2026 22:20:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.196097
- Title: AfriSwitch: A Benchmark for In-the-Wild African Code-Switched Speech Recognition
- Title(参考訳): AfriSwitch: アフリカのコード変換音声認識のベンチマーク
- Authors: Gabrial Zencha Ashungafac, Busayo Awobade, Tobi Olatunji,
- Abstract要約: AfriSwitchは16のアフリカの言語と言語にまたがる、Wildのコードスイッチによる音声のベンチマークである。
ひとつのスカラーが、言語がコードスイッチングされる様子をキャプチャすることはありません。
モデルスケールや名目上の言語カバレッジではなく、アフリカをターゲットとしたトレーニングは、パフォーマンスを最もよく予測する。
- 参考スコア(独自算出の注目度): 1.5081019182566802
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Code-switching is pervasive in bilingual African conversation, yet most ASR systems assume monolingual input and are evaluated on curated monolingual benchmarks. We present AfriSwitch, a 61.36-hour human-transcribed benchmark of in-the-wild code-switched speech spanning 16 African languages and language varieties, released with switch-level English span tags, perutterance Code-Mixing Index (CMI), and switch-point counts. Corpus statistics show that mixing behaviour varies widely across African languages along two largely independent axes: how often speakers alternate, and how balanced the mixture is. No single scalar captures how code-switched a language is. Benchmarking five open and commercial multilingual ASR systems zero-shot yields word error rates far above published monolingual figures for the same languages, with the best system averaging 35.93% WER and no system falling below 24% on any language. Africa-targeted training, not model scale or nominal language coverage, best predicts performance.
- Abstract(参考訳): コードスイッチングはバイリンガルのアフリカ会話において広く行われているが、ほとんどのASRシステムはモノリンガル入力を仮定し、単リンガルベンチマークで評価される。
提案するAfriSwitchは,16のアフリカ言語と言語多種多様な言語にまたがる,61.36時間で書き起こされる人為的な言語音声のベンチマークであり,スイッチレベルの英語スパンタグ,発話コードマイニングインデックス(CMI),スイッチポイント数などを備える。
コーパス統計によれば、混合行動は2つの独立した軸に沿ってアフリカ諸言語で大きく異なる。
ひとつのスカラーが、言語がコードスイッチングされる様子をキャプチャすることはありません。
5つのオープンかつ商用の多言語ASRシステムのベンチマークでは、ゼロショットは、同じ言語の単言語数よりもはるかに高い単語エラー率を示し、最も優れたシステムは35.93% WERであり、どの言語でも24%未満のシステムはない。
モデルスケールや名目上の言語カバレッジではなく、アフリカをターゲットとしたトレーニングは、パフォーマンスを最もよく予測する。
関連論文リスト
- Benchmarking Commercial ASR Systems on Code-Switching Speech: Arabic, Persian, and German [0.34797121357690153]
我々は、4つの言語ペアで5つの商用ASRプロバイダを評価するベンチマークを示す。
We evaluate on WER and BERTScore, showed that both metrics agree on the Ordinal ranking of systems, WER inflats the size of quality gaps。
ElevenLabs Scribe v2は最低のWER(全体の13.2%)を獲得し、BERTScore(全体の0.936)に導かれる。
論文 参考訳(メタデータ) (2026-05-18T19:50:44Z) - MUSCAT: MUltilingual, SCientific ConversATion Benchmark [60.87925076316812]
多言語音声技術の目標は、異なる言語を話す個人間のシームレスなコミュニケーションを容易にすることである。
この経験を生み出すためには、音声技術は、混合多言語入力、特定の語彙、コードスイッチングといったいくつかの課題に対処する必要がある。
本稿では,これらの課題に対処できるかどうかを問う,現在の音声認識(ASR)システムを評価するための新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2026-04-17T10:39:01Z) - Multilingual self-supervised speech representations improve the speech
recognition of low-resource African languages with codeswitching [65.74653592668743]
微細な自己教師型多言語表現は絶対単語誤り率を最大20%削減する。
訓練データに制限のある状況では、自己教師付き表現を微調整することが、より良いパフォーマンスと実行可能なソリューションである。
論文 参考訳(メタデータ) (2023-11-25T17:05:21Z) - Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages [49.6922490267701]
我々は,自己教師型音声エンコーダのコード切替能力を評価するために,ゼロリソースコード切替音声ベンチマークを導入した。
本稿では,音声エンコーダのコードスイッチング能力を評価するために,離散単位に基づく言語モデリングのベースラインシステムを紹介する。
論文 参考訳(メタデータ) (2023-10-04T17:58:11Z) - LAE: Language-Aware Encoder for Monolingual and Multilingual ASR [87.74794847245536]
言語固有の情報を混在させることにより,両状況に対処する新しい言語対応エンコーダ (LAE) アーキテクチャを提案する。
マンダリン・イングリッシュ・コードスウィッチ音声を用いた実験により,LAEはフレームレベルで異なる言語を識別できることが示唆された。
論文 参考訳(メタデータ) (2022-06-05T04:03:12Z) - Code Switched and Code Mixed Speech Recognition for Indic languages [0.0]
多言語自動音声認識(ASR)システムの訓練は、音響情報と語彙情報が典型的には言語固有のものであるため困難である。
言語識別(LID)に基づく一言語モデルとエンドツーエンドの多言語音声認識システムの性能を比較した。
また,Hindi- English と Bengali- English の相似解法を提案し,それぞれ 21.77 と 28.27 の WER を実現する。
論文 参考訳(メタデータ) (2022-03-30T18:09:28Z) - Reducing language context confusion for end-to-end code-switching
automatic speech recognition [50.89821865949395]
本稿では,E2E符号スイッチングASRモデルの多言語コンテキストの混同を低減するための言語関連アテンション機構を提案する。
複数の言語のそれぞれの注意を計算することにより、豊かな単言語データから言語知識を効率的に伝達することができる。
論文 参考訳(メタデータ) (2022-01-28T14:39:29Z) - Multilingual and code-switching ASR challenges for low resource Indian
languages [59.2906853285309]
インドの7つの言語に関連する2つのサブタスクを通じて、多言語およびコードスイッチングASRシステムの構築に重点を置いている。
これらの言語では、列車とテストセットからなる600時間分の音声データを合計で提供します。
また,マルチリンガルサブタスクとコードスイッチサブタスクのテストセットでは,それぞれ30.73%と32.45%という,タスクのベースラインレシピも提供しています。
論文 参考訳(メタデータ) (2021-04-01T03:37:01Z) - Semi-supervised Development of ASR Systems for Multilingual
Code-switched Speech in Under-resourced Languages [19.569525304938033]
2つのアプローチは、南アフリカの5つの言語で、未ソースでコード変更されたスピーチであると考えられている。
第1は、4つの異なる言語対に対応する4つの別々のバイリンガル自動音声認識器を構成する。
2つ目は、すべての言語を表す単一の、統一された5言語ASRシステムである。
論文 参考訳(メタデータ) (2020-03-06T11:08:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。