論文の概要: WorldSpeech: A Multilingual Speech Corpus from Around the World
- arxiv url: http://arxiv.org/abs/2605.09167v1
- Date: Sat, 09 May 2026 21:00:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.097238
- Title: WorldSpeech: A Multilingual Speech Corpus from Around the World
- Title(参考訳): WorldSpeech: 世界中の多言語音声コーパス
- Abstract要約: WorldSpeechは24kHzの多言語音声コーパスで、76言語にまたがる65k時間の音声書き起こしデータで構成されている。
37言語に対して、WorldSpeechは200時間以上のアライメントされたスピーチを提供しており、28は500時間を超え、24は1k時間を超えている。
WorldSpeech で既存の ASR モデルを微調整すると、11の言語でWord-Error-Rate の平均相対的な 63.5% が減少する。
- 参考スコア(独自算出の注目度): 35.61634772862795
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automatic speech recognition (ASR) performs well for high-resource languages with abundant paired audio-transcript data, but its accuracy degrades sharply for most languages due to limited publicly available aligned data. To this end, we introduce WorldSpeech, a 24 kHz multilingual speech corpus comprising 65k hours of aligned audio-transcript data across 76 languages, collected from diverse public sources including parliamentary proceedings, international broadcasts, and public-domain audiobooks. For 37 languages, WorldSpeech provides more than 200 hours of aligned speech, with 28 exceeding 500 hours and 24 surpassing 1k hours. Fine-tuning existing ASR models on WorldSpeech results in an average relative Word-Error-Rate reduction of 63.5% across 11 typologically diverse languages.
- Abstract(参考訳): ASR(Automatic Speech Recognition)は、ペアの音声書き起こしデータが多い高解像度の言語ではうまく機能するが、その精度は、公開データに制限があるため、ほとんどの言語では著しく低下する。
そこで本研究では,76言語にまたがる65k時間の協調音声書き起こしデータからなる24kHzの多言語音声コーパスWorldSpeechを紹介し,議会手続や国際放送,パブリックドメインオーディオブックなど,さまざまな公開資料から収集した。
37言語に対して、WorldSpeechは200時間以上のアライメントされたスピーチを提供しており、28は500時間を超え、24は1k時間を超えている。
WorldSpeechで既存のASRモデルを微調整すると、11の言語で平均的なWord-Error-Rateの減少率は63.5%となる。
関連論文リスト
- EuroSpeech: A Multilingual Speech Corpus [35.79691721955664]
議会記録から音声データセットを構築するためのスケーラブルなパイプラインを提案する。
このパイプラインを22の欧州議会の録音に適用し、61万時間以上の一致した音声セグメントを抽出します。
データセット上で既存のASRモデルを微調整した場合,平均41.8%の単語誤り率をベースラインで削減する。
論文 参考訳(メタデータ) (2025-10-01T04:51:45Z) - Towards Robust Speech Representation Learning for Thousands of Languages [77.2890285555615]
自己教師付き学習(SSL)は、ラベル付きデータの必要性を減らすことで、音声技術をより多くの言語に拡張するのに役立つ。
我々は4057言語にまたがる100万時間以上のデータに基づいて訓練された、ユニバーサル音声のための言語横断言語であるXEUSを提案する。
論文 参考訳(メタデータ) (2024-06-30T21:40:26Z) - Speech Wikimedia: A 77 Language Multilingual Speech Dataset [2.0288829047328614]
Speech Wikimediaデータセットには、77の異なる言語で、CC-BY-SAライセンスの1780時間 (195 GB) のさまざまなシナリオと話者から書き起こされた音声が含まれている。
各オーディオファイルは異なる言語で1つ以上の書き起こしがあり、このデータセットは音声認識、音声翻訳、機械翻訳モデルの訓練に適している。
論文 参考訳(メタデータ) (2023-08-30T02:14:49Z) - AudioPaLM: A Large Language Model That Can Speak and Listen [79.44757696533709]
本稿では,音声理解・生成のための大規模言語モデルであるAudioPaLMを紹介する。
AudioPaLMはテキストベースの言語モデルと音声ベースの言語モデルを融合する。
音声認識や音声音声翻訳などの応用により、テキストと音声を処理および生成することができる。
論文 参考訳(メタデータ) (2023-06-22T14:37:54Z) - ComSL: A Composite Speech-Language Model for End-to-End Speech-to-Text
Translation [79.66359274050885]
公的な事前訓練された音声のみのモデルと言語のみのモデルからなる複合アーキテクチャ上に構築された音声言語モデルであるComSLを提案する。
提案手法は,エンドツーエンドの音声-テキスト翻訳タスクにおいて有効であることを示す。
論文 参考訳(メタデータ) (2023-05-24T07:42:15Z) - Scaling Speech Technology to 1,000+ Languages [66.31120979098483]
MMS(Massively Multilingual Speech)プロジェクトは、タスクに応じてサポート言語を10~40倍増やす。
主な材料は、一般に公開されている宗教文書の読解に基づく新しいデータセットである。
我々は,1,406言語,1,107言語用1つの多言語自動音声認識モデル,同一言語用音声合成モデル,4,017言語用言語識別モデルについて,事前学習したwav2vec 2.0モデルを構築した。
論文 参考訳(メタデータ) (2023-05-22T22:09:41Z) - Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages [76.95115818308918]
100以上の言語で自動音声認識(ASR)を行う単一大モデルであるUniversal Speech Model (USM)を導入する。
これは300以上の言語にまたがる1200万時間 (M) の大規模なラベル付き多言語データセット上で、モデルのエンコーダを事前トレーニングすることで達成される。
我々は,多言語事前学習とランダム投影量子化と音声-テキスト・モダリティマッチングを用いて,下流多言語ASRおよび音声-テキスト翻訳タスクの最先端性能を実現する。
論文 参考訳(メタデータ) (2023-03-02T07:47:18Z) - SpeechMatrix: A Large-Scale Mined Corpus of Multilingual
Speech-to-Speech Translations [38.058120432870126]
SpeechMatrixは、音声から音声への翻訳の大規模多言語コーパスである。
136言語対の音声アライメントと、合計418万時間の音声を含む。
論文 参考訳(メタデータ) (2022-11-08T19:09:27Z) - Maestro-U: Leveraging joint speech-text representation learning for zero
supervised speech ASR [39.59611707268663]
モーダリティマッチングされた共同音声とテキストモデルを用いて、言語によっては教師付き音声を使わずに、膨大な多言語ASRモデルを訓練できることを示す。
Maestro-Uは,グラフの重なりに制限がある場合にも,教師付き音声言語からの知識伝達を促進することができることを示す。
論文 参考訳(メタデータ) (2022-10-18T17:50:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。