論文の概要: Ara-Best-RQ: Multi Dialectal Arabic SSL
- arxiv url: http://arxiv.org/abs/2603.21900v1
- Date: Mon, 23 Mar 2026 12:23:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.663914
- Title: Ara-Best-RQ: Multi Dialectal Arabic SSL
- Title(参考訳): Ara-Best-RQ: Multi Dialectal Arabic SSL
- Authors: Haroun Elleuch, Ryan Whetten, Salima Mdhaffar, Yannick Estève, Fethi Bougares,
- Abstract要約: Ara-BEST-RQ(アラビア語: Ara-BEST-RQ)は、アラビア語の音声処理のための自己教師付き学習モデルである。
我々はコンバータをベースとしたBEST-RQモデルを6億パラメータまで事前訓練する。
モデルは方言識別(DID)と自動音声認識(ASR)タスクに基づいて評価される。
- 参考スコア(独自算出の注目度): 11.331527589218483
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present Ara-BEST-RQ, a family of self-supervised learning (SSL) models specifically designed for multi-dialectal Arabic speech processing. Leveraging 5,640 hours of crawled Creative Commons speech and combining it with publicly available datasets, we pre-train conformer-based BEST-RQ models up to 600M parameters. Our models are evaluated on dialect identification (DID) and automatic speech recognition (ASR) tasks, achieving state-of-the-art performance on the former while using fewer parameters than competing models. We demonstrate that family-targeted pre-training on Arabic dialects significantly improves downstream performance compared to multilingual or monolingual models trained on non-Arabic data. All models, code, and pre-processed datasets will be publicly released to support reproducibility and further research in Arabic speech technologies.
- Abstract(参考訳): Ara-BEST-RQは,多方言のアラビア音声処理に特化して設計された自己教師型学習(SSL)モデルである。
クロールされたCreative Commonsのスピーチを5,640時間利用し、公開データセットと組み合わせることで、コンフォーマベースのBEST-RQモデルを最大6億のパラメータに事前トレーニングする。
我々のモデルは方言識別(DID)および自動音声認識(ASR)タスクに基づいて評価され、競合モデルよりも少ないパラメータを用いて前者に対して最先端の性能を達成する。
アラビア方言における家族目標の事前学習は、非アラビアデータで訓練された多言語モデルやモノリンガルモデルと比較して、下流のパフォーマンスを著しく向上させることを示した。
すべてのモデル、コード、および事前処理されたデータセットは、再現性をサポートし、アラビア語の音声技術に関するさらなる研究をサポートするために、一般公開される。
関連論文リスト
- DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation [111.94720088481614]
多モーダル生成モデルは方言テキスト入力を効果的に生成できるのか?
6つの共通英語方言にまたがる大規模ベンチマークを構築した。
マルチモーダル生成モデルのための一般的なエンコーダに基づく緩和戦略を設計する。
論文 参考訳(メタデータ) (2025-10-16T17:56:55Z) - Arabic ASR on the SADA Large-Scale Arabic Speech Corpus with Transformer-Based Models [3.2669219874106608]
大規模アラビア音声データセットを用いた音声認識モデルの性能評価を行った。
データセットにはサウジアラビアのテレビ番組の高品質オーディオが68時間含まれている。
4 グラム言語モデルを用いて SADA 上で微調整された MMS 1B モデルは 40.9% の WER と 17.6% の CER を達成する。
論文 参考訳(メタデータ) (2025-08-18T14:44:25Z) - Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis [4.774607166378613]
自己教師付き事前トレーニングと大規模言語モデル(LLM)を組み合わせることで、低リソースシナリオにおけるASRのパフォーマンスを効果的に向上させることができる。
我々は、ラベル付き方言とアクセント付き音声データの30,000時間でData2vec2モデルを事前訓練し、教師付きデータセット上で4万時間アライメントトレーニングを行う。
論文 参考訳(メタデータ) (2025-05-27T12:50:55Z) - Resource-Aware Arabic LLM Creation: Model Adaptation, Integration, and Multi-Domain Testing [0.0]
本稿では,4GB VRAMしか持たないシステム上で,量子化低ランク適応(QLoRA)を用いたアラビア語処理のためのQwen2-1.5Bモデルを微調整する新しい手法を提案する。
Bactrian、OpenAssistant、Wikipedia Arabic corporaなどの多様なデータセットを使用して、この大きな言語モデルをアラビア語領域に適応する過程を詳述する。
1万以上のトレーニングステップの実験結果は、最終的な損失が0.1083に収束するなど、大幅なパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2024-12-23T13:08:48Z) - Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer [59.57249127943914]
本稿では,複数の改良を加えた多言語音声認識モデルを提案する。
我々は、6つの異なる言語に対する音声視覚訓練データの量を増やし、重複しない多言語データセットの自動書き起こしを生成する。
提案モデルでは, LRS3データセット上での新たな最先端性能を実現し, WERは0.8%に達した。
論文 参考訳(メタデータ) (2024-03-14T01:16:32Z) - Improving Massively Multilingual ASR With Auxiliary CTC Objectives [40.10307386370194]
FLEURSは102言語によるオープンASRベンチマークである。
我々は,最近のコネクショニスト時間分類(CTC)研究から着想を得た手法を考察し,モデルが多数の言語を扱えるようにした。
コンバータアーキテクチャを用いた自己教師型モデルを用いた最先端システムでは,相対28.4%CERによるFLEURSの先行研究よりも改善されている。
論文 参考訳(メタデータ) (2023-02-24T18:59:51Z) - From English to More Languages: Parameter-Efficient Model Reprogramming
for Cross-Lingual Speech Recognition [50.93943755401025]
言語間音声認識のためのニューラルモデル再プログラミングに基づく新しいパラメータ効率学習フレームワークを提案する。
我々は、学習可能な事前学習機能強化に焦点を当てた、異なる補助的ニューラルネットワークアーキテクチャを設計する。
提案手法は,既存のASRチューニングアーキテクチャとその拡張性能を自己監督的損失で向上させる。
論文 参考訳(メタデータ) (2023-01-19T02:37:56Z) - QAmeleon: Multilingual QA with Only 5 Examples [71.80611036543633]
数ショットの学習環境下で事前学習した言語モデルを利用する方法を示す。
我々のアプローチであるQAmeleonは、PLMを使用して、QAモデルをトレーニングした多言語データを自動的に生成する。
言語毎に5つの例しか持たないデータ合成のためにPLMをプロンプトチューニングすることで、翻訳ベースのベースラインよりも精度が向上する。
論文 参考訳(メタデータ) (2022-11-15T16:14:39Z) - Unsupervised Cross-lingual Representation Learning for Speech
Recognition [63.85924123692923]
XLSRは、複数の言語における音声の生波形から1つのモデルを事前学習することで、言語間音声表現を学習する。
我々は、マスク付き潜在音声表現よりも対照的なタスクを解くことで訓練されたwav2vec 2.0を構築した。
実験により、言語間事前学習はモノリンガル事前訓練よりも著しく優れていることが示された。
論文 参考訳(メタデータ) (2020-06-24T18:25:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。