論文の概要: AraYoungVoices: A Diverse L1/L2 Corpus of Arabic Child and Adolescent Speech
- arxiv url: http://arxiv.org/abs/2610.05044v1
- Date: Sun, 04 Oct 2026 08:25:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 06:42:44.311914
- Title: AraYoungVoices: A Diverse L1/L2 Corpus of Arabic Child and Adolescent Speech
- Title(参考訳): AraYoungVoices:アラビア語の子供と思春期のスピーチの多言語L1/L2コーパス
- Abstract要約: AraYoungVoicesは、7歳から18歳の286人の話者による151.72時間のアラビア語読み上げコーパスである。
コーパスには146のアラビア語(L1)と140の第二言語(L2)話者が含まれている。
結果,L2話者はL1話者よりもL2話者の方が有意に難易度が高いことが明らかとなった。
- 参考スコア(独自算出の注目度): 12.788299301869202
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: State-of-the-art ASR systems primarily target native adult speech, leading to substantial performance gaps for children, adolescents, and L2 speakers. We introduce AraYoungVoices, a 151.72-hour Arabic read-speech corpus from 286 speakers aged 7--18, comprising AraKids (7--12) and AraTeens (13--18). The corpus includes 146 native Arabic (L1) and 140 second-language (L2) speakers, with native speakers spanning Egyptian, Gulf, Levantine, and North African dialectal backgrounds and L2 speakers representing diverse linguistic backgrounds across the Americas, Asia, Africa, and Europe. We benchmark four pretrained ASR models under zero-shot and fine-tuned settings using unseen-speaker-$\&$-unseen-prompt (USUP) and unseen-speaker-$\&$-seen-prompt (USSP) evaluations. Results show that L2 speech remains substantially more challenging than L1 speech, with the largest errors observed mainly for younger L2 speakers. Age-specific fine-tuning improves the matched age group, while joint fine-tuning provides a stronger balance across populations. ASR hypotheses are also consistently closer to the standard reading prompt than to the verbatim transcription, particularly for L2 speech, suggesting partial normalization of reading deviations.
- Abstract(参考訳): 最先端のASRシステムは、主にネイティブアダルトスピーチをターゲットとしており、子供、青年、およびL2話者の実質的なパフォーマンスギャップにつながっている。
AraKids (7--12) と AraTeens (13--18) を含む7-18歳の話者286人のアラビア語読み上げコーパスであるAraYoungVoicesを紹介した。
コーパスには146のアラビア語(L1)と140の第二言語(L2)話者が含まれ、エジプト語、ガルフ語、レバンタ語、北アフリカの方言の背景とL2話者はアメリカ、アジア、アフリカ、ヨーロッパ各地の多様な言語的背景を表す。
ゼロショットと微調整の4つの事前訓練されたASRモデルを、未確認話者-$&$-unseen-prompt (USUP) と未学習話者-$&$-seen-prompt (USSP) 評価を用いてベンチマークした。
結果,L2話者はL1話者よりもL2話者の方が有意に難易度が高いことが明らかとなった。
年齢別微調整は一致した年齢群を改善する一方、共同微調整は人口間のバランスを強くする。
ASR仮説は、特にL2音声において、動詞の文字起こしよりも標準読解に一貫して近づき、読解偏差の部分正規化が示唆される。
関連論文リスト
- ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions [66.93528077633728]
ESCUCHAは、既存のデータセットからではなく、音声と組み合わせた1,000の人為的な質問からなる。
このベンチマークは、9つの知覚的カテゴリーと10の推論カテゴリにまたがる推論を強調し、複数のスペイン語アクセントと非ノルマ的スピーチを通して言語多様性を捉えている。
いくつかの最先端のマルチモーダルおよび音声モデルのベンチマークでは、訓練された人間と比較して、かなりのパフォーマンスのギャップが示される。
論文 参考訳(メタデータ) (2026-07-20T10:59:15Z) - DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models [54.10223256792762]
アラビア方言における大規模言語モデル(LLM)の性能評価のための新しいベンチマークであるDialectalArabicMMLUを提案する。
MMLU-Redux フレームワークを手動で翻訳し、3K 個の質問応答対を5つの主要な方言に適応することで拡張する。
論文 参考訳(メタデータ) (2025-10-31T15:17:06Z) - In-Context Learning Boosts Speech Recognition via Human-like Adaptation to Speakers and Language Varieties [24.74769794165231]
本稿では,Phi-4 Multimodal におけるコンテキスト内学習(ICL)を実現するスケーラブルなフレームワークを提案する。
単語の誤り率を相対的に19.7%減少させるのは、12の例に過ぎない。
全体として、我々の新しいICL適応方式は、人間の聴取者と同様の性能を示す。
論文 参考訳(メタデータ) (2025-05-20T20:20:37Z) - LearnerVoice: A Dataset of Non-Native English Learners' Spontaneous Speech [36.447412884392115]
我々はLearnerVoiceを公開し、LearnerVoiceは50.04時間の音声とL2学習者の自然発話の書き起こしからなるデータセットである。
言語学的解析により、我々のデータセットの転写にはL2Sの特徴が含まれており、ネイティブな音声データセットよりもはるかに多いことが判明した。
LearnerVoiceによる微調整のwhisper-small.enのWERは10.26%、バニラのwhisper-small.enよりも44.2%低い。
論文 参考訳(メタデータ) (2024-07-05T06:25:54Z) - Language Proficiency and F0 Entrainment: A Study of L2 English Imitation in Italian, French, and Slovak Speakers [48.3822861675732]
本研究は、第2言語(L2)における第2言語(ART)のF0エントレメントについて検討する。
イタリア語、フランス語、スロバキア原語の参加者は、英語の発声を模倣しました。
その結果,L2英語の習熟度とエントレメントの関係は曖昧であった。
論文 参考訳(メタデータ) (2024-04-16T10:10:19Z) - VALUE: Understanding Dialect Disparity in NLU [50.35526025326337]
アフリカ・アメリカン・バーナクラ・イングリッシュ(AAVE)の11つの特徴に関するルールを構築した。
言語的アクセプタビリティ判断により,各特徴変換の検証を行うために,流線型AAVE話者を募集する。
実験により、これらの新しい方言の特徴がモデル性能の低下につながることが示された。
論文 参考訳(メタデータ) (2022-04-06T18:30:56Z) - XLS-R: Self-supervised Cross-lingual Speech Representation Learning at
Scale [48.0390317915984]
XLS-Rはwav2vec 2.0に基づく言語間音声表現学習のための大規模モデルである。
128の言語で50万時間近く、最大2Bパラメータを持つモデルをトレーニングします。
論文 参考訳(メタデータ) (2021-11-17T18:49:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。