論文の概要: Building an ASR Solution for Training and Assessing Children's Reading
- arxiv url: http://arxiv.org/abs/2606.31508v1
- Date: Tue, 30 Jun 2026 11:24:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.193889
- Title: Building an ASR Solution for Training and Assessing Children's Reading
- Title(参考訳): 子どもの読書の学習と評価のためのASRソリューションの構築
- Abstract要約: 本研究では,バンバラにおける児童の読書評価のためのオープンソースシステムを提案する。
モバイル・コレクション・アセスメント・アプリは60人の子供から55時間の生読み音声を収集するために使用された。
- 参考スコア(独自算出の注目度): 0.7456526005219318
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automatic speech recognition for children's reading remains underdeveloped for most African languages, including Bambara, despite its potential value for reproducible literacy assessment. We present an open-source system for assessing children's reading in Bambara, developed through an end-to-end process linking field data collection, benchmark construction, model adaptation, a reading application, and classroom validation. A mobile collection and assessment app was used to collect 55 hours of raw reading speech from 60 children, from which we construct a public benchmark for Bambara child-reading assessment. Fine-tuning experiments compare Soloni, a Bambara-adapted Fast-Conformer ASR framework with TDT and CTC decoders, with QuartzNet, a compact convolutional ASR architecture. The best Soloni model reduces WER from 0.42 to 0.22 and CER from 0.15 to 0.08, substantially outperforming QuartzNet on the isolated benchmark. The experiments further show that repeated readings of the same texts provide architecture-dependent benefits: they substantially improve QuartzNet but add only marginal gains for Soloni, while SpecAugment regulates training without exceeding the best unaugmented configuration. Disaggregated analysis identifies children under 10 as the main source of residual errors, motivating targeted collection from younger readers. Ten classroom trials supported continued use of the application.
- Abstract(参考訳): 子どもの読み書きの自動音声認識は、再現可能なリテラシー評価に価値があるにもかかわらず、バンバラを含むほとんどのアフリカの言語では未発達のままである。
本研究では,フィールドデータ収集,ベンチマーク構築,モデル適応,読書アプリケーション,教室の検証といった,エンド・ツー・エンドのプロセスによって開発された,バンバラにおける児童の読書を評価するためのオープンソースシステムを提案する。
モバイル・コレクション・アセスメント・アプリを用いて,60人の子供から55時間の生読み音声を収集し,Bambara育児評価のための公開ベンチマークを構築した。
微調整実験では、Bambaraに適応したFast-Conformer ASRフレームワークであるSoloniと、TDTおよびCTCデコーダを、コンパクトな畳み込みASRアーキテクチャであるQuartzNetと比較した。
最も優れたソロニモデルでは、WERを0.42から0.22に、CERを0.15から0.08に削減し、孤立したベンチマークでQuartzNetを大幅に上回っている。
それらはQuartzNetを大幅に改善するが、Soloniには限界利得しか加えず、SpecAugmentは最高の未解決構成を超えずにトレーニングを規制している。
解離分析は10歳未満の子どもを残差の主な原因とみなし、若い読者の標的収集を動機付けている。
10の教室での試験は、アプリケーションの継続的な使用を支持した。
関連論文リスト
- AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following [17.52339026461815]
本稿では,複雑な音声キャプションを可変個の独立した検証可能なバイナリルーブリックアイテムに適応的に分解する動的ルーブリック評価パラダイムを提案する。
我々はこの能力をAnyAudio-Judge Benchでベンチマークする。
実験により、AnyAudio-Judgeは、最先端のベースラインに比べて、ゼロショットアライメントの検出を著しく向上する。
論文 参考訳(メタデータ) (2026-06-02T04:00:32Z) - Elementary, My Dear Watson: Non-Invasive Neural Keyword Spotting in the LibriBrain Dataset [1.497166779417398]
キーワードスポッティング(英: Keywords Spotting, KWS)は、脳とコンピュータのインターフェイスのための、プライバシーに配慮した中間タスクである。
我々は、単語レベルのデータローダとColab対応のチュートリアルを備えたpnplライブラリの更新版をリリースした。
論文 参考訳(メタデータ) (2025-10-23T22:44:50Z) - Can Layer-wise SSL Features Improve Zero-Shot ASR Performance for Children's Speech? [43.31597557333867]
本研究では、最先端SSL事前訓練モデルから抽出した階層的特徴が、ゼロショットシナリオにおける子供の発話におけるASRの性能向上に有効であることを示す。
分析では、ゼロショットシナリオにおいて、子どもの発話におけるASRパフォーマンスを向上させる最も効果的なレイヤを特定した。
論文 参考訳(メタデータ) (2025-08-28T21:32:36Z) - Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet [72.53502346791814]
データセット、SSL表現(WavLM、XEUS)、デコーダアーキテクチャ間のフラットスタートトレーニングを比較した。
SSL表現は成人のスピーチに偏りがあり、子どものスピーチに対するフラットスタートトレーニングはこれらのバイアスを緩和する。
年齢関連ASRと話者検証分析は、プロプライエタリモデルの限界を強調している。
論文 参考訳(メタデータ) (2025-08-22T17:59:35Z) - Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR [74.38242498079627]
自己教師付き学習(SSL)に基づく離散音声表現は、非常にコンパクトで、ドメイン適応性が高い。
本稿では、Zipformer-Transducer ASRシステムにおいて、WavLMモデルから抽出したSSL離散音声特徴を追加の発話音響コンテキスト特徴として用いた。
論文 参考訳(メタデータ) (2024-09-13T13:01:09Z) - An ASR-Based Tutor for Learning to Read: How to Optimize Feedback to
First Graders [18.849741353784328]
前報では,ASRをベースとしたオランダ語読解指導アプリケーションについて紹介し,初等生の読み方に対する即時フィードバックについて検討した。
既存のコーパス (JASMIN) から得られた子どもの音声を用いて, 2つの新しいASRシステムの開発を行い, 前報と比較した。
ASRシステムの精度は、読み出しタスクや単語の種類によって異なる。
論文 参考訳(メタデータ) (2023-06-07T06:58:38Z) - Strategies for improving low resource speech to text translation relying
on pre-trained ASR models [59.90106959717875]
本稿では,テキスト翻訳(ST)における低音源音声の性能向上のための技術と知見について述べる。
本研究は,英語とポルトガル語,タマシェク語とフランス語の2つの言語対について,シミュレーションおよび実低資源設定について実験を行った。
論文 参考訳(メタデータ) (2023-05-31T21:58:07Z) - Z-ICL: Zero-Shot In-Context Learning with Pseudo-Demonstrations [97.41375480696972]
そこで,Z-ICLを提案する。Z-ICL,Z-ICLは,与えられたテスト入力に対して擬似デモを構築することでギャップを埋める新しいゼロショット方式である。
9つの分類データセットの評価は、Z-ICLが従来のゼロショット法よりも有意差で優れていたことを示している。
論文 参考訳(メタデータ) (2022-12-19T21:34:26Z) - COLO: A Contrastive Learning based Re-ranking Framework for One-Stage
Summarization [84.70895015194188]
コントラスト学習に基づく一段階要約フレームワークであるCOLOを提案する。
COLOはCNN/DailyMailベンチマークの1段階システムの抽出と抽象化結果を44.58と46.33ROUGE-1スコアに引き上げた。
論文 参考訳(メタデータ) (2022-09-29T06:11:21Z) - Nonwords Pronunciation Classification in Language Development Tests for
Preschool Children [7.224391516694955]
本研究の目的は,子どもの言語発達が年齢的に適切かどうかを自動評価することである。
本研究の課題は、発話された非単語が正しく発声されたかどうかを判断することである。
特定の言語構造をモデル化する動機付けの異なるアプローチを比較する。
論文 参考訳(メタデータ) (2022-06-16T10:19:47Z) - MOCHA: A Dataset for Training and Evaluating Generative Reading
Comprehension Metrics [55.85042753772513]
そこで本研究では,生成的読解の指標であるModeling Correctness with Humanをトレーニングし,評価するためのベンチマークを提案する。
S
我々は,MOCHAを用いて,人間の判断スコアを模倣する学習評価尺度LERCを訓練する。
最小のペアで評価すると、LERCは80%の精度でベースラインを14から26の絶対パーセンテージポイントで上回り、改善の余地は大きい。
論文 参考訳(メタデータ) (2020-10-07T20:22:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。