論文の概要: Context-aware child-directed speech detection from long-form recordings
- arxiv url: http://arxiv.org/abs/2606.01134v1
- Date: Sun, 31 May 2026 10:12:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:29.271236
- Title: Context-aware child-directed speech detection from long-form recordings
- Title(参考訳): 長期記録からのコンテキスト認識型児童指向音声検出
- Authors: Théo Charlot, Tarek Kunze, Kaveri K. Sheth, Alejandrina Cristia, Marvin Lavechin,
- Abstract要約: 我々は182人の子供の多言語データセットを用いて6人の教師付きモデルを微調整し評価した。
子ども中心の録音におけるドメイン内事前学習は、成人の発話で訓練されたモデルよりもかなり優れていた。
- 参考スコア(独自算出の注目度): 38.06151982833055
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Automatically distinguishing child-directed speech from adult-directed speech in long-form recordings is key to scalable analyses of children's language environments. Existing approaches process utterances in isolation and have been evaluated primarily on English. We address these gaps along three dimensions. First, we fine-tune and evaluate six-self supervised models on a multilingual dataset of 182 children, showing that in-domain pre-training on child-centered recordings substantially outperforms models trained on adult speech. Second, we demonstrate that incorporating surrounding context substantially improves classification, with an absolute gain of 13.8% in average F1-score. Third, we evaluate our model in a realistic end-to-end pipeline, from adult speech detection to addressee classification, showing that performance drops under automatic segmentation but still consistently outperforms a rule-based baseline.
- Abstract(参考訳): 成人向け音声と成人向け音声の自動識別は,子どもの言語環境のスケーラブルな分析の鍵となる。
既存のアプローチは孤立して発話を処理し、主に英語で評価されてきた。
これらのギャップを3次元に沿って解決する。
まず,182人の子どもの多言語データセット上で6人の教師付きモデルを微調整し,評価し,子ども中心の録音におけるドメイン内事前学習が,成人の発話で訓練されたモデルを大幅に上回ることを示した。
第2に、周囲の文脈を取り入れることで分類が大幅に改善し、平均F1スコアの13.8%が絶対的に向上することを示した。
第3に、アダルト音声検出からアドレナライズ分類に至るまで、我々のモデルを現実的なエンドツーエンドパイプラインで評価し、自動セグメンテーションでは性能が低下するが、規則ベースのベースラインを一貫して上回っていることを示す。
関連論文リスト
- On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation [88.77441715819366]
大規模生音声で事前訓練された生成音声言語モデルは、適切な内容で音声プロンプトを継続することができる。
本稿では,グローバルトークンの難易度に代えて,多種多様な可能性・生成的評価手法を提案する。
論文 参考訳(メタデータ) (2026-01-09T22:01:56Z) - Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet [72.53502346791814]
データセット、SSL表現(WavLM、XEUS)、デコーダアーキテクチャ間のフラットスタートトレーニングを比較した。
SSL表現は成人のスピーチに偏りがあり、子どものスピーチに対するフラットスタートトレーニングはこれらのバイアスを緩和する。
年齢関連ASRと話者検証分析は、プロプライエタリモデルの限界を強調している。
論文 参考訳(メタデータ) (2025-08-22T17:59:35Z) - SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models [60.72029578488467]
SpeechRは、大規模な音声言語モデルにおける音声に対する推論を評価するための統一的なベンチマークである。
事実検索、手続き推論、規範的判断の3つの重要な側面に沿ったモデルを評価する。
11個の最先端のLALMの評価は、高い転写精度が強い推論能力に変換されないことを示している。
論文 参考訳(メタデータ) (2025-08-04T03:28:04Z) - Employing self-supervised learning models for cross-linguistic child speech maturity classification [38.411292716220174]
子どもの発声を識別するために,新しいデータセットであるSpeechMaturityを最先端のトランスフォーマーモデルに適用する。
データセットには242,004のラベル付き発声が含まれている。
データセットでトレーニングされたモデルは、以前のデータセットでトレーニングされた最先端モデルを上回っ、人間に匹敵する分類精度を達成し、農村部や都市部で堅牢であった。
論文 参考訳(メタデータ) (2025-06-10T17:20:02Z) - Automated evaluation of children's speech fluency for low-resource languages [8.918459083715149]
本稿では,微調整された多言語ASRモデルと客観的なメトリクス抽出段階を組み合わせることで,流速を自動的に評価するシステムを提案する。
提案システムは,タミル語とマレー語という2つの低リソース言語を用いて,子どもの発話のデータセットに基づいて評価する。
論文 参考訳(メタデータ) (2025-05-26T08:25:50Z) - Analysing the Impact of Audio Quality on the Use of Naturalistic
Long-Form Recordings for Infant-Directed Speech Research [62.997667081978825]
早期言語習得のモデリングは、幼児が言語スキルをブートストラップする方法を理解することを目的としている。
近年の進歩により、より自然主義的なトレーニングデータを計算モデルに利用できるようになった。
音質がこれらのデータに対する分析やモデリング実験にどう影響するかは、現時点では不明である。
論文 参考訳(メタデータ) (2023-05-03T08:25:37Z) - M-SpeechCLIP: Leveraging Large-Scale, Pre-Trained Models for
Multilingual Speech to Image Retrieval [56.49878599920353]
本研究は,多言語画像音声検索におけるCLIPとHuBERTの大規模,英語のみの事前学習モデル(CLIPとHuBERT)の利用について検討する。
非英語画像音声検索では、各言語毎に個別のモデルを訓練する場合と、3言語すべてで音声を処理する1つのモデルの両方において、最先端のパフォーマンスを幅広いマージンで上回ります。
論文 参考訳(メタデータ) (2022-11-02T14:54:45Z) - Transfer Learning for Robust Low-Resource Children's Speech ASR with
Transformers and Source-Filter Warping [11.584388304271029]
本研究では,成人と子どもの発話の領域ギャップを埋めるために,音声のソースフィルタモデルに基づくデータ拡張手法を提案する。
この拡張戦略を用いて、成人データに基づいて事前学習したTransformerモデルに転送学習を適用する。
このモデルは、最近導入されたXLS-Rアーキテクチャ(wav2vec 2.0モデル)に従っている。
論文 参考訳(メタデータ) (2022-06-19T12:57:47Z) - A Text-to-Speech Pipeline, Evaluation Methodology, and Initial
Fine-Tuning Results for Child Speech Synthesis [3.2548794659022398]
音声合成は、現在のTTS(text-to-speech)モデルが人間の自然な音声を生成できるようになったため、長い道のりを経ている。
本研究では,子どもの音声データセットを用いて,最先端のニューラルネットワークモデルを構築するためのトレーニングパイプラインを開発し,検証した。
論文 参考訳(メタデータ) (2022-03-22T09:34:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。