論文の概要: Scaling Human and G2P Supervision for Robust Phonetic Transcription
- arxiv url: http://arxiv.org/abs/2606.16019v1
- Date: Sun, 14 Jun 2026 21:05:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:33.992451
- Title: Scaling Human and G2P Supervision for Robust Phonetic Transcription
- Title(参考訳): ロバスト音声書き起こしのための人間とG2Pのスケーリング
- Abstract要約: 一般的な方法は、Grapheme-to-Phoneme(G2P)モデルを使用して、テキストの書き起こしから音声ラベルを自動生成することである。
英語における人間とG2Pの教師による自動音素書き起こし性能の尺度化について検討した。
- 参考スコア(独自算出の注目度): 41.99844472131922
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Expert phonetic annotation is costly, especially for non-standard dialects and atypical speech. A common alternative is using Grapheme-to-Phoneme (G2P) models to auto-generate phonetic labels from text transcripts at scale. We study how automatic phonetic transcription performance scales with human and G2P supervision in English. Using a curated 80-hour benchmark spanning native, non-native and post-stroke speech, we identify a supervision quality threshold: G2P supervision helps only when fewer than 20-30 hours of human annotation are available. Beyond this threshold, it provides no significant benefit and can reduce cross-dialect robustness. What is effective after this threshold is ASR pretraining which we use to achieve a 2.3x reduction in weighted phone feature error rate over prior systems, with strong gains on non-native and aphasic speech. These results suggest that quantity-driven G2P scaling may yield diminishing returns for robust generalization.
- Abstract(参考訳): 専門的な音韻アノテーションは、特に非標準方言や非典型的音声に対して費用がかかる。
一般的な方法は、Grapheme-to-Phoneme(G2P)モデルを使用して、テキストの書き起こしから音声ラベルを自動生成することである。
英語における人間とG2Pの教師による自動音素書き起こし性能の尺度化について検討した。
ネイティブ、非ネイティブ、ポストストロークのスピーチにまたがる80時間のベンチマークを使用して、監視品質のしきい値を特定します。
このしきい値を超えると、大きなメリットが得られず、クロスダイアレクトの堅牢性を低減することができる。
このしきい値以降の有効性は、従来のシステムよりも重み付けされた電話特徴誤り率の2.3倍の低減を達成するために、非ネイティブおよび失語音声に強い利得を与えるASR事前訓練である。
これらの結果は、量駆動G2Pスケーリングは、ロバストな一般化のために低下するリターンをもたらす可能性があることを示唆している。
関連論文リスト
- Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing [8.921166277011347]
モデルが既に両方のスタイルを符号化していることを示し、その課題はアクティベーションを制御することである。
パラレルな冗長/意図された転写文字ペアで訓練されたカバレッジ対応デコーダタスクトークンを用いて、ドイツの拡散F1を10%から79%ゼロショットに引き上げる。
完全な英語のみの微調整は、動詞の精度、拡散検出、および両方の言語にわたる意図されたモードの品質において、すべてのベースラインを超えている。
論文 参考訳(メタデータ) (2026-07-21T10:19:17Z) - PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects [29.32197370490759]
PolySpeech-100は110の言語変種にわたるネイティブレベルの音声理解を評価するために設計された大規模ベンチマークである。
我々は、指示駆動合成音声によるゴールドスタンダードな人間の録音を増強する、新しいハイブリッド構築パイプラインを採用している。
論文 参考訳(メタデータ) (2026-05-31T05:13:32Z) - POWSM: A Phonetic Open Whisper-Style Speech Foundation Model [50.73202227472358]
POWSMは、複数の電話関連のタスクを共同で実行できる最初の統合フレームワークである。
私たちのトレーニングデータ、コード、モデルは、オープンサイエンスを育むためにリリースされています。
論文 参考訳(メタデータ) (2025-10-28T21:43:45Z) - Towards Unsupervised Speech Recognition at the Syllable-Level [95.54031547995874]
マスク付き言語モデリングに基づく音節レベルのUASRフレームワークを提案する。
我々は,従来の手法では特に難しい言語であるマンダリンを効果的に一般化する。
論文 参考訳(メタデータ) (2025-10-04T02:56:33Z) - Graph Connectionist Temporal Classification for Phoneme Recognition [15.311893064721858]
グラフ時間分類(GTC)を自動音素認識(APR)設定に適用する。
GTCは、代替音素列のグラフからのトレーニングを可能にし、モデルが単語ごとの複数の発音を有効な監視対象とすることができる。
英語とオランダ語のデータセットの実験では、単語毎の発音をトレーニング損失に組み込むことで、音素誤り率を一貫して改善している。
論文 参考訳(メタデータ) (2025-09-05T15:20:59Z) - Towards Unsupervised Speech Recognition Without Pronunciation Models [57.222729245842054]
本稿では,ペア音声とテキストコーパスを使わずにASRシステムを開発するという課題に取り組む。
音声合成とテキスト・テキスト・マスクによるトークン埋込から教師なし音声認識が実現可能であることを実験的に実証した。
この革新的なモデルは、レキシコンフリー環境下での以前の教師なしASRモデルの性能を上回る。
論文 参考訳(メタデータ) (2024-06-12T16:30:58Z) - Improving grapheme-to-phoneme conversion by learning pronunciations from
speech recordings [12.669655363646257]
Grapheme-to-Phoneme(G2P)タスクは、正書法入力を離散的な音声表現に変換することを目的としている。
音声録音から発音例を学習し,G2P変換課題を改善する手法を提案する。
論文 参考訳(メタデータ) (2023-07-31T13:25:38Z) - The Effects of Input Type and Pronunciation Dictionary Usage in Transfer
Learning for Low-Resource Text-to-Speech [1.1852406625172218]
低音源言語(LRL)の音声合成における音声ラベルと音声特徴を言語間変換学習の入力として比較する。
FastSpeech 2 と LRL West Frisian を用いた実験では,音声の明瞭さと自然さの両面で,音声による特徴が優れていた。
論文 参考訳(メタデータ) (2023-06-01T10:42:56Z) - Sample-Efficient Unsupervised Domain Adaptation of Speech Recognition
Systems A case study for Modern Greek [70.82099772016234]
M2DS2は,大規模な事前学習音声モデルに対して,単純かつサンプル効率のよい微調整手法である。
ソースドメインの自己スーパービジョンを含め、トレーニングを安定させ、潜伏表現のモード崩壊を避けることができる。
論文 参考訳(メタデータ) (2022-12-31T22:57:30Z) - Simple and Effective Unsupervised Speech Translation [68.25022245914363]
ラベル付きデータなしで音声翻訳システムを構築するための,シンプルで効果的な手法について検討する。
事前学習された音声モデルに対する教師なし領域適応手法を提案する。
実験により、教師なし音声からテキストへの翻訳は、それまでの教師なし状態よりも優れていたことが示されている。
論文 参考訳(メタデータ) (2022-10-18T22:26:13Z) - r-G2P: Evaluating and Enhancing Robustness of Grapheme to Phoneme
Conversion by Controlled noise introducing and Contextual information
incorporation [32.75866643254402]
ニューラルG2Pモデルはスペルミスのようなグラフエムの正書法の変化に対して極めて敏感であることを示す。
雑音の多い学習データを合成するための3つの制御ノイズ導入法を提案する。
文脈情報をベースラインに組み込んで,トレーニングプロセスの安定化のための堅牢なトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2022-02-21T13:29:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。