論文の概要: Phonetic forced alignment for low-resource language varieties: Model training and evaluation on Chengdu Mandarin
- arxiv url: http://arxiv.org/abs/2607.21332v1
- Date: Thu, 23 Jul 2026 14:00:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.426685
- Title: Phonetic forced alignment for low-resource language varieties: Model training and evaluation on Chengdu Mandarin
- Title(参考訳): 低音源言語のための音声強制アライメント:Chengdu Mandarinのモデルトレーニングと評価
- Authors: Zhiheng Qian, Aini Li, Hai Hu, Liang Zhao,
- Abstract要約: 我々は17時間コーパスとカスタムG2P辞書を使用して、Chengdu Mandarinのためにテキスト依存およびテキスト非依存のトレーニングを行う。
Chengdu-MFAは平均電話境界差を31.8%減らし、Chengdu-FCは61.2%減らした。
- 参考スコア(独自算出の注目度): 8.665600634619361
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Phonetic forced alignment is a key technique in phonetic research, yet existing alignment systems lack specialized models for low-resource language varieties. We address this by training text-dependent and text-independent aligners for Chengdu Mandarin using a 17-hour corpus and a custom G2P dictionary. We trained a text-dependent GMM-HMM model (Chengdu-MFA) and fine-tuned a pretrained audio encoder on frame classification with Chengdu-MFA's pseudo label for text-independent alignment (Chengdu-FC). Evaluation on an expert-annotated test set show that both methods significantly outperform Standard Mandarin baselines. Chengdu-MFA reduced average phone boundary differences by 31.8%, while Chengdu-FC achieved a 61.2% reduction. This work establishes a practical bootstrapping pipeline for developing accurate aligners for under-resourced varieties without labor- and time-intensive manual annotation.
- Abstract(参考訳): 音素強制アライメントは音素研究において重要な技法であるが、既存のアライメントシステムは低リソース言語に対する特別なモデルが欠如している。
我々は17時間コーパスと独自のG2P辞書を用いて、Chengdu Mandarinのテキスト依存およびテキスト依存のアライメントをトレーニングすることでこの問題に対処する。
我々は、テキスト依存型GMM-HMMモデル(Chengdu-MFA)を訓練し、Chengdu-MFAのテキスト非依存アライメントのための擬似ラベル(Chengdu-FC)を用いて、フレーム分類に基づく事前訓練されたオーディオエンコーダを微調整した。
専門家がアノテートしたテストセットの評価は、どちらの手法も標準マンダリンベースラインを著しく上回っていることを示している。
Chengdu-MFAは平均電話境界差を31.8%減らし、Chengdu-FCは61.2%減らした。
この研究は、労働力や時間集約的な手動アノテーションを使わずに、アンダーリソースの品種の正確な調整器を開発するための実用的なブートストラップパイプラインを確立する。
関連論文リスト
- Neural Machine Translation for Low-Resource Tangkhul--English [0.0]
タングル語(Tangkhul)は、主にインドのマニプールで話されているチベット・ビルマン語族の言語である。
本報告では,(1)ByT5-largeファインチューニングに基づく基本システムと,(2)同一コーパス上のmT5-smallファインチューニングに基づくコントラストシステム,の2つのシステムについて述べる。
我々の主要なBYT5大規模システムは、コーパスBLEUスコア39.97、chrF++58.07、BERTScore F1、COMET0.7302をホールドアウトテストセットで達成する。
論文 参考訳(メタデータ) (2026-06-24T03:54:46Z) - CLiFT-ASR: A Cross-Lingual Fine-Tuning Framework for Low-Resource Taiwanese Hokkien Speech Recognition [12.323666705980672]
CLiFT-ASRは台湾のホッキエンにおける音声認識のための言語横断的な微調整フレームワークである。
最初は音素の太ロアノテーションから音響と音調の表現を学び、次に漢文字の語彙と構文をキャプチャする。
TAT-MOEコーパスの実験は、CLiFT-ASRが文字誤り率を24.88%減少させることを示した。
論文 参考訳(メタデータ) (2025-11-10T09:03:30Z) - Disambiguation of Chinese Polyphones in an End-to-End Framework with Semantic Features Extracted by Pre-trained BERT [81.99600765234285]
ポリフォニック文字の発音を予測するためのエンドツーエンドフレームワークを提案する。
提案手法は,Transformers(BERT)モデルとニューラルネットワーク(NN)に基づく分類器から,事前訓練された双方向エンコーダ表現からなる。
論文 参考訳(メタデータ) (2025-01-02T06:51:52Z) - Improving Long-Text Alignment for Text-to-Image Diffusion Models [50.91173337689504]
長文処理のためのセグメントレベル符号化手法を含むLongAlignを提案する。
選好最適化のために、我々はCLIPに基づく選好モデルを微調整拡散モデルに適用する。
テキスト非関連部が微調整時の共通オーバーフィッティング問題に寄与していることが判明した。
論文 参考訳(メタデータ) (2024-10-15T17:46:31Z) - MURI: High-Quality Instruction Tuning Datasets for Low-Resource Languages via Reverse Instructions [54.08017526771947]
MURI(Multilingual Reverse Instructions)は低リソース言語のための高品質な命令チューニングデータセットを生成する。
MURIは、低リソース言語における既存の人文テキストから命令出力ペアを生成する。
私たちのデータセットであるMURI-ITには200言語にまたがる200万以上の命令出力ペアが含まれています。
論文 参考訳(メタデータ) (2024-09-19T17:59:20Z) - Language Model Decoding as Direct Metrics Optimization [87.68281625776282]
現在の復号法は、異なる側面にわたる人間のテキストと整合するテキストを生成するのに苦労している。
本研究では,言語モデルからの復号化を最適化問題として,期待される性能と人間のテキストとの厳密なマッチングを目的とした。
この誘導分布は,人間のテキストの難易度を向上させることが保証されていることを証明し,人間のテキストの基本的な分布に対するより良い近似を示唆する。
論文 参考訳(メタデータ) (2023-10-02T09:35:27Z) - Dual-Decoder Transformer For end-to-end Mandarin Chinese Speech
Recognition with Pinyin and Character [15.999657143705045]
ピニインと文字・綴り体系としての性格はそれぞれ、中国語における相互の昇進である。
そこで本研究では,2次元デコーダ変換器を用いた新しい中国語ASRモデルを提案する。
AISHELL-1データセットのテストセットの結果は、言語モデルを持たない音声-ピニイン-文字-相互作用(S PCI)モデルがテストセット上で9.85%の文字誤り率(CER)を達成することを示している。
論文 参考訳(メタデータ) (2022-01-26T07:59:03Z) - Phone-to-audio alignment without text: A Semi-supervised Approach [8.751201799254323]
テキストに依存しない2つのWav2Vec2ベースのモデルを導入する。
半教師付きモデルであるWav2Vec2-FSは、コントラスト学習とフォワード和損失によって直接音声のアライメントを学習する。
他のモデルであるWav2Vec2-FCは、強制整列ラベルに基づいて訓練されたフレーム分類モデルである。
論文 参考訳(メタデータ) (2021-10-08T03:30:24Z) - ChineseBERT: Chinese Pretraining Enhanced by Glyph and Pinyin
Information [32.70080326854314]
我々は,漢字のグリフとピニイン情報を事前学習に組み込んだ ChineseBERT を提案する。
提案した ChineseBERT モデルは,トレーニングステップの少ないベースラインモデルよりも大幅な性能向上を実現している。
論文 参考訳(メタデータ) (2021-06-30T13:06:00Z) - Generating Major Types of Chinese Classical Poetry in a Uniformed
Framework [88.57587722069239]
GPT-2に基づく漢詩の主要なタイプを生成するフレームワークを提案する。
予備的な結果は、この強化されたモデルが、形も内容も質の高い大型漢詩を生成できることを示している。
論文 参考訳(メタデータ) (2020-03-13T14:16:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。