論文の概要: Dictionary-Constrained Grapheme-to-Phoneme for Unsegmented Languages from LLM-Annotated Data
- arxiv url: http://arxiv.org/abs/2609.19805v2
- Date: Mon, 21 Sep 2026 03:06:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.105311
- Title: Dictionary-Constrained Grapheme-to-Phoneme for Unsegmented Languages from LLM-Annotated Data
- Title(参考訳): LLM- Annotated Data を用いた非セグメンテーション言語のための辞書制約付きGrapheme-to-Phoneme
- Abstract要約: Grapheme-to-phoneme (G2P)変換は、生のテキストを音韻形式に変換する。
文脈認識型セグメンテーションに依存しないニューラルG2Pフレームワークを提案する。
本手法は,目標単語読解精度99.62%,目標単語音素誤り率0.32%,文PER0.14%に達する。
- 参考スコア(独自算出の注目度): 4.185321081381552
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Grapheme-to-phoneme (G2P) conversion turns raw text into its phonemic form and is an essential part of both text-to-speech (TTS) and automatic speech recognition (ASR) systems. It is required to be fast, stable and context-aware. For unsegmented languages such as Japanese, G2P additionally couples word segmentation with highly context-dependent polyphone disambiguation, and the scarcity of accurately annotated data remains a bottleneck. In this paper, we present a context-aware, segmentation-agnostic neural G2P framework that models the joint segmentation-and-reading hypothesis space, scoring paths of a discriminative conditional random field (CRF) over a dictionary-derived word lattice. To tackle data scarcity, we utilize large language models (LLMs) to generate more than 2 million sentences. Experimental results demonstrate that our method substantially outperforms conventional morphological analyzer-based methods and neural sequence models. On the Joyo-Kanji-Yomi benchmark, our method reaches 99.62% target word reading accuracy, 0.32% target word phoneme error rate (PER) and 0.14% sentence PER.
- Abstract(参考訳): Grapheme-to-phoneme (G2P) 変換は生のテキストを音素に変換し、テキスト音声(TTS)と自動音声認識(ASR)システムの両方に不可欠な部分である。
高速で、安定的で、コンテキスト対応であることが求められます。
日本語などの未分類言語では、G2Pは文脈に依存した多音節の曖昧さと単語のセグメンテーションを兼ね備えており、正確な注釈付きデータの不足がボトルネックとなっている。
本稿では,辞書由来の単語格子上での識別条件付きランダムフィールド(CRF)のスコアパスをモデル化する,文脈認識型セグメンテーション非依存型ニューラルG2Pフレームワークを提案する。
データ不足に対処するために,大規模言語モデル(LLM)を用いて200万以上の文を生成する。
実験結果から,本手法は従来の形態素解析法やニューラルネットワークモデルよりも大幅に優れていた。
城陽漢字読解ベンチマークでは, 目標単語読解精度99.62%, 目標単語音素誤り率0.32%, 文PER0.14%に達した。
関連論文リスト
- Syllabic-Structure Decoder for Automatic Speech Recognition in Vietnamese [8.447993256993428]
我々はベトナム語の特徴から、ASRのためのSyllabic-Structure Decoderを提案する。
提案手法では,音節の音韻的構成を明示的に把握し,コンパクトな音韻インベントリから有効な音節構造をデコーダで生成する。
論文 参考訳(メタデータ) (2026-05-27T02:51:09Z) - Simultaneous Speech-to-Speech Translation Without Aligned Data [52.467808474293605]
同時音声翻訳では、ソース音声を対象言語にリアルタイムで翻訳する必要がある。
単語レベルのアライメントを完全に不要にするヒビキゼロを提案する。
Hibiki-Zeroは5つのX-英語タスクの翻訳精度、レイテンシ、音声転送、自然性において最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-11T17:41:01Z) - Pronunciation-Lexicon Free Training for Phoneme-based Crosslingual ASR via Joint Stochastic Approximation [12.39451124683428]
本稿では,音素を離散潜在変数として扱う潜在変数モデルに基づく手法を提案する。
多言語事前学習S2Pモデルに基づいて,ポーランド語とインドネシア語でクロスリンガル実験を行った。
10分間しか音素の監督を行ない、新しい手法であるJSA-SPGは5%の誤り率の低減を実現した。
論文 参考訳(メタデータ) (2025-07-04T12:23:22Z) - Unifying Global and Near-Context Biasing in a Single Trie Pass [11.277273712268897]
NEバイアスリストと単語レベルn-gram言語モデル(LM)の未探索組み合わせを提案する。
提案したキーワードバイアスとn-gram LMの組み合わせは,エンティティ認識を最大32%改善し,WER全体の最大12%削減することを示す。
論文 参考訳(メタデータ) (2024-09-20T13:53:37Z) - Cross-lingual Contextualized Phrase Retrieval [63.80154430930898]
そこで本研究では,言語間関係の単語検索を多義的に行うタスクの定式化を提案する。
我々は、コントラスト学習を用いて、言語間コンテクスト対応句検索(CCPR)を訓練する。
フレーズ検索タスクでは、CCPRはベースラインをかなり上回り、少なくとも13ポイント高いトップ1の精度を達成する。
論文 参考訳(メタデータ) (2024-03-25T14:46:51Z) - Wav2Gloss: Generating Interlinear Glossed Text from Speech [78.64412090339044]
音声から4つの言語アノテーションを自動抽出するタスクであるWav2Glossを提案する。
音声からのインターリニア・グロッシド・テキスト・ジェネレーションの今後の研究の基盤となる基盤となるものについて述べる。
論文 参考訳(メタデータ) (2024-03-19T21:45:29Z) - Generative Spoken Language Model based on continuous word-sized audio
tokens [52.081868603603844]
本稿では,単語サイズ連続評価音声埋め込みに基づく生成音声言語モデルを提案する。
結果として得られるモデルは、単語サイズの連続埋め込みに基づく最初の生成言語モデルである。
論文 参考訳(メタデータ) (2023-10-08T16:46:14Z) - SelfSeg: A Self-supervised Sub-word Segmentation Method for Neural
Machine Translation [51.881877192924414]
サブワードセグメンテーションはニューラルマシン翻訳(NMT)に不可欠な前処理ステップである
本稿では,自己教師型ニューラルネットワークサブワードセグメンテーション手法であるSelfSegを紹介する。
SelfSegはトレーニング/デコードがはるかに高速で、並列コーパスの代わりに単言語辞書のみを必要とする。
論文 参考訳(メタデータ) (2023-07-31T04:38:47Z) - SoundChoice: Grapheme-to-Phoneme Models with Semantic Disambiguation [10.016862617549991]
本稿では,単語レベルで操作するのではなく文全体を処理可能な新しいGrapheme-to-Phoneme(G2P)アーキテクチャであるSoundChoiceを提案する。
SoundChoiceは、LibriSpeechとWikipediaのデータを用いて全文の書き起こしで2.65%のPhoneme Error Rate(PER)を達成する。
論文 参考訳(メタデータ) (2022-07-27T01:14:59Z) - Seed Words Based Data Selection for Language Model Adaptation [11.59717828860318]
本稿では,テキストコーパスから文を自動的に選択する手法を提案する。
ベースラインモデルの語彙は拡張・調整され、OOVレートが低下する。
異なる測定値(OOVレート, WER, 精度, リコール)を用いて, 提案手法の有効性を示す。
論文 参考訳(メタデータ) (2021-07-20T12:08:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。