論文の概要: Phoneme-Guided Initialization for LLM-based Speech Recognition
- arxiv url: http://arxiv.org/abs/2610.08994v1
- Date: Tue, 06 Oct 2026 18:52:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.561552
- Title: Phoneme-Guided Initialization for LLM-based Speech Recognition
- Title(参考訳): LLMに基づく音声認識のための音素誘導初期化
- Abstract要約: 音声大言語モデル(音声LLM)は、十分なペア音声テキストデータが得られる場合、音声認識(ASR)において良好に機能する。
音素間変換とP2G変換を併用したS2P変換を行うカスケードパイプラインは、この方式におけるエンドツーエンドのLLMよりも優れていることを示す。
- 参考スコア(独自算出の注目度): 19.672840566474086
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speech large language models (speech LLMs) perform well on automatic speech recognition (ASR) when sufficient paired speech-text data is available, but their performance degrades in low-resource settings. A cascaded pipeline that performs speech-to-phoneme (S2P) conversion followed by phoneme-to-grapheme (P2G) conversion has been shown to outperform end-to-end speech LLMs in this regime, suggesting that phoneme-mediated processing is beneficial when paired data is scarce. We propose \textit{phoneme-guided initialization}, a simple method that uses this insight within an end-to-end framework: we pre-train the audio encoder on S2P and the LLM on P2G tasks, then connect them and fine-tune the full model end-to-end on the target ASR task. Experiments on Japanese (CSJ), Chinese (AISHELL-1), and two low-resource languages from Common Voice 25.0 (Tatar and Urdu) show that our method matches or outperforms both the cascaded S2P-P2G baseline and the end-to-end model without P2G initialization.
- Abstract(参考訳): 音声大言語モデル(音声LLM)は、十分なペア音声テキストデータが得られる場合、音声認識(ASR)において良好に機能するが、低リソース環境では性能が低下する。
音声から音素への変換(S2P)と音素から音素への変換(P2G)を併用したカスケードパイプラインは、このシステムにおいて、音素を介する処理が不十分な場合に有益であることを示す。
我々は、S2P上のオーディオエンコーダとP2Gタスク上でLLMを事前訓練し、それらを接続し、ターゲットのASRタスク上で完全なモデルエンドツーエンドを微調整する簡単な方法である「textit{phoneme-guided initialization」を提案する。
日本語(CSJ),中国語(AISHELL-1),および共通音声25.0(タタール語とウルドゥー語)の2つの低リソース言語による実験により,本手法がP2G初期化のないS2P-P2Gベースラインとエンド・ツー・エンドモデルの両方に一致するか,あるいは優れていることが示された。
関連論文リスト
- POWSM: A Phonetic Open Whisper-Style Speech Foundation Model [50.73202227472358]
POWSMは、複数の電話関連のタスクを共同で実行できる最初の統合フレームワークである。
私たちのトレーニングデータ、コード、モデルは、オープンサイエンスを育むためにリリースされています。
論文 参考訳(メタデータ) (2025-10-28T21:43:45Z) - UtterTune: LoRA-Based Target-Language Pronunciation Edit and Control in Multilingual Text-to-Speech [1.7462881580496206]
UtterTuneは、多言語テキスト音声システムの微調整を行う軽量適応手法である。
日本語音声の音素レベルにおける音節発音とピッチアクセントの制御を可能にする。
論文 参考訳(メタデータ) (2025-08-13T12:52:38Z) - LLM-based phoneme-to-grapheme for phoneme-based speech recognition [11.552927239284582]
音素自動音声認識(ASR)のための音素間符号化(LLM-P2G)を提案する。
実験の結果, LLM-P2G はポーランド語とドイツ語の交叉型 ASR において, WER の相対減少率 3.6% と 6.9% でWFST 系よりも優れていた。
論文 参考訳(メタデータ) (2025-06-05T07:35:55Z) - Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model [76.06585781346601]
音声言語モデル(Speech LMs)は、単一のモデル内でエンドツーエンドの音声テキストモデリングを可能にする。
音声テキストの共同復号パラダイムの選択は、性能、効率、アライメント品質において重要な役割を担っている。
論文 参考訳(メタデータ) (2025-06-04T23:53:49Z) - SyncSpeech: Low-Latency and Efficient Dual-Stream Text-to-Speech based on Temporal Masked Transformer [68.78023656892319]
本稿では、ストリーミング音声を同時に生成しながら、上流モデルからストリーミングテキスト入力を受信できる、双方向ストリームテキスト音声(TTS)モデルSyncSpeechを提案する。
SyncSpeechには次のような利点がある: 低レイテンシ、第2のテキストトークンの受信時にストリーミング音声を生成し始めるとき、高効率、そして、受信したテキストトークンに対応するすべての音声トークンを1ステップでデコードするとき、。
論文 参考訳(メタデータ) (2025-02-16T12:14:17Z) - Zero-resource Speech Translation and Recognition with LLMs [38.11535502039386]
我々は,ペア音声テキストデータを見たことのない言語において,多言語大言語モデル(LLM)を用いてSTとASRを実行することを提案する。
我々は、事前訓練された多言語音声エンコーダ、多言語LLM、およびLLMのトークン埋め込み空間に音声表現をマッピングする軽量適応モジュールを用いて、これを実現する。
論文 参考訳(メタデータ) (2024-12-24T17:37:11Z) - AudioPaLM: A Large Language Model That Can Speak and Listen [79.44757696533709]
本稿では,音声理解・生成のための大規模言語モデルであるAudioPaLMを紹介する。
AudioPaLMはテキストベースの言語モデルと音声ベースの言語モデルを融合する。
音声認識や音声音声翻訳などの応用により、テキストと音声を処理および生成することができる。
論文 参考訳(メタデータ) (2023-06-22T14:37:54Z) - Textless Speech-to-Speech Translation on Real Data [49.134208897722246]
本研究では、ある言語から別の言語への翻訳が可能なテキストなし音声音声翻訳システム(S2ST)を提案する。
マルチ話者ターゲット音声をモデル化し、実世界のS2STデータを用いてシステムを訓練する際の課題に対処する。
論文 参考訳(メタデータ) (2021-12-15T18:56:35Z) - AdaSpeech 2: Adaptive Text to Speech with Untranscribed Data [115.38309338462588]
AdaSpeech 2 は、未転写音声データのみを適応に利用する適応型 TTS システムである。
具体的には,よく訓練されたttsモデルにmel-spectrogramエンコーダを導入し,音声再構成を行う。
適応では,ttsデコーダのみを微調整し,未書き起こし音声データを用いて音声再構成を行う。
論文 参考訳(メタデータ) (2021-04-20T01:53:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。