論文の概要: When Synthetic Speech Is All You Have: Better Call GRPO
- arxiv url: http://arxiv.org/abs/2607.08409v1
- Date: Thu, 09 Jul 2026 12:34:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.52895
- Title: When Synthetic Speech Is All You Have: Better Call GRPO
- Title(参考訳): GRPO」とよばれる「Synthetic Speech」(動画あり)
- Abstract要約: その結果,強化学習は教師付き微調整よりも,同じ合成音声から抽出されることがわかった。
合成音声が主流となる場合、教師付き微調整よりも強化学習が望ましい。
- 参考スコア(独自算出の注目度): 15.624707805080474
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based ASR adapted to regulated domains such as banking is bottlenecked by privacy: real speech is costly and legally constrained to collect, making synthetic text-to-speech (TTS) an attractive substitute. Yet synthetic speech stays acoustically mismatched with real recordings, and work on this gap has stayed within supervised fine-tuning (SFT). We instead turn to reinforcement learning, and show that Group Relative Policy Optimization (GRPO) extracts far more from the same synthetic speech than SFT. Synthetic-only adaptation of the model with GRPO, a critic-free method rewarding low-WER hypotheses, reduces WER by 40\% relative to SFT (36.71\%$\to$22.09\%), and an SFT-then-GRPO combination pushes this further to 45\%. We trace the gain to behavior rather than representation: GRPO reduces insertion errors by improving stopping calibration and speech-to-text alignment by better anchoring attention to audio, leaving early-layer representations intact. When synthetic speech is the main resource, reinforcement learning should be preferred over supervised fine-tuning.
- Abstract(参考訳): LLMベースのASRは、銀行のような規制されたドメインに適応し、プライバシによってボトルネックとなる。
しかし、合成音声は実際の録音と音響的に一致せず、このギャップの研究は監督された微調整(SFT)の範囲に留まっている。
その代わり、強化学習に転換し、グループ相対政策最適化(GRPO)がSFTよりもはるかに多くの合成音声を抽出していることを示す。
GRPOは低WER仮説に対する批判のない手法であり、SFT(36.71 %$\to$22.09 %)と比較してWERを40 %削減し、SFT-then-GRPOの組み合わせによりさらに45 %まで押し上げる。
GRPOはキャリブレーションの停止と音声とテキストのアライメントの改善により挿入エラーを低減し、音声への注意を固定し、初期層表現をそのまま残す。
合成音声が主流となる場合、教師付き微調整よりも強化学習が望ましい。
関連論文リスト
- CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents [53.73961877379327]
CuteTTSはコンパクトな連続自己回帰型TSシステムである。
意味的に整列した因果性VAE潜伏剤とパッチレベルの自己回帰、明示的な話者条件付け、双方向のフローマッチングヘッドを組み合わせる。
論文 参考訳(メタデータ) (2026-08-09T11:10:20Z) - How to Leverage Synthetic Speech for LLM-Based ASR Systems? [15.386863365540407]
銀行や医療といった規制された領域では、実際のスピーチは収集と維持に費用がかかる。
しかし、合成データと実際のデータの間の永続的な分散ギャップは、真の記録をどこまで置き換えるかを制限している。
室内インパルス応答 (RIR) を伴う合成音声は, 実録音の音響的不規則性を再現することにより, ギャップを狭めることを示す。
論文 参考訳(メタデータ) (2026-06-27T17:57:27Z) - Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation [78.39988331831077]
Mega-ASRは、スケーラブルな複合データ構築とプログレッシブ・アコースティック・ツー・セマンティック・最適化を組み合わせる。
我々は,Mega-ASRが従来の最先端システムに対して,悪条件ASRベンチマークにおいて大きな優位性を発揮することを示す。
論文 参考訳(メタデータ) (2026-05-19T13:26:51Z) - Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech [50.45710815530982]
同時音声翻訳(SST)は、部分的な音声入力を受けながら翻訳を生成する。
近年の進歩により、大規模言語モデル(LLM)はSSTの品質を大幅に向上するが、高い計算オーバーヘッドのコストがかかる。
本稿では,不完全なSFTデータに基づいて列車後モデルを訓練する階層的ポリシー最適化(HPO)手法を提案する。
英語と中国語/ドイツ語/日本語の実験では、+7 COMETスコアと+1.25 MetricXスコアが1.5秒で改善された。
論文 参考訳(メタデータ) (2026-04-22T19:43:51Z) - ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models [49.18708573170585]
経験的な評価は、ASPIRinがターンテイキング、バックチャネル、一時停止処理をまたいで対話性を最適化していることを示している。
ASPIRin degrade turn to say when when when to fall when. ASPIRin degrade turn to say when when to say。
論文 参考訳(メタデータ) (2026-04-11T07:07:08Z) - Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models [11.897185319653744]
Spoken Language Models (SLM) は、明示的なGrapheme-to-phonemeパイプラインをバイパスすることによって、音声合成のための有望なパラダイムとして登場した。
実際には、このような環境でSLMをスケールするための主要な戦略は合成データである。
この依存は基本的なトレードオフを導入し、安定-圧縮ギャップ(stable-Expressivity Gap)と呼ぶ。
論文 参考訳(メタデータ) (2026-04-10T12:44:27Z) - ZeSTA: Zero-Shot TTS Augmentation with Domain-Conditioned Training for Data-Efficient Personalized Speech Synthesis [3.1848820580333737]
低リソースなパーソナライズされた音声合成のためのデータ拡張源としてゼロショット音声合成(ZS-TTS)を用いることを検討した。
実音声と合成音声を区別するシンプルなドメイン条件学習フレームワークZesTAを提案する。
論文 参考訳(メタデータ) (2026-03-04T16:04:02Z) - No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS [1.9492333719038202]
Group Relative Policy Optimization (GRPO) を用いたニューラルテキスト音声(TTS)の最近の研究動向
テキストプロソディに対する検証可能な報酬がないため、GRPOは転写指向信号(CER/NLL)を訓練し、誤り率を下げるが、プロソディを単調で不自然な音声に分解する。
本手法では,1ラウンドあたり数百の人間ラベルの選好ペアのみを使用するテキスト開始直接選好最適化(DPO)方式でこの問題に対処する。
論文 参考訳(メタデータ) (2025-09-23T01:51:38Z) - GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM [42.93855899824886]
新たな2分岐ArchiTecture(GOAT-TTS)を用いた音声合成手法を提案する。
GOAT-TTSは音声エンコーダとプロジェクタを組み合わせて連続的な音響埋め込みをキャプチャし、パラ言語的特徴(言語、音色、感情)と意味的テキスト表現の双方向の相関を可能にする。
実験の結果,GOAT-TTSは最先端のTSモデルに匹敵する性能を示した。
論文 参考訳(メタデータ) (2025-04-15T01:44:56Z) - Self-Play Preference Optimization for Language Model Alignment [75.83359213697854]
近年の進歩は、嗜好の確率で直接作業することで、人間の嗜好をより正確に反映できることを示している。
本稿では,言語モデルアライメントのためのセルフプレイ方式を提案する。
我々の手法はSPPO(Self-Play Preference Optimization)と呼ばれ、繰り返しポリシー更新を利用してナッシュ均衡を確実に近似する。
論文 参考訳(メタデータ) (2024-05-01T17:59:20Z) - You Do Not Need More Data: Improving End-To-End Speech Recognition by
Text-To-Speech Data Augmentation [59.31769998728787]
我々は、ASRトレーニングデータベース上にTSシステムを構築し、合成音声でデータを拡張し、認識モデルを訓練する。
テストクリーンはWER 4.3%,他のテストクリーンは13.5%で、このシステムはLibriSpeechトレインクリーン100で訓練されたエンドツーエンドASRの競争結果を確立している。
論文 参考訳(メタデータ) (2020-05-14T17:24:57Z) - End-to-end Whispered Speech Recognition with Frequency-weighted
Approaches and Pseudo Whisper Pre-training [130.56878980058966]
発声音声のエンド・ツー・エンド(E2E)認識に対するいくつかのアプローチを提案する。
我々は,比較的小型のTIMITコーパスを用いて,PER19.8%,CER44.4%の相対的な削減を実現した。
正規または擬似発声音声で事前訓練された優れたE2Eモデルがある限り、比較的小さな発声音声は、合理的に優れたE2E発声音声認識器を得るのに十分である。
論文 参考訳(メタデータ) (2020-05-05T07:08:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。