論文の概要: How to Leverage Synthetic Speech for LLM-Based ASR Systems?
- arxiv url: http://arxiv.org/abs/2606.29031v1
- Date: Sat, 27 Jun 2026 17:57:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.764468
- Title: How to Leverage Synthetic Speech for LLM-Based ASR Systems?
- Title(参考訳): LLMに基づくASRシステムにおける合成音声の活用法
- Authors: Yanis Labrak, Dairazalia Sanchez-Cortes, Sergio Burdisso, Séverin Baroudi, Shashi Kumar, Esaú Villatoro-Tello, Srikanth Madikeri, Manjunath K E, Oldřich Plchot, Kadri Hacioğlu, Petr Motlicek, Andreas Stolcke,
- Abstract要約: 銀行や医療といった規制された領域では、実際のスピーチは収集と維持に費用がかかる。
しかし、合成データと実際のデータの間の永続的な分散ギャップは、真の記録をどこまで置き換えるかを制限している。
室内インパルス応答 (RIR) を伴う合成音声は, 実録音の音響的不規則性を再現することにより, ギャップを狭めることを示す。
- 参考スコア(独自算出の注目度): 15.386863365540407
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In regulated domains such as banking and healthcare, where privacy constraints make real speech costly to collect and retain, synthetic speech from modern text-to-speech (TTS) is an appealing alternative for training automatic speech recognition (ASR) without exposing sensitive customer recordings. Yet a persistent distributional gap between synthetic and real data limits how far it can replace genuine recordings. Prior work largely treats this gap as a black box to be engineered around, but in our work, we instead examine its origin directly by probing a SLAM-ASR architecture. Then, we localise where its LLM backbone separates real from synthetic speech and find the discriminative signal concentrated in the early-to-middle layers, where temporal and prosodic perturbations disrupt it most. We further show that representation-level separability, help, but does not directly predict downstream ASR gains. On the other hand, convolving synthetic audio with room impulse responses (RIRs) narrows the gap not by making synthetic speech sound cleaner or more natural, but by reproducing the acoustic irregularities of real recordings. Translating these findings into the training procedure, by adding a layer-selection module combined with RIR augmentation matches a fully real-data baseline using only 25% of the real speech (13.6h) and surpasses it at all higher proportions.
- Abstract(参考訳): 銀行や医療などの規制領域では、プライバシー制約が実際の音声を収集・保持するのにコストがかかるため、現代の音声合成音声(TTS)は、機密性の高い顧客記録を知らせることなく自動音声認識(ASR)を訓練するための魅力的な代替手段である。
しかし、合成データと実際のデータの間の永続的な分散ギャップは、真の記録をどこまで置き換えるかを制限している。
これまでの作業では、このギャップをエンジニアリング対象のブラックボックスとして扱っていましたが、私たちの作業では、SLAM-ASRアーキテクチャを探索することで、その起源を直接調べます。
そして、LLMのバックボーンが合成音声から現実を分離する場所をローカライズし、時間的および韻律的な摂動がほとんど破壊される早期から中期の層に集中する識別的信号を見つける。
さらに、表現レベルの分離性、ヘルプを示すが、下流のASRの利得を直接予測することはできない。
一方、室内インパルス応答(RIR)を伴う合成音声の結合は、合成音声をよりクリーンにしたり、より自然なものにしたり、実際の録音の音響的不規則性を再現することによってギャップを狭める。
これらの結果をトレーニング手順に翻訳することで、RIR拡張と組み合わせた層選択モジュールは、実際の音声(13.6h)の25%しか使用せず、全ての比率でそれを上回る完全な実データベースラインと一致する。
関連論文リスト
- Synthetic Audio Generation Framework for Air Traffic Control Speech Recognition [37.456341310281225]
合成データのみによる微調整や、実データと合成データの混合による微調整は、アウト・オブ・ザ・ボックスと実データのみのベースラインよりも単語誤り率を大幅に向上させることを示す。
ATCO2コーパス上でのWhisperモデルによる実験により,合成データのみを用いた微調整,あるいは実データと実データの組み合わせによる微調整により,単語誤り率をアウト・オブ・ザ・ボックスと実データのみのベースラインよりも大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-06-19T11:37:06Z) - Closing the Speech-Text Gap with Limited Audio for Effective Domain Adaptation in LLM-Based ASR [13.366872438646654]
最近の音声テキスト適応アーキテクチャは、プロジェクションモジュールを介して音声エンコーダを大きな言語モデルに接続する。
これは、言語モデルが音声プロジェクタが生成する雑音表現に曝されないため、モダリティギャップをもたらす。
このミスマッチを最小限に抑えることができるか検討する。
論文 参考訳(メタデータ) (2026-04-07T21:41:16Z) - Two Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual Hypotheses [71.34350093068473]
本稿では,音声視覚音声認識(AVSR)における生成誤り訂正(GER)フレームワークの新たなパラダイムを提案する。
我々のフレームワークであるDualHypは、独立した自動音声認識(ASR)モデルと視覚音声認識(VSR)モデルから独立したN-best仮説を構成するために、大規模言語モデル(LLM)を強制する。
我々のフレームワークは、標準のASRベースラインよりもLRS2ベンチマークで57.7%のエラー率を獲得していますが、シングルストリームのGERアプローチでは10%のゲインしか達成できません。
論文 参考訳(メタデータ) (2025-10-15T08:27:16Z) - MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance [66.74042564585942]
MOSS-Speechは、テキストガイダンスに頼ることなく直接理解し、音声を生成する、真の音声音声合成大言語モデルである。
我々の研究は、表現的かつ効率的なエンドツーエンドの音声対話のための新しいパラダイムを確立する。
論文 参考訳(メタデータ) (2025-10-01T04:32:37Z) - SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation [15.58921460046093]
本稿では,音声言語モデル(ALM)を用いて,予備的分離後のテキスト領域内での音声の修正と再合成を行う先駆的アプローチであるSepALMを紹介する。
SepALMは、セパレータ、修正器、シンセサイザー、調整器の4つのコアコンポーネントから構成される。
我々の実験は、SepALMが音声分離の精度を高めるだけでなく、新しい音響環境における適応性を著しく向上させることを実証している。
論文 参考訳(メタデータ) (2025-05-06T08:04:37Z) - Internalizing ASR with Implicit Chain of Thought for Efficient Speech-to-Speech Conversational LLM [3.6950912517562435]
本稿では,ASR の思考を音声 LLM に暗黙的に内部化する手法を提案する。
このアプローチはレイテンシを低減し、モデルの音声に対するネイティブ理解を改善し、より効率的で自然なリアルタイムオーディオインタラクションを実現する。
論文 参考訳(メタデータ) (2024-09-25T20:59:12Z) - UNIT-DSR: Dysarthric Speech Reconstruction System Using Speech Unit
Normalization [60.43992089087448]
変形性音声再構成システムは、変形性音声を正常な音声に変換することを目的としている。
本稿では,HuBERTのドメイン適応能力を活用して学習効率を向上させるユニットDSRシステムを提案する。
NEDアプローチと比較すると、ユニットDSRシステムは音声単位正規化器とユニットHiFi-GANボコーダのみで構成されている。
論文 参考訳(メタデータ) (2024-01-26T06:08:47Z) - Audio-visual End-to-end Multi-channel Speech Separation, Dereverberation
and Recognition [52.11964238935099]
本稿では,音声-視覚的多チャンネル音声分離,デバーベレーション,認識手法を提案する。
ビデオ入力は、マスクベースのMVDR音声分離、DNN-WPEまたはスペクトルマッピング(SpecM)ベースの音声残響フロントエンドで一貫して実証される。
オックスフォードLSS2データセットのシミュレーションや再生を用いて合成した重畳および残響音声データについて実験を行った。
論文 参考訳(メタデータ) (2023-07-06T10:50:46Z) - Improving Noise Robustness of Contrastive Speech Representation Learning
with Speech Reconstruction [109.44933866397123]
実環境における音声認識システムの実現には,雑音の堅牢性が不可欠である。
雑音認識のための自己教師型フレームワークにより学習したノイズロスト表現を用いる。
ラベル付きデータのわずか16%で報告された最高の教師付きアプローチに匹敵するパフォーマンスを実現した。
論文 参考訳(メタデータ) (2021-10-28T20:39:02Z) - Temporal-Spatial Neural Filter: Direction Informed End-to-End
Multi-channel Target Speech Separation [66.46123655365113]
ターゲット音声分離とは、混合信号からターゲット話者の音声を抽出することを指す。
主な課題は、複雑な音響環境とリアルタイム処理の要件である。
複数話者混合から対象音声波形を直接推定する時間空間ニューラルフィルタを提案する。
論文 参考訳(メタデータ) (2020-01-02T11:12:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。