論文の概要: Reinforcement Learning for Data-Efficient Code-Switched ASR
- arxiv url: http://arxiv.org/abs/2607.02757v1
- Date: Thu, 02 Jul 2026 20:44:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.414396
- Title: Reinforcement Learning for Data-Efficient Code-Switched ASR
- Title(参考訳): データ効率の良いコードスイッチングASRのための強化学習
- Abstract要約: 本稿では,音声モデルのコードスイッチングASRへのデータ効率適応のための,検証可能な報酬レシピを用いた実践的強化学習を提案する。
得られたデータのうち10%のRLVRは全データセットでトレーニングされた微調整をLoRAが監督し、タイポロジカルに距離を置くペアの最大増加率を示す。
- 参考スコア(独自算出の注目度): 0.8594140167290097
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Audio-language models can be prompted for code-switched speech, but their decoding is not optimized for code-switching and often fails at language boundaries. We propose a practical reinforcement learning with verifiable rewards recipe for data-efficient adaptation of audio-language models to code-switched ASR using group relative policy optimization, combining an error rate reward with a script fidelity reward that penalizes wrong writing systems and a two-pass draft-and-refinement procedure. Using Qwen2-Audio as a reproducible testbed across 10 language pairs, training on only TTS code-switched speech, we show that RLVR with 10% of the data matches LoRA supervised fine-tuning trained on the full dataset, with the largest gains on typologically distant pairs. The error rate reward eliminates translation errors while the script fidelity reward separately reduces script contamination without degradation. These gains transfer zero-shot to a human-recorded code-switching corpus.
- Abstract(参考訳): 音声言語モデルは、コードスイッチされた音声に対してトリガーすることができるが、その復号化は、コードスイッチに最適化されておらず、言語境界で失敗することが多い。
本稿では,グループポリシー最適化を用いて,音声モデルからコードスイッチングされたASRへのデータ効率向上のための検証可能な報酬レシピを用いた実践的強化学習を提案し,エラー率報酬と,誤った書き込みシステムと2パスのドラフト・アンド・リファインメント手順を併用したスクリプトの忠実性報酬とを比較検討した。
Qwen2-Audio を10言語対にまたがる再現性テストベッドとして使用し,RTS コードスイッチ付き音声のみをトレーニングし,全データセットでトレーニングされたLoRA による微調整の10%の RLVR が,タイポロジー的に距離のあるペアに対して最大の利益をもたらすことを示した。
エラーレート報酬は翻訳誤りを排除し、スクリプト忠実報酬は劣化することなくスクリプトの汚染を別々に低減する。
これらのゲインはゼロショットを人間に記録されたコードスイッチングコーパスに転送する。
関連論文リスト
- Light-weight Pronunciation Assessment via Discrete Speech Token Surprisal [10.584132982823883]
自動発音評価の訓練は、しばしばラベル付き学習者エラーや収集にコストがかかる非ネイティブコーパスに依存している。
そこで本研究では,教師なしあるいは軽微な校正を行うために,ネイティブ音声リソースのみを訓練した軽量なフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-18T08:04:16Z) - Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech [50.45710815530982]
同時音声翻訳(SST)は、部分的な音声入力を受けながら翻訳を生成する。
近年の進歩により、大規模言語モデル(LLM)はSSTの品質を大幅に向上するが、高い計算オーバーヘッドのコストがかかる。
本稿では,不完全なSFTデータに基づいて列車後モデルを訓練する階層的ポリシー最適化(HPO)手法を提案する。
英語と中国語/ドイツ語/日本語の実験では、+7 COMETスコアと+1.25 MetricXスコアが1.5秒で改善された。
論文 参考訳(メタデータ) (2026-04-22T19:43:51Z) - Improving Code-Switching Speech Recognition with TTS Data Augmentation [58.34842693152991]
本稿では,この不足に対処する効果的なデータ拡張手法として,多言語テキスト音声(TTS)モデルについて検討する。
我々は、SEAMEデータセット上の多言語CosyVoice2 TTSモデルを微調整し、中国語と英語の合成音声を生成する。
論文 参考訳(メタデータ) (2026-01-02T10:11:51Z) - ATRI: Mitigating Multilingual Audio Text Retrieval Inconsistencies by Reducing Data Distribution Errors [42.469131776062724]
既存の多言語音声テキスト検索方式は、例えば言語間での類似性マッチングのような不整合に悩まされている。
1対kのコントラスト学習とオーディオ-英語のコントラスト学習を用いた一貫したML-ATR方式を提案する。
提案手法は,英語を含む8つの主流言語に対して,リコールと整合性評価の最先端性能を実現する。
論文 参考訳(メタデータ) (2025-02-20T15:06:15Z) - Multilingual self-supervised speech representations improve the speech
recognition of low-resource African languages with codeswitching [65.74653592668743]
微細な自己教師型多言語表現は絶対単語誤り率を最大20%削減する。
訓練データに制限のある状況では、自己教師付き表現を微調整することが、より良いパフォーマンスと実行可能なソリューションである。
論文 参考訳(メタデータ) (2023-11-25T17:05:21Z) - Speech collage: code-switched audio generation by collaging monolingual
corpora [50.356820349870986]
Speech Collage は音声セグメントをスプライシングすることでモノリンガルコーパスからCSデータを合成する手法である。
2つのシナリオにおける音声認識における生成データの影響について検討する。
論文 参考訳(メタデータ) (2023-09-27T14:17:53Z) - Optimizing Bilingual Neural Transducer with Synthetic Code-switching
Text Generation [10.650573361117669]
半教師付きトレーニングと合成コードスイッチングデータにより、コードスイッチング音声におけるバイリンガルASRシステムを改善することができる。
最終システムは ASCEND English/Mandarin code-switching test set 上で25%混合誤り率 (MER) を達成する。
論文 参考訳(メタデータ) (2022-10-21T19:42:41Z) - Pre-Training Transformer Decoder for End-to-End ASR Model with Unpaired
Speech Data [145.95460945321253]
本稿では,音響単位,すなわち擬似符号を用いたエンコーダ・デコーダネットワークのための2つの事前学習タスクを提案する。
提案したSpeech2Cは,デコーダを事前学習することなく,単語誤り率(WER)を19.2%削減できる。
論文 参考訳(メタデータ) (2022-03-31T15:33:56Z) - Lexically Aware Semi-Supervised Learning for OCR Post-Correction [90.54336622024299]
世界中の多くの言語における既存の言語データの多くは、非デジタル化された書籍や文書に閉じ込められている。
従来の研究は、あまり良くない言語を認識するためのニューラル・ポスト・コレクション法の有用性を実証してきた。
そこで本研究では,生画像を利用した半教師付き学習手法を提案する。
論文 参考訳(メタデータ) (2021-11-04T04:39:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。