論文の概要: Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation
- arxiv url: http://arxiv.org/abs/2605.19833v1
- Date: Tue, 19 May 2026 13:26:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-20 15:03:09.369578
- Title: Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation
- Title(参考訳): Mega-ASR: 実環境音響シミュレーションのスケールアップによる音素内^2音声認識に向けて
- Authors: Zhifei Xie, Kaiyu Pang, Haobin Zhang, Deheng Ye, Xiaobin Hu, Shuicheng Yan, Chunyan Miao,
- Abstract要約: Mega-ASRは、スケーラブルな複合データ構築とプログレッシブ・アコースティック・ツー・セマンティック・最適化を組み合わせる。
我々は,Mega-ASRが従来の最先端システムに対して,悪条件ASRベンチマークにおいて大きな優位性を発揮することを示す。
- 参考スコア(独自算出の注目度): 78.39988331831077
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite rapid advances in automatic speech recognition (ASR) and large audio-language models, robust recognition in real-world environments remains limited by an "acoustic robustness bottleneck": models often lose acoustic grounding and produce omissions or hallucinations under severe, compositional distortions. We propose Mega-ASR, a unified ASR-in-the-wild framework that combines scalable compound-data construction with progressive acoustic-to-semantic optimization. We introduce Voices-in-the-Wild-2M, covering 7 classic acoustic phenomena and 54 physically plausible compound scenarios, and train Mega-ASR with Acoustic-to-Semantic Progressive Supervised Fine-Tuning and Dual-Granularity WER-Gated Policy Optimization. Extensive experiments demonstrate that Mega-ASR achieves significant advantages over prior state-of-the-art systems on adverse-condition ASR benchmarks (45.69% vs. 54.01% on VOiCES R4-B-F, and 21.49% vs. 29.34% on NOIZEUS Sta-0). On complex compositional acoustic scenarios, Mega-ASR further delivers over 30% relative WER reduction against strong open- and closed-source baselines, establishing a scalable paradigm for robust ASR in-the-wild.
- Abstract(参考訳): 自動音声認識(ASR)や大規模オーディオ言語モデルの急速な進歩にもかかわらず、実世界の環境におけるロバストな認識は「音響的堅牢性ボトルネック」によって制限されている。
本稿では,スケーラブルな複合データ構築とプログレッシブ・アコースティック・ツー・セマンティック・最適化を組み合わせたASR-in-the-wildフレームワークであるMega-ASRを提案する。
我々は,7つの古典的音響現象と54個の物理的に可算な複合シナリオをカバーするVoices-in-the-Wild-2Mを導入し,音響-セマンティック・プログレッシブ・スーパービジョン・ファインタニングとデュアルグラニティWER-Gated Policy Optimizationを用いてメガASRを訓練する。
大規模な実験により、Mega-ASRは、悪条件のASRベンチマークにおける最先端システムよりも大きな利点を達成している(VOiCES R4-B-Fでは45.69%、NOIZEUS Sta-0では29.34%)。
複雑な構成音響シナリオでは、Mega-ASRはさらに30%以上の相対的なWER削減を強力なオープンソースベースラインとクローズドソースベースラインに対して提供し、堅牢なASRを実現するためのスケーラブルなパラダイムを確立している。
関連論文リスト
- Make It Hard to Hear, Easy to Learn: Long-Form Bengali ASR and Speaker Diarization via Extreme Augmentation and Perfect Alignment [0.0]
Lipi-Ghor-882は、882時間のマルチスピーカーBengaliデータセットである。
ASRでは、生データスケーリングが非効率であることを示し、代わりに、合成音響劣化と組み合わせた完全整合アノテーションを用いた微調整を目標とした。
話者ダイアリゼーションでは、この複雑なデータセットでは、グローバルなオープンソースステート・オブ・ザ・アートモデルのパフォーマンスが驚くほど低かった。
論文 参考訳(メタデータ) (2026-02-26T14:59:24Z) - When De-noising Hurts: A Systematic Study of Speech Enhancement Effects on Modern Medical ASR Systems [0.6158894274166716]
音声強調法は,雑音環境下での自動音声認識(ASR)の性能を向上させることが一般的である。
我々は,4つの最先端ASRシステム上でのMetricGAN+Voicebankの分類評価を行った。
音声強調前処理は,全ての雑音条件およびモデルにおいてASR性能を低下させる。
論文 参考訳(メタデータ) (2025-12-19T13:32:19Z) - Cocktail-Party Audio-Visual Speech Recognition [58.222892601847924]
本研究では,現在のAVSRシステムのベンチマークを行うために設計された,新しい音声-視覚カクテルパーティデータセットを提案する。
音声とサイレント顔の両方からなる1526時間AVSRデータセットをコントリビュートし,カクテルパーティー環境における顕著な性能向上を実現した。
我々の手法は、WERを最先端と比較して67%削減し、WERを明示的なセグメンテーション手法に頼ることなく、極音の119%から39.2%に削減する。
論文 参考訳(メタデータ) (2025-06-02T19:07:51Z) - Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation [18.678742816040856]
自動音声認識(ASR)におけるウィスパーの頑健な性能は、しばしば680khのトレーニングセットによるものである。
訓練データにおける言語的および音響的多様性がASRモデルの堅牢性に与える影響について検討する。
ASRモデルの一般化能力を大幅に向上させることが期待できる。
論文 参考訳(メタデータ) (2025-05-27T00:55:32Z) - Joint Beamforming and Speaker-Attributed ASR for Real Distant-Microphone Meeting Transcription [18.151884620928936]
最先端のエンドツーエンド話者分散自動音声認識(SA-ASR)アーキテクチャは、マルチチャネルノイズと残響低減フロントエンドを欠いている。
そこで本研究では, 実聴記録のためのビームフォーミング法とSA-ASR法を提案する。
論文 参考訳(メタデータ) (2024-10-29T08:17:31Z) - Convoifilter: A case study of doing cocktail party speech recognition [59.80042864360884]
このモデルは、このアプローチにより、ASRの単語誤り率(WER)を80%から26.4%に下げることができる。
我々はオープンに事前学習モデルを共有し、hf.co/nguyenvulebinh/voice-filterのさらなる研究を促進する。
論文 参考訳(メタデータ) (2023-08-22T12:09:30Z) - Scenario Aware Speech Recognition: Advancements for Apollo Fearless
Steps & CHiME-4 Corpora [70.46867541361982]
本稿では、TRILLと呼ばれる三重項損失に基づく自己監督基準で訓練された一般的な非意味的音声表現について考察する。
我々は、Fearless Stepsの開発と評価のために、+5.42%と+3.18%の相対的なWER改善を観察した。
論文 参考訳(メタデータ) (2021-09-23T00:43:32Z) - A Lottery Ticket Hypothesis Framework for Low-Complexity Device-Robust
Neural Acoustic Scene Classification [78.04177357888284]
デバイス・ロバスト音響シーン分類(ASC)のためのデータ拡張、知識伝達、プルーニング、量子化を組み合わせた新しいニューラルモデル圧縮戦略を提案する。
本稿では,低複雑マルチデバイスASCのためのアコースティック・ロッテリー(Austratic Lottery)という,効率的なジョイント・フレームワークについて報告する。
論文 参考訳(メタデータ) (2021-07-03T16:25:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。