論文の概要: Qwen-Audio-3.0-ASR Technical Report
- arxiv url: http://arxiv.org/abs/2609.07549v2
- Date: Wed, 09 Sep 2026 11:59:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.443846
- Title: Qwen-Audio-3.0-ASR Technical Report
- Title(参考訳): Qwen-Audio-3.0-ASR技術報告
- Authors: Chuanmeng Bian, Daren Chen, Peixin Chen, Zhigao Chen, Zhiyun Fan, Zhifu Gao, Bo Gong, Qing Gu, Jiajun He, Yawei Hu, Yunjie Ji, Jingbei Li, Xiangang Li, Xu Li, Zengxi Li, Zheng Li, Chengdong Liang, Baiji Liu, Ying Liu, Bin Ma, Yiping Peng, Yuezhang Peng, Zhendong Peng, Yu Pu, Yang Shi, Xin Shu, Jian Tang, Biao Tian, Peiyao Wang, Tianzi Wang, Wen Wang, Wupeng Wang, Cheng Wen, Yuzhong Wu, Zijian Xia, Yunchong Xiao, Nan Yang, Jianwei Yu, Jixing Yu, Binbin Zhang, Lei Zhang, Sitong Zhao, Guangdong Zhou, Yuan Zhou, Jianheng Zhuo,
- Abstract要約: 本稿では,Mixture-of-Experts (MoE) LLM-based ASRシステムであるQwen-Audio-3.0-ASRを提案する。
Qwen-Audio-3.0-ASRは8つの主要方言領域にまたがる30の言語と16の中国語方言の転写をサポートしている。
レイテンシに敏感なアプリケーションのための専用ストリーミング変種Qwen-Audio-3.0-ASR-Streamingを開発した。
- 参考スコア(独自算出の注目度): 52.28849889799101
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In recent years, automatic speech recognition (ASR) has witnessed transformative advancements driven by three complementary paradigms: data scaling, model scaling, and deep integration with large language models (LLMs). However, bridging the gap between academic benchmark performance and real-world production utility remains a persistent challenge, particularly in handling diverse regional dialects, dynamic entities and hotwords, long-range contextual information, and disfluent spontaneous speech. In this report, we present Qwen-Audio-3.0-ASR, a Mixture-of-Experts (MoE) LLM-based ASR system designed to address these production demands through a unified, instruction-following framework. The model is built upon the Qwen backbone, and is trained on tens of millions of hours of large-scale speech data. Qwen-Audio-3.0-ASR supports transcription across 30 languages and 16 Chinese dialectal varieties spanning eight major dialect regions. Beyond multilingual and dialectal recognition, the model provides production-oriented capabilities including industry-domain entity recognition, hierarchical hotword customization, native single-pass transcription polishing, and long-audio contextual modeling. We further develop a dedicated streaming variant, Qwen-Audio-3.0-ASR-Streaming, for latency-sensitive applications. Extensive evaluations on Chinese, English, multilingual, and real-world industrial test sets demonstrate state-of-the-art or highly competitive recognition performance across a broad range of evaluation conditions, with strong performance relative to leading commercial and proprietary systems including GPT-4o Transcribe and Gemini 3.1 Pro.
- Abstract(参考訳): 近年,データスケーリング,モデルスケーリング,大規模言語モデル(LLM)との深い統合という3つの相補的パラダイムによって,音声認識(ASR)が進化していくのを目撃している。
しかしながら、学術ベンチマークのパフォーマンスと実世界の生産ユーティリティのギャップを埋めることは、特に多様な地域方言、動的実体とホットワード、長距離文脈情報、および非流動的な自然発話を扱う上で、永続的な課題である。
本稿では,Mixture-of-Experts (MoE) LLMベースのASRシステムであるQwen-Audio-3.0-ASRについて述べる。
このモデルはQwenのバックボーン上に構築されており、何千万時間もの大規模音声データに基づいて訓練されている。
Qwen-Audio-3.0-ASRは8つの主要方言領域にまたがる30の言語と16の中国語方言の転写をサポートしている。
多言語と方言の認識以外にも、このモデルは産業ドメインのエンティティ認識、階層的なホットワードのカスタマイズ、ネイティブなシングルパス転写研磨、長期の文脈モデリングなど、生産指向の機能を提供する。
さらに,レイテンシに敏感なアプリケーションのための専用ストリーミング変種Qwen-Audio-3.0-ASR-Streamingを開発した。
GPT-4o TranscribeやGemini 3.1 Proといった主要な商用およびプロプライエタリシステムと比較して、幅広い評価条件において、中国語、英語、多言語、実世界の産業試験セットに対する広範な評価は、最先端または高い競争力のある認識性能を示している。
関連論文リスト
- Qwen3.5-Omni Technical Report [0.0]
Qwen3.5- Omniは数十億のパラメータにスケールし、256kのコンテキスト長をサポートする。
Qwen3.5-Omniは、215のオーディオとオーディオの視覚的理解、推論、インタラクションのサブタスクとベンチマークで結果を得る。
ARIAはテキストと音声ユニットを動的に調整し、会話音声の安定性と韻律を大幅に向上させる。
論文 参考訳(メタデータ) (2026-04-17T08:05:46Z) - PRiSM: Benchmarking Phone Realization in Speech Models [70.82595415252682]
音声認識(PR)は言語に依存しない言語間音声処理と音声解析のためのアトミックインタフェースとして機能する。
PRiSMは、音声知覚における盲点を明らかにするために設計された、最初のオープンソースベンチマークである。
論文 参考訳(メタデータ) (2026-01-20T15:00:36Z) - AHELM: A Holistic Evaluation of Audio-Language Models [78.20477815156484]
マルチモーダルオーディオ言語モデル(ALM)は、インターリーブされた音声とテキストを入力および出力テキストとして取り込む。
AHELMは、PARADEとCoRe-Benchと呼ばれる2つの新しい合成オーディオテキストデータセットを含む、さまざまなデータセットを集約するベンチマークである。
また、モデル間の等価比較を確保するために、プロンプト、推論パラメータ、評価指標を標準化する。
論文 参考訳(メタデータ) (2025-08-29T07:40:39Z) - Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction [110.38946048535033]
本稿では,音声認識のための最初のプロダクション対応オープンソースソリューションであるStep-Audioを紹介する。
1) 統合された理解と生成を実現する統合音声テキストマルチモーダルモデル、2) 安価な音声クローニングフレームワークを確立し、蒸留によりオープンソースで軽量なStep-Audio-TTS-3Bモデルを生産する生成音声データエンジン、3) 方言、感情、歌、RAP間の動的調整を可能にする命令駆動型微制御システム、4) ツールコールとロールプレイング機能を備えた強化認知アーキテクチャ。
論文 参考訳(メタデータ) (2025-02-17T15:58:56Z) - Developing a Multilingual Dataset and Evaluation Metrics for Code-Switching: A Focus on Hong Kong's Polylingual Dynamics [0.5700195008916903]
我々は,Multi-Agent Data Generation Framework (MADGF) を用いた混合カントンと英語(MCE)音声の34.8時間データセットを開発した。
我々は,オープンソースの多言語自動音声認識(ASR)モデルであるWhisperをMCEデータセットで微調整し,印象的なゼロショット性能を実現した。
論文 参考訳(メタデータ) (2023-10-27T08:01:55Z) - Cross-lingual Knowledge Distillation via Flow-based Voice Conversion for
Robust Polyglot Text-To-Speech [6.243356997302935]
本稿では、上流音声変換(VC)モデルと下流音声合成(TTS)モデルを含む、言語間音声合成のためのフレームワークを提案する。
最初の2段階では、VCモデルを用いてターゲット話者の発話をターゲット話者の声に変換する。
第3段階では、変換されたデータは、対象言語における記録からの言語的特徴や持続時間と組み合わせられ、単一話者音響モデルの訓練に使用される。
論文 参考訳(メタデータ) (2023-09-15T09:03:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。