論文の概要: Xiaomi-CocktailASR-1 Technical Report
- arxiv url: http://arxiv.org/abs/2609.11274v1
- Date: Thu, 10 Sep 2026 09:06:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.278062
- Title: Xiaomi-CocktailASR-1 Technical Report
- Title(参考訳): Xiaomi-CocktailASR-1技術報告
- Abstract要約: 既存のTS-ASR手法は、劣化した単一スピーカの性能と、ターゲット話者が不在な場合に拒否できないことに悩まされている。
LLMに基づくエンドツーエンドTS-ASRアーキテクチャであるXiaomi-CocktailASR-1を提案する。
基準音声を音声プリントプロンプトとして利用することにより、音声分離を必要とせずに、ターゲット話者の音声を直接書き起こす。
- 参考スコア(独自算出の注目度): 33.13681089835933
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recently, large language model (LLM) based ASR models have achieved significant progress, yet they generally lack support for multi-speaker scenarios, where the cocktail party problem remains a critical bottleneck for further advancing ASR. Existing TS-ASR methods, including end-to-end architectures with speaker embeddings and latest LLM-based explorations suffer from degraded single-speaker performance and the inability to reject when the target speaker is absent. In this paper, we propose Xiaomi-CocktailASR-1, an LLM-based end-to-end TS-ASR architecture. By utilizing reference speech as voiceprint prompts, it directly transcribes the target speaker's speech without requiring speech separation. Xiaomi-CocktailASR-1 maintains competitive performance in single-speaker scenarios, comparable to mainstream ASR models. It also features a negative sample rejection capability, outputting empty text when the target speaker is absent from the mixed speech. Additionally, Xiaomi-CocktailASR-1 supports a Chain-of-Thought (CoT) reasoning mode to provide explicit reasoning steps. Extensive experiments on various synthetic and real-world multispeaker benchmarks demonstrate that Xiaomi-CocktailASR-1 achieves state-of-the-art performance, effectively addressing the cocktail party problem through a unified architecture that balances multispeaker and single-speaker recognition accuracy, along with rejection capability.
- Abstract(参考訳): 近年,大規模言語モデル (LLM) に基づくASRモデルは大きな進歩を遂げているが,多話者シナリオは一般的にはサポートされていない。
従来のTS-ASR手法では、話者埋め込みと最新のLCMベースの探索を含むエンドツーエンドアーキテクチャでは、単一話者の性能が劣化し、ターゲット話者が不在時に拒否できない。
本稿では,LSMに基づくエンドツーエンドTS-ASRアーキテクチャであるXiaomi-CocktailASR-1を提案する。
基準音声を音声プリントプロンプトとして利用することにより、音声分離を必要とせずに、ターゲット話者の音声を直接書き起こす。
Xiaomi-CocktailASR-1は、メインストリームのASRモデルに匹敵する単一話者シナリオでの競争性能を維持している。
また、ターゲット話者が混合音声から欠落している場合に空のテキストを出力する、負のサンプル拒絶機能も備えている。
さらにXiaomi-CocktailASR-1は、明確な推論ステップを提供するためにChain-of-Thought (CoT)推論モードをサポートする。
Xiaomi-CocktailASR-1は,多話者認識精度と単一話者認識精度のバランスをとる統一アーキテクチャにより,カクテルパーティー問題を効果的に解決する。
関連論文リスト
- HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding [54.365959989048406]
音声言語モデル(SLM)は、ますますマルチスピーカー環境にデプロイされている。
しかし、音声を正しい話者とみなし、話者の身元を判断する能力は、いまだに不明である。
本稿では,話者対応推論の基礎的能力を診断するベンチマークHEARを紹介する。
A2Rは、話者レベルのハードな負を持つ非現実的オーディオに最適化された30Bモデルである。
論文 参考訳(メタデータ) (2026-08-29T08:01:20Z) - DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Supervised Speech Foundational Model [65.93900011975238]
DELULUは、話者を意識した、検証、ダイアリゼーション、プロファイリングのための基礎モデルである。
マスク付き予測と妄想を組み合わせ、堅牢性と一般化をさらに強化する2つの目的を用いて訓練される。
以上の結果から,DELULUは話者認識音声処理の強力なユニバーサルエンコーダであり,タスク固有の微調整がなくても優れた性能が得られることがわかった。
論文 参考訳(メタデータ) (2025-10-20T15:35:55Z) - Two Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual Hypotheses [71.34350093068473]
本稿では,音声視覚音声認識(AVSR)における生成誤り訂正(GER)フレームワークの新たなパラダイムを提案する。
我々のフレームワークであるDualHypは、独立した自動音声認識(ASR)モデルと視覚音声認識(VSR)モデルから独立したN-best仮説を構成するために、大規模言語モデル(LLM)を強制する。
我々のフレームワークは、標準のASRベースラインよりもLRS2ベンチマークで57.7%のエラー率を獲得していますが、シングルストリームのGERアプローチでは10%のゲインしか達成できません。
論文 参考訳(メタデータ) (2025-10-15T08:27:16Z) - Cocktail-Party Audio-Visual Speech Recognition [58.222892601847924]
本研究では,現在のAVSRシステムのベンチマークを行うために設計された,新しい音声-視覚カクテルパーティデータセットを提案する。
音声とサイレント顔の両方からなる1526時間AVSRデータセットをコントリビュートし,カクテルパーティー環境における顕著な性能向上を実現した。
我々の手法は、WERを最先端と比較して67%削減し、WERを明示的なセグメンテーション手法に頼ることなく、極音の119%から39.2%に削減する。
論文 参考訳(メタデータ) (2025-06-02T19:07:51Z) - MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models [59.80042864360884]
話者分布自動音声認識(SA-ASR)は,対応する話者に文字を正確に割り当てながら音声を転写することを目的としている。
本稿では,凍結した多言語ASRモデルを用いて話者属性を転写に組み込む新しい手法を提案する。
論文 参考訳(メタデータ) (2024-11-27T09:01:08Z) - USAT: A Universal Speaker-Adaptive Text-to-Speech Approach [11.022840133207788]
目に見えない、データセット外話者のために、人生のようなスピーチを無視するという課題は、重要で未解決のままである。
ゼロショットアプローチは、強いアクセントを持つ話者の声を再現するために、一般化性能が不十分である。
非常に多様なアクセントを再現することができず、保存の負担が大きくなり、過度なフィットや破滅的な忘れ込みのリスクが生じる。
提案手法は,ゼロショット話者適応戦略と少数ショット話者適応戦略を一体化したものである。
論文 参考訳(メタデータ) (2024-04-28T06:50:55Z) - Extending Whisper with prompt tuning to target-speaker ASR [18.31992429200396]
ターゲット話者自動音声認識(Target-Speaker Automatic Speech Recognition, ASR)は、ターゲット話者の所望の音声を重なり合う発話から書き起こすことを目的としている。
既存のターゲットスピーカーASR(TS-ASR)の手法のほとんどは、スクラッチからトレーニングするか、事前訓練されたモデルを完全に微調整するものである。
この研究は、パラメータ効率のよい微調整手法であるプロンプトチューニングを利用して、大規模なシングルストーカーASRモデルであるWhisperをTS-ASRに拡張する。
論文 参考訳(メタデータ) (2023-12-13T11:49:16Z) - Streaming Multi-speaker ASR with RNN-T [8.701566919381223]
本研究は、リカレントニューラルネットワークトランスデューサ(RNN-T)に基づくマルチスピーカ音声認識に焦点を当てている。
RNN-Tの高レベル話者追跡能力を高めるために,前者における話者順ラベルの分離が重要であることを示す。
我々の最良モデルは、前述した最先端非ストリーミングモデル(10.3%)と競合する2話者Libriデータ上で10.2%のWERを達成する。
論文 参考訳(メタデータ) (2020-11-23T19:10:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。