論文の概要: X2Streaming-ASR: wait when uncertain, emit when ready for streaming ASR
- arxiv url: http://arxiv.org/abs/2609.08672v1
- Date: Tue, 08 Sep 2026 12:39:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.649126
- Title: X2Streaming-ASR: wait when uncertain, emit when ready for streaming ASR
- Title(参考訳): X2Streaming-ASR: 確実であれば待機、ストリーミングASRの準備ができたら出力する
- Abstract要約: X2Streaming-ASRは、ストリーミング認識をコミットのタイミングとコミットのタイミングに分解する。
AISHELL-1とAISHELL-3で評価されたシステムの中で、非常に低いレイテンシで最高のストリーミングCERを達成する。
- 参考スコア(独自算出の注目度): 9.702263445347981
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Streaming automatic speech recognition (ASR) for real-time voice agents and full-duplex dialogue must provide accurate partial transcripts with low commit latency. Existing systems commonly use a fixed chunk size, look-ahead, or target delay, or encourage emissions near estimated acoustic boundaries. These approaches do not directly optimize how much additional context to use at each output position under a single-pass, hard-commit constraint. We propose X2Streaming-ASR, which decomposes streaming recognition into when to commit and what to commit. Its three-stage training procedure first establishes streaming recognition ability, then warm-starts the commit policy with automatically probed trajectories, and finally refines the policy using character-level, segment-assigned group-relative rewards for recognition accuracy and latency. Across AISHELL-1/2/3 and WenetSpeech, X2Streaming-ASR achieves a mean character-level commit latency of 27-84 ms relative to forced-aligned character endpoints, compared with 409-585 ms for the evaluated streaming baselines. It achieves the best streaming CER among the evaluated systems on AISHELL-1 and AISHELL-3 with substantially lower latency.
- Abstract(参考訳): リアルタイム音声エージェントとフル二重対話のためのストリーミング自動音声認識(ASR)は、コミットレイテンシの低い正確な部分的書き起こしを提供する必要がある。
既存のシステムは、通常、固定されたチャンクサイズ、ルックアヘッド、またはターゲット遅延を使用するか、または推定された音響境界付近の放出を促進する。
これらのアプローチは、単一パスのハードコミット制約の下で各出力位置で使用すべき追加コンテキストを直接最適化しない。
本稿では,ストリーミング認識をコミットのタイミングとコミットのタイミングに分解するX2Streaming-ASRを提案する。
その3段階の訓練手順は、まずストリーミング認識能力を確立し、次に自動的に探索された軌道でコミットポリシーをウォームスタートさせ、最後に認識精度と遅延のために文字レベル、セグメントアサインされたグループ相対報酬を使用してポリシーを洗練する。
AISHELL-1/2/3 と WenetSpeech 全体で、X2Streaming-ASR は、評価されたストリーミングベースラインの 409-585 ms と比較して、強制整列文字エンドポイントと比較して、平均的な文字レベルのコミットレイテンシが 27-84 ms である。
AISHELL-1とAISHELL-3で評価されたシステムの中で、非常に低いレイテンシで最高のストリーミングCERを達成する。
関連論文リスト
- Moonshine v2: Ergodic Streaming Encoder ASR for Latency-Critical Speech Applications [0.8691520242484038]
フルアテンショントランスフォーマーエンコーダは、音声認識(ASR)のための強力な精度ベースラインのままである
本稿では、スライディングウインドウ自己アテンションを用いて、有界低レイテンシ推論を実現するエルゴードストリーミングエンコーダASRモデルv2を紹介する。
提案モデルでは,標準ベンチマーク間での単語誤り率の状態を達成し,モデルのサイズを6倍にし,性能を著しく向上した。
論文 参考訳(メタデータ) (2026-02-12T18:20:45Z) - Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage [66.67531241554546]
従来のASR-LLM-TTSパイプラインに代わる強力な対話システムとして、エンドツーエンドの音声対話システムが登場している。
本稿では,音声入力システムに直接ツールの使用を拡張するための最初のアプローチを紹介する。
提案するStreaming Retrieval-Augmented Generation (Streaming RAG) は,ユーザ音声と並行してツールクエリを予測することにより,ユーザ知覚のレイテンシを低減する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-10-02T14:18:20Z) - Whisfusion: Parallel ASR Decoding via a Diffusion Transformer [7.327454599174306]
Whisfusionは、トレーニング済みのWhisperエンコーダをテキスト拡散デコーダで融合するフレームワークである。
パラメータ効率細調整(PEFT)によって訓練された軽量なクロスアテンションアダプタは、2つのモードをブリッジする。
LibriSpeech (960h)のみに微調整されたWhisfusionは、Whisper-tinyよりも低いWERを実現し、短いオーディオに匹敵するレイテンシを提供する。
論文 参考訳(メタデータ) (2025-08-09T17:20:54Z) - StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling [50.537794606598254]
StreamMelは、継続的メル-スペクトログラムをモデル化する、先駆的なシングルステージストリーミングTSフレームワークである。
高い話者類似性と自然性を保ちながら、低レイテンシで自己回帰的な合成を可能にする。
オフラインシステムに匹敵するパフォーマンスを実現し、効率的なリアルタイム生成もサポートしている。
論文 参考訳(メタデータ) (2025-06-14T16:53:39Z) - Joint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation [44.94458898538114]
マルチデコーダと知識蒸留に基づくストリーミングと非ストリーミングASRの連成最適化を提案する。
評価の結果,ストリーミングASRのCSJでは2.6%-5.3%,ストリーミングASRでは8.3%-9.7%,非ストリーミングASRでは8.3%-9.7%であった。
論文 参考訳(メタデータ) (2024-05-22T10:17:30Z) - DCTX-Conformer: Dynamic context carry-over for low latency unified
streaming and non-streaming Conformer ASR [20.42366884075422]
本稿では,最先端統合型ASRシステムにおける動的コンテキスト搬送機構の統合を提案する。
提案する動的コンテキストコンバータ (DCTX-Conformer) は、重複しないコンテキスト搬送機構を利用する。
単語誤り率25.0%でSOTAを上回り、追加のコンテキスト埋め込みによる遅延の影響は無視できる。
論文 参考訳(メタデータ) (2023-06-13T23:42:53Z) - Streaming Audio-Visual Speech Recognition with Alignment Regularization [69.30185151873707]
本稿では,ハイブリッド接続型時間分類(CTC)/アテンションニューラルネットワークアーキテクチャに基づくストリーミングAV-ASRシステムを提案する。
提案したAV-ASRモデルは、オフラインおよびオンライン設定でLip Reading Sentences 3データセット上で、WERの2.0%と2.6%を達成する。
論文 参考訳(メタデータ) (2022-11-03T20:20:47Z) - Unified End-to-End Speech Recognition and Endpointing for Fast and
Efficient Speech Systems [17.160006765475988]
本稿では,単一エンドツーエンド (E2E) モデルを用いて, ASR と EP タスクを協調訓練する手法を提案する。
我々は、EPにオーディオフレームを直接消費するか、ASRモデルから低レベルの潜在表現を消費するよう訓練する「スウィッチ」接続を導入する。
これにより、推論中にフレームフィルタリングを低コストで行うことができる単一のE2Eモデルが得られる。
論文 参考訳(メタデータ) (2022-11-01T23:43:15Z) - Dual Causal/Non-Causal Self-Attention for Streaming End-to-End Speech
Recognition [58.69803243323346]
注意に基づくエンドツーエンド自動音声認識(ASR)システムは、最近、多くのタスクに対する最先端の結果を実証している。
しかし、自己注意および注意に基づくエンコーダデコーダモデルの応用は、ASRのストリーミングでは依然として困難である。
二重因果的/非因果的自己注意アーキテクチャを提案するが、これは制限された自己意識とは対照的に、全体的なコンテキストが単一のレイヤのルックアヘッドを超えて成長することを妨げている。
論文 参考訳(メタデータ) (2021-07-02T20:56:13Z) - Advanced Long-context End-to-end Speech Recognition Using
Context-expanded Transformers [56.56220390953412]
コンフォーメータアーキテクチャを導入することで、精度をさらに向上させ、以前の作業を拡張します。
拡張トランスフォーマーは、最先端のエンドツーエンドのASR性能を提供する。
論文 参考訳(メタデータ) (2021-04-19T16:18:00Z) - FastEmit: Low-latency Streaming ASR with Sequence-level Emission
Regularization [78.46088089185156]
ストリーム自動音声認識(ASR)は、仮説化された単語を可能な限り迅速かつ正確に出力することを目的としている。
既存のアプローチでは、シーケンストランスデューサモデルにおいて、トーケン単位またはフレーム単位の確率予測を演算することで、発光遅延をペナルティ化する。
本稿では,訓練用トランスデューサモデルにおいて,シーケンス毎の確率に遅延正規化を直接適用する,FastEmitというシーケンスレベルのエミッション正規化手法を提案する。
論文 参考訳(メタデータ) (2020-10-21T17:05:01Z) - Streaming automatic speech recognition with the transformer model [59.58318952000571]
本稿では,ストリーミングASRのためのトランスフォーマーに基づくエンドツーエンドASRシステムを提案する。
本研究では,エンコーダに時間制限付き自己アテンションを適用し,エンコーダ・デコーダのアテンション機構に注意を喚起する。
提案したストリーミングトランスアーキテクチャは,LibriSpeechの「クリーン」および「他の」テストデータに対して,2.8%と7.2%のWERを実現する。
論文 参考訳(メタデータ) (2020-01-08T18:58:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。