論文の概要: Beyond Fresh Starts: Stateful Inference for Streaming ASR in Conversational Voice Agents
- arxiv url: http://arxiv.org/abs/2608.22101v1
- Date: Sat, 22 Aug 2026 20:46:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.611139
- Title: Beyond Fresh Starts: Stateful Inference for Streaming ASR in Conversational Voice Agents
- Title(参考訳): Beyond Fresh Starts:会話音声エージェントにおけるASRストリーミングのためのステートフル推論
- Authors: Sameep Chattopadhyay, Alexander Erdmann, Mari Ostendorf,
- Abstract要約: 現代の音声エージェントシステムは、厳格なレイテンシ制約の下で動作するストリーミング音声認識モデルに依存している。
本研究は、リアルタイム処理のメモリ制限が限られているため、長い沈黙やバックチャネルなどの会話現象に悪影響を及ぼすことを示した。
そこで本稿では,発話コンテキストを保存する2つの状態管理手法を提案する。
- 参考スコア(独自算出の注目度): 49.161325931466074
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern voice-agent systems rely on streaming speech recognition models that operate under stringent latency constraints. This study shows that, due to the limited memory constraints of real-time processing, these systems are adversely impacted by conversational phenomena such as long silences and backchannels. While many agentic pipelines mitigate this by resetting state at each turn, this approach discards vital context and impairs performance at turn onsets. We propose two state-management strategies that preserve cross-utterance context to reduce onset errors. In experiments with two state-of-the-art streaming models on two spoken dialogue benchmarks, our best method yields an average of 15-21% relative WER reduction at utterance onsets.
- Abstract(参考訳): 現代の音声エージェントシステムは、厳格なレイテンシ制約の下で動作するストリーミング音声認識モデルに依存している。
本研究は、リアルタイム処理のメモリ制限が限られているため、長い沈黙やバックチャネルなどの会話現象に悪影響を及ぼすことを示した。
多くのエージェントパイプラインは各ターンで状態をリセットすることでこれを緩和するが、このアプローチは重要なコンテキストを捨て、オンセット時のパフォーマンスを損なう。
そこで本稿では,発話コンテキストを保存する2つの状態管理手法を提案する。
2つの音声対話ベンチマークにおける2つの最先端ストリーミングモデルを用いた実験では,発話開始時のWERの相対減少率の平均は15~21%である。
関連論文リスト
- In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion [52.18702395026718]
In-Context Forcingは、雑音レベルを下げるコンテキストを利用するプログレッシブ・オートレグレッシブ・パラダイムである。
遠方のフレームにマスキングを減らし、隣接するフレームにマスキングを減らすことにより、このアプローチは適応的なガイダンスを提供する。
提案手法は, 視覚的忠実度と推論速度の両方において, 最先端のアプローチを著しく上回っている。
論文 参考訳(メタデータ) (2026-08-05T13:54:31Z) - Chronological Thinking in Full-Duplex Spoken Dialogue Language Models [66.84843878538207]
時系列思考は、完全なSDLMの応答品質を改善することを目的としている。
追加のレイテンシがない: ユーザが話すのをやめると、エージェントは考えるのをやめ、それ以上の遅延なしに話し始める。
結果: 客観的指標と人的評価の両面から, 時系列思考の有効性を示す実験を行った。
論文 参考訳(メタデータ) (2025-10-02T10:28:11Z) - TRNet: Two-level Refinement Network leveraging Speech Enhancement for Noise Robust Speech Emotion Recognition [29.756961194844717]
提案したTRNetは,一致した雑音環境と一致しない雑音環境の両方において,提案方式の堅牢性を大幅に向上させる。
その結果,提案方式は,一致した環境と一致しない環境の両方において,提案方式のロバスト性を大幅に向上させることがわかった。
論文 参考訳(メタデータ) (2024-04-19T16:09:17Z) - On the Effectiveness of ASR Representations in Real-world Noisy Speech Emotion Recognition [23.812838405442953]
音声の感情認識(NSER)を効果的に行う試みを提案する。
ノイズキャンバス特徴抽出器として自動音声認識(ASR)モデルを採用し,雑音の多い音声の非音声情報を除去する。
実験の結果,提案手法は従来のノイズ低減法に比べてNSER性能が向上し,2)自己教師あり学習手法よりも優れ,3)ASR文字起こしや音声音声の真理書き起こしによるテキストベースアプローチよりも優れていた。
論文 参考訳(メタデータ) (2023-11-13T05:45:55Z) - Streaming Speech-to-Confusion Network Speech Recognition [19.720334657478475]
本稿では、待ち時間を維持しながら混乱ネットワークを出力する新しいストリーミングASRアーキテクチャを提案する。
モデルのうち1-bestの結果は、同等のRNN-Tシステムと同等であることを示す。
また、遠距離音声アシスタントタスクにおいて、我々のモデルは強力なRNN-Tベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2023-06-02T20:28:14Z) - TranSpeech: Speech-to-Speech Translation With Bilateral Perturbation [61.564874831498145]
TranSpeechは、両側摂動を伴う音声から音声への翻訳モデルである。
我々は,非自己回帰S2ST手法を構築し,繰り返しマスキングを行い,単位選択を予測する。
TranSpeechは推論遅延を大幅に改善し、自動回帰技術よりも最大21.4倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2022-05-25T06:34:14Z) - Improving Noise Robustness of Contrastive Speech Representation Learning
with Speech Reconstruction [109.44933866397123]
実環境における音声認識システムの実現には,雑音の堅牢性が不可欠である。
雑音認識のための自己教師型フレームワークにより学習したノイズロスト表現を用いる。
ラベル付きデータのわずか16%で報告された最高の教師付きアプローチに匹敵するパフォーマンスを実現した。
論文 参考訳(メタデータ) (2021-10-28T20:39:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。