Beyond Fresh Starts: Stateful Inference for Streaming ASR in Conversational Voice Agents
Abstractの概要
本論文では、低遅延ストリーミングASRにおける状態(ステート)処理が対話型音声エージェントに与える影響を、ターンの境界、長い無音、短い相槌(バックチャネル)ターンに着目して分析しています。著者らはCallHomeおよびSwitchboard上で2つのキャッシュ対応FastConformer-RNNTストリーミングモデルを用い、標準的なターンごとの状態リセット、連続ストリーミング、および提案する2つの推論時状態管理戦略を比較しました。提案手法は、モデル状態における無音や相槌による汚染の悪影響を回避しつつ、発話間の文脈を保持します。160ミリ秒の遅延および関連設定での評価全体を通じて、都度リセットするデコードの主な弱点が発話冒頭の誤りであること、そして選択的な状態保持が認識精度を向上させることを明らかにしています。
新規性
主な新規性は、学習手順の変更や明示的なテキスト文脈メカニズムの追加を行うのではなく、ストリーミングASRの状態を対話エージェント向けの状態管理問題として推論時に扱う点にあります。本論文は、ターンを跨いで有用な先行文脈を保持する2つのシンプルな戦略(State Carry-overとState Rollback)を導入し、ロールバックによって相槌などの非常に短いターンからの文脈を選択的に破棄します。
成果
最良の手法であるState Rollbackは、評価した両方のモデルとデータセットにおいて最も低いWERを達成し、都度リセットするベースラインと比較して最初の単語/発話冒頭のWERを相対で平均約15〜21%削減しました。都度リセットするデコードに対する改善は4つのモデル・データセットの組み合わせすべてで統計的に有意であると報告されており、この向上は250ミリ秒未満の遅延や、正解のタイミングの代わりにVADから得られたターン境界を使用した場合でも維持されます。
論文の注目点
- ターンごとにASR状態をリセットすると無音の蓄積は防げるものの、先行文脈が破棄されるため次の発話の冒頭単語で大幅な精度低下が生じる。
- 状態制御を行わない連続ストリーミングは、限られた音響メモリを汚染する可能性がある長い休止や短い相槌ターンによる性能劣化に対して脆弱である。
- 選択的な状態保持、特にState Rollbackは、有用なターン間文脈の保持と有害な対話ノイズの回避との間で一貫して最も優れたトレードオフを提供する。