論文の概要: Not All Speech Is Intent: Adaptive Self-Correcting Inference Layer for Post-ASR False Wake-Up
- arxiv url: http://arxiv.org/abs/2609.12469v1
- Date: Fri, 11 Sep 2026 06:06:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.637955
- Title: Not All Speech Is Intent: Adaptive Self-Correcting Inference Layer for Post-ASR False Wake-Up
- Title(参考訳): すべての発話が意図的ではない:ASR後の偽ウェイクアップのための適応的自己修正推論層
- Abstract要約: 会話型AIでは、偽の起動アクティベーションは依然として永続的な課題である。
フィードバック駆動型適応型自己修正型推論層(ASCIL)について紹介する。
ASCILは、音響埋め込み、言語的手がかり、デバイスコンテキスト、過去の誤分類からのパターンを融合させることで、応答生成前の覚醒意図を再評価する。
- 参考スコア(独自算出の注目度): 2.497926557563177
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: False wake-up activations remain a persistent challenge in conversational AI. Speech phonetically similar to a device's wake word can produce a syntactically valid and semantically coherent ASR transcript that the assistant incorrectly executes. Most existing systems make a single intent decision in isolation, without a mechanism to learn from recurring errors over time or adapt to individual users through personalized learning. We introduce the Feedback-Driven Adaptive Self-Correcting Inference Layer (ASCIL), a complementary post-ASR correction framework that re-evaluates wake-up intent before response generation by fusing acoustic embeddings, linguistic cues, device context, and patterns from past misclassifications. ASCIL interprets implicit signals, including hesitation, disengagement, and silence, and explicit signals, including cancellation and repetition, as automatically inferred, noisy behavioral indicators of potential misclassification. These signals drive online pattern updates without manual annotation, whereas the intentional/unintentional reference labels used for offline evaluation are human-annotated. It generalizes from prior errors, applies corrective adjustments at inference time, and continuously updates in parallel with natural-language execution. Evaluated on a proprietary dataset of 3,667 interactions with human-annotated intentional/unintentional reference labels spanning 14 acoustic and contextual conditions, ASCIL achieves 54.27% relative error reduction on a session-disjoint subset constructed from baseline failures, and up to 24.39% relative error reduction at threshold 0.90 on the issue-tagged evaluation slice. These gains are achieved while improving intentional acceptance rates, with a median added latency below 60 ms in the reported benchmark.
- Abstract(参考訳): 会話型AIでは、偽の起動アクティベーションは依然として永続的な課題である。
音声学的にデバイスのウェイクワードに類似した音声は、アシスタントが誤って実行した構文的に有効で意味的に一貫性のあるASR文字を生成することができる。
既存のシステムの多くは、繰り返し発生するエラーから学習したり、パーソナライズされた学習を通じて個々のユーザに適応するメカニズムなしで、単一の意図を単独で決定する。
本稿では、音響埋め込み、言語的手がかり、デバイスコンテキスト、過去の誤分類からのパターンを融合させることにより、応答生成前の覚醒意図を再評価する、ASR後の補完的な修正フレームワークである、フィードバック駆動適応型自己修正層(ASCIL)を紹介する。
ASCILは、隠蔽、解離、沈黙を含む暗黙の信号と、キャンセルや繰り返しを含む明示的な信号を、潜在的な誤分類の潜在的なノイズのある行動指標として自動的に推論する。
これらの信号は手動によるアノテーションなしでオンラインパターンの更新を駆動するが、オフライン評価に使用される意図的/意図しない参照ラベルは人手による注釈である。
事前のエラーから一般化し、推論時に修正調整を適用し、自然言語実行と並行して継続的に更新する。
ASCILは、人間の注釈付き意図/意図しない参照ラベルと14の音響的および文脈的条件にまたがる3,667のプロプライエタリなデータセットに基づいて評価され、ベースラインの故障から構築されたセッション非結合サブセットに対して54.27%の相対的なエラー削減、イシュータグ付き評価スライスにおいて閾値0.90で24.39%の相対的なエラー削減を達成する。
これらのゲインは、意図的な受け入れ率を改善しながら達成され、報告されたベンチマークでは、中央値のレイテンシが60ミリ秒以下になった。
関連論文リスト
- Content is What Remains: Invariant Speech Tokenization from Parallel Utterances [8.166364251367627]
PINTはSSLエンコーダを微調整し、並列発話におけるアライメント損失と、この共有残基を蒸留するために拡張する。
ASRテキストとは異なり、PINTトークンはフレームレベルの時間的グラウンドを保持し、オーディオコーデックのドロップインセマンティックターゲットとして機能する。
論文 参考訳(メタデータ) (2026-07-21T12:19:38Z) - Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models [59.51249894128724]
マスク付き拡散言語モデルは、反復を識別するごとに複数のトークンを明らかにすることで推論ステップを削減することができる。
パラレルマスク拡散復号法のためのトレーニング不要な復号法であるADASを提案する。
論文 参考訳(メタデータ) (2026-06-09T13:17:27Z) - Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation [53.844308305341166]
単一パスのASRフロントエンドと意味的訂正,意図のルーティング,推論に基づく編集を組み合わせた閉ループフレームワークである textbfAgentic ASR を提案する。
複数言語、名前付き集中型、コードスイッチングベンチマークの実験は、反復的相互作用が意味的誤りを一貫して減少させることを示している。
論文 参考訳(メタデータ) (2026-05-28T06:23:31Z) - ReHear: Iterative Pseudo-Label Refinement for Semi-Supervised Speech Recognition via Audio Large Language Models [12.527207210862151]
ReHearは、自動音声認識における反復的な擬似ラベル改善のためのフレームワークである。
命令調整されたオーディオ対応の大規模言語モデルを自己学習ループに統合する。
ReHearはエラーの伝播を効果的に軽減し、教師付きベースラインと疑似ラベルベースラインの両方を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-21T05:04:22Z) - Towards Automated Error Discovery: A Study in Conversational AI [48.735443116662026]
本稿では,会話型AIにおけるエラーの検出と定義のためのフレームワークであるAutomated Error Discoveryを紹介する。
また,その実装に対するエンコーダに基づくアプローチとして,SEEED(Soft Clustering Extended-Based Error Detection)を提案する。
論文 参考訳(メタデータ) (2025-09-13T14:53:22Z) - Error Correction by Paying Attention to Both Acoustic and Confidence References for Automatic Speech Recognition [52.624909026294105]
本稿では,非自己回帰型音声誤り訂正法を提案する。
信頼モジュールは、N-best ASR仮説の各単語の不確実性を測定する。
提案方式は,ASRモデルと比較して誤差率を21%削減する。
論文 参考訳(メタデータ) (2024-06-29T17:56:28Z) - Transcription-Free Fine-Tuning of Speech Separation Models for Noisy and Reverberant Multi-Speaker Automatic Speech Recognition [18.50957174600796]
重なり合う話者の自動音声認識(ASR)の解決策は、音声を分離し、分離された信号でASRを実行することである。
現在、セパレータはASR性能を劣化させるアーティファクトを生産している。
本稿では,音声信号のみを用いた共同学習のための書き起こし不要手法を提案する。
論文 参考訳(メタデータ) (2024-06-13T08:20:58Z) - Self-Taught Recognizer: Toward Unsupervised Adaptation for Speech Foundation Models [84.8919069953397]
Self-Taught Recognizer (STAR) は、音声認識システムのための教師なし適応フレームワークである。
その結果,STARは14のドメインで平均13.5%の単語誤り率の相対的な減少を実現していることがわかった。
STARは1時間以内のラベル付きデータを必要とする高いデータ効率を示す。
論文 参考訳(メタデータ) (2024-05-23T04:27:11Z) - HyPoradise: An Open Baseline for Generative Speech Recognition with
Large Language Models [81.56455625624041]
ASRの誤り訂正に外部の大規模言語モデル(LLM)を利用する最初のオープンソースベンチマークを導入する。
提案したベンチマークには、334,000組以上のN-best仮説を含む新しいデータセットHyPoradise (HP)が含まれている。
合理的なプロンプトと生成能力を持つLLMは、N-bestリストに欠けているトークンを修正できる。
論文 参考訳(メタデータ) (2023-09-27T14:44:10Z) - Pre-trained Language Models as Re-Annotators [3.193067591317475]
事前学習言語モデルから意味センシティブなアノテーション表現を取得する方法について検討する。
アノテーション修正のためのクロスバリデーションに基づく事前学習言語モデルを微調整する。
関係抽出における再アノテーションについて検討し、手動で改訂したデータセットRe-DocREDを作成する。
論文 参考訳(メタデータ) (2022-05-11T09:28:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。