論文の概要: PromptKWS: A Novel Prompt-Guided Open-Vocabulary Keyword Spotting Framework
- arxiv url: http://arxiv.org/abs/2608.28640v1
- Date: Tue, 11 Aug 2026 12:10:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-06 19:38:41.460575
- Title: PromptKWS: A Novel Prompt-Guided Open-Vocabulary Keyword Spotting Framework
- Title(参考訳): PromptKWS: Prompt-Guided Open-Vocabulary Keyword Spotting Framework
- Abstract要約: 本稿では,キーワードプロンプト埋め込みを効果的に抽出するエンコーダデコーダアーキテクチャであるPrompt Phrases Prediction Network (PPN)を紹介する。
本稿では,PPNエンコーダを用いてキーワードプロンプトを符号化し,Prompt-acoustic Multi-head Cross-attention (MHCA) を用いて,Prompt-guided KWSエンコーダにプロンプトを注入する。
実験の結果, PromptKWSはベースラインシステムと比較して起動率を10%以上改善することがわかった。
- 参考スコア(独自算出の注目度): 17.616287091537128
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this paper, we present PromptKWS, a novel Prompt-guided keyword spotting (KWS) framework to improve the accuracy of open vocabulary KWS systems. In specific terms, we introduce the Prompt Phrases Prediction Network (PPN), an encoder-decoder architecture designed to effectively extract keyword prompts embeddings. we employ the PPN encoder to encode the keyword prompts and infuse the prompt embedding into the Prompt-guided KWS encoder by utilizing a Prompt-acoustic Multi-head Cross-attention (MHCA). Experiments show that PromptKWS improves the wakeup rate by over 10% compared to baseline system. Notably, another strength of PromptKWS is its ability to effectively leverage keyword prompts for adapting to complex real-world environments involving noise and pronunciation variations. In comparison to purely acoustic models, which often struggle in such situations, PromptKWS demonstrates remarkable performance, with an average accuracy improvement of over 15% in test sets.
- Abstract(参考訳): 本稿では,オープン語彙KWSシステムの精度を向上させるために,新しいキーワードスポッティング(KWS)フレームワークであるPromptKWSを提案する。
本稿では,キーワードプロンプトの埋め込みを効果的に抽出するエンコーダ・デコーダアーキテクチャであるPrompt Phrases Prediction Network (PPN)を紹介する。
本稿では,PPNエンコーダを用いてキーワードプロンプトを符号化し,Prompt-acoustic Multi-head Cross-attention (MHCA) を用いて,Prompt-guided KWSエンコーダにプロンプトを注入する。
実験の結果, PromptKWSはベースラインシステムと比較して起動率を10%以上改善することがわかった。
特に、PromptKWSのもうひとつの強みは、ノイズや発音の変化を含む複雑な現実世界環境に適応するためのキーワードプロンプトを効果的に活用する能力である。
このような状況でしばしば苦労する純粋音響モデルと比較して、PromptKWSは、テストセットの平均精度が15%以上向上し、顕著な性能を示す。
関連論文リスト
- Text-Aware Adapter for Few-Shot Keyword Spotting [13.040457187781671]
テキスト・アウェア・アダプタ(TA-adapter)と呼ばれる新しい数発転写学習手法を提案する。
実験では、TA-adapterは、Google Speech Commands V2データセットから35の異なるキーワードに対して、大幅なパフォーマンス向上を示した。
論文 参考訳(メタデータ) (2024-12-24T03:54:40Z) - Keyword-Guided Adaptation of Automatic Speech Recognition [17.011087631073863]
本稿では,Whisper ベースモデルを用いた文脈バイアスによる単語認識の改良手法を提案する。
本稿では,Whisperエンコーダ表現を利用したキーワードスポッティングモデルを用いて,書き起こし処理中にデコーダを誘導するプロンプトを動的に生成する。
その結果,特定のキーワードの認識精度が向上し,全体的な単語誤り率の低減が図られた。
論文 参考訳(メタデータ) (2024-06-04T14:20:38Z) - Open-vocabulary Keyword-spotting with Adaptive Instance Normalization [18.250276540068047]
本稿では,キーワード条件付き正規化パラメータを出力するためにテキストエンコーダを訓練するキーワードスポッティングの新しい手法であるAdaKWSを提案する。
近年のキーワードスポッティングやASRベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2023-09-13T13:49:42Z) - InfoPrompt: Information-Theoretic Soft Prompt Tuning for Natural
Language Understanding [51.48361798508375]
我々は,プロンプトと他のモデルパラメータ間の相互情報の最大化として,ソフトプロンプトチューニングを定式化する情報理論フレームワークを開発する。
本稿では,インフォプロンプトがプロンプトチューニングの収束を著しく加速し,従来のプロンプトチューニング手法よりも優れた性能を発揮することを示す。
論文 参考訳(メタデータ) (2023-06-08T04:31:48Z) - Prompting the Hidden Talent of Web-Scale Speech Models for Zero-Shot
Task Generalization [61.60501633397704]
本稿では,最近提案されたWebスケール音声モデルのWhisperの創発的能力について検討する。
タスク固有のプロンプトを、別の大規模モデルを活用するか、あるいはデフォルトのプロンプトで特別なトークンを操作するだけで設計する。
実験の結果,提案手法は3つのゼロショットタスクで10%から45%向上し,SotAの教師付きモデルよりも優れていることがわかった。
論文 参考訳(メタデータ) (2023-05-18T16:32:58Z) - To Wake-up or Not to Wake-up: Reducing Keyword False Alarm by Successive
Refinement [58.96644066571205]
既存の深層キーワードスポッティング機構は逐次リファインメントにより改善可能であることを示す。
13Kパラメーターから2.41Mパラメーターまで、複数のモデルにまたがって、連続精製法はFAを最大8.5%削減する。
提案手法は"plug-and-play"であり,任意の深いキーワードスポッティングモデルに適用できる。
論文 参考訳(メタデータ) (2023-04-06T23:49:29Z) - Noise-Robust Dense Retrieval via Contrastive Alignment Post Training [89.29256833403167]
Contrastive Alignment POst Training (CAPOT) は、指数再生を必要とせず、モデルロバスト性を改善する高効率な微調整法である。
CAPOTはドキュメントエンコーダを凍結することで堅牢な検索を可能にし、クエリエンコーダはノイズの多いクエリを修正されていないルートに整列させる。
MSMARCO、Natural Questions、Trivia QAパス検索のCAPOTノイズ変動を評価し、CAPOTがオーバーヘッドを伴わないデータ増大に類似した影響があることを発見した。
論文 参考訳(メタデータ) (2023-04-06T22:16:53Z) - TEMPERA: Test-Time Prompting via Reinforcement Learning [57.48657629588436]
強化学習(TEMPERA)を用いたテスト時間プロンプト編集を提案する。
従来のプロンプト生成手法とは対照的に、TEMPERAは事前知識を効率的に活用することができる。
本手法は従来の微調整法と比較して試料効率の平均改善率を5.33倍に向上させる。
論文 参考訳(メタデータ) (2022-11-21T22:38:20Z) - Exploring Sequence-to-Sequence Transformer-Transducer Models for Keyword
Spotting [15.61189030504559]
本稿では,文字列スポッティング(KWS)タスクにシーケンス・ツー・シーケンス変換器・トランスデューサASRシステムを適用するための新しい手法を提案する。
そこで本研究では,テキスト書き起こし中のキーワードを特別なトークンkw>に置き換え,音声ストリーム中のkw>トークンを検出する訓練を行う。
我々のアプローチは、ASRベースのKWSシステムよりも大幅に優れています。
論文 参考訳(メタデータ) (2022-11-11T20:41:46Z) - Short-Term Word-Learning in a Dynamically Changing Environment [63.025297637716534]
本稿では、単語/フレーズメモリと、このメモリにアクセスして単語やフレーズを正しく認識するためのメカニズムを用いて、エンドツーエンドのASRシステムを補完する方法を示す。
誤報がわずかに増加しただけで, 単語の検出速度が大幅に向上した。
論文 参考訳(メタデータ) (2022-03-29T10:05:39Z) - Deep Keyphrase Completion [59.0413813332449]
Keyphraseは、非常にコンパクトで簡潔で、意味に満ちた文書内容の正確な情報を提供し、談話理解、組織化、テキスト検索に広く利用されている。
本論文では,文書内容と既知のキーフレーズの数が極めて限られているため,テキストキーフレーズの完全化(KPC)を提案し,文書中のキーフレーズをより多く生成する(科学出版など)。
深層学習フレームワークを通じて、既知のキーフレーズとともに文書内容の深い意味的意味を捉えようとすることから、textitdeep keyphrase completion (DKPC) と命名する。
論文 参考訳(メタデータ) (2021-10-29T07:15:35Z) - Small-Footprint Open-Vocabulary Keyword Spotting with Quantized LSTM
Networks [3.8382752162527933]
本稿では,オープン語彙のキーワードスポッティング手法に着目し,モデル全体を再トレーニングすることなく,ユーザが独自のキーワードを定義できるようにする。
ユーザ定義キーワードの任意のセットに対して,小さなデバイス上で動作可能な高速かつ小型のフットプリントシステムを実現するための,さまざまな設計選択について説明する。
論文 参考訳(メタデータ) (2020-02-25T13:27:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。