論文の概要: GIVE-KWS: Gated Injection of Visual Evidence for Noise-Robust Query-by-Example Keyword Spotting
- arxiv url: http://arxiv.org/abs/2610.07046v1
- Date: Mon, 05 Oct 2026 02:00:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.532869
- Title: GIVE-KWS: Gated Injection of Visual Evidence for Noise-Robust Query-by-Example Keyword Spotting
- Title(参考訳): GIVE-KWS: ノイズ・ロバストなクエリ・バイ・例キーワードスポッティングのための視覚的エビデンス注入
- Abstract要約: タスク訓練されたビジュアルエンコーダを持つシステムは,テキスト・アンド・オーディオシステムの2ポイント以内の誤り率(EER)が10dBであることがわかった。
視覚的ロバスト性は、音素を含む視覚表現と、音声特徴の再スケーリングよりも視覚的エビデンスを注入する融合の2つの相互作用条件に依存することを示す。
- 参考スコア(独自算出の注目度): 12.284378420490945
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual speech promises noise-robust keyword spotting, yet a visual stream is not necessarily used. On a tri-modal query-by-example keyword spotting (QbyE-KWS) benchmark, we find that a system with a task-trained visual encoder comes within 2 percentage points of a text-and-audio system in equal error rate (EER) at -10 dB, and link this gap to the encoder's lack of phonemic information. We present GIVE-KWS, whose fusion stage, GIVE (Gated Injection of Visual Evidence), conditions query audio on lip motion through gated cross-attention. We show that visual robustness depends on two interacting conditions: a phoneme-bearing visual representation, and fusion that injects visual evidence rather than rescaling audio features. Under a phoneme-bearing encoder, injection yields an effective SNR gain of 4.0-9.3 dB over masking at -10 dB, whereas under a phoneme-poor one it nearly vanishes. Relative to the benchmark system, GIVE-KWS reduces unseen-keyword EER by 72.9% at -10 dB and 62.8% on average.
- Abstract(参考訳): ビジュアル音声はノイズロスのキーワードスポッティングを約束するが、ビジュアルストリームは必ずしも使用されない。
QbyE-KWS(Tri-modal query-by-example keyword spotting)ベンチマークでは、タスク学習された視覚エンコーダを持つシステムは、EER(Equal error rate)が10dBのテキスト・アンド・オーディオシステムの2ポイント以内に到達し、このギャップをエンコーダの音韻情報の欠如にリンクする。
本稿では,GIVE(Gated Injection of Visual Evidence)の融合段階であるGIVE-KWSについて述べる。
視覚的ロバスト性は、音素を含む視覚表現と、音声特徴の再スケーリングよりも視覚的エビデンスを注入する融合の2つの相互作用条件に依存することを示す。
音素を含むエンコーダの下では、インジェクションは10dBのマスキングで4.0-9.3dBの有効SNRゲインを得る。
ベンチマークシステムとは対照的に、GIVE-KWSは未確認キーワードEERを平均で10dBで72.9%、62.8%削減する。
関連論文リスト
- SAVE: Speech-Aware Video Representation Learning for Video-Text Retrieval [10.609554607916914]
本稿では,音声認識ビデオrEpresentation Learning法であるSAVEを提案する。
SOTAオーディオヴィジュアル手法であるAVIGATEを改良し、より効果的な音声埋め込みのための専用の音声ブランチを提供する。
実験の結果、SAVEはSOTAと良好に比較し、AVIGATEをMSRVTT-9kで+4.1%、MSRVTT-7kで+1.9%、VATEXで+2.5%、カレードで+9.8%、LSMDCで+2.1%と上回った。
論文 参考訳(メタデータ) (2026-03-09T10:54:10Z) - DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos [4.452513686760606]
マルチモーダル大言語モデル(MLLM)の内部連鎖(CoT)を利用したビデオから音声を生成するフレームワークを提案する。
対応するマルチモーダル推論データセットを構築し、音声生成における初期推論の学習を容易にする。
実験では,提案手法が生成した音声の不一致(発声)の低減に有効であることを示す。
論文 参考訳(メタデータ) (2025-03-28T07:56:19Z) - Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer [59.57249127943914]
本稿では,複数の改良を加えた多言語音声認識モデルを提案する。
我々は、6つの異なる言語に対する音声視覚訓練データの量を増やし、重複しない多言語データセットの自動書き起こしを生成する。
提案モデルでは, LRS3データセット上での新たな最先端性能を実現し, WERは0.8%に達した。
論文 参考訳(メタデータ) (2024-03-14T01:16:32Z) - Jointly Learning Visual and Auditory Speech Representations from Raw
Data [108.68531445641769]
RAVEnは視覚と聴覚の表現を協調的に学習する自己教師型マルチモーダルアプローチである。
我々の設計は、ビデオとオーディオの固有の違いによって駆動される非対称なw.r.t.である。
RAVEnは視覚音声認識における全自己指導手法を超越している。
論文 参考訳(メタデータ) (2022-12-12T21:04:06Z) - SuperVoice: Text-Independent Speaker Verification Using Ultrasound
Energy in Human Speech [10.354590276508283]
ボイスアクティベートシステムは、さまざまなデスクトップ、モバイル、IoT(Internet-of-Things)デバイスに統合されている。
既存の話者検証技術は、音声コマンドの可聴周波数範囲から抽出した分光学的特徴により、個々の話者を識別する。
本稿では,特徴融合機構を備えた2ストリームアーキテクチャを用いた話者検証システム SUPERVOICE を提案する。
論文 参考訳(メタデータ) (2022-05-28T18:00:50Z) - Wav2vec-Switch: Contrastive Learning from Original-noisy Speech Pairs
for Robust Speech Recognition [52.71604809100364]
音声の文脈化表現に雑音のロバスト性をエンコードするwav2vec-Switchを提案する。
具体的には、オリジナルノイズの多い音声ペアを同時にwav2vec 2.0ネットワークに供給する。
既存のコントラスト学習タスクに加えて、原音声と雑音音声の量子化表現を追加の予測対象に切り替える。
論文 参考訳(メタデータ) (2021-10-11T00:08:48Z) - Speech Enhancement for Wake-Up-Word detection in Voice Assistants [60.103753056973815]
キースポッティング、特にWake-Up-Word(WUW)検出は音声アシスタントにとって非常に重要なタスクである。
本稿では,WUW検出に適応した音声強調モデルを提案する。
これらのノイズの存在下で、認識率を高め、誤報を減らすことを目的としている。
論文 参考訳(メタデータ) (2021-01-29T18:44:05Z) - Characterizing Speech Adversarial Examples Using Self-Attention U-Net
Enhancement [102.48582597586233]
本稿では,U-Net$_At$という,U-Netに基づくアテンションモデルを提案する。
対戦型音声アタックを用いた自動音声認識(ASR)タスクの実験を行った。
論文 参考訳(メタデータ) (2020-03-31T02:16:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。