論文の概要: HearInContext: A Benchmark for Implicit Context in Speech Recognition
- arxiv url: http://arxiv.org/abs/2609.18680v2
- Date: Mon, 21 Sep 2026 05:09:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.020506
- Title: HearInContext: A Benchmark for Implicit Context in Speech Recognition
- Title(参考訳): HearInContext: 音声認識における暗黙の文脈のベンチマーク
- Abstract要約: HearInContextは、異なる解釈をサポートするアシスタント応答と合成音声をペアリングする。
微調整されたQwen3-ASR-1.7Bは、暗黙のコンテキストターゲットリコールを、マンダリンとイングリッシュの両方で11.4ポイント改善する。
ゲインは、微調整から除外された明示的な条件や、実際の録音におけるマンダリンのホットワード認識にまで拡張される。
- 参考スコア(独自算出の注目度): 12.347653424855004
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Contextual ASR can benefit from semantic cues or from target words explicitly provided in the context. We introduce HearInContext, a Mandarin-English benchmark that pairs shared synthetic speech with assistant replies supporting different interpretations. The benchmark comprises 3,764 semantic test cases built around homophones. Implicit contexts exclude candidate words; explicit contexts name the target. No-context and unrelated-context controls measure the benefit of relevant history and sensitivity to irrelevant history. Context-capable models benefit from implicit cues but achieve higher target recall with explicit hints. Fine-tuning Qwen3-ASR-1.7B improves implicit-context target recall by 11.4 percentage points in both Mandarin and English, while absolute CER/WER changes on AISHELL-1 and LibriSpeech remain below 0.1 percentage points. Gains extend to explicit conditions excluded from fine-tuning and to Mandarin hotword recognition on real recordings. Code and data are available at https://github.com/OPPO-Mente-Lab/HearInContext
- Abstract(参考訳): 文脈的ASRは、意味的な手がかりや、コンテキストで明示的に提供されるターゲット語から恩恵を受けることができる。
HearInContextは、共有合成音声と、異なる解釈をサポートするアシスタント応答をペアリングするマンダリン英文ベンチマークである。
ベンチマークは、ホモフォンを中心に構築された3,764のセマンティックテストケースで構成されている。
暗黙のコンテキストは候補語を除外し、明示的なコンテキストはターゲットを命名する。
非コンテキストと無関係なコンテキスト制御は、関連する歴史と無関係な歴史に対する感受性の利点を測定する。
コンテキスト対応モデルは暗黙の手がかりの恩恵を受けるが、明示的なヒントでより高いターゲットリコールを達成する。
微調整されたQwen3-ASR-1.7Bは、暗黙のコンテキストターゲットリコールをマンダリンとイングリッシュの両方で11.4ポイント改善する一方、AISHELL-1とLibriSpeechの絶対CER/WER変更は0.1ポイント以下である。
ゲインは、微調整から除外された明示的な条件や、実際の録音におけるマンダリンのホットワード認識にまで拡張される。
コードとデータはhttps://github.com/OPPO-Mente-Lab/HearInContextで公開されている。
関連論文リスト
- INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval [53.79335341504602]
INSPIREは命令対応音声検索のための最初のベンチマークである。
我々は,大規模音声言語モデル,ケースドパイプライン,自己教師型音声モデル,コントラスト型音声言語モデルという4つの検索パラダイムを評価する。
論文 参考訳(メタデータ) (2026-08-17T07:35:18Z) - How to Recognize New Words: A Comparison Between Context Biasing Methods and Speech LLMs [61.601626186678146]
音声大言語モデル(LLM)に対するWhisperに基づく2つの文脈バイアス法の評価を行った。
文脈バイアス法は、WERのバイアスを最大88%削減し、他の単語はほとんど影響を受けなかった。
音声LLMは読み上げ音声に優れるが、非読み出し音声にはあまり適さないため、散発的数に敏感であり、語順を誘導する。
論文 参考訳(メタデータ) (2026-08-06T08:45:33Z) - Speak in Context: Multilingual ASR with Speech Context Alignment via Contrastive Learning [5.770962296305264]
多様な言語とアクセントをサポートするコンテキスト対応多言語ASRフレームワークを提案する。
提案手法は,フリーズした音声エンコーダと,軽量プロジェクションモジュールによるデコーダのみの言語モデルを組み合わせたものである。
文脈入力は認識品質を継続的に改善することを示す。
論文 参考訳(メタデータ) (2026-03-06T17:37:06Z) - AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering [97.52852990265136]
音声対応大規模言語モデルの推論機能を活用するバックボーン非依存評価フレームワークであるAQAScoreを紹介する。
AQAScoreは人格関連性、ペア比較、構成推論タスクを含む複数のベンチマークで評価する。
論文 参考訳(メタデータ) (2026-01-21T07:35:36Z) - Understanding Emotion in Discourse: Recognition Insights and Linguistic Patterns for Generation [0.36980845568339205]
認識のための10シード評価を併用した厳格なアブレーション試験を行った。
言語分析では,5,286件の談話マーカーを解析する。
感情とマーカー位置の有意な関連性を見いだす。
論文 参考訳(メタデータ) (2026-01-01T02:49:44Z) - DEBATE: A Dataset for Disentangling Textual Ambiguity in Mandarin Through Speech [11.79037119988533]
本稿では,中国独自の音声テキストデータセットであるDEBATEについて述べる。
10人の母語話者によって記録された1,001の丁寧に選択されたあいまいな発話を含んでいる。
我々は、機械と人間の発話意図の理解の間には、明確で大きなパフォーマンスギャップがあることを示す、最先端の3つの大規模音声および音声言語モデルをベンチマークする。
論文 参考訳(メタデータ) (2025-06-09T07:27:22Z) - Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR [74.38242498079627]
自己教師付き学習(SSL)に基づく離散音声表現は、非常にコンパクトで、ドメイン適応性が高い。
本稿では、Zipformer-Transducer ASRシステムにおいて、WavLMモデルから抽出したSSL離散音声特徴を追加の発話音響コンテキスト特徴として用いた。
論文 参考訳(メタデータ) (2024-09-13T13:01:09Z) - BLASER: A Text-Free Speech-to-Speech Translation Evaluation Metric [66.73705349465207]
エンドツーエンドの音声音声翻訳(S2ST)は、一般的にテキストベースのメトリクスで評価される。
本稿では,ASRシステムへの依存を回避するために,BLASERと呼ばれるエンドツーエンドS2STのテキストフリー評価指標を提案する。
論文 参考訳(メタデータ) (2022-12-16T14:00:26Z) - Evaluating context-invariance in unsupervised speech representations [15.67794428589585]
現在のベンチマークでは文脈不変性は測定されていない。
我々は文脈不変性を測定するZeroSpeech ABXベンチマークの新バージョンを開発する。
表現の文脈依存性は単語レベルの表現の安定性の予測であることを示す。
論文 参考訳(メタデータ) (2022-10-27T21:15:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。