論文の概要: A Common Measure of Communication for Speech Brain-Computer Interfaces
- arxiv url: http://arxiv.org/abs/2609.02887v1
- Date: Wed, 02 Sep 2026 17:59:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.488306
- Title: A Common Measure of Communication for Speech Brain-Computer Interfaces
- Title(参考訳): 音声脳-コンピュータインタフェースにおけるコミュニケーションの共通測度
- Authors: Dulhan Jayalath, Benjamin Ballyk, Oiwi Parker Jones,
- Abstract要約: 音声脳-コンピュータインタフェース(音声BCI)は、神経活動を言語に翻訳する。
この約束にもかかわらず、システムは異なるデータセット、記録方法、音声の種類、語彙を使用するため、フィールドは共通の進歩の尺度を欠いている。
i) 音声BCIがユーザのコミュニケーションを可能とすべき単語の分布と,(ii) この分布から得られる情報がシステムにどの程度伝達できるか,という2つの未解決問題に対処する。
我々は、通常報告される精度、単語誤り率(WER)、その他のメトリクスが、システムがサポートしている単語でのみ計算されることを示す。
- 参考スコア(独自算出の注目度): 1.826714999578514
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Speech brain-computer interfaces (speech BCIs) translate neural activity into language, offering a path towards restoring speech for people with paralysis and, more broadly, enabling new forms of natural human-computer interaction. Despite this promise, the field lacks a common measure of progress because systems use different datasets, recording methods, types of speech, and vocabularies, so their reported scores are rarely comparable. Underlying this measurement problem are two unresolved questions: (i) what distribution of words should a speech BCI enable a user to communicate, and (ii) how much information from this distribution can a system convey. We address both by deriving open-vocabulary mutual information (OVMI), an information-theoretic quantity that measures the information conveyed by a decoder relative to a reference distribution over the words a user may wish to communicate. This allows capabilities measured under different conditions, such as distinct vocabularies, to be evaluated on a common communication scale. We show that ordinarily reported accuracy, word error rate (WER), and other metrics computed only over the words a system supports can overstate how much of a user's intended speech the system can communicate. We then use OVMI to compare existing systems, expose trade-offs between how much of the user's language a system supports and how accurately it decodes those words, show that these comparisons depend on what the user is expected to communicate, and demonstrate that selecting a vocabulary to maximise OVMI yields up to 16.3% relative improvement in accuracy across three speech domains. OVMI therefore provides the speech BCI community with a principled way to compare heterogeneous systems, improve vocabulary design, and measure progress in the field.
- Abstract(参考訳): 音声脳とコンピュータのインターフェイス(音声BCI)は、神経活動を言語に翻訳し、麻痺のある人々のためのスピーチの回復への道を提供する。
この約束にもかかわらず、システムは異なるデータセット、記録方法、音声の種類、語彙を使用するため、フィールドは共通の進歩の尺度を欠いているため、報告されたスコアは滅多に比較されない。
この測定問題の根底には、未解決の2つの疑問がある。
一 音声BCIにより、利用者がコミュニケーションできる単語の分布、及び
(ii) この分布から得られる情報がシステムにどの程度伝達できるか。
オープン語彙相互情報(OVMI)は,ユーザが通信したいと思う単語の参照分布に対してデコーダが伝達する情報を測定する情報理論量である。
これにより、異なる語彙などの異なる条件下で測定される能力は、共通のコミュニケーションスケールで評価できる。
我々は,通常報告される精度,単語誤り率(WER),その他の指標が,システムが提供する単語にのみ計算されることを示す。
次に、OVMIを用いて既存のシステムを比較し、システムがサポートしているユーザの言語と、それらの単語をどの程度正確にデコードするかのトレードオフを公開し、これらの比較がユーザの期待する通信内容に依存していることを示し、OVMIを最大化するための語彙の選択が3つの音声領域で最大16.3%の精度向上をもたらすことを示す。
したがって、OVMIは言語BCIコミュニティに、異種システムを比較し、語彙設計を改善し、分野の進歩を測定するための原則化された方法を提供する。
関連論文リスト
- MUSCAT: MUltilingual, SCientific ConversATion Benchmark [60.87925076316812]
多言語音声技術の目標は、異なる言語を話す個人間のシームレスなコミュニケーションを容易にすることである。
この経験を生み出すためには、音声技術は、混合多言語入力、特定の語彙、コードスイッチングといったいくつかの課題に対処する必要がある。
本稿では,これらの課題に対処できるかどうかを問う,現在の音声認識(ASR)システムを評価するための新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2026-04-17T10:39:01Z) - Plug-and-Play Multilingual Few-shot Spoken Words Recognition [3.591566487849146]
マルチ言語・プラグイン・アンド・プレイ型キーワードスポッティングシステムであるPLiXを提案する。
私たちの数秒のディープモデルは、20言語にまたがる数百万の1秒のオーディオクリップで学習されています。
PLiX は,1つのサポート例に限らず,新規な音声単語に一般化可能であることを示す。
論文 参考訳(メタデータ) (2023-05-03T18:58:14Z) - Cognitive Semantic Communication Systems Driven by Knowledge Graph:
Principle, Implementation, and Performance Evaluation [74.38561925376996]
単一ユーザと複数ユーザのコミュニケーションシナリオに対して,認知意味コミュニケーションフレームワークが2つ提案されている。
知識グラフから推論規則をマイニングすることにより,効果的な意味補正アルゴリズムを提案する。
マルチユーザ認知型セマンティックコミュニケーションシステムにおいて,異なるユーザのメッセージを識別するために,メッセージ復元アルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-03-15T12:01:43Z) - Speech Aware Dialog System Technology Challenge (DSTC11) [12.841429336655736]
タスク指向ダイアログモデリングのほとんどの研究は、テキスト入力に基づいている。
TTS-Verbatim: テキスト入力をTTSシステムを用いて音声波形に変換し, (b) ヒューマン・ヴァーバティム: ユーザ入力を動詞入力, (c) ヒューマン・パラフレーズ化: ユーザ入力をパラフレーズ化した。
論文 参考訳(メタデータ) (2022-12-16T20:30:33Z) - Language-agnostic Code-Switching in Sequence-To-Sequence Speech
Recognition [62.997667081978825]
コードスイッチング(Code-Switching, CS)とは、異なる言語の単語やフレーズを交互に使用する現象である。
本稿では,異なるソース言語の音声および対応するラベルを転写する,シンプルで効果的なデータ拡張手法を提案する。
さらに,5,03%のWERによるトレーニング中に見つからない文間言語スイッチにおいて,モデルの性能を向上できることを示す。
論文 参考訳(メタデータ) (2022-10-17T12:15:57Z) - Attentive Contextual Carryover for Multi-Turn End-to-End Spoken Language
Understanding [14.157311972146692]
本稿では,先行発話と対話動作を符号化したマルチヘッドアテンション機構を用いた文脈的E2E SLUモデルアーキテクチャを提案する。
本手法は,平均単語と意味的誤り率をそれぞれ10.8%,12.6%削減する。
論文 参考訳(メタデータ) (2021-12-13T15:49:36Z) - VQMIVC: Vector Quantization and Mutual Information-Based Unsupervised
Speech Representation Disentanglement for One-shot Voice Conversion [54.29557210925752]
ワンショット音声変換は、音声表現のアンタングルメントによって効果的に実現できる。
コンテンツエンコーディングにはベクトル量子化(VQ)を使用し、トレーニング中に相互情報(MI)を相関指標として導入する。
実験結果は,提案手法が効果的に非絡み合った音声表現を学習する際の優位性を反映している。
論文 参考訳(メタデータ) (2021-06-18T13:50:38Z) - An Adversarial Learning based Multi-Step Spoken Language Understanding
System through Human-Computer Interaction [70.25183730482915]
対戦型学習に基づく多段階音声言語理解システムを提案する。
我々は,F1の観点で解析性能を少なくとも2.5%向上させることを実証した。
論文 参考訳(メタデータ) (2021-06-06T03:46:53Z) - Dynamic Acoustic Unit Augmentation With BPE-Dropout for Low-Resource
End-to-End Speech Recognition [62.94773371761236]
我々は、OOVレートの高い低リソースセットアップで効果的なエンドツーエンドASRシステムを構築することを検討します。
本稿では,BPE-dropout法に基づく動的音響ユニット拡張法を提案する。
我々の単言語トルココンフォーマーは22.2%の文字誤り率(CER)と38.9%の単語誤り率(WER)の競争結果を確立した。
論文 参考訳(メタデータ) (2021-03-12T10:10:13Z) - Evaluating the reliability of acoustic speech embeddings [10.5754802112615]
音声埋め込みは可変長音声列の定サイズ音響表現である。
ここでは,ABX識別と平均精度 (MAP) という2つの一般的な指標を,17の埋め込み手法にまたがる5つの言語で体系的に比較する。
ABXとMAPは相互に相関し,周波数推定を行う。
論文 参考訳(メタデータ) (2020-07-27T13:24:09Z) - Fast and Robust Unsupervised Contextual Biasing for Speech Recognition [16.557586847398778]
明示的な文脈言語モデルを必要としない代替手法を提案する。
学習コーパスからシステム語彙の各単語に対するバイアススコアを導出する。
関連するコンテキストが利用できる場合,認識精度が大幅に向上することを示す。
論文 参考訳(メタデータ) (2020-05-04T17:29:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。