論文の概要: Joint Text-Audio Alignment for EEG-to-Text Decoding in Chinese Speech Production and Perception
- arxiv url: http://arxiv.org/abs/2607.25626v1
- Date: Tue, 28 Jul 2026 12:06:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.821227
- Title: Joint Text-Audio Alignment for EEG-to-Text Decoding in Chinese Speech Production and Perception
- Title(参考訳): 中国語音声生成と知覚における脳波とテキストの復号のための共同テキスト・オーディオアライメント
- Abstract要約: 脳波は心電図より安全で、より広く展開できる。
この課題は、数千文字の高次元出力空間を処理しなければならない中国語の文の復号化において、さらに悪化している。
既存の方法は単一の監督軸にコミットするが、文レベルの識別性の要求を同時に満たすことはできない。
本稿では,脳波を2つの軸に整合させる新しいパラメータ効率フレームワークであるEEGAlignを紹介する。
- 参考スコア(独自算出の注目度): 18.265569655784116
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Decoding speech information directly from scalp electroencephalography (EEG) into text provides a potential non-invasive neural communication pathway for individuals with severe speech and motor impairments. Compared with invasive approaches such as electrocorticography, EEG is safer and more widely deployable, yet substantially more challenging to decode.This challenge is exacerbated for Chinese sentence decoding, which must handle a high-dimensional output space with thousands of characters, severe inter-subject variability, and low signal-to-noise ratios for text alignment.Existing methods commit to a single supervisory axis---either text semantics or audio acoustic features---yet neither can simultaneously satisfy the demands of sentence-level discriminability and fine-grained temporal resolution required for large-vocabulary Chinese decoding. We introduce EEGAlign, a novel parameter-efficient framework that jointly aligns EEG with two axes---text alignment with BGE-M3 text embeddings and audio alignment with wav2vec~2.0 speech features via contrastive learning followed by CTC character-sequence decoding. On ChineseEEG-2 data, EEGAlign yields state-of-the-art closed-set sentence classification performance, reaching up to 82.37% Top-1 accuracy on Reading Aloud EEG and 41.43% on Passive Listening EEG out of 101 candidates. Ablation studies show that the two alignment axes are highly complementary: combining them yields consistently better performance than either alone. To the best of our knowledge, this is the first study on decoding large-vocabulary Chinese sentences from non-invasive EEG during overt speech production, and achieving strong classification performance with relatively large closed-set candidate-sentence setting.
- Abstract(参考訳): 頭皮脳波(EEG)から直接テキストに音声情報をデコードすることで、重度の言語障害と運動障害を持つ個人に対して、潜在的に非侵襲的な神経伝達経路を提供する。
電子コルチコグラフィーなどの侵襲的アプローチと比較して、EEGはより安全で、より広くデプロイ可能であるが、復号化が困難である。この課題は、数千文字の高次元出力空間、重度物体間変動、テキストアライメントのための低信号対雑音比を処理しなければならない中国語の文復号において、さらに悪化している。
EEGAlignは,BGE-M3テキストの埋め込みとwav2vec~2.0音声特徴とのテキストアライメントと,CTC文字列デコードによるコントラスト学習による音声アライメントという,脳波と2つの軸を協調的にアライメントする新しいパラメータ効率フレームワークである。
中国EEG-2のデータでは、EEGAlignは最先端のクローズドセットの文分類性能を示し、101候補のうち82.37%が読解脳波、41.43%が受聴脳波である。
アブレーション研究により、2つのアライメント軸は極めて相補的であることが示されている。
本研究は,大語彙中国語文を非侵襲的脳波から非侵襲的にデコードし,比較的大きなクローズドセット候補文設定で強い分類性能を達成するための最初の研究である。
関連論文リスト
- Brain-CLIPLM: Decoding Compressed Semantic Representations in EEG for Language Reconstruction [20.162170862752813]
コントラスト学習と文再構成により,脳波からテキストへのデコーディングを意味的アンカー抽出に分解するフレームワークを提案する。
Brain-CLIPLMは、67.55%のトップ5と85.00%のトップ25の文章検索精度を達成し、直接デコードベースラインを著しく上回っている。
脳波からテキストへのデコーディングは、全文を再構築するよりも、圧縮されたセマンティックコンテンツを復元する方がよいことが示唆された。
論文 参考訳(メタデータ) (2026-03-23T11:45:51Z) - SENSE: Efficient EEG-to-Text via Privacy-Preserving Semantic Retrieval [6.012652594597545]
脳活動を自然言語にデコードすることは、補助コミュニケーション、ニューロテクノロジー、人間とコンピュータの相互作用に重要な応用を持つAIにおける大きな課題である。
既存のBrain-Computer Interface (BCI) のアプローチは、Large Language Models (LLM) やエンコーダ-デコーダモデルのメモリ集約的な微調整に依存している。
我々は,非侵襲脳波(EEG)をLLM微調整なしでテキストに変換する軽量でプライバシー保護のフレームワークであるSENSEを紹介する。
論文 参考訳(メタデータ) (2026-03-17T19:59:41Z) - EEG2TEXT-CN: An Exploratory Study of Open-Vocabulary Chinese Text-EEG Alignment via Large Language Model and Contrastive Learning on ChineseEEG [0.0]
中国語に適した新しいオープン語彙EEG-to-text生成フレームワークを提案する。
脳波エンコーダ(NICE-EEG)と小型事前学習言語モデル(MiniLM)に基づいて構築され,脳信号と自然言語表現を協調する。
1500以上のトレーニング検証文と300件の保持試験サンプルによる評価は、最高のBLEU-1スコアが6.38%である、有望な語彙的アライメントを示している。
この研究は、多言語脳-テキスト研究における新たな方向性を開き、中国における未来の認知言語インターフェースの基礎を築いた。
論文 参考訳(メタデータ) (2025-06-01T06:26:32Z) - Enhancing Listened Speech Decoding from EEG via Parallel Phoneme Sequence Prediction [36.38186261968484]
本稿では脳波(EEG)信号から聴取音声の復号化を促進する新しい手法を提案する。
テキスト音素列を同時に復号する補助音素予測器を用いる。
論文 参考訳(メタデータ) (2025-01-08T21:11:35Z) - BrainECHO: Semantic Brain Signal Decoding through Vector-Quantized Spectrogram Reconstruction for Whisper-Enhanced Text Generation [48.20672677492805]
現在のEEG/MEG-to-textデコーディングシステムには3つの重要な制限がある。
BrainECHOは、分離された表現学習を利用する多段階フレームワークである。
BrainECHOは文、セッション、主題に依存しない条件をまたいだ堅牢性を示す。
論文 参考訳(メタデータ) (2024-10-19T04:29:03Z) - SEE: Semantically Aligned EEG-to-Text Translation [5.460650382586978]
神経生理学的信号を言語に復号することは、脳-コンピュータインターフェース(BCI)の応用において非常に興味深い研究である。
現在のEEG-to-Textデコーディングアプローチは、EEGレコードと生テキストの間に大きなドメインギャップがあるため、課題に直面している。
本稿では,脳波からテキストへのデコードを改善するための新しい手法であるセマンティック・アラインドEEG-to-Text Translationを提案する。
論文 参考訳(メタデータ) (2024-09-14T05:37:15Z) - Enhancing EEG-to-Text Decoding through Transferable Representations from Pre-trained Contrastive EEG-Text Masked Autoencoder [69.7813498468116]
コントラスト型脳波テキストマスケード自動エンコーダ(CET-MAE)を提案する。
また、E2T-PTR(Pretrained Transferable Representationsを用いたEEG-to-Text decoding)と呼ばれるフレームワークを開発し、EEGシーケンスからテキストをデコードする。
論文 参考訳(メタデータ) (2024-02-27T11:45:21Z) - Code-Switching Text Generation and Injection in Mandarin-English ASR [57.57570417273262]
業界で広く使われているストリーミングモデルTransformer-Transducer(T-T)の性能向上のためのテキスト生成とインジェクションについて検討する。
まず、コードスイッチングテキストデータを生成し、テキスト-to-Speech(TTS)変換または暗黙的に音声とテキストの潜在空間を結び付けることによって、T-Tモデルに生成されたテキストを明示的に注入する戦略を提案する。
実際のマンダリン・イングリッシュ音声の1,800時間を含むデータセットを用いて訓練したT-Tモデルの実験結果から,生成したコードスイッチングテキストを注入する手法により,T-Tモデルの性能が著しく向上することが示された。
論文 参考訳(メタデータ) (2023-03-20T09:13:27Z) - Exploiting Cross-domain And Cross-Lingual Ultrasound Tongue Imaging
Features For Elderly And Dysarthric Speech Recognition [55.25565305101314]
調音機能は音響信号歪みに不変であり、音声認識システムにうまく組み込まれている。
本稿では,A2Aモデルにおける24時間TaLコーパスの並列音声・超音波舌画像(UTI)データを利用したクロスドメインおよびクロスランガルA2Aインバージョン手法を提案する。
生成した調音機能を組み込んだ3つのタスクの実験は、ベースラインのTDNNとコンフォーマーASRシステムより一貫して優れていた。
論文 参考訳(メタデータ) (2022-06-15T07:20:28Z) - TranSpeech: Speech-to-Speech Translation With Bilateral Perturbation [61.564874831498145]
TranSpeechは、両側摂動を伴う音声から音声への翻訳モデルである。
我々は,非自己回帰S2ST手法を構築し,繰り返しマスキングを行い,単位選択を予測する。
TranSpeechは推論遅延を大幅に改善し、自動回帰技術よりも最大21.4倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2022-05-25T06:34:14Z) - Speaker Embedding-aware Neural Diarization: a Novel Framework for
Overlapped Speech Diarization in the Meeting Scenario [51.5031673695118]
重なり合う音声のダイアリゼーションを単一ラベル予測問題として再構成する。
話者埋め込み認識型ニューラルダイアリゼーション(SEND)システムを提案する。
論文 参考訳(メタデータ) (2022-03-18T06:40:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。