論文の概要: Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval
- arxiv url: http://arxiv.org/abs/2608.01481v1
- Date: Sun, 02 Aug 2026 20:28:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.254849
- Title: Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval
- Title(参考訳): 知覚音声の解釈可能なMEGデコード:皮質音源と検索を駆動する刺激特徴
- Abstract要約: 知覚音声の短いセグメントは、CLIPスタイルのターゲットで訓練されたディープネットワークによる非侵襲脳磁図(MEG)記録から、wav2vec 2.0オーディオ埋め込みに対して検索することができる。
高性能なMEG-to-audio検索アーキテクチャを構築するが、フロントエンドとデコーダの両方を再設計する。
被験者固有の表現を270から25の枝に減らし、各枝に時間フィルタを加えて空間と時間でニューロンソースにマッチさせ、畳み込みデコーダをより浅くする。
MEG-MASCでは、モデルは39.75 +/- 0.34%のTop-1精度に達する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Short segments of perceived speech can be retrieved from non-invasive magnetoencephalographic (MEG) recordings by deep networks trained with a CLIP-style objective against wav2vec 2.0 audio embeddings. Yet their weights do not map onto electrophysiological quantities, and it remains unclear which speech properties drive retrieval. We build on a high-performing MEG-to-audio retrieval architecture but redesign both its front end and decoder. Its spatial attention operates on a flattened sensor layout; we replace it with spherical harmonics defined on the three-dimensional MEG helmet geometry. We reduce the subject-specific representation from 270 to 25 branches, add a temporal filter to each branch to match it to a neuronal source in space and time, and make the convolutional decoder shallower. Ocular and cardiac components are removed before training to reduce the risk of stimulus-locked shortcuts. On MEG-MASC, the model reaches 39.75 +/- 0.34% Top-1 accuracy among 1005 candidates across six trained solutions, with about 20 times fewer decoder parameters. Its weights map to source space, recovering generators consistent with the speech-perception network, while left-lateralized branches carry higher-frequency rhythmic components not evident on the right. Paired MEG occlusion shows that 15 of 19 stimulus features contribute, with the largest effects for silence, sound intensity, vowels, and acoustic onsets. Random word lists behave oppositely: substituting narrative MEG into them improves retrieval, indicating that activity without narrative structure carries less recoverable information than activity during coherent speech. The wav2vec target can be reduced to about twelve learned feature dimensions without loss of accuracy, whereas strong temporal compression causes a clear loss. Together, source mapping and input interventions reveal what drives retrieval.
- Abstract(参考訳): 知覚音声の短いセグメントは、CLIPスタイルのターゲットで訓練されたディープネットワークによる非侵襲脳磁図(MEG)記録から、wav2vec 2.0オーディオ埋め込みに対して検索することができる。
しかし、それらの重みは電気生理学的量にマッピングされず、どの音声特性が検索を駆動するかは定かではない。
高性能なMEG-to-audio検索アーキテクチャを構築するが、フロントエンドとデコーダの両方を再設計する。
空間的注意は平らなセンサー配置で動作し、3次元のMEGヘルメット形状に定義された球面調和に置き換える。
被験者固有の表現を270から25の枝に減らし、各枝に時間フィルタを加えて空間的・時間的にニューロン源と一致させ、畳み込みデコーダをより浅くする。
刺激同期ショートカットのリスクを軽減するため、訓練前に眼と心臓の成分を除去する。
MEG-MASCでは、トレーニングされた6つのソリューションにまたがる1005の候補のうち、39.75 +/- 0.34%のTop-1精度に達し、デコーダパラメータの約20倍も少ない。
重みはソース空間にマッピングされ、音声知覚ネットワークと整合したジェネレータを復元する。
ペアMEGの閉塞は、19の刺激の特徴のうち15が寄与し、最も大きな効果は、沈黙、音の強さ、母音、音響的オンセットである。
物語のMEGを置換することで検索が改善し、物語構造を持たない活動がコヒーレントスピーチ中の活動よりも回復可能な情報を伝達しないことを示す。
wav2vecターゲットは精度を損なうことなく、学習した特徴次元を約12に減らすことができるが、強い時間圧縮は明らかな損失を引き起こす。
ソースマッピングと入力の介入によって、検索を駆動するものが明らかになる。
関連論文リスト
- Arti-JEPA: Adapting Video World Model to Real-Time MRI of the Vocal Tract for Speech-Production Analysis [37.674716609612325]
リアルタイムMRI (Real-time MRI) は音声中の声道全体の動態を捉える。
本稿では,声道rtMRIをモデル化するための組込み予測アーキテクチャであるArti-JEPAを紹介する。
論文 参考訳(メタデータ) (2026-09-09T05:58:40Z) - SIREM: Speech-Informed MRI Reconstruction with Learned Sampling [5.140545130871631]
音声生成のリアルタイム磁気共鳴画像(rtMRI)は、動的声道運動の非侵襲的な可視化を可能にする。
そこで本研究では,SIREMという音声インフォームドMRI再構成フレームワークを提案する。
我々は,USC音声rtMRIベンチマークにおけるSIREMを,グリッド化,ウェーブレットベース圧縮センシング,全変動を含む標準ベースラインに対して評価した。
論文 参考訳(メタデータ) (2026-05-18T11:05:10Z) - Zero-Shot Imagined Speech Decoding via Imagined-to-Listened MEG Mapping [0.0]
非侵襲的な脳記録から想像された音声を復号することは困難である。
本稿では,音声聴取時に,よりリッチで信頼性の高いラベル付き録音を活用する,想像音声の復号化のための新しい手法を提案する。
論文 参考訳(メタデータ) (2026-05-08T17:56:19Z) - Affect Decoding in Phonated and Silent Speech Production from Surface EMG [87.23336551848297]
EMGなどの調音筋活動の計測は、音声音声分析とともに感情によって発声がどのように変調されるかを明らかにすることができる。
そこで本研究では,12人の被験者から3つのタスクにまたがる2,780の発話からなるデータセットを導入し,オブジェクト内およびオブジェクト間デコーディングの評価を行った。
以上の結果から,EMG表現は最大0.845AUCのフラストレーションを確実に識別し,調音モード全体にわたってよく一般化することがわかった。
論文 参考訳(メタデータ) (2026-03-12T09:22:02Z) - MEGState: Phoneme Decoding from Magnetoencephalography Signals [15.480040965084214]
本稿では,MEG信号からの音素デコードのための新しいアーキテクチャであるMEGStateを紹介する。
MeGStateは聴覚刺激によって誘発されるきめ細かい皮質反応を捉える。
これらの知見は,MEGをベースとした音素デコーディングが,非侵襲的音声脳-コンピュータインタフェースへのスケーラブルな経路としての可能性を強調した。
論文 参考訳(メタデータ) (2025-12-19T13:02:31Z) - Neural Decoding of Overt Speech from ECoG Using Vision Transformers and Contrastive Representation Learning [1.58476321728042]
Speech Brain Computer Interfacesは、重度の麻痺を抱える人々に対して、コミュニケーションができない有望なソリューションを提供する。
近年の研究では、表面電図(ECoG)や皮質内記録からの理解不能音声の再構築が実証されている。
本稿では,エンコーダ-デコーダディープニューラルアーキテクチャに基づいて,視覚変換器とコントラスト学習を統合したオフライン音声復号パイプラインを提案する。
論文 参考訳(メタデータ) (2025-12-04T09:47:15Z) - DecoFuse: Decomposing and Fusing the "What", "Where", and "How" for Brain-Inspired fMRI-to-Video Decoding [82.91021399231184]
既存のfMRI-to-video法は、しばしば空間情報や動き情報を見下ろしながら意味的内容に焦点を当てる。
そこで我々は,fMRI信号から映像をデコードするための,脳にインスパイアされた新しいフレームワークであるDecoFuseを提案する。
まず、ビデオはセマンティック、空間、動きの3つのコンポーネントに分解し、次に各コンポーネントを別々にデコードしてから、ビデオを再構成する。
論文 参考訳(メタデータ) (2025-04-01T05:28:37Z) - UNIT-DSR: Dysarthric Speech Reconstruction System Using Speech Unit
Normalization [60.43992089087448]
変形性音声再構成システムは、変形性音声を正常な音声に変換することを目的としている。
本稿では,HuBERTのドメイン適応能力を活用して学習効率を向上させるユニットDSRシステムを提案する。
NEDアプローチと比較すると、ユニットDSRシステムは音声単位正規化器とユニットHiFi-GANボコーダのみで構成されている。
論文 参考訳(メタデータ) (2024-01-26T06:08:47Z) - High Fidelity Neural Audio Compression [92.4812002532009]
我々は、ニューラルネットワークを利用した最先端のリアルタイム、高忠実、オーディオを導入する。
ストリーミングエンコーダ-デコーダアーキテクチャと、エンドツーエンドでトレーニングされた量子化潜在空間で構成されている。
単一マルチスケール・スペクトログラム・アドバイザリーを用いて、トレーニングを簡素化し、高速化する。
論文 参考訳(メタデータ) (2022-10-24T17:52:02Z) - Decoding speech perception from non-invasive brain recordings [48.46819575538446]
非侵襲的な記録から知覚音声の自己教師付き表現をデコードするために、コントラスト学習で訓練されたモデルを導入する。
我々のモデルでは、3秒のMEG信号から、1,000以上の異なる可能性から最大41%の精度で対応する音声セグメントを識別できる。
論文 参考訳(メタデータ) (2022-08-25T10:01:43Z) - End-to-End Binaural Speech Synthesis [71.1869877389535]
本稿では,低ビットレート音声システムと強力なデコーダを組み合わせたエンドツーエンド音声合成システムを提案する。
実感的な聴覚シーンを作るために必要な環境効果を捉える上で, 対人的損失がもたらす効果を実証する。
論文 参考訳(メタデータ) (2022-07-08T05:18:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。