論文の概要: Mechanistic Interpretability Reveals Shared Causal Subspaces in Brain-to-Speech Decoders
- arxiv url: http://arxiv.org/abs/2609.31992v1
- Date: Fri, 25 Sep 2026 20:52:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 04:03:49.324785
- Title: Mechanistic Interpretability Reveals Shared Causal Subspaces in Brain-to-Speech Decoders
- Title(参考訳): 脳と音声のデコーダにおける共用因数部分空間の機械論的解釈可能性
- Abstract要約: 1つの音声フォームから情報をデコードするクロスモーダル転送は、有望な対策である。
我々は、デコーダのどのニューロンがクロスモーダル情報を持ち、これらのニューロンは異なる音声形態で共有されているのかを問う。
この利点を駆動するニューロンは1つもないことが分かりました。代わりに、発声された音声を最も有用な情報源として、小さなニューロン群から生じます。
- 参考スコア(独自算出の注目度): 7.035614061748732
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Decoding covert speech, such as mimed or imagined, from brain activity is harder than decoding vocalized speech. Cross-modal transfer, where information from one speech form helps decode another, is a promising remedy; yet how a decoder internally represents and processes brain activity from different speech forms remains unclear. In this work, we ask: which internal neurons of a decoder carry cross-modal information, and are these neurons shared across different speech forms? To answer these questions, we leverage mechanistic interpretability, using recordings of the same sentences in vocalized, mimed, and imagined input pairs for activation patching. We insert the decoder's internal activity for a sentence in one condition into its processing of the same sentence in another and measure the change in decoding accuracy. We find that no single neuron drives this benefit; instead, it arises from small groups of neurons, with vocalized speech as the most useful source. These groups are largely condition-specific in the early stage of the decoder but overlap in the later stage. These findings point toward more data-efficient covert speech decoders through training objectives that encourage shared later-stage representations learned mainly from vocalized data.
- Abstract(参考訳): 脳活動からミドや想像などの隠蔽音声を復号することは、発声音声を復号するよりも難しい。
ある音声フォームからの情報が他の音声フォームからの情報をデコードするクロスモーダル転送は、有望な治療である。
この研究では、デコーダのどのニューロンがクロスモーダル情報を持ち、これらのニューロンは異なる音声形態で共有されているのか?
これらの疑問に答えるために,同じ文を発声,和音,想像的な入力ペアで記録し,アクティベーションパッチに利用して,機械的解釈性を活用する。
本研究では,ある文に対するデコーダの内部動作を同一文の処理に挿入し,復号精度の変化を計測する。
この利点を駆動するニューロンは1つもないことが分かりました。代わりに、発声された音声を最も有用な情報源として、小さなニューロン群から生じます。
これらのグループはデコーダの初期段階では条件固有であるが、後期では重複する。
これらの知見は、主に発声データから学んだ後段表現の共有を促す訓練目的を通じて、よりデータ効率の高い包括的音声デコーダに向けられている。
関連論文リスト
- Integrating Language Models into Listened and Imagined Speech Decoding from MEG [19.774038251336375]
我々は、MEG表現を音響および文脈言語表現と整合させるニューラルデコーダを訓練する。
音声音声の復号化は,音声音声の復号化よりも,言語モデルから恩恵を受けることが判明した。
論文 参考訳(メタデータ) (2026-09-25T20:55:26Z) - Mechanistic Interpretability of Brain-to-Speech Models Across Speech Modes [0.5156484100374058]
我々は、機械的解釈可能性を用いて、ニューラル音声デコーダの内部表現を因果的に調査する。
我々は、音声モード間の内部アクティベーションのクロスモードアクティベーションパッチを行い、トリオモーダルを用いて、音声表現が離散的に、または連続的に変化するかどうかを調べる。
その結果, 音声モードは共用連続因果多様体上に存在し, クロスモード転送は拡散活性ではなく, コンパクトで層特異的な部分空間によって媒介されることがわかった。
論文 参考訳(メタデータ) (2026-02-01T14:14:40Z) - Decoding Covert Speech from EEG Using a Functional Areas Spatio-Temporal Transformer [9.914613096064848]
脳波(EEG)からの音声の復号は、脳波マッピングの理解が限られているため困難である。
本研究では,57人の右利き英語話者を対象に,大規模多言語音声脳波を作成した。
本研究は,前頭側頭葉領域と側頭葉領域のFAST生成活性化マップを可視化することにより,音声のニューラル特徴を明らかにした。
論文 参考訳(メタデータ) (2025-04-02T10:38:08Z) - Towards Unified Neural Decoding of Perceived, Spoken and Imagined Speech from EEG Signals [1.33134751838052]
本研究では,非侵襲的ニューラルネットワーク復号法におけるディープラーニングモデルの有効性について検討した。
それは、知覚、過度、ささやき、想像されたスピーチなど、異なる音声パラダイムの区別に焦点を当てた。
論文 参考訳(メタデータ) (2024-11-14T07:20:08Z) - Towards General-Purpose Text-Instruction-Guided Voice Conversion [84.78206348045428]
本稿では,「深い声調でゆっくり発声する」や「陽気な少年声で話す」といったテキスト指示によって導かれる,新しい音声変換モデルを提案する。
提案したVCモデルは、離散コード列を処理するニューラルネットワークモデルであり、変換された音声のコード列を生成する。
論文 参考訳(メタデータ) (2023-09-25T17:52:09Z) - Decoding speech perception from non-invasive brain recordings [48.46819575538446]
非侵襲的な記録から知覚音声の自己教師付き表現をデコードするために、コントラスト学習で訓練されたモデルを導入する。
我々のモデルでは、3秒のMEG信号から、1,000以上の異なる可能性から最大41%の精度で対応する音声セグメントを識別できる。
論文 参考訳(メタデータ) (2022-08-25T10:01:43Z) - Toward a realistic model of speech processing in the brain with
self-supervised learning [67.7130239674153]
生波形で訓練された自己教師型アルゴリズムは有望な候補である。
We show that Wav2Vec 2.0 learns brain-like representations with little as 600 hours of unlabelled speech。
論文 参考訳(メタデータ) (2022-06-03T17:01:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。