論文の概要: MindAlign: Bridging EEG, Vision, and Language for Zero-Shot Visual Decoding
- arxiv url: http://arxiv.org/abs/2605.24523v1
- Date: Sat, 23 May 2026 11:23:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.160909
- Title: MindAlign: Bridging EEG, Vision, and Language for Zero-Shot Visual Decoding
- Title(参考訳): MindAlign: ゼロショットビジュアルデコーディングのための脳波、ビジョン、言語をブリッジする
- Authors: Zexuan Chen, Sichao Liu, Runhao Lu, Huichao Qi, Alexandra Woolgar, Xi Vincent Wang, Lihui Wang,
- Abstract要約: 脳信号からの視覚的復号化は、コンピュータビジョンと神経科学の交差において重要な課題である。
本稿では,脳波,視覚,テキスト表現の整合性を考慮した,脳波に基づく視覚的デコーディングのための3モーダルコントラストフレームワークを提案する。
- 参考スコア(独自算出の注目度): 36.958608375007124
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual decoding from brain signals is a key challenge at the intersection of computer vision and neuroscience, requiring methods that bridge neural representations and computational models of vision. We introduce a tri-modal contrastive framework for EEG-based visual decoding that aligns EEG, visual, and textual representations within a unified latent space. Our approach follows a two-stage design. First, we pre-train an EEG encoder via masked reconstruction on unlabeled trials, learning spatio-temporal regularities that transfer robustly to downstream tasks. Second, we jointly align EEG, image, and LLM-generated textual descriptions through contrastive learning, where text supervision acts as a semantic regularizer that injects linguistic structure into the shared space without overwhelming the primary EEG-image signal. The encoder integrates subject-specific adaptation, graph-attention over channels, and temporal-spatial convolutional embeddings. On the Things-EEG2 200-way zero-shot benchmark, our framework achieves 54.1% Top-1 and 83.4% Top-5 accuracy, substantially exceeding the strongest prior baseline (32.4% / 64.0%), with paired Wilcoxon tests confirming significance (p < 0.01) over all in-subject baselines. We validate generalization on Things-MEG. Analysis reveals that compact embedding geometries (CN-CLIP) outperform much larger backbones, and that decoding aligns with established neurophysiology of visual processing. This work is a critical step towards robust, semantically-grounded visual decoding from non-invasive temporal neural signals. The source code is publicly available in https://github.com/anon-eeg/eeg_image_decoding.
- Abstract(参考訳): 脳信号からの視覚復号は、コンピュータビジョンと神経科学の交差において重要な課題であり、神経表現と視覚の計算モデルを橋渡しする手法を必要とする。
我々は,脳波,視覚,テキストの表現を統一された潜在空間内で整列させる,脳波に基づく視覚的デコーディングのための3モーダルコントラストフレームワークを提案する。
私たちのアプローチは2段階の設計に従っています。
第一に,脳波エンコーダをマスク付き再構成してラベルなしの試行において事前訓練し,下流タスクに頑健に伝達する時空間規則を学習する。
第2に、脳波、画像、LLM生成したテキスト記述をコントラスト学習により協調的に調整し、テキスト監督は、主要な脳波画像信号に圧倒されることなく、共有空間に言語構造を注入する意味正規化器として機能する。
エンコーダは、主題固有の適応、チャネル上のグラフアテンション、時間空間の畳み込み埋め込みを統合する。
Things-EEG2 200-way 0-shotベンチマークでは、我々のフレームワークは54.1%のTop-1と83.4%のTop-5の精度を達成し、最強のベースライン(32.4% / 64.0%)をほぼ上回り、Wilcoxonのペアテストにより、すべてのオブジェクトのベースラインに対する重要性(p < 0.01)が確認された。
我々はモノ-MEGの一般化を検証した。
解析によると、コンパクトな埋め込みジオメトリ(CN-CLIP)は、はるかに大きなバックボーンよりも優れており、デコードは視覚処理の確立した神経生理学と一致している。
この研究は、非侵襲的側頭葉神経信号からの堅牢で意味論的に基底化された視覚的復号への重要なステップである。
ソースコードはhttps://github.com/anon-eeg/eeg_image_decodingで公開されている。
関連論文リスト
- OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence [113.73007911004446]
OneVision-Encoderは、視覚構造を意味的な意味に圧縮することでビデオをエンコードする。
Codec-aligned, patch-level sparsityは基本的な原則であり、次世代のビジュアルジェネラリストのためのスケーラブルなエンジンとしてOV-Encoderを可能にする。
論文 参考訳(メタデータ) (2026-02-09T14:06:17Z) - NeuroCLIP: Brain-Inspired Prompt Tuning for EEG-to-Image Multimodal Contrastive Learning [13.254096454986318]
脳波から画像へのコントラスト学習に適したプロンプトチューニングフレームワークであるNeuroCLIPを提案する。
我々は初めて視覚的プロンプトトークンを脳波画像アライメントに導入し、グローバルなモダリティレベルのプロンプトとして機能する。
THINGS-EEG2データセットでは、NeuroCLIPはゼロショット画像検索において63.2%のTop-1精度を達成した。
論文 参考訳(メタデータ) (2025-11-12T12:13:24Z) - Neural-Driven Image Editing [51.11173675034121]
従来の画像編集は手動のプロンプトに依存しており、運動制御や言語能力に制限のある個人には労働集約的でアクセスできない。
神経生理学的信号によるハンズフリー画像編集手法であるLoongXを提案する。
LoongXは、23,928の画像編集ペアの包括的なデータセットに基づいてトレーニングされた最先端の拡散モデルを使用している。
論文 参考訳(メタデータ) (2025-07-07T18:31:50Z) - ViEEG: Hierarchical Visual Neural Representation for EEG Brain Decoding [18.51835182602402]
ViEEGは神経系であり、我々はさらに、EEG-CLIPのアライメントアライメントに階層的コントラスト学習を採用し、ゼロショットオブジェクト認識を可能にする。
われわれのフレームワークは脳波脳波復号のための新しいパラダイムを定めている。
ViEEGは、視覚刺激を3つの生物学的に整列した構成要素、前景のオブジェクト、三次元脳波エンコーダのための文脈的なシーン保存アンカーに分解する。
論文 参考訳(メタデータ) (2025-05-18T13:19:08Z) - DecoFuse: Decomposing and Fusing the "What", "Where", and "How" for Brain-Inspired fMRI-to-Video Decoding [82.91021399231184]
既存のfMRI-to-video法は、しばしば空間情報や動き情報を見下ろしながら意味的内容に焦点を当てる。
そこで我々は,fMRI信号から映像をデコードするための,脳にインスパイアされた新しいフレームワークであるDecoFuseを提案する。
まず、ビデオはセマンティック、空間、動きの3つのコンポーネントに分解し、次に各コンポーネントを別々にデコードしてから、ビデオを再構成する。
論文 参考訳(メタデータ) (2025-04-01T05:28:37Z) - Mind's Eye: Image Recognition by EEG via Multimodal Similarity-Keeping Contrastive Learning [2.087148326341881]
本稿では,ゼロショット脳波画像分類のためのMUltimodal similarity-keeper contrastivE学習フレームワークを提案する。
我々は、脳波信号に適した多変量時系列エンコーダを開発し、正規化コントラスト脳波画像事前学習の有効性を評価する。
本手法は,200方向ゼロショット画像分類において,トップ1の精度が19.3%,トップ5の精度が48.8%の最先端性能を実現する。
論文 参考訳(メタデータ) (2024-06-05T16:42:23Z) - Open Vocabulary Electroencephalography-To-Text Decoding and Zero-shot
Sentiment Classification [78.120927891455]
最先端のブレイン・トゥ・テキストシステムは、ニューラルネットワークを使用して脳信号から直接言語を復号することに成功した。
本稿では,自然読解課題における語彙的脳波(EEG)-テキスト列列列復号化とゼロショット文感性分類に問題を拡張する。
脳波-テキストデコーディングで40.1%のBLEU-1スコア、ゼロショット脳波に基づく3次感情分類で55.6%のF1スコアを達成し、教師付きベースラインを著しく上回る結果となった。
論文 参考訳(メタデータ) (2021-12-05T21:57:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。