論文の概要: MindAU: EEG-Conditioned Facial Action Unit Editing via Dual-Stream Manifold Alignment
- arxiv url: http://arxiv.org/abs/2607.00410v1
- Date: Wed, 01 Jul 2026 04:12:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.712044
- Title: MindAU: EEG-Conditioned Facial Action Unit Editing via Dual-Stream Manifold Alignment
- Title(参考訳): MindAU: デュアルストリームマニフォールドアライメントによる脳波駆動型顔アクションユニットの編集
- Abstract要約: MindAUは、微細な顔アクションユニット(AU)制御のための脳波条件の顔画像編集のためのフレームワークである。
MindAUは、仮面再構築とAU分類監督を通じて、ノイズロストおよびAU識別脳波表現を学習する。
EEG-Conditioned Action-Unit Facial EditingのベンチマークであるE-CAFEについても紹介する。
- 参考スコア(独自算出の注目度): 8.200182245054712
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent brain decoding studies have made substantial progress in reconstructing externally perceived visual content from neural signals. However, using electroencephalography (EEG) recordings to guide facial expression editing remains largely unexplored and poses a distinct challenge: rather than recovering what a subject sees, it requires identifying facial-action related patterns from noisy EEG signals and grounding them in localized, identity-preserving expression edits. In this paper, we investigate EEG-conditioned facial image editing for fine-grained facial action unit (AU) control and propose MindAU, a unified framework for controlling facial AU edits from EEG signals. MindAU first learns noise-robust and AU-discriminative EEG representations through temporal masked reconstruction and AU classification supervision. It then bridges the modality gap via Dual-Stream Manifold Alignment, aligning EEG features with AU-level text semantics and identity-reduced visual displacement trajectories in the multimodal space of Qwen2.5-VL. Finally, MindAU incorporates EEG-aware Multimodal Rotary Positional Embeddings, landmark-guided reference masking, and AU-aware region supervision into a multimodal diffusion-based editor for high-fidelity identity-preserving editing. We also introduce E-CAFE, a curated benchmark for EEG-Conditioned Action-Unit Facial Editing with paired EEG-face editing samples and standardized evaluation protocols. Extensive experiments demonstrate the effectiveness of MindAU and suggest its potential as a step towards future assistive expression technologies for individuals with facial neuromuscular disorders.
- Abstract(参考訳): 最近の脳の復号化研究は、神経信号から外部に知覚される視覚内容の再構成に大きく進歩している。
しかし、表情の編集を導くために脳波記録(EEG)を用いることで、被験者が見ているものを回復するのではなく、ノイズの多い脳波信号から顔の動きに関連するパターンを識別し、局所的でアイデンティティを保った表現編集を行う必要がある。
本稿では,脳波信号から顔AU編集を制御する統合フレームワークであるMindAUを提案する。
MindAUは、まず、仮面再構築とAU分類監督を通じて、ノイズロストおよびAU識別脳波表現を学習する。
次に、Dual-Stream Manifold Alignmentを介してモダリティギャップをブリッジし、Qwen2.5-VLのマルチモーダル空間におけるAUレベルのテキストセマンティクスと同一性還元された視覚的変位軌跡とEEG特徴を整列する。
最後に、MindAUは、EEG対応マルチモーダル回転位置埋め込み、ランドマーク誘導参照マスキング、AU対応領域監視を多モーダル拡散ベースエディターに組み込んで、高忠実度ID保存編集を行う。
EEG-Conditioned Action-Unit Facial Editing for paired EEG-face editing sampleと標準化された評価プロトコルを用いたEEG-Conditioned Action-Unit Facial EditingのベンチマークであるE-CAFEについても紹介する。
広範囲にわたる実験は、MindAUの有効性を実証し、その可能性を、顔面神経筋疾患患者に対する将来の補助的表現技術へのステップとして示唆している。
関連論文リスト
- What Does the Brain See? Multiview Neural Representations to Demystify the Brain-Visual Alignment [16.54359569394021]
脳の反応を視覚的セマンティックな埋め込みと整合させるための統合型多視点脳波表現学習フレームワークを提案する。
提案手法は,物体内部設定において54.8%のTop-1,85.6%のTop-5,クロスオブジェクト設定では15.3%のTop-1,45.4%のTop-5の精度を有する。
論文 参考訳(メタデータ) (2026-06-24T11:33:21Z) - LaCoVL-FER: Landmark-Guided Contrastive Learning Network with Vision-Language Enhancement for Facial Expression Recognition [51.70817823155725]
顔表情認識のための視覚言語強化型ランドマーク誘導型コントラスト学習ネットワーク(FER)を提案する。
LaCoVL-FERは、顔のランドマークと視覚言語モデルからのセマンティックな事前情報を統合する。
実験により、LaCoVL-FERは3つの代表的な実世界のFERデータセット上で最先端のメソッドより優れていることが示された。
論文 参考訳(メタデータ) (2026-05-19T13:15:41Z) - E^2-LLM: Bridging Neural Signals and Interpretable Affective Analysis [54.763420895859035]
脳波からの感情分析のための最初のMLLMフレームワークであるELLM2-EEG-to-Emotion Large Language Modelを提案する。
ELLMは学習可能なプロジェクション層を通じて、トレーニング済みのEEGエンコーダとQベースのLLMを統合し、マルチステージのトレーニングパイプラインを使用する。
7つの感情カテゴリーにまたがるデータセット実験により, ELLM2-EEG-to-Emotion Large Language Modelは感情分類において優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2026-01-11T13:21:20Z) - EEG-Driven Image Reconstruction with Saliency-Guided Diffusion Models [4.815274507478168]
既存の脳波駆動画像再構成法は、しばしば空間的注意機構を見落とし、忠実さとセマンティックコヒーレンスを制限する。
本稿では,脳波の埋め込みと空間空間分布マップを組み合わせることで画像生成を向上する2つの条件付けフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-30T11:34:37Z) - Talking Head Generation via AU-Guided Landmark Prediction [48.30051606459973]
顔行動単位(AUs)を用いた微粒化表現制御による音声駆動音声ヘッド生成のための2段階フレームワークを提案する。
第1段階では、変動運動生成器は、音声およびAU強度から時間的にコヒーレントなランドマークシーケンスを予測する。
第2段階では、拡散に基づく合成器がこれらのランドマークと参照画像に調和したリアルなリップ同期ビデオを生成する。
論文 参考訳(メタデータ) (2025-09-24T04:01:57Z) - Interpretable EEG-to-Image Generation with Semantic Prompts [6.712646807032639]
本モデルでは,脳波信号とセマンティックキャプションをアライメントすることで,直接脳波画像生成をバイパスする。
トランスフォーマーベースの脳波エンコーダは、対照的な学習を通じて脳活動をこれらのキャプションにマッピングする。
このテキストによるフレームワークは、EEGCVPRデータセット上で最先端のビジュアルデコーディングをもたらす。
論文 参考訳(メタデータ) (2025-07-09T17:18:06Z) - BrainOmni: A Brain Foundation Model for Unified EEG and MEG Signals [46.121056431476156]
異種脳波とMEG記録を対象とする脳基礎モデルBrain Omniを提案する。
既存のアプローチは一般的に、パフォーマンスとクロスドメインのスケーラビリティを制限する、分離、モダリティ、データセット固有のモデルに依存します。
EEGの合計1,997時間、MEGデータの656時間は、事前トレーニングのために公開されているソースからキュレーションされ、標準化されている。
論文 参考訳(メタデータ) (2025-05-18T14:07:14Z) - ViEEG: Hierarchical Visual Neural Representation for EEG Brain Decoding [18.51835182602402]
ViEEGは神経系であり、我々はさらに、EEG-CLIPのアライメントアライメントに階層的コントラスト学習を採用し、ゼロショットオブジェクト認識を可能にする。
われわれのフレームワークは脳波脳波復号のための新しいパラダイムを定めている。
ViEEGは、視覚刺激を3つの生物学的に整列した構成要素、前景のオブジェクト、三次元脳波エンコーダのための文脈的なシーン保存アンカーに分解する。
論文 参考訳(メタデータ) (2025-05-18T13:19:08Z) - Enhancing EEG-to-Text Decoding through Transferable Representations from Pre-trained Contrastive EEG-Text Masked Autoencoder [69.7813498468116]
コントラスト型脳波テキストマスケード自動エンコーダ(CET-MAE)を提案する。
また、E2T-PTR(Pretrained Transferable Representationsを用いたEEG-to-Text decoding)と呼ばれるフレームワークを開発し、EEGシーケンスからテキストをデコードする。
論文 参考訳(メタデータ) (2024-02-27T11:45:21Z) - BrainVis: Exploring the Bridge between Brain and Visual Signals via Image Reconstruction [7.512223286737468]
脳信号からの視覚刺激の分析と再構成は、人間の視覚系の理解を効果的に進める。
しかし、脳波信号は複雑であり、大きなノイズを含む。
これにより、脳波からの視覚刺激再建の既存の作品にかなりの制限が生じる。
我々はこれらの課題に対処するためにBrainVisと呼ばれる新しいアプローチを提案する。
論文 参考訳(メタデータ) (2023-12-22T17:49:11Z) - CSLP-AE: A Contrastive Split-Latent Permutation Autoencoder Framework
for Zero-Shot Electroencephalography Signal Conversion [49.1574468325115]
脳波分析の鍵となる目的は、基礎となる神経活動(コンテンツ)を抽出し、個体の変動(スタイル)を考慮することである。
近年の音声変換技術の発展に触発されて,脳波変換を直接最適化するCSLP-AEフレームワークを提案する。
論文 参考訳(メタデータ) (2023-11-13T22:46:43Z) - Semi-Supervised Dual-Stream Self-Attentive Adversarial Graph Contrastive Learning for Cross-Subject EEG-based Emotion Recognition [19.578050094283313]
DS-AGCフレームワークは、クロスオブジェクト脳波に基づく感情認識において、限定ラベル付きデータの課題に取り組むために提案されている。
提案手法は,不完全ラベル条件の異なる既存手法よりも優れている。
論文 参考訳(メタデータ) (2023-08-13T23:54:40Z) - Emotion Separation and Recognition from a Facial Expression by Generating the Poker Face with Vision Transformers [57.1091606948826]
我々はこれらの課題に対処するため,ポーカー・フェイス・ビジョン・トランスフォーマー (PF-ViT) と呼ばれる新しいFERモデルを提案する。
PF-ViTは、対応するポーカーフェースを生成して、乱れを認識できない感情を静的な顔画像から分離し、認識することを目的としている。
PF-ViTはバニラビジョントランスフォーマーを使用し、そのコンポーネントは大規模な表情データセット上でMasked Autoencodeerとして事前トレーニングされている。
論文 参考訳(メタデータ) (2022-07-22T13:39:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。