論文の概要: Adaptive Physical-Facial Representation Fusion via Subject-Invariant Cross-Modal Prompt Tuning for Video-Based Emotion Recognition
- arxiv url: http://arxiv.org/abs/2605.05694v1
- Date: Thu, 07 May 2026 05:33:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.534455
- Title: Adaptive Physical-Facial Representation Fusion via Subject-Invariant Cross-Modal Prompt Tuning for Video-Based Emotion Recognition
- Title(参考訳): 映像に基づく感情認識のための主観的不変なクロスモーダル・プロンプト・チューニングによる適応的物理・ファシアル表現融合
- Authors: Xiwen Luo, Jia Li, Rencheng Song, Yu Liu, Juan Cheng,
- Abstract要約: 映像に基づく感情認識のためのクロスモーダルなクロスチューニングプロンプトチューニング手法を提案する。
提案手法は、認識精度と一般化能力の両方において、強いベースラインを一貫して上回る。
- 参考スコア(独自算出の注目度): 14.850489141041017
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Emotion recognition from facial videos enables non-contact inference of human emotional states. Although facial expressions are widely used cues, they cannot fully reflect intrinsic affective states. Remote photoplethysmography (rPPG) provides complementary physiological information, but it is highly susceptible to noise and inter-subject variability, limiting generalization to unseen individuals. Existing multimodal methods combine facial and rPPG features, yet their fusion strategies often disrupt pretrained facial representations and lack explicit mechanisms to suppress subject-specific variations. To address these issues, we propose a subject-invariant cross-modal prompt-tuning framework for video-based emotion recognition. Specifically, rPPG waveforms are transformed into noise-robust time-frequency representations (TFRs), from which modality-complementary prompts are generated to modulate facial tokens within a frozen Vision Transformer (ViT). This design enables effective cross-modal interaction while preserving the generalizable facial representations learned by the pretrained backbone. In addition, we introduce a decoupled shared-specific adapter (DSSA) into each ViT layer to explicitly separate subject-shared and subject-specific components, thereby improving cross-subject generalization. Experiments on the MAHNOB-HCI and DEAP benchmarks demonstrate that the proposed method consistently outperforms strong baselines in both recognition accuracy and generalization ability, highlighting its effectiveness for video-based emotion recognition.
- Abstract(参考訳): 顔画像からの感情認識は、人間の感情状態の非接触推論を可能にする。
表情は広く使われているが、本質的な感情状態を完全に反映することはできない。
リモート光胸腺造影(rPPG)は相補的な生理情報を提供するが、ノイズや物体間変動に非常に敏感であり、目に見えない個体に一般化を制限している。
既存のマルチモーダル手法は顔とrPPGの特徴を組み合わせるが、それらの融合戦略はしばしば事前訓練された顔表現を妨害し、対象固有のバリエーションを抑制するための明確なメカニズムを欠いている。
これらの課題に対処するために、ビデオベースの感情認識のための主題不変なクロスモーダル・プロンプトチューニングフレームワークを提案する。
具体的には、rPPG波形をノイズローバスト時間周波数表現(TFR)に変換し、そこからモダリティ補間プロンプトを生成して、凍結したビジョントランス(ViT)内の顔トークンを変調する。
この設計は、トレーニング済みのバックボーンによって学習された一般化可能な顔表現を保ちながら、効果的な相互モーダル相互作用を可能にする。
さらに,各 ViT 層に分離した共有固有アダプタ (DSSA) を導入し,主観的および主観的コンポーネントを明確に分離し,クロスオブジェクトの一般化を改善する。
MAHNOB-HCI と DEAP のベンチマーク実験により,提案手法は認識精度と一般化能力の両方において高いベースラインを一貫して上回り,映像ベースの感情認識の有効性を強調した。
関連論文リスト
- Personalized Cross-Modal Emotional Correlation Learning for Speech-Preserving Facial Expression Manipulation [63.90351637818903]
音声保存表情操作は、本来の音声に結びついた口の動きを変えることなく、人間の表現力を高めることを目的としている。
現在のVisual-Language Models (VLM)は、整列した視覚的特徴と意味的特徴を抽出し、将来的な監視の源となる。
VLMをベースとしたパーソナライズされたクロスモーダル感情相関学習アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-04-28T06:02:23Z) - Multimodal Emotion Recognition via Bi-directional Cross-Attention and Temporal Modeling [2.8037951156321377]
本稿では,第10回ABAWチャレンジにおける表現課題に対するマルチモーダル感情認識フレームワークを提案する。
本フレームワークは,視覚および音声表現学習のための大規模事前学習モデルを構築し,それらを統合マルチモーダルアーキテクチャに統合する。
ABAW 10th EXPRベンチマークの実験結果から,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2026-03-12T14:20:29Z) - Text-guided Weakly Supervised Framework for Dynamic Facial Expression Recognition [49.41688891301643]
動的表情認識は、映像列間の顔の動きの時間的変化をモデル化することにより、感情状態の同定を目的としている。
DFERの重要な課題は、多数のフレームからなるビデオが単一の感情ラベルに割り当てられる、多対一のラベリングの問題である。
本稿では,テキスト誘導型弱教師付きフレームワークであるTG-DFERを提案する。
論文 参考訳(メタデータ) (2025-11-14T04:49:58Z) - FACE: Few-shot Adapter with Cross-view Fusion for Cross-subject EEG Emotion Recognition [57.08108545219043]
クロスオブジェクト脳波の感情認識は、重要なオブジェクト間変動と複雑に絡み合ったオブジェクト内変動によって困難である。
最近の数発の学習パラダイムは、これらの制限に対処しようと試みているが、しばしば限られたサンプルを用いて主題固有の適応を行う際に破滅的な過度なオーバーフィッティングに遭遇する。
本稿では,脳波の感情認識のためのFACEと呼ばれるクロスビュー融合方式のマイクロショットアダプタについて紹介する。
論文 参考訳(メタデータ) (2025-03-24T03:16:52Z) - Controllable Talking Face Generation by Implicit Facial Keypoints Editing [6.036277153327655]
本稿では,音声による表情の変形を制御するための音声合成手法であるControlTalkを提案する。
提案手法は,HDTFやMEADなど,広く使用されているベンチマークにおいて,最先端の性能よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-06-05T02:54:46Z) - CIAO! A Contrastive Adaptation Mechanism for Non-Universal Facial
Expression Recognition [80.07590100872548]
本稿では、顔エンコーダの最後の層に異なるデータセットの特定の感情特性を適応させるメカニズムであるContrastive Inhibitory Adaptati On(CIAO)を提案する。
CIAOは、非常にユニークな感情表現を持つ6つの異なるデータセットに対して、表情認識性能が改善されている。
論文 参考訳(メタデータ) (2022-08-10T15:46:05Z) - Emotion Separation and Recognition from a Facial Expression by Generating the Poker Face with Vision Transformers [57.1091606948826]
我々はこれらの課題に対処するため,ポーカー・フェイス・ビジョン・トランスフォーマー (PF-ViT) と呼ばれる新しいFERモデルを提案する。
PF-ViTは、対応するポーカーフェースを生成して、乱れを認識できない感情を静的な顔画像から分離し、認識することを目的としている。
PF-ViTはバニラビジョントランスフォーマーを使用し、そのコンポーネントは大規模な表情データセット上でMasked Autoencodeerとして事前トレーニングされている。
論文 参考訳(メタデータ) (2022-07-22T13:39:06Z) - I Only Have Eyes for You: The Impact of Masks On Convolutional-Based
Facial Expression Recognition [78.07239208222599]
今回提案したFaceChannelがマスクを持つ人からの表情認識にどのように適応するかを評価します。
また、制約された社会的相互作用シナリオにおける顔の特徴の変化を学習し、組み合わせるためのFaceChannelの本質的な能力を示すために、特定の機能レベルの可視化も行います。
論文 参考訳(メタデータ) (2021-04-16T20:03:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。