論文の概要: Sparse Attention to Emotion: Efficient Facial Emotion Recognition via Token Reduction
- arxiv url: http://arxiv.org/abs/2608.08873v1
- Date: Sun, 09 Aug 2026 19:28:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.980444
- Title: Sparse Attention to Emotion: Efficient Facial Emotion Recognition via Token Reduction
- Title(参考訳): 感情に対するスパースアテンション:トーケンリダクションによる顔の感情認識の効率化
- Abstract要約: 顔の感情認識(FER)は、バイオメトリックス、健康、人間とコンピュータの相互作用など、様々な分野において重要な意味を持つ重要なタスクである。
現在のVision Transformerベースのアプローチでは、2次複雑性$mathcalO(N2)$を示し、Nは入力シーケンス長である。
本研究では,情緒的文脈に付加価値のない画像トークンを廃棄するモデルであるSparse Attention to Emotion (SAE)を提案する。
- 参考スコア(独自算出の注目度): 1.0266286487433587
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Facial Emotion Recognition (FER) is an important task that has significant implications across various fields such as biometrics, health, and human-computer interaction. Current Vision Transformer-based approaches display quadratic complexity $\mathcal{O}(N^2)$, with N being the input sequence length, making them cumbersome to deploy at the edge. In this paper, we hypothesize that the FER task does not necessarily require all facial information to correctly interpret emotional states, as specific regions such as the eyes, the mouth, and parts of the cheeks carry discriminative information that can be sufficient to recognize emotions. Based on this, we propose Sparse Attention to Emotion (SAE), a model that discards image tokens that have no added value to the emotional context, while preserving good accuracy and achieving a significant gain in computational cost. Surprisingly, even after suppressing 90\% of the image tokens, our model achieves competitive accuracy to state of the art methods at much lower cost, providing a lightweight Facial Emotion Recognition approach. Experimental results demonstrate that SAE achieves new state of the art results on the RAF-DB dataset while reducing the computational complexity by up to 90\%.
- Abstract(参考訳): 顔の感情認識(FER)は、バイオメトリックス、健康、人間とコンピュータの相互作用など、様々な分野において重要な意味を持つ重要なタスクである。
現在のVision Transformerベースのアプローチは、2次複雑性$\mathcal{O}(N^2)$を示し、Nは入力シーケンス長であり、エッジに展開するのは煩雑である。
本稿では,眼,口,頬の一部といった特定の領域が,感情を認識するのに十分な識別情報を伝達しているため,FERタスクが感情状態を正しく解釈するために必要なすべての顔情報を必要としないことを仮定する。
そこで本研究では,情緒的文脈に付加価値のない画像トークンを破棄するモデルであるSparse Attention to Emotion (SAE)を提案する。
驚くべきことに、画像トークンの90%を抑えながら、我々のモデルは最先端の手法に対する競争精度をはるかに低いコストで達成し、軽量な顔の感情認識アプローチを提供する。
実験結果から,SAEはRAF-DBデータセット上で,計算複雑性を最大90%削減し,最先端の新たな結果が得られることが示された。
関連論文リスト
- Smile on the Face, Sadness in the Eyes: Bridging the Emotion Gap with a Multimodal Dataset of Eye and Facial Behaviors [49.833812625518554]
視覚行動は重要な感情的手がかりとして導入され、視覚行動支援マルチモーダル感情認識データセットを構築する。
実験では,EMERデータセットの総合的な評価のために,7つのマルチモーダルベンチマークプロトコルを導入する。
その結果、EMERTは、他の最先端のマルチモーダル手法よりも優れた性能を示し、ロバストERに対する目の動きのモデリングの重要性を明らかにした。
論文 参考訳(メタデータ) (2025-12-18T12:52:55Z) - Smile upon the Face but Sadness in the Eyes: Emotion Recognition based on Facial Expressions and Eye Behaviors [63.194053817609024]
視覚行動は、視覚行動支援型マルチモーダル感情認識データセットを作成するための重要な感情的手がかりとなる。
EMERデータセットに感情認識(ER)と表情認識(FER)の両方のアノテーションを初めて提供する。
具体的には、ERとFERの両方のパフォーマンスを同時に向上する新しいEMERTアーキテクチャを設計する。
論文 参考訳(メタデータ) (2024-11-08T04:53:55Z) - Facial Expression Recognition using Squeeze and Excitation-powered Swin
Transformers [0.0]
本研究では,Swin Vision Transformers (SwinT) とSwin Vision Transformers (SE) を用いて,視覚タスクに対処するフレームワークを提案する。
我々の焦点は、最小限のデータを使って顔の感情を認識できるSwinTアーキテクチャに基づく効率的なFERモデルを作ることであった。
我々は、ハイブリッドデータセットでモデルをトレーニングし、そのパフォーマンスをAffectNetデータセットで評価し、F1スコア0.5420を達成しました。
論文 参考訳(メタデータ) (2023-01-26T02:29:17Z) - Emotion Separation and Recognition from a Facial Expression by Generating the Poker Face with Vision Transformers [57.1091606948826]
我々はこれらの課題に対処するため,ポーカー・フェイス・ビジョン・トランスフォーマー (PF-ViT) と呼ばれる新しいFERモデルを提案する。
PF-ViTは、対応するポーカーフェースを生成して、乱れを認識できない感情を静的な顔画像から分離し、認識することを目的としている。
PF-ViTはバニラビジョントランスフォーマーを使用し、そのコンポーネントは大規模な表情データセット上でMasked Autoencodeerとして事前トレーニングされている。
論文 参考訳(メタデータ) (2022-07-22T13:39:06Z) - Facial Emotion Recognition: A multi-task approach using deep learning [0.0]
マルチタスク学習アルゴリズムを提案する。一つのCNNが感情とともに対象者の性別、年齢、人種を検出する。
その結果、このアプローチは現在のタスクの最先端技術アルゴリズムよりもはるかに優れていることがわかった。
論文 参考訳(メタデータ) (2021-10-28T11:23:00Z) - Interpretable Image Emotion Recognition: A Domain Adaptation Approach Using Facial Expressions [11.808447247077902]
本稿では,ジェネリックイメージ中の感情を識別するための特徴に基づくドメイン適応手法を提案する。
これは、事前訓練されたモデルと、画像感情認識(IER)のための十分に注釈付けされたデータセットの限られた可用性の課題に対処する。
提案されたIERシステムは、IAPSaデータセットの61.86%、ArtPhotoデータセットの62.47、FIデータセットの70.78%、EMOTICデータセットの59.72%の感情分類精度を示した。
論文 参考訳(メタデータ) (2020-11-17T02:55:16Z) - Learning Emotional-Blinded Face Representations [77.7653702071127]
感情反応に関連する表情に盲目な2つの顔表現を提案する。
この作業は、個人データ保護に関する新たな国際規則によって動機付けられている。
論文 参考訳(メタデータ) (2020-09-18T09:24:10Z) - Continuous Emotion Recognition via Deep Convolutional Autoencoder and
Support Vector Regressor [70.2226417364135]
マシンはユーザの感情状態を高い精度で認識できることが不可欠である。
ディープニューラルネットワークは感情を認識する上で大きな成功を収めている。
表情認識に基づく連続的感情認識のための新しいモデルを提案する。
論文 参考訳(メタデータ) (2020-01-31T17:47:16Z) - Learning to Augment Expressions for Few-shot Fine-grained Facial
Expression Recognition [98.83578105374535]
顔表情データベースF2EDについて述べる。
顔の表情は119人から54人まで、200万枚以上の画像が含まれている。
実世界のシナリオでは,不均一なデータ分布やサンプルの欠如が一般的であるので,数発の表情学習の課題を評価する。
顔画像合成のための統合されたタスク駆動型フレームワークであるComposeal Generative Adversarial Network (Comp-GAN) 学習を提案する。
論文 参考訳(メタデータ) (2020-01-17T03:26:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。