論文の概要: Explainable Lightweight Compact Deep Models for Speech Emotion Recognition
- arxiv url: http://arxiv.org/abs/2607.16803v1
- Date: Sat, 18 Jul 2026 12:50:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.262367
- Title: Explainable Lightweight Compact Deep Models for Speech Emotion Recognition
- Title(参考訳): 音声感情認識のための説明可能な軽量コンパクトディープモデル
- Abstract要約: 音声感情認識(SER)は、幅広い人間中心のアプリケーションにおいて重要な要素である。
本稿では,コンパクトな畳み込みニューラルネットワークアーキテクチャに基づく,説明可能な軽量な音声感情認識フレームワークを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speech Emotion Recognition (SER) is an important component in a wide range of human-centered applications, including healthcare, customer service, and human-omputer interaction. In medical and decision-support settings, there is increasing interest in models that not only achieve accurate emotion recognition but also support transparent predictions and efficient deployment. However, many existing SER approaches rely on complex deep learning architectures that limit interpretability and increase computational cost. This paper presents an explainable and lightweight speech emotion recognition framework based on a compact convolutional neural network architecture. The proposed approach utilizes log-Mel spectrogram representations to capture spectro-temporal speech characteristics and employs attentive statistics pooling to emphasize emotionally salient temporal segments. To improve model transparency, gradient-based class activation mapping (Grad-CAM) is incorporated to visualize the time-frequency regions that influence the model's predictions. Experimental evaluation on the SAVEE emotional speech dataset demonstrates that the proposed framework achieves competitive recognition performance while maintaining a compact architecture with significantly fewer parameters than many existing SER models. The results indicate that efficient convolutional architectures combined with interpretable analysis can provide a practical balance between recognition accuracy, computational efficiency, and model transparency.
- Abstract(参考訳): 音声感情認識(SER)は、医療、カスタマーサービス、ヒューマン・オプティマイザ・インタラクションなど、幅広い人間中心のアプリケーションにおいて重要なコンポーネントである。
医療や意思決定支援の設定では、正確な感情認識を達成するだけでなく、透過的な予測と効率的な展開をサポートするモデルへの関心が高まっている。
しかし、既存のSERアプローチの多くは、解釈可能性の制限と計算コストの増加を制限した複雑なディープラーニングアーキテクチャに依存している。
本稿では,コンパクトな畳み込みニューラルネットワークアーキテクチャに基づく,説明可能な軽量な音声感情認識フレームワークを提案する。
提案手法では,対数メルスペクトル表現を用いてスペクトル時間的音声特性を抽出し,感情的に有意な時間的セグメントを強調するため,注意統計プールを用いる。
モデルの透明性を改善するために、勾配に基づくクラスアクティベーションマッピング(Grad-CAM)が組み込まれ、モデルの予測に影響を与える時間周波数領域を可視化する。
SAVEE感情音声データセットの実験的評価により,提案手法は既存のSERモデルよりもはるかに少ないパラメータを持つコンパクトなアーキテクチャを維持しながら,競争力のある音声認識性能を実現することが示された。
その結果, 効率的な畳み込みアーキテクチャと解釈可能な解析を組み合わせることで, 認識精度, 計算効率, モデルの透明性の両立を図ることが可能であることが示唆された。
関連論文リスト
- Enhancing Multimodal Emotion Recognition via Multi-Feature Encoding and Attention-Based Fusion [5.740228163421595]
本稿では,新しいマルチモーダル感情認識フレームワークを提案する。
リッチなオーディオと視覚的特徴抽出と、注意に基づく融合戦略を統合している。
提案手法は, 多様な感情的手がかりを音声や視覚的表現から効果的にとらえることが示唆された。
論文 参考訳(メタデータ) (2026-09-04T03:40:16Z) - ViQ: Text-Aligned Visual Quantized Representations at Any Resolution [91.46185855575789]
本稿では,視覚的量子化表現フレームワークViQについて紹介する。
我々のアプローチは、量子化学習をテキスト整列事前学習と特徴分別という2つの段階に構成する。
マルチモーダル・タスクの実験では、ViQは最先端のマルチモーダル・ビジョン・エンコーダに比べて競争性能が高いことを示した。
論文 参考訳(メタデータ) (2026-06-25T17:29:27Z) - A Lightweight Transformer for Pain Recognition from Brain Activity [11.72500739025842]
本稿では,複数のfNIRS表現を統一トークン化機構を通じて融合する軽量トランスフォーマーアーキテクチャを提案する。
提案したトークン混合戦略は、異種入力を共有潜在表現に投影することにより、空間的・時間的・時間的特性を保存する。
このモデルは、重畳された生波形とfNIRS入力のパワースペクトル密度表現を用いてAI4Painデータセット上で評価する。
論文 参考訳(メタデータ) (2026-04-13T13:25:19Z) - Multimodal Emotion Recognition via Bi-directional Cross-Attention and Temporal Modeling [2.8037951156321377]
本稿では,第10回ABAWチャレンジにおける表現課題に対するマルチモーダル感情認識フレームワークを提案する。
本フレームワークは,視覚および音声表現学習のための大規模事前学習モデルを構築し,それらを統合マルチモーダルアーキテクチャに統合する。
ABAW 10th EXPRベンチマークの実験結果から,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2026-03-12T14:20:29Z) - LeMoRe: Learn More Details for Lightweight Semantic Segmentation [48.81126061219231]
計算効率と表現の忠実さのバランスをとるために、明示的および暗黙的なモデリングを相乗化することによって効率的なパラダイムを導入する。
提案手法は、明確にモデル化されたビューと暗黙的に推論された中間表現とをうまく組み合わせ、グローバルな依存関係を効率的に取得する。
論文 参考訳(メタデータ) (2025-05-29T04:55:10Z) - Efficient Speech Language Modeling via Energy Distance in Continuous Latent Space [74.12387631212609]
本稿では、音声波形を連続的な潜在表現の列に符号化することで、音声言語モデリングの代替手法であるSLEDを紹介する。
SLEDは離散化エラーを回避し、既存の言語モデルに共通する複雑な階層アーキテクチャの必要性を排除する。
実験結果から,SLEDはゼロショット音声合成とストリーミング音声合成の両方において高い性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-05-19T14:38:59Z) - Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture [2.3272964989267626]
本稿では,発話レベルの感情分類に適した,軽量かつ効果的な融合型ディープラーニングモデルを提案する。
我々のアプローチは、注意深く機能エンジニアリングとモジュール設計を行うことで、より単純な融合戦略がより複雑なモデルより優れているか、あるいは一致しているかを示します。
論文 参考訳(メタデータ) (2025-05-05T02:31:11Z) - Unveiling Hidden Factors: Explainable AI for Feature Boosting in Speech Emotion Recognition [17.568724398229232]
音声感情認識(SER)は、メンタルヘルス、教育、人間とコンピュータの相互作用など、いくつかの応用分野から注目されている。
本研究では,機械学習モデルの性能向上のための特徴関連性と説明可能性を強調した,SERの反復的特徴増強手法を提案する。
提案手法の有効性をトロントの感情音声セット(TESS)、ベルリンの感情音声データベース(EMO-DB)、Ryersonの感情音声データベース(RAVDESS)、Surrey Audio-Visual Expressed Emotioned Emotion(SAVEE)データセットのSERベンチマークで検証した。
論文 参考訳(メタデータ) (2024-06-01T00:39:55Z) - Iterative Feature Boosting for Explainable Speech Emotion Recognition [17.568724398229232]
本稿では,効率的な特徴工学手法に基づく新しい教師付きSER手法を提案する。
特徴の関連性を評価し,特徴セットを洗練させるために,結果の説明可能性に特に注意を払っている。
提案手法は,TESSデータセット上での感情認識において,ヒトレベルのパフォーマンス(HLP)および最先端の機械学習手法より優れる。
論文 参考訳(メタデータ) (2024-05-30T15:44:27Z) - Multimodal Emotion Recognition using Transfer Learning from Speaker
Recognition and BERT-based models [53.31917090073727]
本稿では,音声とテキストのモダリティから,伝達学習モデルと微調整モデルとを融合したニューラルネットワークによる感情認識フレームワークを提案する。
本稿では,対話型感情的モーションキャプチャー・データセットにおけるマルチモーダル・アプローチの有効性を評価する。
論文 参考訳(メタデータ) (2022-02-16T00:23:42Z) - Improved Speech Emotion Recognition using Transfer Learning and
Spectrogram Augmentation [56.264157127549446]
音声感情認識(SER)は、人間とコンピュータの相互作用において重要な役割を果たす課題である。
SERの主な課題の1つは、データの不足である。
本稿では,スペクトログラム拡張と併用した移動学習戦略を提案する。
論文 参考訳(メタデータ) (2021-08-05T10:39:39Z) - A Dependency Syntactic Knowledge Augmented Interactive Architecture for
End-to-End Aspect-based Sentiment Analysis [73.74885246830611]
エンドツーエンドABSAのためのマルチタスク学習を用いた対話型アーキテクチャを新たに提案する。
このモデルは、よく設計された依存性関係埋め込みグラフ畳み込みネットワーク(DreGcn)を活用することで、構文知識(依存性関係と型)を完全に活用することができる。
3つのベンチマークデータセットの大規模な実験結果から,本手法の有効性が示された。
論文 参考訳(メタデータ) (2020-04-04T14:59:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。