Fugu-MT 論文翻訳(概要): Enhancing Speech Emotion Recognition Through Differentiable Architecture Search

論文の概要: Enhancing Speech Emotion Recognition Through Differentiable Architecture Search

arxiv url: http://arxiv.org/abs/2305.14402v3
Date: Fri, 19 Jan 2024 00:16:49 GMT
ステータス: 翻訳完了
システム内更新日: 2024-01-22 19:14:54.944942
Title: Enhancing Speech Emotion Recognition Through Differentiable Architecture Search
Title（参考訳）: 微分可能なアーキテクチャ探索による音声感情認識の強化
Authors: Thejan Rajapakshe, Rajib Rana, Sara Khalifa, Berrak Sisman, Bj\"orn Schuller
Abstract要約: 音声感情認識(英: Speech Emotion Recognition, SER)は、人間とコンピュータの相互作用における感情認識コミュニケーションの重要な実現要因である。近年のディープラーニング(DL)の進歩により,SERモデルの性能が大幅に向上している。本稿では,DARTSを最適化したCNNとLSTMアーキテクチャを提案する。
参考スコア（独自算出の注目度）: 10.155873909545196
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Speech Emotion Recognition (SER) is a critical enabler of emotion-aware communication in human-computer interactions. Recent advancements in Deep Learning (DL) have substantially enhanced the performance of SER models through increased model complexity. However, designing optimal DL architectures requires prior experience and experimental evaluations. Encouragingly, Neural Architecture Search (NAS) offers a promising avenue to determine an optimal DL model automatically. In particular, Differentiable Architecture Search (DARTS) is an efficient method of using NAS to search for optimised models. This paper proposes a DARTS-optimised joint CNN and LSTM architecture, to improve SER performance, where the literature informs the selection of CNN and LSTM coupling to offer improved performance. While DARTS has previously been applied to CNN and LSTM combinations, our approach introduces a novel mechanism, particularly in selecting CNN operations using DARTS. In contrast to previous studies, we refrain from imposing constraints on the order of the layers for the CNN within the DARTS cell; instead, we allow DARTS to determine the optimal layer order autonomously. Experimenting with the IEMOCAP and MSP-IMPROV datasets, we demonstrate that our proposed methodology achieves significantly higher SER accuracy than hand-engineering the CNN-LSTM configuration. It also outperforms the best-reported SER results achieved using DARTS on CNN-LSTM.
Abstract（参考訳）: 音声感情認識(ser)は、人間とコンピュータの相互作用における感情認識コミュニケーションの重要な実現要因である。近年のディープラーニング(DL)の進歩により,SERモデルの性能は大幅に向上した。しかし、最適なDLアーキテクチャを設計するには、事前の経験と実験的な評価が必要である。拡張的に、Neural Architecture Search (NAS)は最適なDLモデルを自動的に決定するための有望な道を提供する。特に、微分可能なアーキテクチャ探索(DARTS)は、NASを用いて最適化されたモデルを探索する効率的な方法である。本稿では,DARTS を最適化した CNN と LSTM アーキテクチャを提案する。 DARTSは従来,CNNとLSTMの組み合わせに応用されてきたが,本手法では新しい機構を導入し,特にDARTSを用いたCNN操作を選択する。従来の研究とは対照的に、我々はDARTS細胞内のCNNの層順に制約を課すことを控え、代わりにDARTSが最適な層順を自律的に決定できるようにする。提案手法は,IEMOCAPおよびMPP-IMPROVデータセットを用いて,手作業によるCNN-LSTM構成よりもSERの精度が高いことを示す。また、CNN-LSTM上でDARTSを用いて達成された最高のSER結果よりも優れている。

関連論文リスト

Dynamic Acoustic Model Architecture Optimization in Training for ASR [51.21112094223223]
DMAOは、Grow-and-drop戦略を使用して、トレーニング中にパラメータを自動的に再配置するアーキテクチャ最適化フレームワークである。 CTC onSpeech, TED-Lium-v2, Switchboard を用いてDMAOの評価を行った。
論文参考訳（メタデータ） (2025-06-16T07:47:34Z)
EM-DARTS: Hierarchical Differentiable Architecture Search for Eye Movement Recognition [54.99121380536659]
眼球運動バイオメトリックスは、高い安全性の識別により注目されている。深層学習(DL)モデルは近年,眼球運動認識に成功している。 DLアーキテクチャはまだ人間の事前知識によって決定されている。眼球運動認識のためのDLアーキテクチャを自動設計する階層的微分可能なアーキテクチャ探索アルゴリズムEM-DARTSを提案する。
論文参考訳（メタデータ） (2024-09-22T13:11:08Z)
emoDARTS: Joint Optimisation of CNN & Sequential Neural Network Architectures for Superior Speech Emotion Recognition [26.29080428328618]
音声感情認識(SER)は、コンピュータが人間のコミュニケーションで伝達される感情を理解するために重要である。本研究では,DARTSを最適化したCNNとSeqNN(SeqNN: LSTM, RNN)アーキテクチャであるemoDARTSについて述べる。
論文参考訳（メタデータ） (2024-03-21T02:26:30Z)
Neural Architecture Search using Particle Swarm and Ant Colony Optimization [0.0]
本稿では,OpenNASのSwarm Intelligence (SI)コンポーネントを用いたCNNのトレーニングと最適化に焦点を当てる。画像の分類において,OpenNAS(Neural Architecture Search)のオープンソースツールを統合するシステムを開発した。
論文参考訳（メタデータ） (2024-03-06T15:23:26Z)
RLEEGNet: Integrating Brain-Computer Interfaces with Adaptive AI for Intuitive Responsiveness and High-Accuracy Motor Imagery Classification [0.0]
本稿では,Deep Q-Networks (DQN) を用いた強化学習を分類タスクに活用するフレームワークを提案する。本稿では,OVR(One-Versus-The-Rest)方式で,マルチクラス運動画像(MI)分類のための前処理手法を提案する。 DQNと1D-CNN-LSTMアーキテクチャの統合は意思決定プロセスをリアルタイムで最適化する。
論文参考訳（メタデータ） (2024-02-09T02:03:13Z)
DNS-Rec: Data-aware Neural Architecture Search for Recommender Systems [79.76519917171261]
本稿では,SRS(Sequential Recommender Systems)における計算オーバーヘッドと資源非効率性について述べる。本稿では, プルーニング法と高度なモデル設計を組み合わせた革新的な手法を提案する。我々の主な貢献は、リコメンダシステム(DNS-Rec)のためのデータ対応ニューラルアーキテクチャ検索の開発である。
論文参考訳（メタデータ） (2024-02-01T07:22:52Z)
DCP-NAS: Discrepant Child-Parent Neural Architecture Search for 1-bit CNNs [53.82853297675979]
バイナリ重みとアクティベーションを備えた1ビット畳み込みニューラルネットワーク(CNN)は、リソース制限された組み込みデバイスの可能性を示している。自然なアプローチの1つは、NASの計算とメモリコストを削減するために1ビットCNNを使用することである。本稿では,1ビットCNNを効率的に探索するためにDCP-NAS(Disrepant Child-Parent Neural Architecture Search)を提案する。
論文参考訳（メタデータ） (2023-06-27T11:28:29Z)
Comparison Analysis of Traditional Machine Learning and Deep Learning Techniques for Data and Image Classification [62.997667081978825]
本研究の目的は、コンピュータビジョン2次元オブジェクト分類タスクに使用される最も一般的な機械学習およびディープラーニング技術を分析し比較することである。まず、視覚語モデルと深部畳み込みニューラルネットワーク(DCNN)の理論的背景を示す。次に、Bag of Visual Wordsモデル、VGG16 CNN Architectureを実装します。
論文参考訳（メタデータ） (2022-04-11T11:34:43Z)
Neural Architecture Search for Speech Emotion Recognition [72.1966266171951]
本稿では,SERモデルの自動構成にニューラルアーキテクチャサーチ(NAS)技術を適用することを提案する。 NASはモデルパラメータサイズを維持しながらSER性能(54.89%から56.28%)を向上させることができることを示す。
論文参考訳（メタデータ） (2022-03-31T10:16:10Z)
Convolution Neural Network Hyperparameter Optimization Using Simplified Swarm Optimization [2.322689362836168]
畳み込みニューラルネットワーク(CNN)はコンピュータビジョンで広く使われている。パフォーマンスが向上したネットワークアーキテクチャを見つけるのは容易ではない。
論文参考訳（メタデータ） (2021-03-06T00:23:27Z)
Exploring Deep Hybrid Tensor-to-Vector Network Architectures for Regression Based Speech Enhancement [53.47564132861866]
我々は、CNN-TTというハイブリッドアーキテクチャが、モデルパラメータを小さくして高品質な性能を維持することができることを見出した。 CNN-TTは、音声品質を改善するために、特徴抽出のために下部に複数の畳み込み層で構成されている。
論文参考訳（メタデータ） (2020-07-25T22:21:05Z)
Neural Architecture Search For LF-MMI Trained Time Delay Neural Networks [61.76338096980383]
TDNN(State-of-the-the-art Factored Time delay Neural Network)の2種類のハイパーパラメータを自動的に学習するために、さまざまなニューラルネットワークサーチ(NAS)技術が使用されている。 DARTSメソッドはアーキテクチャ選択とLF-MMI(格子のないMMI)TDNNトレーニングを統合する。 300時間のSwitchboardコーパスで行われた実験では、自動構成システムはベースラインLF-MMI TDNNシステムより一貫して優れていることが示唆された。
論文参考訳（メタデータ） (2020-07-17T08:32:11Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。