論文の概要: Prompt Amplification and Zero-Shot Late Fusion in Audio-Language Models for Speech Emotion Recognition
- arxiv url: http://arxiv.org/abs/2603.23057v1
- Date: Tue, 24 Mar 2026 10:55:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.439521
- Title: Prompt Amplification and Zero-Shot Late Fusion in Audio-Language Models for Speech Emotion Recognition
- Title(参考訳): 音声感情認識のための音声言語モデルにおけるプロンプト増幅とゼロショットレイトフュージョン
- Authors: Saurabh Kataria, Xiao Hu,
- Abstract要約: ZS-Fuseは、デュアルエンコーダALMからのゼロショット感情推定とスペシャリストFMを組み合わせたレイトフュージョン方式である。
3つのデュアルエンコーダALMと2つのFMでZS-Fuseを評価し,SOTAベースラインに対する改善点を報告する。
- 参考スコア(独自算出の注目度): 4.565947624283521
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Audio-Language Models (ALMs) are making strides in understanding speech and non-speech audio. However, domain-specialist Foundation Models (FMs) remain the best for closed-ended speech processing tasks such as Speech Emotion Recognition (SER). Using ALMs for Zero-shot SER is a popular choice, but their potential to work with specialists to achieve state-of-the-art (SOTA) performance remains unexplored. We propose ZS-Fuse, a late-fusion method that combines zero-shot emotion estimates from a dual-encoder ALM with specialist FMs. To handle ambiguity in emotions and sensitivity to prompt choice, 1) we use a simple prompt ensemble and 2) suggest a novel technique called prompt amplification, which repeats audio and text queries to discover stronger zero-shot capabilities. We demonstrate the efficacy of our technique by evaluating ZS-Fuse with three dual-encoder ALMs and two FMs, and report improvements over SOTA baselines, such as WavLM-Large, on three speech emotion recognition datasets.
- Abstract(参考訳): 音声言語モデル(ALM)は、音声と非音声の理解に力を入れている。
しかし、ドメインスペシャリストのファンデーションモデル(FM)は、音声感情認識(SER)のような閉じた音声処理タスクに最適である。
ゼロショットSERにALMを使うことは一般的な選択であるが、最先端(SOTA)のパフォーマンスを達成するために専門家と協力する可能性はまだ明らかではない。
本稿では,デュアルエンコーダALMのゼロショット感情推定とスペシャリストFMを組み合わせたレイトフュージョン手法ZS-Fuseを提案する。
感情のあいまいさと選択を促すための敏感さに対処する。
1)簡単なプロンプトアンサンブルと
提案手法は,音声とテキストのクエリを繰り返すことで,より強力なゼロショット機能を実現する手法である。
本稿では、3つのデュアルエンコーダALMと2つのFMを用いたZS-Fuseの有効性を実証し、3つの音声感情認識データセット上でのWavLM-LargeなどのSOTAベースラインの改善について報告する。
関連論文リスト
- VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs [54.75016325571445]
音声大言語モデル (LLM) は, 音声の感情認識において, 生成インタフェースを介する大きな可能性を示す。
クローズドセットからオープンテキスト生成へのシフトは、ゼロショット性を導入し、プロンプトに非常に敏感な評価を与える。
本稿では,VoxEmoについて紹介する。VoxEmoは音声LLMのための15言語に35の感情コーパスを含む総合的なSERベンチマークである。
論文 参考訳(メタデータ) (2026-03-09T21:10:34Z) - Large Language Models are Strong Audio-Visual Speech Recognition Learners [53.142635674428874]
マルチモーダル・大規模言語モデル(MLLM)は,近年,多モーダル理解能力の強化により,研究の焦点となっている。
本稿では,Llama-AVSRを提案する。
我々は,最大公的なAVSRベンチマークであるLSS3に対する提案手法を評価し,WERが0.79%,AVSRが0.77%であるASRとAVSRのタスクに対して,新しい最先端の結果が得られることを示した。
論文 参考訳(メタデータ) (2024-09-18T21:17:27Z) - Beyond Silent Letters: Amplifying LLMs in Emotion Recognition with Vocal Nuances [3.396456345114466]
本稿では,音声特徴を自然言語記述に変換するSpeechCueLLMを提案する。
我々は、IEMOCAPとMELDの2つのデータセット上でSpeechCueLLMを評価し、感情認識精度を大幅に改善した。
論文 参考訳(メタデータ) (2024-07-31T03:53:14Z) - BLSP-Emo: Towards Empathetic Large Speech-Language Models [34.62210186235263]
BLSP-Emoは、音声における意味と感情の両方を理解可能なエンドツーエンドの音声言語モデルを開発するための新しいアプローチである。
実験の結果,BLSP-Emoモデルでは,音声の理解と共感応答の伝達が優れていることがわかった。
論文 参考訳(メタデータ) (2024-06-06T09:02:31Z) - Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities [37.02115473120654]
音声を理解するために大きな言語モデル(LLM)を拡張することは、様々な現実世界のアプリケーションにとって非常に重要である。
本稿では,1)強音声理解能力を備えた新しい音声言語モデルであるAudio Flamingoを提案する。
論文 参考訳(メタデータ) (2024-02-02T18:58:34Z) - Learning Speech Representation From Contrastive Token-Acoustic
Pretraining [57.08426714676043]
本研究では、2つのエンコーダを用いて音素と音声を複数モーダル空間に導入するCTAP(Contrastive Token-Acoustic Pretraining)を提案する。
提案したCTAPモデルは、210k音声と音素ペアで訓練され、最小教師付きTS、VC、ASRを実現する。
論文 参考訳(メタデータ) (2023-09-01T12:35:43Z) - Prompting the Hidden Talent of Web-Scale Speech Models for Zero-Shot
Task Generalization [61.60501633397704]
本稿では,最近提案されたWebスケール音声モデルのWhisperの創発的能力について検討する。
タスク固有のプロンプトを、別の大規模モデルを活用するか、あるいはデフォルトのプロンプトで特別なトークンを操作するだけで設計する。
実験の結果,提案手法は3つのゼロショットタスクで10%から45%向上し,SotAの教師付きモデルよりも優れていることがわかった。
論文 参考訳(メタデータ) (2023-05-18T16:32:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。