論文の概要: VocalAffectBench: Evaluating Vocal Emotion Recognition in AI Audio Models
- arxiv url: http://arxiv.org/abs/2608.28932v2
- Date: Tue, 01 Sep 2026 03:00:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.575934
- Title: VocalAffectBench: Evaluating Vocal Emotion Recognition in AI Audio Models
- Title(参考訳): VocalAffectBench:AIオーディオモデルにおける音声感情認識の評価
- Authors: Luc Debaupte, Tyler Baumgartner, Brandon Tai, Candice Fan, Bill Wang, Yi Zhong,
- Abstract要約: 我々は、AIオーディオモデルが生音声から表現された音声感情を識別できるかどうかを評価するテスト専用ベンチマークであるVocalAffectBenchを紹介する。
このベンチマークには、51人の話者による273本の英語のWAVクリップが含まれており、7つのラベルで合計1.95時間である。
すべてのベースラインは、書き起こしやコンテキストメタデータなしで、オーディオのみから評価される。
- 参考スコア(独自算出の注目度): 3.031452739909654
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Voice products increasingly need affective cues that are present in speech but absent from transcripts. We introduce VocalAffectBench, a public, test-only benchmark for evaluating whether AI audio models can identify expressed vocal emotion from raw audio. The benchmark contains 273 human-recorded English WAV clips from 51 speaker accounts totaling 1.95 hours across seven labels: angry, disgusted, fearful, happy, neutral, sad, and surprised, with 39 clips per class. All baselines are evaluated from audio alone, without transcripts or contextual metadata. Across six released baselines, average accuracy is 35.5%. The strongest baseline, gemini_3_5_flash, reaches 46.5% on the seven-way task, above the 14.3% random baseline but far from robust emotion recognition. A secondary valence-bucket analysis maps labels into positive, neutral, and negative classes, excluding surprised because its valence is ambiguous. Aggregate accuracy under this coarser view is 50.9%. Performance is highly uneven across classes. By recall, neutral is identified most reliably at 75.6% averaged across baselines, while surprised and fearful reach only 10.7% and 15.4%, respectively. These results show that the evaluated baselines can extract some affective signal from speech, but discrete expressed-emotion recognition remains fragile, especially for non-neutral emotions that are often most important in voice agent workflows.
- Abstract(参考訳): 音声製品はますます感情的な手がかりを必要としており、音声中に存在するが、文字起こしが欠如している。
我々は、AIオーディオモデルが生音声から表現された声の感情を識別できるかどうかを評価するための公開テスト専用ベンチマークであるVocalAffectBenchを紹介する。
このベンチマークには、51人の話者の合計1.95時間、怒り、嫌悪感、恐怖、幸福、中立、悲しみ、驚きの273本の英語のWAVクリップが含まれている。
すべてのベースラインは、書き起こしやコンテキストメタデータなしで、オーディオのみから評価される。
6つのリリースベースラインで平均精度は35.5%である。
最強のベースラインであるgemini_3_5_flashは、14.3%のランダムベースラインを超える7方向タスクで46.5%に達するが、強い感情認識からは程遠い。
二次原子価-バケット分析は、その原子価が曖昧であるため驚きを除いて、ラベルを正、中、負のクラスにマッピングする。
この粗視下での凝集精度は50.9%である。
パフォーマンスはクラス間で非常に不均一です。
言い換えれば、中立性はベースライン全体で平均75.6%で、驚きと恐怖がそれぞれ10.7%と15.4%にしか達していない。
これらの結果から,評価されたベースラインは音声から感情的な信号を引き出すことができるが,特に音声エージェントのワークフローにおいて最も重要な非ニュートラル感情に対して,離散的な感情認識は脆弱なままであることがわかった。
関連論文リスト
- Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis [2.490194241610381]
音声配信におけるテキストの一致変化から, 脱獄能力がどの程度生じるかを検討する。
PJ-Breakは, 覚醒, 権威, 発話率を目標とした, 予め設定したブラックボックス評価プロトコルである。
全体として、一致したテキストによる音声の配信は、オーディオLLMの安全性評価において第一級の要素として扱われるべきである。
論文 参考訳(メタデータ) (2026-07-29T07:12:44Z) - Voice Memory for Agentic Speech Recognition [66.69623133635868]
エージェント音声認識のための推論専用スキームであるVoice Memoryを提案する。
同期的に、スコア付き例は、境界編集を通じてそのファイルを更新する。
10のHyPoradiseドメインにオープン修正器、Voice Memory、重み付き単語エラー率8.36%から7.52%の10のドメインがある。
論文 参考訳(メタデータ) (2026-07-29T02:42:56Z) - Robust Assamese Speech Recognition through Controlled Fine-Tuning of Whisper Models [1.4095958360608893]
本稿ではMozilla Common Voice 24.0-Assamese corpusで学習したWhisper-based Assamese ASRシステムについて述べる。
ハードウェア対応の最適化トレーニングパイプラインは、リソース制約のある環境向けに実装されている。
論文 参考訳(メタデータ) (2026-07-19T09:54:52Z) - EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis [1.5803208833562954]
EmotionAIは完全にローカルな計算インテリジェンスパイプラインで、音声認識と生成的推論を結合する。
話者ダイアリゼーション、Whisper Automatic Speech Recognition (ASR)、およびwav2vec2感情分類器は、セグメントごとの感情的証拠を生成する。
このコントリビューションは最先端のSERではなく、不完全な感情的証拠を監査可能なプライバシー保護の基盤となる会話分析に統合したものだ。
論文 参考訳(メタデータ) (2026-06-22T20:45:49Z) - Speaker Identity in Non-Verbal Vocalizations: Conditional Distillation and Mixture of Experts Approach [70.31217233606066]
10種類の非言語発声(NVV)を対象とした最初の系統的研究について述べる。
本研究では,Data2Vec の自己教師機能と ECAPA-TDNN を組み合わせたフレームワークを提案し,Mixture of Experts (MoE) モジュールと学習ドメイン認識ルーティングを併用した。
事前訓練された教師による音声入力に対する条件付き蒸留損失は音声合成精度を保ち、対照的な損失は音声-NVV領域ギャップを橋渡しする。
論文 参考訳(メタデータ) (2026-06-19T08:32:07Z) - Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition [58.25449304752214]
生音声が既に利用可能である場合に、明示的な音響的手がかりが根拠となるかどうかを考察する。
標準化されたeGeMAPSパラ言語特徴集合から6つの解釈可能な音響概念トークンを導出する。
調整されたトークンは平均リコール(UAR)を改善するが、シャッフル、競合、破損したトークンはパフォーマンスを低下させる。
トークンのみの介入は、ALMに基づく感情計算において、オーディオグラウンドドキューの使用、堅牢性、解釈可能性を調べるための実用的な方法である、と我々は主張する。
論文 参考訳(メタデータ) (2026-06-05T14:26:06Z) - StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation [56.49717639074325]
ストリーミング話者匿名化(SA)における感情コンテンツ保存の課題に対処する。
音響トークン隠蔽状態におけるフレームレベルの感情蒸留と同一話者からのニュートラル感情発話対を用いた教師付き微調整を提案する。
VoicePrivacy 2024プロトコルでは、49.2%のUAR(感情保存)と5.77%のWER(インテリジェンス)を実現している。
論文 参考訳(メタデータ) (2026-03-06T09:30:20Z) - Emotional Voice Messages (EMOVOME) database: emotion recognition in spontaneous voice messages [2.1455880234227624]
EMOVOME(Emotional Voice Messages)は、スペイン語話者100人のメッセージアプリで、実際の会話から999の音声メッセージを含む、自発的な音声データセットである。
ボイスメッセージは、参加者が採用される前に、実験室環境による意識的な偏見を避けるために、現場で発生した。
このデータベースは、野生における感情認識の研究に大きく貢献すると同時に、スペイン語に固有の自然で自由にアクセスできるリソースを提供する。
論文 参考訳(メタデータ) (2024-02-27T13:22:47Z) - Decoding speech perception from non-invasive brain recordings [48.46819575538446]
非侵襲的な記録から知覚音声の自己教師付き表現をデコードするために、コントラスト学習で訓練されたモデルを導入する。
我々のモデルでは、3秒のMEG信号から、1,000以上の異なる可能性から最大41%の精度で対応する音声セグメントを識別できる。
論文 参考訳(メタデータ) (2022-08-25T10:01:43Z) - Textless Speech Emotion Conversion using Decomposed and Discrete
Representations [49.55101900501656]
我々は、音声を、コンテンツ単位、F0、話者、感情からなる離散的、非絡み合いの学習表現に分解する。
まず、内容単位を対象の感情に翻訳し、その単位に基づいて韻律的特徴を予測することによって、音声内容を変更する。
最後に、予測された表現をニューラルボコーダに入力して音声波形を生成する。
論文 参考訳(メタデータ) (2021-11-14T18:16:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。