論文の概要: EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis
- arxiv url: http://arxiv.org/abs/2606.24941v1
- Date: Mon, 22 Jun 2026 20:45:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.052282
- Title: EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis
- Title(参考訳): EmotionAI: 会話分析のためのプライバシ保護型コンピュータインテリジェンスパイプライン
- Abstract要約: EmotionAIは完全にローカルな計算インテリジェンスパイプラインで、音声認識と生成的推論を結合する。
話者ダイアリゼーション、Whisper Automatic Speech Recognition (ASR)、およびwav2vec2感情分類器は、セグメントごとの感情的証拠を生成する。
このコントリビューションは最先端のSERではなく、不完全な感情的証拠を監査可能なプライバシー保護の基盤となる会話分析に統合したものだ。
- 参考スコア(独自算出の注目度): 1.5803208833562954
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reviewing recorded interviews for affective cues such as composure, hesitation and agitation is slow and subjective, and cloud services that could automate it require sensitive audio to leave the device. EmotionAI is a fully local Computational Intelligence (CI) pipeline that couples Speech Emotion Recognition (SER) with generative reasoning. Speaker diarisation, Whisper Automatic Speech Recognition (ASR) and a wav2vec2 emotion classifier produce per-segment affective evidence, which is then passed to an adversarial three-model local Large Language Model (LLM) panel for timestamp-grounded and citation-constrained question answering. Zero-shot evaluation on the RAVDESS four-class English subset (n = 672) exposes cross-corpus fragility rather than classifier superiority: the deployed classifier scores 48.8% accuracy, above random (24.9%) and majority (28.6%) baselines but below an in-domain MFCC + logistic-regression comparator (71.0%). The complete pipeline runs in a mean 157 s on CPU (real-time factor approximately 1.33) with zero external calls. The contribution is not state-of-the-art SER but an auditable, privacy-preserving integration of imperfect affective evidence into grounded conversational analysis, together with an honest empirical account of where cross-corpus transfer and human-centred validation still fall short.
- Abstract(参考訳): 録音されたインタビュー、例えばコンポージャー、ためらみ、扇動などの感情的な手がかりのレビューは遅く、主観的であり、デバイスを離れるには機密性の高いオーディオを自動化できるクラウドサービスが必要である。
EmotionAIは、音声感情認識(SER)と生成的推論を結合した、完全にローカルな計算知能(CI)パイプラインである。
話者ダイアリゼーション、Whisper Automatic Speech Recognition (ASR)、およびwav2vec2感情分類器は、セグメントごとの感情的証拠を生成し、その後、タイムスタンプと引用に制約のある質問応答のための逆3モデル局所言語モデル(LLM)パネルに渡される。
RAVDESSの4クラス英語サブセット(n = 672)のゼロショット評価では、分類器の優位性よりもクロスコーパスの脆弱性が露呈している: 展開された分類器は48.8%の精度でランダム(24.9%)、多数(28.6%)のベースラインを上回り、ドメイン内のMFCC+ロジスティック回帰コンパレータ(71.0%)以下である。
完全なパイプラインはCPU上の平均157秒(リアルタイム係数は約1.33)で実行され、外部呼び出しはゼロである。
このコントリビューションは最先端のSERではなく、不完全な感情的証拠の監査可能なプライバシー保護統合であり、また、クロスコーパス転送と人間中心の検証がまだ不足しているという、正直な実証的な説明もある。
関連論文リスト
- SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training [4.0913617519821255]
音声感情認識(SER)は、ラベル付きデータの不足と話者間変動の2つの根本的な課題に直面している。
我々は, SISER (Speaker-Invariant Speech Emotion Recognition) を提案し, wav2vec 2.0 を特徴エンコーダとして, ECAPA-TDNN を話者識別器として統合する。
SISERは60.63%のUAを達成し、ベースライン(51.15%)とwav2vec 2.0(56.46%)を上回った
論文 参考訳(メタデータ) (2026-08-31T16:48:43Z) - Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation [1.6389263804357965]
感情認識のための音声のみのアーキテクチャであるDSSM-CRFを提案する。
双方向状態空間モデルは、フレームと対話スケールでの融合した自己教師付き音声表現を符号化する。
話者の連鎖における連続的な発話は、スコアがコーパスレベルの遷移行列と、2つの文脈化された発話から予測される残差を組み合わせた遷移対を形成する。
論文 参考訳(メタデータ) (2026-08-23T12:56:03Z) - SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models [42.27807245438137]
音声言語モデル(SLM)の社会言語学的推論を評価するための包括的なフレームワークであるtextscSpeechEQを紹介する。
このフレームワークには、EQ-i 2.0理論に基づく15の感情的クオシエント(EQ)サブスケールにわたる2,265の対話の検証データセットが含まれている。
論文 参考訳(メタデータ) (2026-06-24T16:03:38Z) - ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models [60.14219417402433]
LLMエージェントの既存のメモリベンチマークは、事実の明示的なリコールを評価するが、意識的な検索なしに、経験が自動的な振る舞いになる暗黙の記憶を見落としている。
IndicitMemBenchは、非宣言的メモリの標準的な認知科学のアカウントから引き出された3つの構造を通して暗黙的メモリを評価する最初の体系的なベンチマークである。
当社の300イテムスイートでは,初動採点を備えたLearning/Priming-Interfere-Testプロトコルを統一しています。
論文 参考訳(メタデータ) (2026-04-09T10:26:32Z) - VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs [54.75016325571445]
音声大言語モデル (LLM) は, 音声の感情認識において, 生成インタフェースを介する大きな可能性を示す。
クローズドセットからオープンテキスト生成へのシフトは、ゼロショット性を導入し、プロンプトに非常に敏感な評価を与える。
本稿では,VoxEmoについて紹介する。VoxEmoは音声LLMのための15言語に35の感情コーパスを含む総合的なSERベンチマークである。
論文 参考訳(メタデータ) (2026-03-09T21:10:34Z) - ADEPT: RL-Aligned Agentic Decoding of Emotion via Evidence Probing Tools -- From Consensus Learning to Ambiguity-Driven Emotion Reasoning [67.22219034602514]
ADEPT(Agentic Decoding of Emotion via Evidence Probing Tools)は,感情認識をマルチターン探索プロセスとして再構成するフレームワークである。
ADEPTはSLLMを進化する候補感情を維持するエージェントに変換し、専用のセマンティックおよび音響探査ツールを適応的に呼び出す。
ADEPTは、ほとんどの設定において主感情の精度を向上し、微妙な感情の特徴を著しく改善することを示した。
論文 参考訳(メタデータ) (2026-02-13T08:33:37Z) - AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering [97.52852990265136]
音声対応大規模言語モデルの推論機能を活用するバックボーン非依存評価フレームワークであるAQAScoreを紹介する。
AQAScoreは人格関連性、ペア比較、構成推論タスクを含む複数のベンチマークで評価する。
論文 参考訳(メタデータ) (2026-01-21T07:35:36Z) - Understanding Emotion in Discourse: Recognition Insights and Linguistic Patterns for Generation [0.36980845568339205]
認識のための10シード評価を併用した厳格なアブレーション試験を行った。
言語分析では,5,286件の談話マーカーを解析する。
感情とマーカー位置の有意な関連性を見いだす。
論文 参考訳(メタデータ) (2026-01-01T02:49:44Z) - When Robots Should Say "I Don't Know": Benchmarking Abstention in Embodied Question Answering [27.058973883094]
EQA(Embodied Question Answering)は、エージェントが言語を解釈し、その環境を認識し、3Dシーン内をナビゲートして応答を生成する。
我々は、EQAエージェントに対する最小限の要件、棄権:いつ回答を控えるかを知ることに注力する。
我々は,行動可能性,参照的不特定性,嗜好依存,情報利用不能,虚偽の先入観の5つのカテゴリーを抽出した。
論文 参考訳(メタデータ) (2025-12-04T09:17:40Z) - SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models [60.72029578488467]
SpeechRは、大規模な音声言語モデルにおける音声に対する推論を評価するための統一的なベンチマークである。
事実検索、手続き推論、規範的判断の3つの重要な側面に沿ったモデルを評価する。
11個の最先端のLALMの評価は、高い転写精度が強い推論能力に変換されないことを示している。
論文 参考訳(メタデータ) (2025-08-04T03:28:04Z) - Speech Emotion Detection Based on MFCC and CNN-LSTM Architecture [0.0]
本稿では,最初の音声入力をウェーブプロットとスペクトルに処理して分析し,特徴抽出の対象としてMFCCを含む複数の特徴に集中する。
このアーキテクチャは、テストセットに対して総合的に61.07%の精度を達成し、怒りと中立性の検出はそれぞれ75.31%と71.70%のパフォーマンスに達した。
論文 参考訳(メタデータ) (2025-01-18T06:15:54Z) - EmoDiarize: Speaker Diarization and Emotion Identification from Speech
Signals using Convolutional Neural Networks [0.0]
本研究では,音声認識における深層学習技術の統合について検討する。
既存の話者ダイアリゼーションパイプラインと、畳み込みニューラルネットワーク(CNN)上に構築された感情識別モデルを組み合わせたフレームワークを導入する。
提案モデルでは,63%の非重み付き精度が得られ,音声信号中の感情状態を正確に同定する上で,顕著な効率性を示した。
論文 参考訳(メタデータ) (2023-10-19T16:02:53Z) - Decoding speech perception from non-invasive brain recordings [48.46819575538446]
非侵襲的な記録から知覚音声の自己教師付き表現をデコードするために、コントラスト学習で訓練されたモデルを導入する。
我々のモデルでは、3秒のMEG信号から、1,000以上の異なる可能性から最大41%の精度で対応する音声セグメントを識別できる。
論文 参考訳(メタデータ) (2022-08-25T10:01:43Z) - HuBERT: Self-Supervised Speech Representation Learning by Masked
Prediction of Hidden Units [81.53783563025084]
本稿では、BERTのような予測損失に対して、アライメントされたターゲットラベルを提供するオフラインクラスタリングステップを提案する。
提案手法の重要な要素は,マスク領域にのみ予測損失を適用することである。
HuBERTは、より困難なdev-otherおよびtest-other評価サブセットに対して、最大19%と13%の相対的なWER削減を示す。
論文 参考訳(メタデータ) (2021-06-14T14:14:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。