論文の概要: EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models
- arxiv url: http://arxiv.org/abs/2608.09189v1
- Date: Mon, 10 Aug 2026 06:58:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.119795
- Title: EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models
- Title(参考訳): EmoS: 音声言語モデルにおける感情的知性の評価と調整のための理論集約型フレームワーク
- Abstract要約: EmoSBenchは、Spoken Language Modelsの最初の包括的なEI評価ベンチマークである。
EmoSは83.8%の精度に達し、人間レベルのパフォーマンスに近づいている。
- 参考スコア(独自算出の注目度): 66.28519000191191
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite significant advances in instruction-following and auditory comprehension, the evaluation of Emotional Intelligence (EI) in Spoken Language Models (SLMs) remains confined to rudimentary paralinguistic perception, lacking a systematic, theory-driven cognitive framework. We introduce EmoSBench, the first comprehensive EI evaluation benchmark for SLMs constructed upon the four-branch theoretical model, covering Perceiving, Understanding, Using, and Managing Emotion across ten sub-tasks. Preliminary assessments on EmoSBench reveal a substantial gap: even leading proprietary models like GPT-4o-Audio achieve only 52.6%, significantly trailing human baselines. To bridge this gap, we develop EmoS, a specialized evaluator model optimized via Supervised Fine-Tuning (SFT) and Group Relative Policy Optimization (GRPO). To facilitate its effective training, we curate EmoDialogue, a bilingual dataset providing necessary fine-grained supervision through response pairs with rigorously defined EI gradations. Concurrently, we introduce a reward mechanism integrating a Steep Exponential Accuracy Reward (SEAR) and a Rationale Fidelity Reward (RFR) to enforce precise ordinal scoring and valid reasoning. Experiments demonstrate that EmoS reaches 83.8% accuracy, approaching human-level performance. Furthermore, evaluations on authentic, unconstrained spoken interactions validate its robust real-world generalization, establishing a foundational framework for advancing emotionally intelligent dialogue systems.
- Abstract(参考訳): 音声言語モデル(SLM)における情緒的知性(EI)の評価は、命令追従と聴覚的理解の大幅な進歩にもかかわらず、体系的、理論駆動的な認知枠組みを欠いた初歩的パラ言語的知覚に限られている。
EmoSBenchは,4分岐理論モデルに基づいて構築されたSLMの総合的EI評価ベンチマークであり,10のサブタスクにわたる知覚,理解,利用,および情動の管理をカバーしている。
GPT-4o-Audioのような主要なプロプライエタリモデルでさえ、52.6%しか達成できず、人間のベースラインを大きく下回っている。
このギャップを埋めるために,スーパービジョンファインチューニング(SFT)とグループ相対政策最適化(GRPO)によって最適化された特殊評価モデルであるEmoSを開発した。
EmoDialogueは、厳密に定義されたEIグレードを持つ応答ペアを通して、必要なきめ細かな監視を提供するバイリンガルデータセットである。
同時に,SEAR(Steep Exponential Accuracy Reward)とRFR(Rationale Fidelity Reward)を統合し,厳密な順序付けと妥当な推論を行う報奨機構を導入する。
実験の結果、EmoSは83.8%の精度に達し、人間レベルのパフォーマンスに近づいた。
さらに、真正で制約のない音声対話の評価は、その堅牢な現実世界の一般化を検証し、感情的に知的な対話システムを前進させる基盤となる枠組みを確立した。
関連論文リスト
- CAREBench: Evaluating LLMs' Emotion Understanding by Assessing Cognitive Appraisal Reasoning [15.748287669426695]
本稿では,CAREBenchについて紹介する。CAREBenchは,実世界の物語に関する一対一の視点と三対三の視点から,完全な推論連鎖アノテーションを用いた最初のベンチマークである。
より強いモデルは、特定のタスクにおいて人間の観察者と一致するか、あるいは上回っているが、評価的推論と肯定的な感情認識では不足している。
論文 参考訳(メタデータ) (2026-05-16T22:23:21Z) - SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution [82.31558282651811]
複雑な対人相互作用をナビゲートするソーシャルインテリジェンスは、言語エージェントに根本的な課題を提示する。
既存のアプローチでは、言語モデルを直接使用してエピソードレベルの報酬を分配する。
協調ゲーム理論に基づく新しい原理的枠組みであるSAVOIRを提案する。
論文 参考訳(メタデータ) (2026-04-21T02:08:25Z) - HeartBench: Probing Core Dimensions of Anthropomorphic Intelligence in LLMs [20.794341575633503]
HeartBenchは、中国の大規模言語モデル(LLM)の総合的な感情的、文化的、倫理的次元を評価するために設計されたフレームワークである。
先行モデルでさえ、専門家が定義した理想スコアの60%しか達成できない。
難易度階層化された「ハードセット」を用いた分析では、微妙な感情的な文章や複雑な倫理的トレードオフを含むシナリオにおいて、顕著な性能低下が見られる。
論文 参考訳(メタデータ) (2025-12-26T03:54:56Z) - Evaluating AI Counseling in Japanese: Counselor, Client, and Evaluator Roles Assessed by Motivational Interviewing Criteria [0.0]
本研究は,日本語治療における3つのカウンセリングの役割において,大規模言語モデル(LLM)の性能を総合的に評価した最初の事例である。
我々は同時に、カウンセラー人工知能(AI)システム(GPT-4-turbo with zeroshot prompting or Structured Multi-step Dialogue Prompts (SMDP), Claude-3-Opus-SMDP)、クライアントAIシミュレーション、評価AIシステム(o3, Claude-3.7-Sonnet, Gemini-2.5-pro)を評価した。
Geminiはパワーシェアリングを強調し、o3は技術的熟練に焦点を当て、Sonnetは感情表現を優先した。
論文 参考訳(メタデータ) (2025-06-28T21:50:29Z) - EmoBench: Evaluating the Emotional Intelligence of Large Language Models [73.60839120040887]
EmoBenchは、確立された心理学理論に基づいて、マシン感情知能(EI)の包括的な定義を提案するベンチマークである。
EmoBenchには、英語と中国語で400の手作りの質問が含まれている。
以上の結果から,既存の大規模言語モデルのEIと平均的な人間の間には,かなりのギャップがみられ,今後の研究に向けての有望な方向性が浮かび上がっている。
論文 参考訳(メタデータ) (2024-02-19T11:48:09Z) - MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation [60.65820977963331]
大規模言語モデル(LLM)のための新しい評価パラダイムを導入する。
このパラダイムは、しばしば推論プロセスを無視する結果指向の評価から、より包括的な評価へと重点を移す。
GSM8Kデータセットにこのパラダイムを適用し,MR-GSM8Kベンチマークを開発した。
論文 参考訳(メタデータ) (2023-12-28T15:49:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。