論文の概要: EIBench: A Simulator-Based Benchmark and Turn-Credit RL for Emotion Management
- arxiv url: http://arxiv.org/abs/2606.15532v1
- Date: Sun, 14 Jun 2026 01:22:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:33.67928
- Title: EIBench: A Simulator-Based Benchmark and Turn-Credit RL for Emotion Management
- Title(参考訳): EIBench: 感情管理のためのシミュレータベースのベンチマークとターンクレディットRL
- Abstract要約: EIBenchは対話型感情管理のためのシミュレータベースのベンチマークである。
EIBenchには2,222のシナリオがあり、トレーニングには2,009、ホールドアウトテストには213のシナリオがある。
現在のモデルはサポートやラプポート構築の場面でうまく機能するが、ユーザ圧力下での境界維持に苦労する。
- 参考スコア(独自算出の注目度): 78.71074071187753
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Emotional intelligence (EI) in Large Language Models (LLMs) is often evaluated through static understanding tasks or single-response dialogue generation. However, emotion management is interactive: a good model should not only recognize a user's emotion, but also improve the user's emotional and relational state over several turns. We introduce EIBench, a simulator-based benchmark for interactive emotion management. EIBench contains 2,222 scenarios, with 2,009 for training and 213 for held-out testing. The scenarios are organized by a 2x2 taxonomy covering Support, Defense, Repair, and Charm, which together capture different forms of support, boundary maintenance, trust repair, and rapport building. In each scenario, an LLM simulator plays the user, updates an emotion-relation state after each turn, and maps the final state to an anchor-based score. This design makes EIBench both an evaluation benchmark and a training environment: the final state gives the outcome reward, while the per-turn state updates provide dense feedback for RL. We evaluate 15 open- and closed-source LLMs. Current models perform well on support and rapport-building scenes, but struggle with boundary maintenance under user pressure. To improve the EI ability of LLMs, we propose Centered Turn-Credit GRPO (CTC-GRPO), a GRPO extension that reuses the simulator's per-turn state updates as dense turn-level feedback while preserving the final outcome reward. CTC-GRPO improves Qwen3-8B from -22.4 to +22.4 on EIBench and also improves on out-of-distribution evaluations including SAGE (+12.4) and EQBench3 (+20.9%). Our results show that simulator-tracked user states can support both evaluation and training for multi-turn emotion management.
- Abstract(参考訳): 大規模言語モデル(LLM)における感情知能(EI)は静的理解タスクや単一応答対話生成を通じて評価されることが多い。
しかし、感情管理は対話的であり、良いモデルはユーザーの感情を認識するだけでなく、ユーザの感情や関係状態を数回にわたって改善すべきである。
EIBenchは対話型感情管理のためのシミュレータベースのベンチマークである。
EIBenchには2,222のシナリオがあり、トレーニングには2,009、ホールドアウトテストには213のシナリオがある。
シナリオは、サポート、防衛、修復、およびチャームをカバーする2×2の分類学によって編成され、それぞれ異なる種類の支援、境界維持、信頼回復、ラプポートビルを同時に取得する。
各シナリオでは、LDMシミュレータがユーザを再生し、各ターン後に感情関連状態を更新し、最終状態をアンカーベースのスコアにマップする。
この設計により、EIBenchは評価ベンチマークとトレーニング環境の両方を実現している。
オープンおよびクローズドソースのLLMを15種類評価する。
現在のモデルはサポートやラプポート構築の場面でうまく機能するが、ユーザ圧力下での境界維持に苦労する。
LLMのEI能力を向上させるため、最終結果の報奨を保ちながら、シミュレータのターン毎の状態更新を高密度なターンレベルフィードバックとして再利用するGRPO拡張であるCentered Turn-Credit GRPO(CTC-GRPO)を提案する。
CTC-GRPOは、EIBenchでQwen3-8Bを-22.4から+22.4に改善し、SAGE(+12.4)やEQBench3(+20.9%)などのアウト・オブ・ディストリビューションの評価も改善した。
この結果から,マルチターン感情管理のための評価とトレーニングの両面で,シミュレータ追跡されたユーザ状態が有効であることが示唆された。
関連論文リスト
- Disclosure-Gated User Simulation for Companion-Agent Evaluation [14.962552394114894]
私たちは大きな言語モデルを使ってユーザをプレイし、その仕様に対してユーザシミュレータをトレーニングします。
ゲーティング行動は、トレーニングコーパスの合成ブランチから学習され、実際のブランチは、人々が話す方法と反応する方法を提供する。
ランク付けは順序保存でなければならず、絶対スコアはスケール安定でなければなりません。
論文 参考訳(メタデータ) (2026-09-01T09:39:41Z) - Reinforcing Human Behavior Simulation via Verbal Feedback [105.68319269895653]
本稿では,言語フィードバックを強化学習の第一級信号として扱うことによって訓練したモデルであるDITTOを提案する。
また、心の理論、キャラクターロールプレイ、社会的スキル、学習者シミュレーション、ユーザシミュレーション、ペルソナシミュレーションの6つのカテゴリにまたがる10のタスクにまたがる統合ベンチマークとトレーニングデータスイートであるSOULを紹介した。
DitTOはベースモデルに対して平均36%の改善を達成し、10のSOULベンチマークでGPT-5.4を上回った。
論文 参考訳(メタデータ) (2026-05-19T21:23:24Z) - EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents [3.0301675282070577]
EVA-Benchは、音声エージェントのエンドツーエンド評価フレームワークである。
動的マルチターン対話を通じてボット間音声会話をオーケストレーションする。
タスク完了、忠実度、および音声レベルの音声の忠実度をキャプチャする。
また、会話の進行、会話の簡潔さ、ターンテイキングのタイミングもキャプチャする。
論文 参考訳(メタデータ) (2026-05-13T17:58:52Z) - Simulating Students or Sycophantic Problem Solving? On Misconception Faithfulness of LLM Simulators [55.617099475539305]
大規模言語モデル(LLM)は、生徒のような反応を流線型に生成できるため、AI教師や人間教育者のトレーニングや評価のための模擬学生として魅力的である。
しかし、このようなシミュレータは、実際の学生と出力の類似性によって評価され、相互作用中に一貫性のある誤解を持つ学生のように振る舞うかどうかによって評価される。
シミュレーションが誤解駆動の信念状態を維持しているかどうかを判断し、フィードバックが誤解に対処した場合に選択的に更新する。
論文 参考訳(メタデータ) (2026-05-12T20:55:23Z) - Can You Break RLVER? Probing Adversarial Robustness of RL-Trained Empathetic Agents [0.0]
RLVERは、協力的で正直なユーザを前提としたベンチマークに基づいて、強い共感的パフォーマンスを持つ言語モデルを作成している。
本稿では, 情緒的強靭性を評価するために, 情緒的共感ベンチマークAEBを構築し, 情緒的一貫性スコアECSを導入する。
我々は,ECS-FS(Final Score)ギャップを,内部理解や臨床準備の証拠としてではなく,シミュレーターファミリー内での行動・相対性解離と解釈する。
論文 参考訳(メタデータ) (2026-05-08T02:14:12Z) - SimEval-IR: A Unified Toolkit and Benchmark Suite for Evaluating User Simulators and Search Sessions [1.1105673928718571]
オープンソースのツールキットとベンチマークスイートであるSimEval-IRについて述べる。
SimEval-IR は,(1) セッション検索と対話を統一する標準セッションスキーマ,(2) 行動リアリズム,RATE スタイルの推定によるテスタの信頼性,および2つの言語と4つのシミュレーターファミリーの4つの実データセットのベースライン結果に関する3つのベンチマークを提供する。
論文 参考訳(メタデータ) (2026-04-30T13:56:18Z) - SimulatorArena: Are User Simulators Reliable Proxies for Multi-Turn Evaluation of AI Assistants? [61.07963107032645]
大規模言語モデル(LLM)は、対話型アプリケーションでますます使われている。
人間の評価は、マルチターン会話におけるパフォーマンスを評価するためのゴールドスタンダードのままである。
我々は、909の注釈付き人間とLLMの会話を2つの対話タスクで行うベンチマークであるSimulatorArenaを紹介した。
論文 参考訳(メタデータ) (2025-10-06T23:17:44Z) - RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents [67.46032287312339]
大規模言語モデル(LLM)は論理的およびアルゴリズム的推論において優れているが、彼らの感情的知性(EQ)は認知能力よりもはるかに遅れている。
シミュレーションユーザによる検証可能な感情報酬を活用する,最初のエンドツーエンド強化学習フレームワークであるRLVERを紹介する。
以上の結果から,RLVERは感情的知的で幅広い言語エージェントへの実践的な経路であることが示唆された。
論文 参考訳(メタデータ) (2025-07-03T18:33:18Z) - Metaphorical User Simulators for Evaluating Task-oriented Dialogue
Systems [80.77917437785773]
タスク指向対話システム(TDS)は、主にオフラインまたは人間による評価によって評価される。
本稿では,エンド・ツー・エンドのTDS評価のためのメタファ型ユーザシミュレータを提案する。
また,異なる機能を持つ対話システムなどの変種を生成するためのテスタベースの評価フレームワークを提案する。
論文 参考訳(メタデータ) (2022-04-02T05:11:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。