論文の概要: Evolving Support Priorities in Empathetic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.34249v1
- Date: Mon, 28 Sep 2026 03:55:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 22:32:37.845123
- Title: Evolving Support Priorities in Empathetic Reinforcement Learning
- Title(参考訳): 共感的強化学習における支援優先事項の展開
- Abstract要約: 我々は、認知的、感情的、積極的共感に沿った共感的支援を組織し、文脈適応進化(CARE)を提案する。
それぞれのターンで、CAREはこれら3つの共感次元の重みとそれらのきめ細かい評価基準を調整し、文脈適応型ルーブリックを生成する。
CAREは、SentientBench、EQBench3、EMPAの3つの独立したLCM判事の下で最先端のパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 32.37203872838011
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We identify a fundamental mismatch in empathetic reinforcement learning: support priorities evolve with the dialogue state, yet existing methods typically optimize predefined reward specifications that remain fixed across turns. To model these evolving support priorities, we organize empathetic support along cognitive, affective, and proactive empathy, and propose Context-Adaptive Rubric Evolution (CARE). At each turn, CARE generates a context-adaptive rubric by adjusting both the weights of these three empathy dimensions and their fine-grained evaluation criteria. The rubric generator is trained with turn-level rubric supervision and human preference data through supervised fine-tuning followed by preference-based reinforcement learning, and then serves as an adaptive reward interface for online empathetic RL. Integrated with both RLVER and MICA, CARE achieves state-of-the-art performance across SentientBench, EQBench3, and EMPA under three independent LLM judges. Notably, on EMPA, CARE improves EPM-Idx over the strongest baseline by at least 13 points under all three judges, including an increase from 28.11 to 83.54 under Gemini-2.5-Pro. Further analyses show that learned rubric priorities systematically vary across dialogue stages and user emotions, demonstrating that CARE adapts what is rewarded as support needs evolve.
- Abstract(参考訳): 我々は共感的強化学習における基本的なミスマッチを識別する: サポートの優先順位は対話状態とともに進化するが、既存の手法は通常、ターン毎に固定された報酬仕様を最適化する。
これらの発展するサポートの優先順位をモデル化するために、認知、感情、積極的共感に沿った共感的支援を組織し、文脈適応的ルーブリック進化(CARE)を提案する。
それぞれのターンで、CAREはこれら3つの共感次元の重みとそれらのきめ細かい評価基準を調整し、文脈適応型ルーブリックを生成する。
本発明のルーブリックジェネレータは、教師付き微調整後、嗜好に基づく強化学習を経て、ターンレベルのルーブリック監視と人間の嗜好データを訓練し、オンライン共感RLの適応報酬インタフェースとして機能する。
RLVERとMICAの両方と統合されたCAREは、3人の独立LLM判事の下でSentientBench、EQBench3、EMPAの最先端のパフォーマンスを達成する。
特にEMPAでは、CAREはジェミニ2.5-Proの28.11から83.54までの3人の審査員の少なくとも13ポイントでEPM-Idxを最強のベースラインで改善している。
さらに分析したところ、学習されたルーリックの優先順位は対話の段階やユーザ感情によって体系的に異なることが示され、CAREが支援が進化するにつれて得られる報酬に適応することを示した。
関連論文リスト
- ESCRAG-R1: Retrieval-Augmented Reinforcement Learning for Emotional Support Conversation [11.720936066131893]
情緒的支援会話システムは、専門的治療能力と自然な共感のバランスをとることによって、全体的支援を提供することを目的としている。
既存の手法は、構造化されたステージアウェアな推論とシームレスな共感-専門家のアライメントを同時に達成するのに苦労している。
本稿では,グループ相対政策最適化に検索に基づく心理的ガイダンスを統合する統合フレームワークESCRAG-R1を提案する。
論文 参考訳(メタデータ) (2026-08-22T11:32:22Z) - EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models [66.28519000191191]
EmoSBenchは、Spoken Language Modelsの最初の包括的なEI評価ベンチマークである。
EmoSは83.8%の精度に達し、人間レベルのパフォーマンスに近づいている。
論文 参考訳(メタデータ) (2026-08-10T06:58:30Z) - Think2Go: Generative Next POI Recommendation with LLM Reasoning [57.37706163990998]
Next Point-of-Interest (POI)レコメンデーションタスクは、ユーザの行動選好パターンを過去のチェックインからマイニングすることに焦点を当て、次の目的地へのパーソナライズされた提案を提供する。
既存の手法は、次のPOIを予測するために、浅いコンテキスト情報と手作りの特徴相互作用に依存している。
本稿では,SID表現の理解を深め,テスト時間計算による多様な時空間パターンを探索する新しい次世代POIレコメンデーションフレームワークThink2Goを提案する。
論文 参考訳(メタデータ) (2026-07-31T03:52:20Z) - From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape [79.30826980815927]
ルーブリックは、複雑な品質判断を構造化され、実行可能な標準に変換する明示的な基準セットです。
我々は,既存のルーリックデザインを体系的に整理し,その構築と最適化を検証し,評価と訓練をまたいだ役割を解析する。
論文 参考訳(メタデータ) (2026-06-07T13:34:55Z) - SELF-EMO: Emotional Self-Evolution from Recognition to Consistent Expression [13.896538941019722]
より優れた感情予測がより一貫性のある感情応答をもたらすという仮説に基づく自己進化フレームワークであるSELF-EMOを提案する。
本稿では、感情理解と感情表現という2つの補助的タスクを導入し、モデルが感情認識と対話応答の両方として機能するロールベースのセルフプレイパラダイムを設計する。
IEMOCAP、MELD、エモリーNLPの実験により、SELF-EMOは最先端の性能を達成し、Qwen3-4Bでは+6.33%、Qwen3-8Bでは+8.54%の精度が向上した。
論文 参考訳(メタデータ) (2026-04-20T09:27:40Z) - MAPO: Mixed Advantage Policy Optimization for Long-Horizon Multi-Turn Dialogue [4.304129034500234]
マルチターン対話タスクは、進化するユーザ状態に対応するポリシーを必要とする。
アウトカムのみのトレーニングは、クレジットの割り当てを1つの軌道レベルの報酬に転換する。
我々は,MAPO という,批判のない効率的な強化学習アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-06T12:06:57Z) - Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback [82.70507055599093]
本稿では,マルチターン・チェーン・オブ・ソートモデルとブロックワイド・デュプレックスモデルの両方において,SDSの品質向上のための選好学習に関する最初の体系的研究を行う。
実験により, 単一回帰RLAIFは目標距離を選択的に改善し, 連立多重回帰学習は意味的品質と音声の自然性において一貫した利得が得られることが示された。
論文 参考訳(メタデータ) (2026-01-27T00:55:14Z) - POLARIS: Is Multi-Agentic Reasoning the Next Wave in Engineering Self-Adaptive Systems? [0.0]
POLARISは3層多層自己適応フレームワークである。
不確実性に対処し、過去の行動から学び、その戦略を進化させる。
SWIMとSWITCHの2つの自己適応型指数に対する予備評価は、POLARISが一貫して最先端のベースラインを上回っていることを示している。
論文 参考訳(メタデータ) (2025-12-04T11:51:03Z) - Homogeneous Speaker Features for On-the-Fly Dysarthric and Elderly Speaker Adaptation [71.31331402404662]
本稿では, 変形性関節症と高齢者の話者レベルの特徴を学習するための2つの新しいデータ効率手法を提案する。
話者規則化スペクトルベース埋め込み-SBE特徴は、特別な正規化項を利用して適応における話者特徴の均一性を強制する。
テスト時間適応において、話者レベルのデータ量に敏感であることが示されるVR-LH機能に規定されている特徴ベースの学習隠れユニットコントリビューション(f-LHUC)。
論文 参考訳(メタデータ) (2024-07-08T18:20:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。