論文の概要: Rationale-Guided Learning for Multimodal Emotion Recognition
- arxiv url: http://arxiv.org/abs/2608.10448v2
- Date: Tue, 18 Aug 2026 03:30:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 15:55:59.073273
- Title: Rationale-Guided Learning for Multimodal Emotion Recognition
- Title(参考訳): マルチモーダル感情認識のためのRationale-Guided Learning
- Abstract要約: 会話におけるマルチモーダル感情認識には、言語と非言語間の複雑な相互作用を理解する必要がある。
本稿では,MERCを認知に触発された推論タスクに変換する新しいフレームワークである理性指導学習(RGL)を提案する。
- 参考スコア(独自算出の注目度): 21.87364319362605
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal emotion recognition in conversation (MERC) requires understanding complex interactions between verbal and non-verbal cues. However, most existing approaches fundamentally treat this as a direct input-output (multimodal cues-emotion labels) mapping problem, overlooking the causal reasoning that humans use when interpreting emotions. We propose rationale-guided learning (RGL), a novel framework that transforms MERC into a cognitively-inspired reasoning task. Based on dual-process theory, we decompose emotional reasoning into three facets: Intuitive (immediate perception, System 1), Contextual (situational analysis, System 2), and Integrative (synthesis of both). We leverage an MLLM offline to generate structured rationales, which are encoded as memories to guide model training via aligning internal representations with human-like reasoning patterns. Our final model operates without any MLLM overheads at inference time. Experimental results show that RGL achieves state-of-the-art performance on the IEMOCAP and MELD benchmarks. Further, for interpretation, we demonstrate that the model's internal features effectively retrieve semantically correct rationales for unseen test samples, validating its rationale reasoning capabilities.
- Abstract(参考訳): 会話におけるマルチモーダル感情認識(MERC)は、言語と非言語間の複雑な相互作用を理解する必要がある。
しかし、既存のほとんどのアプローチでは、感情を解釈する際に人間が使用する因果的推論を見越して、これを直接入力出力(マルチモーダルキュー・感情ラベル)マッピング問題として扱う。
本稿では,MERCを認知に触発された推論タスクに変換する新しいフレームワークである理性指導学習(RGL)を提案する。
両プロセス理論に基づき,感情的推論を直感的(即時知覚,システム1),文脈的(時間的分析,システム2),統合的(両方の合成)の3つの側面に分解する。
我々はMLLMをオフラインで利用して構造化された論理を生成する。それは記憶として符号化され、内部表現と人間のような推論パターンを整合させることでモデルトレーニングをガイドする。
私たちの最終モデルは、推論時にMLLMオーバーヘッドなしで動作します。
実験の結果,IEMOCAPおよびMELDベンチマークにおいて,RGLが最先端の性能を達成することが示された。
さらに, モデルの内部的特徴が, 未知のテストサンプルに対して意味論的に正しい有理性を効果的に検索し, その有理性推論能力を検証することを実証する。
関連論文リスト
- Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning [82.86343313807158]
我々は、視覚的証拠が推論プロセスにどのように、いつ導入されるかが中心的な課題であると主張している。
この知見により,言語モデルが推論プロセスを制御するマルチモーダル推論フレームワークCSMRを提案する。
論文 参考訳(メタデータ) (2026-05-27T08:43:13Z) - EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models [62.3977734456669]
マルチモーダル大規模言語モデル(MLLM)の感情的推論能力を高めるためのフレームワークとして,情緒的推論のための反射強化学習(EMO-R3)を提案する。
構造化された感情的思考を導入し、構造化された解釈可能な方法で段階的に感情的推論を行い、そのモデルが視覚的テキストの一貫性と感情的コヒーレンスに基づいてその推論を再評価できる反射的感情的回帰を設計する。
EMO-R3はMLLMの解釈可能性と感情的インテリジェンスの両方を大幅に改善し、複数の視覚的感情理解ベンチマークにおいて優れた性能を達成する。
論文 参考訳(メタデータ) (2026-02-27T08:42:52Z) - Unveiling the Cognitive Compass: Theory-of-Mind-Guided Multimodal Emotion Reasoning [31.790359663851305]
真の感情知性は、感情が生まれる認知基盤である心の理論(ToM)の明確なモデリングを必要とする。
ToMをベースとした階層型ベンチマークであるHitEmotionを導入する。
第2に、精神状態を追跡し、モダクティブな証拠を校正し、忠実な感情的推論を実現するToM誘導推論チェーンを提案する。
論文 参考訳(メタデータ) (2026-02-01T02:26:12Z) - E^2-LLM: Bridging Neural Signals and Interpretable Affective Analysis [54.763420895859035]
脳波からの感情分析のための最初のMLLMフレームワークであるELLM2-EEG-to-Emotion Large Language Modelを提案する。
ELLMは学習可能なプロジェクション層を通じて、トレーニング済みのEEGエンコーダとQベースのLLMを統合し、マルチステージのトレーニングパイプラインを使用する。
7つの感情カテゴリーにまたがるデータセット実験により, ELLM2-EEG-to-Emotion Large Language Modelは感情分類において優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2026-01-11T13:21:20Z) - A Unified Spoken Language Model with Injected Emotional-Attribution Thinking for Human-like Interaction [50.05919688888947]
本稿では,感情的インテリジェンスのための統一言語モデルを提案する。
IEATは、ユーザーの感情状態とその根本原因をモデルの内部推論プロセスに組み込んでおり、明示的な監督として扱われるのではなく、感情を意識した推論を内部化することができる。
HumDial(Human-like Spoken Dialogue Systems Challenge)Emotional Intelligenceベンチマークの実験は、提案手法が感情軌道モデリング、感情的推論、共感的応答生成にまたがるトップランクのパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2026-01-08T14:07:30Z) - Do LLMs Feel? Teaching Emotion Recognition with Prompts, Retrieval, and Curriculum Learning [16.195689085967004]
会話における感情認識(Emotion Recognition in Conversation、ERC)は、人間の感情を理解し、人間とコンピュータの自然な相互作用を可能にするための重要なタスクである。
本稿では,Promptエンジニアリング,実証検索,カリキュラム学習を統合した新しいERCトレーニングフレームワークであるPRC-Emoを提案する。
提案手法は新たなSOTA(State-of-the-art)性能を実現し,提案手法の有効性と一般化性を示す。
論文 参考訳(メタデータ) (2025-11-10T12:52:11Z) - Emotion-Coherent Reasoning for Multimodal LLMs via Emotional Rationale Verifier [53.55996102181836]
本稿では,感情関係検証器 (ERV) と説明リワードを提案する。
本手法は,対象感情と明確に一致した推論をモデルに導出する。
我々のアプローチは、説明と予測の整合性を高めるだけでなく、MLLMが感情的に一貫性があり、信頼できる対話を実現するのにも役立ちます。
論文 参考訳(メタデータ) (2025-10-27T16:40:17Z) - Fine-Grained Emotion Recognition via In-Context Learning [24.79387634284384]
きめ細かい感情認識は、推論と意思決定プロセスを通じて、クエリの感情タイプを特定することを目的としている。
最近の手法では、インコンテキスト学習(ICL)が使われ、意味論的に類似した例を通してクエリの表現が強化されている。
本稿では,プロトタイプ理論による微粒な感情認識における意思決定について検討する。
論文 参考訳(メタデータ) (2025-10-08T03:17:09Z) - Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs [47.325269852330884]
我々は,意味的に整合したエビデンスに基づく説明を行うことで,感情認識を強化する戦略を開発する。
本稿では、推論強化データ監視、デュアルエンコーダアーキテクチャ、タスク代替トレーニングを組み合わせた統合フレームワークを提案する。
IEMOCAPとMELDの実験により、我々のアプローチは感情予測精度を向上するだけでなく、生成した応答のコヒーレンスと明解なグラウンド化も向上することが示された。
論文 参考訳(メタデータ) (2025-06-07T14:52:58Z) - DialogueCRN: Contextual Reasoning Networks for Emotion Recognition in
Conversations [0.0]
本稿では,会話コンテキストを認知的視点から完全に理解するための新しい文脈推論ネットワーク(DialogueCRN)を提案する。
感情認知理論(Cognitive Theory of Emotion)に触発された我々は、感情の手がかりを抽出し統合するための多ターン推論モジュールを設計する。
推論モジュールは、人間の独特な認知的思考を模倣する直感的検索プロセスと意識的推論プロセスを反復的に実行する。
論文 参考訳(メタデータ) (2021-06-03T16:47:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。