論文の概要: From Expression to Reaction: Role-aware Visual Transfer and Stimulus-guided Reasoning for Interlocutor Emotion Recognition
- arxiv url: http://arxiv.org/abs/2610.03016v1
- Date: Fri, 02 Oct 2026 08:50:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.289205
- Title: From Expression to Reaction: Role-aware Visual Transfer and Stimulus-guided Reasoning for Interlocutor Emotion Recognition
- Title(参考訳): 表情から反応へ:視覚伝達と刺激誘導による感情認識
- Abstract要約: 情動認識のためのRASG(Role-Aware Stimulus-guided)フレームワークを提案する。
RASG は Role-aware Visual Transfer (RVT) と Stimulus-guided Boundary Reasoning (SBR) モジュールで構成されている。
私たちのチームは、ACM MM 2026のMERグランドチャレンジのトラック1(MER-Cross)で2位です。
- 参考スコア(独自算出の注目度): 14.540273316547788
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this paper, we propose a Role-aware Stimulus-guided (RASG) framework for interlocutor emotion recognition, which predicts listener emotions from listener-only videos and speaker-only audios. RASG consists of Role-aware Visual Transfer (RVT) and Stimulus-guided Boundary Reasoning (SBR) modules, which address supervision mismatch due to the lack of labeled listener data and ambiguity among visually similar listener reactions whose interpretation depends on speaker context, respectively. More specifically, RVT selects speaker samples whose facial expressions support their emotion labels. It then filters listener tracks and uses reliable pseudo-labels to train a listener-centric visual expert. SBR uses a two-class language reasoner only when the visual model is uncertain. It treats speaker audio and text as context rather than direct emotion evidence to distinguish similar listener reactions. Experiments conducted on MER-Cross dataset shows that RASG achieves 76.25\% on MER-Cross and improves the performance of the baseline over 17\%. Our team ranks second in Track 1 (MER-Cross) of the MER Grand Challenge at ACM MM 2026.
- Abstract(参考訳): 本稿では,聴取者のみの映像や話者のみの音声から,聴取者のみの感情を予測できる対話者感情認識のための役割意識型刺激誘導(RASG)フレームワークを提案する。
RASG はロール・アウェア・ビジュアル・トランスファー (RVT) と Stimulus-guided Boundary Reasoning (SBR) モジュールから構成される。
より具体的には、RVTは表情が感情ラベルをサポートする話者サンプルを選択する。
するとリスナーのトラックをフィルタリングし、信頼できる擬似ラベルを使ってリスナー中心のビジュアルエキスパートを訓練する。
SBRは視覚モデルが不確実な場合にのみ2クラス言語推論器を使用する。
話者の音声とテキストを直接の感情の証拠ではなく文脈として扱い、聴取者の反応を区別する。
MER-Crossデータセットで行った実験によると、RASGはMER-Crossで76.25\%を獲得し、ベースラインのパフォーマンスを17\%以上改善している。
私たちのチームは、ACM MM 2026のMERグランドチャレンジのトラック1(MER-Cross)で2位です。
関連論文リスト
- Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation [1.6389263804357965]
感情認識のための音声のみのアーキテクチャであるDSSM-CRFを提案する。
双方向状態空間モデルは、フレームと対話スケールでの融合した自己教師付き音声表現を符号化する。
話者の連鎖における連続的な発話は、スコアがコーパスレベルの遷移行列と、2つの文脈化された発話から予測される残差を組み合わせた遷移対を形成する。
論文 参考訳(メタデータ) (2026-08-23T12:56:03Z) - ADEPT: RL-Aligned Agentic Decoding of Emotion via Evidence Probing Tools -- From Consensus Learning to Ambiguity-Driven Emotion Reasoning [67.22219034602514]
ADEPT(Agentic Decoding of Emotion via Evidence Probing Tools)は,感情認識をマルチターン探索プロセスとして再構成するフレームワークである。
ADEPTはSLLMを進化する候補感情を維持するエージェントに変換し、専用のセマンティックおよび音響探査ツールを適応的に呼び出す。
ADEPTは、ほとんどの設定において主感情の精度を向上し、微妙な感情の特徴を著しく改善することを示した。
論文 参考訳(メタデータ) (2026-02-13T08:33:37Z) - Contrastive Decoupled Representation Learning and Regularization for Speech-Preserving Facial Expression Manipulation [58.189703277322224]
音声保存表情操作(SPFEM)は、特定の参照感情を表示するために話頭を変更することを目的としている。
参照およびソース入力に存在する感情とコンテンツ情報は、SPFEMモデルに対して直接的かつ正確な監視信号を提供することができる。
コントラスト学習による指導として、コンテンツと感情の事前学習を提案し、分離されたコンテンツと感情表現を学習する。
論文 参考訳(メタデータ) (2025-04-08T04:34:38Z) - Towards Empathetic Conversational Recommender Systems [77.53167131692]
本稿では,共感型会話レコメンデータ(ECR)フレームワークを提案する。
ECRには、感情対応アイテムレコメンデーションと感情対応応答生成という、2つの主要なモジュールが含まれている。
ReDialデータセットの実験は、推奨精度を高め、ユーザの満足度を向上させる上で、我々のフレームワークの有効性を検証する。
論文 参考訳(メタデータ) (2024-08-30T15:43:07Z) - Emotional Listener Portrait: Realistic Listener Motion Simulation in
Conversation [50.35367785674921]
リスナーヘッドジェネレーションは、話者から提供される情報を参照して、リスナーの非言語行動を生成することに集中する。
このような反応を生成する上で重要な課題は、会話中のきめ細かい表情の非決定論的性質である。
本稿では,複数の個別な動きコーパスの合成として,各顔の動きを微粒化処理する情緒的リスナー・ポートレート(ELP)を提案する。
ELPモデルは,学習分布からのサンプリングにより,与えられた話者に対する自然な,多様な応答を自動的に生成するだけでなく,所定の姿勢で制御可能な応答を生成することができる。
論文 参考訳(メタデータ) (2023-09-29T18:18:32Z) - ASR and Emotional Speech: A Word-Level Investigation of the Mutual
Impact of Speech and Emotion Recognition [12.437708240244756]
本研究では、感情コーパス上でのASR性能を分析し、感情音声におけるASR(Automatic Speech Recognition)の効果を分析する。
単語誤り率の増大を考慮したテキストベースの音声感情認識を行い,ASRがSERに与える影響について検討する。
論文 参考訳(メタデータ) (2023-05-25T13:56:09Z) - deep learning of segment-level feature representation for speech emotion
recognition in conversations [9.432208348863336]
そこで本稿では,意図的文脈依存と話者感応的相互作用をキャプチャする対話型音声感情認識手法を提案する。
まず、事前訓練されたVGGishモデルを用いて、個々の発話におけるセグメントベース音声表現を抽出する。
第2に、注意的双方向リカレントユニット(GRU)は、文脈に敏感な情報をモデル化し、話者内および話者間依存関係を共同で探索する。
論文 参考訳(メタデータ) (2023-02-05T16:15:46Z) - Discovering Emotion and Reasoning its Flip in Multi-Party Conversations
using Masked Memory Network and Transformer [16.224961520924115]
感情フリップ推論(EFR)の新たな課題について紹介する。
EFRは、ある時点で感情状態が反転した過去の発話を特定することを目的としている。
後者のタスクに対して,前者およびトランスフォーマーベースのネットワークに対処するためのマスクメモリネットワークを提案する。
論文 参考訳(メタデータ) (2021-03-23T07:42:09Z) - Seen and Unseen emotional style transfer for voice conversion with a new
emotional speech dataset [84.53659233967225]
感情的音声変換は、言語内容と話者のアイデンティティを保ちながら、音声中の感情的韻律を変換することを目的としている。
可変自動符号化ワッサーシュタイン生成対向ネットワーク(VAW-GAN)に基づく新しいフレームワークを提案する。
提案するフレームワークは,ベースラインフレームワークを一貫して上回り,優れた性能を発揮することを示す。
論文 参考訳(メタデータ) (2020-10-28T07:16:18Z) - Converting Anyone's Emotion: Towards Speaker-Independent Emotional Voice
Conversion [83.14445041096523]
感情的音声変換は、言語内容と話者のアイデンティティを保ちながら、ある状態から別の状態へ音声の感情を変換することを目的としている。
パラレルデータを必要とせずに、誰の感情も変換できる話者非依存の感情音声変換フレームワークを提案する。
実験の結果,提案した話者非依存のフレームワークは,目に見える話者と目に見えない話者の双方に対して,競争的な結果が得られることがわかった。
論文 参考訳(メタデータ) (2020-05-13T13:36:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。