論文の概要: Learning Emotion from Motion: Kinetic Multi-Stream Skeleton Modeling with Metadata-Conditioned Weak Label Distributions
- arxiv url: http://arxiv.org/abs/2607.17121v1
- Date: Sun, 19 Jul 2026 08:13:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.376855
- Title: Learning Emotion from Motion: Kinetic Multi-Stream Skeleton Modeling with Metadata-Conditioned Weak Label Distributions
- Title(参考訳): 動きからの学習:メタデータを付加した弱ラベル分布を用いた動的マルチストリームスケルトンモデリング
- Authors: Sosuke Suzuki, Yijin Wei, Koichiro Kamide, Ran Dong, Haoran Xie, Chao Zhang,
- Abstract要約: 本研究では,6次元回転に基づく感情認識フレームワーク,部分認識型運動的マルチストリームブランチ,メタデータ条件の弱いラベル分布学習ブランチを併用したマルチブランチスケルトンに基づく感情認識フレームワークを提案する。
提案手法は回転ベースライン上での精度を0.271から0.366に改善し、マクロF1は0.252から0.353に改善した。
- 参考スコア(独自算出の注目度): 7.025435839541879
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Skeleton-based emotion recognition from body motion remains challenging because emotional expressions are often characterized by subtle dynamic and relational motion cues, and hard labels may not fully capture ambiguity among related emotion categories. For the DIEM-A task in the MMAC ACII 2026 Challenge, we propose a multi-branch skeleton-based emotion recognition framework that combines a 6D rotation-based branch, a part-aware kinetic multi-stream branch, and a metadata-conditioned weak label distribution learning (LDL) branch. The branches are trained independently and fused by a probability-level ensemble at inference time. In 10-fold leave-performer-out cross-validation, the proposed framework improves Accuracy from 0.271 to 0.366 and Macro-F1 from 0.252 to 0.353 over the rotation-based baseline. Explainability ablations show that velocity and bone streams, as well as arm and leg regions, provide important cues for recognizing emotional body motion.
- Abstract(参考訳): 骨格をベースとした身体運動からの感情認識は、感情表現が微妙なダイナミックな動きとリレーショナルな動きの手がかりによって特徴づけられることが多く、硬いラベルは関連する感情カテゴリー間のあいまいさを完全に把握できないため、依然として困難である。
MMAC ACII 2026 ChallengeのDIEM-Aタスクでは,6次元回転に基づく感情認識フレームワーク,パートアウェアな運動的マルチストリームブランチ,メタデータ条件の弱いラベル分布学習(LDL)を併用したマルチブランチスケルトンベースの感情認識フレームワークを提案する。
分岐は独立して訓練され、推論時に確率レベルアンサンブルによって融合される。
10倍の残留性能を持つクロスバリデーションにおいて,提案手法は回転ベースライン上での精度を0.271から0.366へ,マクロF1は0.252から0.353へ向上させる。
説明可能性の短縮は、速度と骨の流れが、腕や脚の領域と同様に、感情的な身体の動きを認識するための重要な手がかりとなることを示している。
関連論文リスト
- Bayesian Spectral Emotion Transition Discovery from Multi-Annotator Disagreement [0.0]
マルチラターソフトラベルから感情伝達構造を発見するための2段階のフレームワークを提案する。
5ソースのクロスコーパス検証では、英語の0.91-0.98、中国語のM3EDに対する0.79-0.85、人間のハードラベルとLLM仮想ソフトラベルの間の0.979のペアワイズピアソン相関が得られる。
論文 参考訳(メタデータ) (2026-06-01T08:44:08Z) - Memory-guided Prototypical Co-occurrence Learning for Mixed Emotion Recognition [56.00118641432005]
本稿では,感情共起パターンを明示的にモデル化するメモリ誘導型プロトタイプ共起学習フレームワークを提案する。
人間の認知記憶システムに触発されて,意味レベルの共起関係を抽出するメモリ検索戦略を導入する。
本モデルは感情分布予測のための感情情報表現を学習する。
論文 参考訳(メタデータ) (2026-02-24T04:11:25Z) - E^2-LLM: Bridging Neural Signals and Interpretable Affective Analysis [54.763420895859035]
脳波からの感情分析のための最初のMLLMフレームワークであるELLM2-EEG-to-Emotion Large Language Modelを提案する。
ELLMは学習可能なプロジェクション層を通じて、トレーニング済みのEEGエンコーダとQベースのLLMを統合し、マルチステージのトレーニングパイプラインを使用する。
7つの感情カテゴリーにまたがるデータセット実験により, ELLM2-EEG-to-Emotion Large Language Modelは感情分類において優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2026-01-11T13:21:20Z) - Text-guided Weakly Supervised Framework for Dynamic Facial Expression Recognition [49.41688891301643]
動的表情認識は、映像列間の顔の動きの時間的変化をモデル化することにより、感情状態の同定を目的としている。
DFERの重要な課題は、多数のフレームからなるビデオが単一の感情ラベルに割り当てられる、多対一のラベリングの問題である。
本稿では,テキスト誘導型弱教師付きフレームワークであるTG-DFERを提案する。
論文 参考訳(メタデータ) (2025-11-14T04:49:58Z) - MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models [108.61337743051483]
MME-Emotionは,MLLMの感情的理解と推論能力の両方を評価するシステムベンチマークである。
MME-Emotionには6000以上のキュレートされたビデオクリップとタスク固有の質問回答(QA)ペアが含まれており、8つの感情的なタスクを定式化するための広いシナリオにまたがっている。
マルチエージェントシステムフレームワークを通じて分析された、感情認識と推論のためのハイブリッドメトリクスを備えた総合評価スイートが組み込まれている。
論文 参考訳(メタデータ) (2025-08-11T03:14:55Z) - Robust Emotion Recognition via Bi-Level Self-Supervised Continual Learning [3.472622494096705]
クロスオブジェクトの変動性とノイズラベルは、感情認識モデルの性能を妨げる。
本稿では,動的メモリバッファをベースとした2段階の自己教師付き連続学習フレームワークSSOCLを提案する。
このバイレベルアーキテクチャは、動的バッファと擬似ラベルの割り当てを反復的に洗練し、代表サンプルを効果的に保持する。
高速適応モジュールとクラスタマッピングモジュールを含むフレームワークの主要なコンポーネントは、データストリームの堅牢な学習と効果的な処理を可能にする。
論文 参考訳(メタデータ) (2025-05-13T23:47:04Z) - EEG-SCMM: Soft Contrastive Masked Modeling for Cross-Corpus EEG-Based Emotion Recognition [0.862468061241377]
クロスコーパス脳波に基づく感情認識の課題を解決するために,ソフトコントラスト・マスクド・モデリング(SCMM)と呼ばれる新しいフレームワークを提案する。
SCMMは、ソフトコントラスト学習とハイブリッドマスキング戦略を統合し、感情力学を効果的に捉える。
実験では、SCMMは、同じクラスと異なるクラスのクロスコーパス設定の両方で平均4.26%の精度を達成する。
論文 参考訳(メタデータ) (2024-08-17T12:35:13Z) - Tracing Intricate Cues in Dialogue: Joint Graph Structure and Sentiment Dynamics for Multimodal Emotion Recognition [37.12407597998884]
マルチモーダル対話における複雑な感情的手がかりを追跡するために,GraphSmileという新しい手法が提案されている。
GraphSmileは2つの重要なコンポーネント、すなわちGSFとSDPモジュールから構成される。
複数のベンチマークにおける実証的な結果は、GraphSmileが複雑な感情的および感情的パターンを処理可能であることを示している。
論文 参考訳(メタデータ) (2024-07-31T11:47:36Z) - fMRI from EEG is only Deep Learning away: the use of interpretable DL to
unravel EEG-fMRI relationships [68.8204255655161]
多チャンネル脳波データからいくつかの皮質下領域の活性を回復するための解釈可能な領域基底解を提案する。
我々は,皮質下核の血行動態信号の頭皮脳波予測の空間的・時間的パターンを復元する。
論文 参考訳(メタデータ) (2022-10-23T15:11:37Z) - MEmoBERT: Pre-training Model with Prompt-based Learning for Multimodal
Emotion Recognition [118.73025093045652]
マルチモーダル感情認識のための事前学習モデル textbfMEmoBERT を提案する。
従来の「訓練前、微妙な」パラダイムとは異なり、下流の感情分類タスクをマスク付きテキスト予測として再構成するプロンプトベースの手法を提案する。
提案するMEMOBERTは感情認識性能を大幅に向上させる。
論文 参考訳(メタデータ) (2021-10-27T09:57:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。