論文の概要: Causal Supervision of Attention for Affective Behaviour Analysis
- arxiv url: http://arxiv.org/abs/2607.12091v3
- Date: Thu, 16 Jul 2026 10:02:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 14:53:42.21014
- Title: Causal Supervision of Attention for Affective Behaviour Analysis
- Title(参考訳): 行動分析における注意の因果監督
- Authors: Nemanja Rašajski, Konstantinos Makantasis, Antonios Liapis, Georgios N. Yannakakis,
- Abstract要約: textit11th Affective Behaviour Analysis in-the-wild Competitionにはマルチタスク学習チャレンジが含まれている。
課題は、主題全体にわたって一般化される感情に関連した表現を学習することにある。
本稿では、因果的監視と注意要素の相互共分散規則化を組み合わせた注意プールフレームワークを提案する。
- 参考スコア(独自算出の注目度): 5.611458864154039
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The \textit{11th Affective Behaviour Analysis in-the-wild Competition} includes the Multi-Task Learning Challenge, where participants develop a unified framework for Valence-Arousal Estimation, Expression Recognition, and Action Unit Detection. The challenge lies in learning emotion-related representations that generalize across subjects while remaining robust to spurious factors such as identity, illumination, pose, and demographic variation. To aggregate features extracted by a pre-trained backbone into a compact representation for prediction, attention mechanisms selectively weight the most informative facial regions. However, these attention weights can still capture dataset-specific correlations rather than genuine affective cues. To address this limitation, we propose an attention pooling framework that combines causal supervision with cross-covariance regularization of attention components, encouraging subject-invariant attention and non-redundant representations that improve generalization. Our method achieves $CCC_{VA}=0.5123$ for VA estimation on the official validation set, together with $F_{EX}=0.3116$ and $F_{AU}=0.3974$ for expression recognition and action unit detection, respectively, resulting in an overall $P$ score (the sum of the individual task metrics) of $1.2214$.
- Abstract(参考訳): The \textit{11th Affective Behaviour Analysis in-the-wild Competition} にはマルチタスク学習チャレンジが含まれており、参加者はValence-Arousal Estimation, Expression Recognition, Action Unit Detection のための統合されたフレームワークを開発する。
課題は、アイデンティティ、照明、ポーズ、人口変動といった刺激的な要因に頑健なままながら、被験者全体に一般化する感情関連表現を学習することにある。
予め訓練されたバックボーンによって抽出された特徴を、予測のためのコンパクトな表現に集約し、注目機構が最も情報性の高い顔領域を選択的に重み付けする。
しかし、これらの注意重みは、真の感情的な手がかりではなく、データセット固有の相関を捉えることができる。
この制限に対処するため,注意要素の相互共分散規則化と因果的監督を組み合わせ,主観的不変な注意と一般化を改善する非冗長表現を奨励するアテンションプーリングフレームワークを提案する。
提案手法は,公式検証セット上でのVA推定に$CCC_{VA}=0.5123$,式認識とアクション単位検出に$F_{EX}=0.3116$,$F_{AU}=0.3974$,それぞれ$F_{AU}=0.3974$を実現し,全体として$P$スコア(個々のタスクメトリクスの和)は$2214$となる。
関連論文リスト
- Personality-guided Public-Private Domain Disentangled Hypergraph-Former Network for Multimodal Depression Detection [11.865335030037519]
抑うつは、効率的で信頼性の高い自動検出方法を必要とする世界的なメンタルヘルスの課題を表している。
P$3$HF(Personality-guided Public-Private Domain Disentangled Hypergraph-Former Network)を提案する。
MPDD-Youngデータセットの実験によると、P$3$HFは2次および3次うつ病分類タスクの精度と重み付けされたF1を約10%改善する。
論文 参考訳(メタデータ) (2025-11-16T05:14:37Z) - Facial-R1: Aligning Reasoning and Recognition for Facial Emotion Analysis [20.372029918328035]
FEA(Facial Emotion Analysis)は、説明可能なきめ細かい推論を取り入れることで、従来の顔の感情認識を拡張している。
近年のアプローチでは、ビジョンランゲージモデル(VLM)を活用し、有望な結果が得られるが、2つの限界に直面している。
両課題を最小限の監督で効果的に解決する3段階アライメントフレームワークであるFacial-R1を提案する。
論文 参考訳(メタデータ) (2025-11-13T12:40:21Z) - VOGUE: Guiding Exploration with Visual Uncertainty Improves Multimodal Reasoning [62.09195763860549]
検証可能な報酬(RLVR)による強化学習は、大きな言語モデル(LLM)の推論を改善するが、探索に苦労する。
出力(テキスト)から入力(視覚)空間へ探索をシフトする新しい手法である$textbfVOGUE(Visual Uncertainty Guided Exploration)を紹介した。
本研究は,視覚入力の本質的不確実性における基盤探索が,マルチモーダル推論を改善するための効果的な戦略であることを示す。
論文 参考訳(メタデータ) (2025-10-01T20:32:08Z) - RoboView-Bias: Benchmarking Visual Bias in Embodied Agents for Robotic Manipulation [67.38036090822982]
ロボット操作における視覚バイアスの定量化を目的とした,最初のベンチマークであるRoboView-Biasを提案する。
我々は、個々の視覚的要因とその相互作用によって引き起こされるバイアスの堅牢な測定を可能にする2,127のタスクインスタンスを作成します。
本研究は,視覚バイアスの系統的解析が,安全で信頼性の高い汎用的なエンボディエージェントの開発に必須であることを示す。
論文 参考訳(メタデータ) (2025-09-26T13:53:25Z) - Fair Deepfake Detectors Can Generalize [51.21167546843708]
共同設立者(データ分散とモデルキャパシティ)の制御により,公正な介入による一般化が向上することを示す。
この知見を応用して, 逆正当性重み付けとサブグループワイド特徴正規化を併用し, 新たなアライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・インセンティブ・インターベンション・インベンション・インテクション(DAID)を提案する。
DAIDは、いくつかの最先端技術と比較して、公平性と一般化の両方において一貫して優れた性能を達成する
論文 参考訳(メタデータ) (2025-07-03T14:10:02Z) - Self-supervised Gait-based Emotion Representation Learning from Selective Strongly Augmented Skeleton Sequences [4.740624855896404]
自己教師型歩行に基づく感情表現のための選択的強強化を利用したコントラスト学習フレームワークを提案する。
提案手法はEmotion-Gait (E-Gait) と Emilya のデータセットで検証され, 異なる評価プロトコル下での最先端手法よりも優れている。
論文 参考訳(メタデータ) (2024-05-08T09:13:10Z) - Disentangled Interaction Representation for One-Stage Human-Object
Interaction Detection [70.96299509159981]
ヒューマン・オブジェクト・インタラクション(HOI)検出は、人間中心の画像理解のコアタスクである。
最近のワンステージ手法では、対話予測に有用な画像ワイドキューの収集にトランスフォーマーデコーダを採用している。
従来の2段階の手法は、非絡み合いで説明可能な方法で相互作用特徴を構成する能力から大きな恩恵を受ける。
論文 参考訳(メタデータ) (2023-12-04T08:02:59Z) - Seeking Subjectivity in Visual Emotion Distribution Learning [93.96205258496697]
視覚感情分析(VEA)は、人々の感情を異なる視覚刺激に向けて予測することを目的としている。
既存の手法では、集団投票プロセスにおいて固有の主観性を無視して、統合されたネットワークにおける視覚的感情分布を予測することが多い。
視覚的感情分布の主観性を調べるために,新しいテキストサブジェクティビティ評価ネットワーク(SAMNet)を提案する。
論文 参考訳(メタデータ) (2022-07-25T02:20:03Z) - Frame-level Prediction of Facial Expressions, Valence, Arousal and
Action Units for Mobile Devices [7.056222499095849]
本稿では,AffectNetで事前学習した1つのEfficientNetモデルを用いて,顔の特徴を抽出し,フレームレベルの感情認識アルゴリズムを提案する。
当社のアプローチは,モバイルデバイス上でのビデオ解析にも適用できる。
論文 参考訳(メタデータ) (2022-03-25T03:53:27Z) - An Ensemble Approach for Facial Expression Analysis in Video [5.363490780925308]
本稿では,ABAW3 2022の課題について紹介する。
論文は問題の解決に焦点を当てている。
価-覚醒推定とアクションユニット検出。
論文 参考訳(メタデータ) (2022-03-24T07:25:23Z) - $M^3$T: Multi-Modal Continuous Valence-Arousal Estimation in the Wild [86.40973759048957]
本報告では、ABAW(Affective Behavior Analysis in-the-wild)チャレンジの価-覚醒的評価トラックへの提案に基づくマルチモーダルマルチタスク(M3$T)アプローチについて述べる。
提案したM3$Tフレームワークでは,ビデオの視覚的特徴とオーディオトラックの音響的特徴の両方を融合させて,有声度と覚醒度を推定する。
ABAW が提供する検証セットに対して,M3$T フレームワークを評価し,ベースライン法を著しく上回る性能を示した。
論文 参考訳(メタデータ) (2020-02-07T18:53:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。