論文の概要: STAG: Spatio-temporal Evolving Structural Representation of Action Units for Micro-expression Recognition
- arxiv url: http://arxiv.org/abs/2606.28083v1
- Date: Fri, 26 Jun 2026 13:46:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.505646
- Title: STAG: Spatio-temporal Evolving Structural Representation of Action Units for Micro-expression Recognition
- Title(参考訳): STAG:マイクロ圧縮認識のための時空間展開型アクションユニットの構造表現
- Abstract要約: 微小な表情認識は、微妙で短命な顔面筋運動のために困難である。
既存の手法は頂点オンセットのフレームに大きく依存し、微粒なフレーム間ダイナミクスを見落とし、空間情報と時間情報を別々にモデル化する。
本稿では,動的ROI-AU結合型時空間ネットワークSTAGを提案する。
- 参考スコア(独自算出の注目度): 0.7799711162530713
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Micro-expression recognition is challenging due to subtle and short-lived facial muscle movements. Existing methods rely heavily on apex-onset frames, overlook fine-grained inter-frame dynamics, and separately model spatial and temporal information, limiting generalization across datasets. To address these challenges, we propose STAG, a dynamic ROI-AU-coupled spatial-temporal network that jointly models motion flow and adaptive facial connectivity. The framework extracts optical flow from discriminative frames using magnitude-based selection and temporal attention. A dual-branch architecture combines an enhanced graph attention network for structured spatial reasoning with a transformer encoder for temporal modeling. A bidirectional cross-attention module enables mutual refinement of spatial and temporal features, while AU-guided dynamic connectivity adapts facial region interactions according to muscle activation patterns. The transformer captures subtle temporal dynamics beyond apex-based approaches, improving semantic consistency and interpretability for explainable micro-expression recognition. The fused representation is optimized using focal loss and evaluated on CASME II, 4DME, DFME, NaME, SAMM, and SMIC-HS. Extensive experiments demonstrate improved robustness, generalization, interpretability, and computational efficiency, confirming the effectiveness of adaptive relational reasoning, AU-guided dynamic connectivity, and deep spatial-temporal feature fusion for accurate cross-dataset micro-expression recognition.
- Abstract(参考訳): 微小な表情認識は、微妙で短命な顔面筋運動のために困難である。
既存の手法は、頂点オンセットフレームに大きく依存し、粒度の細かいフレーム間ダイナミクスを見落とし、空間情報と時間情報を別々にモデル化し、データセット間の一般化を制限する。
これらの課題に対処するために,動的ROI-AU結合型時空間ネットワークSTAGを提案する。
このフレームワークは、等級に基づく選択と時間的注意を用いて、識別フレームから光の流れを抽出する。
二重ブランチアーキテクチャは、構造化空間推論のための拡張グラフアテンションネットワークと、時間的モデリングのためのトランスフォーマーエンコーダを組み合わせる。
双方向のクロスアテンションモジュールは、空間的特徴と時間的特徴の相互改善を可能にし、AU誘導動的接続は筋肉の活性化パターンに応じて顔領域の相互作用に適応する。
変換器は頂点に基づくアプローチを超えて微妙な時間的ダイナミクスを捉え、説明可能なマイクロ表現認識のための意味的一貫性と解釈性を向上させる。
CASME II, 4DME, DFME, NaME, SAMM, SMIC-HSにおいて, 融合表現を焦点損失を用いて最適化し, 評価を行った。
広汎な実験により、ロバスト性、一般化、解釈可能性、計算効率が向上し、適応的関係推論、AU誘導動的接続、深部空間的特徴融合の有効性が検証された。
関連論文リスト
- DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer [86.4618122245946]
DyG$2$Tは動的モデリングフレームワークで、キーポイント表現を空間的に完了し、時間的に識別することでオブジェクトの運動軌跡を推定する。
合成データセットと実世界のデータセットの両方の実験は、DyG$2$Tが正確な動的モデリングと推論を実現することを示した。
論文 参考訳(メタデータ) (2026-08-19T03:44:28Z) - DSFNet: Learning Dual-Domain Spectral Operators for Multi-Modality Spatio-Temporal Forecasting in Urban Transportation Systems [51.72074484150301]
本稿ではDSFNet(Dual-Domain Spectral Network)を提案し,変数間の関係を明示的にモデル化する。
このフレームワークは、異種空間パターンを捉えるために、二重領域スペクトルフィルタリングを用いる。
2番目のベースラインと比較して、DSFNetはこれらのデータセット間でMAEを3.21%-10.16%削減する。
論文 参考訳(メタデータ) (2026-06-05T07:33:57Z) - Micro-DualNet: Dual-Path Spatio-Temporal Network for Micro-Action Recognition [4.60357552784923]
マイクロアクションは、空間的構成によって定義されるものや、時間的ダイナミクスを通して現れるものなど、様々な特徴を示す。
単一時間分解にコミットする既存の方法は、この多様性に対応できない。
本稿では,Multual Action (MAC) の損失を補足して,各部位が最適な処理選択を学習するエンティティレベルの適応ルーティングを導入する。
論文 参考訳(メタデータ) (2026-04-22T19:00:05Z) - Towards Arbitrary Motion Completing via Hierarchical Continuous Representation [64.6525112550758]
Inlicit Representations(INR)に基づくNAMEと呼ばれる新しいパラメトリックアクティベーションによる階層的暗黙表現フレームワークを提案する。
本手法では,複数の時間スケールで動作列から特徴を抽出し,複雑な時間パターンを効果的に捕捉する階層的時間符号化機構を提案する。
論文 参考訳(メタデータ) (2025-12-24T14:07:04Z) - Improving Micro-Expression Recognition with Phase-Aware Temporal Augmentation [0.0]
マイクロ・エクスプレッション(ME)は、半秒未満の真の感情を示す、簡潔で不随意的な顔の動きである。
深層学習は、マイクロ圧縮認識(MER)に大きな進歩をもたらしたが、その効果は、注釈付きMEデータセットの不足によって制限されている。
本稿では動的画像に基づく位相認識時間拡張法を提案する。
論文 参考訳(メタデータ) (2025-10-17T09:20:51Z) - DIANet: A Phase-Aware Dual-Stream Network for Micro-Expression Recognition via Dynamic Images [0.0]
マイクロ表現は短く、不随意的な顔の動きであり、通常は半秒未満で、しばしば本物の感情を表わす。
本稿では、位相認識動的画像を利用する新しいデュアルストリームフレームワークDIANetを提案する。
3つのベンチマークMERデータセットを用いて行った実験は、提案手法が従来の単相DIベースのアプローチよりも一貫して優れていることを示した。
論文 参考訳(メタデータ) (2025-10-14T07:15:29Z) - DAMS:Dual-Branch Adaptive Multiscale Spatiotemporal Framework for Video Anomaly Detection [7.117824587276951]
この研究は、マルチレベル特徴とデカップリング融合に基づくDual-Branch Adaptive Multiscale Stemporal Framework (DAMS)と呼ばれるデュアルパスアーキテクチャを提供する。
主処理経路は、適応型マルチスケール時間ピラミッドネットワーク(AMTPN)と畳み込みブロック注意機構(CBAM)を統合している。
論文 参考訳(メタデータ) (2025-07-28T08:42:00Z) - Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations [131.33758144860988]
アイデンティティ保存型テキスト・ツー・ビデオ(IPT2V)生成は、一貫した人間のアイデンティティを持つ高忠実度ビデオを作成することを目的としている。
現在のエンドツーエンドフレームワークは、重要な空間的・時間的トレードオフを被る。
本稿では,表現をレイアウトの空間的特徴と運動力学の時間的特徴に分解する,シンプルで効果的な空間時空間分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-07T06:54:44Z) - ReCoM: Realistic Co-Speech Motion Generation with Recurrent Embedded Transformer [58.49950218437718]
音声に同期した高忠実で一般化可能な人体動作を生成するための効率的なフレームワークであるReCoMを提案する。
Recurrent Embedded Transformer (RET)は、動的埋め込み正規化(DER)をViT(Vit)コアアーキテクチャに統合する。
モデルロバスト性を高めるため,ノイズ抵抗とクロスドメイン一般化の二重性を持つモデルに,提案したDER戦略を取り入れた。
論文 参考訳(メタデータ) (2025-03-27T16:39:40Z) - Alignment-free HDR Deghosting with Semantics Consistent Transformer [76.91669741684173]
高ダイナミックレンジイメージングは、複数の低ダイナミックレンジ入力から情報を取得し、リアルな出力を生成することを目的としている。
既存の手法では、前景やカメラの動きによって引き起こされる入力フレーム間の空間的ずれに焦点を当てることが多い。
本研究では,SCTNet(Semantics Consistent Transformer)を用いたアライメントフリーネットワークを提案する。
論文 参考訳(メタデータ) (2023-05-29T15:03:23Z) - Multiple Object Tracking with Correlation Learning [16.959379957515974]
本研究では,局所相関モジュールを用いて,対象と周辺環境のトポロジカルな関係をモデル化する。
具体的には,各空間の位置とその文脈の密接な対応を確立し,自己教師付き学習を通じて相関量を明確に制約する。
提案手法は, 相関学習と優れた性能の相関学習の有効性を示し, MOT17では76.5%, IDF1では73.6%の最先端MOTAが得られる。
論文 参考訳(メタデータ) (2021-04-08T06:48:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。