論文の概要: NCSTR: Node-Centric Decoupled Spatio-Temporal Reasoning for Video-based Human Pose Estimation
- arxiv url: http://arxiv.org/abs/2603.20323v1
- Date: Fri, 20 Mar 2026 00:49:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:38.837871
- Title: NCSTR: Node-Centric Decoupled Spatio-Temporal Reasoning for Video-based Human Pose Estimation
- Title(参考訳): NCSTR:ビデオに基づく人文推定のためのノード中心分離時空間推論
- Authors: Quang Dang Huynh, Xuefei Yin, Andrew Busch, Hugo G. Espinosa, Alan Wee-Chung Liew, Matthew T. O. Worsey, Yanming Zhu,
- Abstract要約: 本稿では,視覚的,時間的,構造的推論を統合し,正確なポーズ推定を行う新しいフレームワークを提案する。
提案手法は,広範に使用されている3つのビデオポーズベンチマークにおいて,最先端の手法よりも優れていることを示す。
- 参考スコア(独自算出の注目度): 13.790494682325873
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video-based human pose estimation remains challenged by motion blur, occlusion, and complex spatiotemporal dynamics. Existing methods often rely on heatmaps or implicit spatio-temporal feature aggregation, which limits joint topology expressiveness and weakens cross-frame consistency. To address these problems, we propose a novel node-centric framework that explicitly integrates visual, temporal, and structural reasoning for accurate pose estimation. First, we design a visuo-temporal velocity-based joint embedding that fuses sub-pixel joint cues and inter-frame motion to build appearance- and motion-aware representations. Then, we introduce an attention-driven pose-query encoder, which applies attention over joint-wise heatmaps and frame-wise features to map the joint representations into a pose-aware node space, generating image-conditioned joint-aware node embeddings. Building upon these node embeddings, we propose a dual-branch decoupled spatio-temporal attention graph that models temporal propagation and spatial constraint reasoning in specialized local and global branches. Finally, a node-space expert fusion module is proposed to adaptively fuse the complementary outputs from both branches, integrating local and global cues for final joint predictions. Extensive experiments on three widely used video pose benchmarks demonstrate that our method outperforms state-of-the-art methods. The results highlight the value of explicit node-centric reasoning, offering a new perspective for advancing video-based human pose estimation.
- Abstract(参考訳): ビデオに基づく人間のポーズ推定は、動きのぼやけ、オクルージョン、複雑な時空間ダイナミクスによって依然として挑戦されている。
既存の手法は、しばしばヒートマップや暗黙の時空間的特徴集約に依存しており、これは関節トポロジーの表現性を制限し、クロスフレームの一貫性を弱める。
これらの問題に対処するために,視覚的,時間的,構造的推論を的確に統合し,正確なポーズ推定を行う新しいノード中心のフレームワークを提案する。
まず、サブピクセルのジョイントキューとフレーム間動作を融合させ、外見と動きを意識した表現を構築するビジュオ時間速度に基づくジョイント埋め込みを設計する。
そこで,注意駆動型ポーズクエリエンコーダを導入し,共同表現をポーズ対応ノード空間にマッピングし,画像条件付き共同認識ノード埋め込みを生成する。
本稿では,これらのノード埋め込みに基づいて,時間的伝搬と空間的制約推論をモデル化した2分岐型時空間アテンショングラフを提案する。
最後に、ノード空間の専門家融合モジュールが提案され、両方の分岐からの相補的な出力を適応的に融合させ、最終的な共同予測のために局所的および大域的キューを統合する。
広範に使用されている3つのビデオポーズベンチマークの大規模な実験により,本手法が最先端の手法より優れていることが示された。
結果は、露骨なノード中心推論の価値を強調し、ビデオベースの人間のポーズ推定を推し進めるための新たな視点を提供する。
関連論文リスト
- Learning Spatio-Temporal Feature Representations for Video-Based Gaze Estimation [50.05866669110754]
映像に基づく視線推定手法は、複数の画像フレームから人間の視線の本質的な時間的ダイナミクスを捉えることを目的としている。
本稿では、CNNバックボーンと専用のチャンネルアテンションと自己注意モジュールを組み合わせたモデルであるSpatio-Temporal Gaze Network(ST-Gaze)を提案する。
そこで本研究では,ST-Gazeが個人固有の適応を伴わずとも最先端の性能を達成することを示す。
論文 参考訳(メタデータ) (2025-12-19T15:15:58Z) - RainDiff: End-to-end Precipitation Nowcasting Via Token-wise Attention Diffusion [64.49056527678606]
本稿では,U-Net拡散モデルだけでなく,レーダ時間エンコーダにも統合されたトークンワイドアテンションを提案する。
従来の手法とは異なり,本手法は,画素空間拡散の典型的な高資源コストを発生させることなく,アーキテクチャに注意を集中させる。
実験と評価により,提案手法は複雑な降水予測シナリオにおいて,最先端の手法,ロバストネスの局所的忠実度,一般化,優位性を著しく上回ることを示した。
論文 参考訳(メタデータ) (2025-10-16T17:59:13Z) - Rethinking Temporal Fusion with a Unified Gradient Descent View for 3D Semantic Occupancy Prediction [62.69089767730514]
視覚に基づく3次元意味的占有予測(VisionOcc)のための時間融合法であるGAFusionを提案する。
これは、VisionOccフレームワーク内の時間融合の未調査の側面を開き、時間的手がかりと融合戦略の両方に焦点を当てる。
論文 参考訳(メタデータ) (2025-04-17T14:05:33Z) - Video-Based Human Pose Regression via Decoupled Space-Time Aggregation [0.5524804393257919]
そこで我々は,Asmapなどの中間表現をバイパスし,その代わりに入力を直接共同座標にマッピングする,効率的で効果的なビデオベースヒューマンポーズ回帰手法を開発した。
本手法は, 隣り合う関節の空間的依存性と各関節の時間的依存性を効率よく, 柔軟に利用することができる。
我々のアプローチは、最先端のヒートマップベースのマルチフレームヒューマンポーズ推定手法に匹敵するか、同等である。
論文 参考訳(メタデータ) (2024-03-29T02:26:22Z) - Generative Hierarchical Temporal Transformer for Hand Pose and Action Modeling [67.94143911629143]
ハンドポーズとアクションをモデル化するための生成型Transformer VAEアーキテクチャを提案する。
手ポーズとアクションのセマンティックな依存性と時間的粒度を忠実にモデル化するために、我々はこのフレームワークを2つのケース化されたVAEブロックに分解する。
その結果,独立解よりも認識と予測の連成モデリングが向上することが示唆された。
論文 参考訳(メタデータ) (2023-11-29T05:28:39Z) - Relation-Based Associative Joint Location for Human Pose Estimation in
Videos [5.237054164442403]
我々は,関節間の連想関係を明確かつ自動でモデル化する軽量でプラグアンドプレイな関節関係抽出器 (JRE) を設計する。
JREは2つの関節の関係を柔軟に学習し、人間のポーズの豊かな空間構成を学習する。
そして、時間的意味連続性モデリングと組み合わせて、ビデオに基づく人間のポーズ推定のための関係に基づくPose Semantics Transfer Network (RPSTN)を提案する。
論文 参考訳(メタデータ) (2021-07-08T04:05:23Z) - Deep Dual Consecutive Network for Human Pose Estimation [44.41818683253614]
キーポイント検出を容易にするために,ビデオフレーム間の時間的キューを豊富に活用した,新しいマルチフレーム人間ポーズ推定フレームワークを提案する。
本手法は、PoseTrack 2017およびPoseTrack 2018の大規模ベンチマークデータセットにおけるマルチフレームパーソンポースチャレンジチャレンジで1位にランクインします。
論文 参考訳(メタデータ) (2021-03-12T13:11:27Z) - Peeking into occluded joints: A novel framework for crowd pose
estimation [88.56203133287865]
OPEC-NetはイメージガイドされたプログレッシブGCNモジュールで、推論の観点から見えない関節を推定する。
OCPoseは、隣接するインスタンス間の平均IoUに対して、最も複雑なOccluded Poseデータセットである。
論文 参考訳(メタデータ) (2020-03-23T19:32:40Z) - A Graph Attention Spatio-temporal Convolutional Network for 3D Human
Pose Estimation in Video [7.647599484103065]
我々は,アテンション機構を用いた局所的グローバル空間情報のモデリングにより,人間の骨格における制約の学習を改善する。
提案手法は, 奥行きのあいまいさと自己閉塞性を効果的に軽減し, 半上半身推定を一般化し, 2次元から3次元映像のポーズ推定における競合性能を実現する。
論文 参考訳(メタデータ) (2020-03-11T14:54:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。