論文の概要: NCSTR: Node-Centric Decoupled Spatio-Temporal Reasoning for Video-based Human Pose Estimation
- arxiv url: http://arxiv.org/abs/2603.20323v1
- Date: Fri, 20 Mar 2026 00:49:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:38.837871
- Title: NCSTR: Node-Centric Decoupled Spatio-Temporal Reasoning for Video-based Human Pose Estimation
- Title(参考訳): NCSTR:ビデオに基づく人文推定のためのノード中心分離時空間推論
- Abstract要約: 本稿では,視覚的,時間的,構造的推論を統合し,正確なポーズ推定を行う新しいフレームワークを提案する。
提案手法は,広範に使用されている3つのビデオポーズベンチマークにおいて,最先端の手法よりも優れていることを示す。
- 参考スコア(独自算出の注目度): 13.790494682325873
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video-based human pose estimation remains challenged by motion blur, occlusion, and complex spatiotemporal dynamics. Existing methods often rely on heatmaps or implicit spatio-temporal feature aggregation, which limits joint topology expressiveness and weakens cross-frame consistency. To address these problems, we propose a novel node-centric framework that explicitly integrates visual, temporal, and structural reasoning for accurate pose estimation. First, we design a visuo-temporal velocity-based joint embedding that fuses sub-pixel joint cues and inter-frame motion to build appearance- and motion-aware representations. Then, we introduce an attention-driven pose-query encoder, which applies attention over joint-wise heatmaps and frame-wise features to map the joint representations into a pose-aware node space, generating image-conditioned joint-aware node embeddings. Building upon these node embeddings, we propose a dual-branch decoupled spatio-temporal attention graph that models temporal propagation and spatial constraint reasoning in specialized local and global branches. Finally, a node-space expert fusion module is proposed to adaptively fuse the complementary outputs from both branches, integrating local and global cues for final joint predictions. Extensive experiments on three widely used video pose benchmarks demonstrate that our method outperforms state-of-the-art methods. The results highlight the value of explicit node-centric reasoning, offering a new perspective for advancing video-based human pose estimation.
- Abstract(参考訳): ビデオに基づく人間のポーズ推定は、動きのぼやけ、オクルージョン、複雑な時空間ダイナミクスによって依然として挑戦されている。
既存の手法は、しばしばヒートマップや暗黙の時空間的特徴集約に依存しており、これは関節トポロジーの表現性を制限し、クロスフレームの一貫性を弱める。
これらの問題に対処するために,視覚的,時間的,構造的推論を的確に統合し,正確なポーズ推定を行う新しいノード中心のフレームワークを提案する。
まず、サブピクセルのジョイントキューとフレーム間動作を融合させ、外見と動きを意識した表現を構築するビジュオ時間速度に基づくジョイント埋め込みを設計する。
そこで,注意駆動型ポーズクエリエンコーダを導入し,共同表現をポーズ対応ノード空間にマッピングし,画像条件付き共同認識ノード埋め込みを生成する。
本稿では,これらのノード埋め込みに基づいて,時間的伝搬と空間的制約推論をモデル化した2分岐型時空間アテンショングラフを提案する。
最後に、ノード空間の専門家融合モジュールが提案され、両方の分岐からの相補的な出力を適応的に融合させ、最終的な共同予測のために局所的および大域的キューを統合する。
広範に使用されている3つのビデオポーズベンチマークの大規模な実験により,本手法が最先端の手法より優れていることが示された。
結果は、露骨なノード中心推論の価値を強調し、ビデオベースの人間のポーズ推定を推し進めるための新たな視点を提供する。
関連論文リスト
- DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer [86.4618122245946]
DyG$2$Tは動的モデリングフレームワークで、キーポイント表現を空間的に完了し、時間的に識別することでオブジェクトの運動軌跡を推定する。
合成データセットと実世界のデータセットの両方の実験は、DyG$2$Tが正確な動的モデリングと推論を実現することを示した。
論文 参考訳(メタデータ) (2026-08-19T03:44:28Z) - Warp-free Cross-view Geo-localization via Feature-space Consensus Mining [49.843311525678565]
ストリートレベルの画像と衛星画像の間に大きな違いがあるため、クロスビューのジオローカライゼーションは困難である。
本稿では,明示的な幾何学的ワープを完全に回避する,新しい統合ビュー・コンセンサス誘導学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-10T09:02:06Z) - Learning Spatio-Temporal Feature Representations for Video-Based Gaze Estimation [50.05866669110754]
映像に基づく視線推定手法は、複数の画像フレームから人間の視線の本質的な時間的ダイナミクスを捉えることを目的としている。
本稿では、CNNバックボーンと専用のチャンネルアテンションと自己注意モジュールを組み合わせたモデルであるSpatio-Temporal Gaze Network(ST-Gaze)を提案する。
そこで本研究では,ST-Gazeが個人固有の適応を伴わずとも最先端の性能を達成することを示す。
論文 参考訳(メタデータ) (2025-12-19T15:15:58Z) - RainDiff: End-to-end Precipitation Nowcasting Via Token-wise Attention Diffusion [64.49056527678606]
本稿では,U-Net拡散モデルだけでなく,レーダ時間エンコーダにも統合されたトークンワイドアテンションを提案する。
従来の手法とは異なり,本手法は,画素空間拡散の典型的な高資源コストを発生させることなく,アーキテクチャに注意を集中させる。
実験と評価により,提案手法は複雑な降水予測シナリオにおいて,最先端の手法,ロバストネスの局所的忠実度,一般化,優位性を著しく上回ることを示した。
論文 参考訳(メタデータ) (2025-10-16T17:59:13Z) - 3D Human Pose Estimation via Spatial Graph Order Attention and Temporal Body Aware Transformer [5.303583360581161]
本稿では,GCNのグラフモデリング機能を利用して,各スケルトンを異なる順序の複数のグラフで表現する手法を提案する。
提案した時間的ボディアウェア変換器を用いてシーケンスの空間的特徴を処理する。
Human3.6m, MPIINF-3DHP, HumanEva-Iデータセットを用いた実験により, 提案手法の有効性が示された。
論文 参考訳(メタデータ) (2025-05-02T04:58:04Z) - Rethinking Temporal Fusion with a Unified Gradient Descent View for 3D Semantic Occupancy Prediction [62.69089767730514]
視覚に基づく3次元意味的占有予測(VisionOcc)のための時間融合法であるGAFusionを提案する。
これは、VisionOccフレームワーク内の時間融合の未調査の側面を開き、時間的手がかりと融合戦略の両方に焦点を当てる。
論文 参考訳(メタデータ) (2025-04-17T14:05:33Z) - Video-Based Human Pose Regression via Decoupled Space-Time Aggregation [0.5524804393257919]
そこで我々は,Asmapなどの中間表現をバイパスし,その代わりに入力を直接共同座標にマッピングする,効率的で効果的なビデオベースヒューマンポーズ回帰手法を開発した。
本手法は, 隣り合う関節の空間的依存性と各関節の時間的依存性を効率よく, 柔軟に利用することができる。
我々のアプローチは、最先端のヒートマップベースのマルチフレームヒューマンポーズ推定手法に匹敵するか、同等である。
論文 参考訳(メタデータ) (2024-03-29T02:26:22Z) - Generative Hierarchical Temporal Transformer for Hand Pose and Action Modeling [67.94143911629143]
ハンドポーズとアクションをモデル化するための生成型Transformer VAEアーキテクチャを提案する。
手ポーズとアクションのセマンティックな依存性と時間的粒度を忠実にモデル化するために、我々はこのフレームワークを2つのケース化されたVAEブロックに分解する。
その結果,独立解よりも認識と予測の連成モデリングが向上することが示唆された。
論文 参考訳(メタデータ) (2023-11-29T05:28:39Z) - OTPose: Occlusion-Aware Transformer for Pose Estimation in
Sparsely-Labeled Videos [21.893572076171527]
本稿では, コンバータを用いたフレーム間の時間依存性を符号化する手法を提案する。
我々は、PoseTrack 2017とPoseTrack 2018データセットの最先端のポーズ推定結果を達成する。
論文 参考訳(メタデータ) (2022-07-20T08:06:06Z) - Relation-Based Associative Joint Location for Human Pose Estimation in
Videos [5.237054164442403]
我々は,関節間の連想関係を明確かつ自動でモデル化する軽量でプラグアンドプレイな関節関係抽出器 (JRE) を設計する。
JREは2つの関節の関係を柔軟に学習し、人間のポーズの豊かな空間構成を学習する。
そして、時間的意味連続性モデリングと組み合わせて、ビデオに基づく人間のポーズ推定のための関係に基づくPose Semantics Transfer Network (RPSTN)を提案する。
論文 参考訳(メタデータ) (2021-07-08T04:05:23Z) - Deep Dual Consecutive Network for Human Pose Estimation [44.41818683253614]
キーポイント検出を容易にするために,ビデオフレーム間の時間的キューを豊富に活用した,新しいマルチフレーム人間ポーズ推定フレームワークを提案する。
本手法は、PoseTrack 2017およびPoseTrack 2018の大規模ベンチマークデータセットにおけるマルチフレームパーソンポースチャレンジチャレンジで1位にランクインします。
論文 参考訳(メタデータ) (2021-03-12T13:11:27Z) - Peeking into occluded joints: A novel framework for crowd pose
estimation [88.56203133287865]
OPEC-NetはイメージガイドされたプログレッシブGCNモジュールで、推論の観点から見えない関節を推定する。
OCPoseは、隣接するインスタンス間の平均IoUに対して、最も複雑なOccluded Poseデータセットである。
論文 参考訳(メタデータ) (2020-03-23T19:32:40Z) - A Graph Attention Spatio-temporal Convolutional Network for 3D Human
Pose Estimation in Video [7.647599484103065]
我々は,アテンション機構を用いた局所的グローバル空間情報のモデリングにより,人間の骨格における制約の学習を改善する。
提案手法は, 奥行きのあいまいさと自己閉塞性を効果的に軽減し, 半上半身推定を一般化し, 2次元から3次元映像のポーズ推定における競合性能を実現する。
論文 参考訳(メタデータ) (2020-03-11T14:54:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。