論文の概要: STA-TFM: Spatio-Temporal Aggregation Across Views TransForMer for Pose Estimation
- arxiv url: http://arxiv.org/abs/2609.24482v1
- Date: Mon, 21 Sep 2026 12:22:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 03:38:27.400668
- Title: STA-TFM: Spatio-Temporal Aggregation Across Views TransForMer for Pose Estimation
- Title(参考訳): STA-TFM: Pose Estimation のための TransForMer を用いた時空間アグリゲーション
- Abstract要約: STA-TFMは、マルチビューポーズ推定のための空間情報と時間情報を組み合わせたトランスフォーマーベースのアーキテクチャである。
DHP19データセットでは、関節位置誤差平均(MPJPE)と関節速度誤差平均(MPJVE)の50.9%と49.5%の削減を実現している。
ノイズと不足した2D入力を処理し、医療監視、運動評価、没入型技術への潜在的展開をサポートする。
- 参考スコア(独自算出の注目度): 0.03262230127283452
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Monocular 3D human pose estimation (HPE) remains challenging due to depth ambiguity, occlu- sions, and the need for temporal consistency. While multi-view methods provide superior accuracy over monocular approaches, they often require complex setups. We introduce STA-TFM, a transformer-based architecture that combines spatial and temporal information for multi-view pose estimation. The approach leverages DSTformer, a monocular feature extractor, to capture long-range pose dependencies within each view. A fusion transformer then aggregates information across views to produce coherent 3D estimates. To address training data scarcity, we use a data generation pipeline that transforms any existing 3D pose dataset into multi-view setups with controllable parameters. Experiments on various datasets demonstrate that STA-TFM outperforms existing camera-parameter-free multi-view methods. STA-TFM achieves 50.9% and 49.5% reductions in mean per joint position error (MPJPE) and mean per joint velocity error (MPJVE) on the DHP19 dataset. Furthermore, it achieves 6.7% and 7.7% respective reductions on HAA4D, and a 15.2% MPJPE reduction on TotalCapture. STA-TFM handles noisy and missing 2D inputs, supporting potential deployment in healthcare monitoring, athletic assessment, and immersive technologies. Code, training checkpoints, and data are available at https://zenodo.org/records/22832620.
- Abstract(参考訳): HPE (Monocular 3D Human pose Estimation) は、深さのあいまいさ、オクルージョン、時間的一貫性の必要性により、依然として困難である。
多視点法は単分子的アプローチよりも精度が高いが、複雑な設定を必要とすることが多い。
マルチビューポーズ推定のための空間情報と時間情報を組み合わせたトランスフォーマーベースのアーキテクチャであるSTA-TFMを紹介する。
このアプローチでは、モノラルな特徴抽出器であるDSTformerを使用して、ビュー内の長距離ポーズ依存関係をキャプチャする。
融合変換器は、ビューにまたがって情報を集約し、コヒーレントな3D推定を生成する。
トレーニングデータの不足に対処するために、既存の3Dポーズデータセットを制御可能なパラメータを持つマルチビュー設定に変換するデータ生成パイプラインを使用します。
様々なデータセットの実験により、STA-TFMは既存のカメラパラメータフリーマルチビュー法よりも優れていることが示された。
STA-TFMは、DHP19データセット上で、関節位置誤差(MPJPE)平均と関節速度誤差(MPJVE)平均の50.9%と49.5%の減少を達成する。
さらに、HAA4Dの6.7%と7.7%の削減、TotalCaptureの15.2%のMPJPE削減を実現している。
STA-TFMはノイズと2D入力を処理し、医療監視、運動評価、没入型技術への潜在的展開をサポートする。
コード、トレーニングチェックポイント、データはhttps://zenodo.org/records/22832620で公開されている。
関連論文リスト
- RUMPL: Ray-Based Transformers for Universal Multi-View 2D to 3D Human Pose Lifting [81.66201044236321]
2D画像から3D人間のポーズを推定することは依然として難しい。
近年の手法では2次元ポーズ推定と2次元から3次元のポーズリフトを合成データで訓練した。
RUMPLは2次元キーポイントの3次元線による表現を導入するトランスフォーマーベースの3Dポーズリフト機である。
論文 参考訳(メタデータ) (2025-12-17T14:37:27Z) - Pre-training a Density-Aware Pose Transformer for Robust LiDAR-based 3D Human Pose Estimation [27.25933965875881]
LiDARベースの3Dヒューマンポース推定が研究の焦点となっている。
既存の手法のほとんどは、時間情報、マルチモーダル融合、あるいはSMPL最適化を使ってバイアスのある結果を修正する。
本稿では,ポイントクラウドのモデリングと拡張に関する洞察を提供する,シンプルながら強力な手法を提案する。
論文 参考訳(メタデータ) (2024-12-18T02:54:30Z) - Enhancing 3D Human Pose Estimation Amidst Severe Occlusion with Dual Transformer Fusion [13.938406073551844]
本稿では,DTF(Dual Transformer Fusion)アルゴリズムを提案する。
正確な3Dヒューマンポース推定を実現するために,本手法では,まず2つの中間ビューを生成する革新的なDTFアーキテクチャを利用する。
このアプローチは、両方のデータセットで既存の最先端メソッドよりも優れており、大幅に改善されています。
論文 参考訳(メタデータ) (2024-10-06T18:15:27Z) - Coordinate Transformer: Achieving Single-stage Multi-person Mesh
Recovery from Videos [91.44553585470688]
ビデオから複数人の3Dメッシュを回収することは、バーチャルリアリティーや理学療法などにおけるグループ行動の自動認識に向けた重要な第一歩である。
本稿では,複数人物の時空間関係を直接モデル化し,同時にエンドツーエンドでマルチ・メッシュ・リカバリを行うコーディネート・トランスフォーマーを提案する。
3DPWデータセットの実験では、CoordFormerが最先端の精度を大幅に向上し、MPJPE、PAMPJPE、PVEの計測値でそれぞれ4.2%、8.8%、そして4.7%を上回った。
論文 参考訳(メタデータ) (2023-08-20T18:23:07Z) - Instant Multi-View Head Capture through Learnable Registration [62.70443641907766]
3次元頭部のデータセットを密接なセマンティック通信でキャプチャする既存の手法は遅い。
キャリブレーションされたマルチビュー画像から3Dヘッドを直接推定するためにTEMPEHを導入する。
1つの頭部の予測には0.3秒かかるが、中央値の復元誤差は0.26mmで、現在の最先端よりも64%低い。
論文 参考訳(メタデータ) (2023-06-12T21:45:18Z) - ConvFormer: Parameter Reduction in Transformer Models for 3D Human Pose
Estimation by Leveraging Dynamic Multi-Headed Convolutional Attention [0.0]
textbftextitConvFormerは、3D人間のポーズ推定タスクのための新しい畳み込み変換器である。
我々は,Human3.6M,MPI-INF-3DHP,HumanEvaの3つのベンチマークデータセットで本手法を検証した。
論文 参考訳(メタデータ) (2023-04-04T22:23:50Z) - P-STMO: Pre-Trained Spatial Temporal Many-to-One Model for 3D Human Pose
Estimation [78.83305967085413]
本稿では,2次元から3次元のポーズ推定作業のためのP-STMOモデルを提案する。
提案手法は,パラメータが少なく,計算オーバーヘッドが少なく,最先端の手法より優れている。
論文 参考訳(メタデータ) (2022-03-15T04:00:59Z) - MixSTE: Seq2seq Mixed Spatio-Temporal Encoder for 3D Human Pose
Estimation in Video [75.23812405203778]
近年, 学習時間相関のため, 全フレームのボディジョイントを世界規模で考慮し, 2次元キーポイントシーケンスから3次元人間のポーズを推定する手法が提案されている。
本研究では,各関節の時間的動きを別々にモデル化する時間的変圧器ブロックと,関節間空間相関を有する変圧器ブロックを有するミキシングミキシングを提案する。
さらに、ネットワーク出力は、中央フレームから入力ビデオの全フレームに拡張され、入力と出力のベンチマーク間のコヒーレンスが改善される。
論文 参考訳(メタデータ) (2022-03-02T04:20:59Z) - Direct Multi-view Multi-person 3D Pose Estimation [138.48139701871213]
マルチビュー画像からマルチパーソン3Dポーズを推定するためのMulti-view Pose Transformer(MvP)を提案する。
MvPは、中間タスクに頼ることなく、複数の人物の3Dポーズを直接クリーンで効率的な方法で回帰する。
我々は,MvPモデルがより効率的でありながら,いくつかのベンチマークにおいて最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2021-11-07T13:09:20Z) - Exploring Severe Occlusion: Multi-Person 3D Pose Estimation with Gated
Convolution [34.301501457959056]
本稿では,2次元関節を3次元に変換するために,ゲート型畳み込みモジュールを用いた時間回帰ネットワークを提案する。
また, 正規化ポーズを大域軌跡に変換するために, 単純かつ効果的な局所化手法も実施した。
提案手法は,最先端の2D-to-3Dポーズ推定法よりも優れている。
論文 参考訳(メタデータ) (2020-10-31T04:35:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。