論文の概要: From Sparse to Dense: Spatio-Temporal Fusion for Multi-View 3D Human Pose Estimation with DenseWarper
- arxiv url: http://arxiv.org/abs/2605.14525v1
- Date: Thu, 14 May 2026 08:08:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.703423
- Title: From Sparse to Dense: Spatio-Temporal Fusion for Multi-View 3D Human Pose Estimation with DenseWarper
- Title(参考訳): スパースからデンスへ:DenseWarperを用いた多視点3次元人物位置推定のための時空間融合
- Authors: Ling Li, Changjie Chen, Yuyan Wang, Jiaqing Lyu, Kenglun Chang, Yiyun Chen, Zhidong Deng,
- Abstract要約: マルチビューの人間のポーズ推定では、モデルは通常、特定の瞬間にポーズを予測するために、異なるカメラビューから同時にキャプチャされた画像に依存する。
そこで本研究では,新しい3次元ポーズ推定手法を提案する。
提案手法は,スパース・インターリーブ画像のみを入力として利用し,従来の多視点入力手法よりも優れ,最先端の性能を実現する。
- 参考スコア(独自算出の注目度): 18.273229436048066
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In multi-view 3D human pose estimation, models typically rely on images captured simultaneously from different camera views to predict a pose at a specific moment. While providing accurate spatial information, this traditional approach often overlooks the rich temporal dependencies between adjacent frames. We propose a novel 3D human pose estimation input method: the sparse interleaved input to address this. This method leverages images captured from different camera views at various time points (e.g., View 1 at time $t$ and View 2 at time $t+δ$), allowing our model to capture rich spatio-temporal information and effectively boost performance. More importantly, this approach offers two key advantages: First, it can theoretically increase the output pose frame rate by N times with N cameras, thereby breaking through single-view frame rate limitations and enhancing the temporal resolution of the production. Second, using a sparse subset of available frames, our method can reduce data redundancy and simultaneously achieve better performance. We introduce the DenseWarper model, which leverages epipolar geometry for efficient spatio-temporal heatmap exchange. We conducted extensive experiments on the Human3.6M and MPI-INF-3DHP datasets. Results demonstrate that our method, utilizing only sparse interleaved images as input, outperforms traditional dense multi-view input approaches and achieves state-of-the-art performance. The source code for this work is available at: https://github.com/lingli1724/DenseWarper-ICLR2026
- Abstract(参考訳): マルチビューの人間のポーズ推定では、モデルは通常、特定の瞬間にポーズを予測するために、異なるカメラビューから同時にキャプチャされた画像に依存する。
正確な空間情報を提供する一方で、この伝統的なアプローチは、隣接するフレーム間の豊富な時間的依存関係をしばしば見落としている。
そこで本研究では,新しい3次元ポーズ推定手法を提案する。
本手法では,様々な時点における様々なカメラビューから取得した画像(例えば,時間$t$のビュー1,時間$t+δ$のビュー2)を活用し,高頻度の時空間情報を収集し,性能を効果的に向上する。
さらに重要なことに、このアプローチには2つの大きな利点がある: まず、NカメラでN倍の出力ポーズフレームレートを理論的に増加させ、単一のビューフレームレートの制限を突破し、生産の時間分解能を高める。
第2に、利用可能なフレームのスパースサブセットを使用することで、データの冗長性を低減し、同時に性能を向上させることができる。
本稿では,高効率な時空間熱マップ交換にエピポーラ幾何を利用するDenseWarperモデルを提案する。
我々はHuman3.6MとMPI-INF-3DHPデータセットについて広範な実験を行った。
提案手法は,スパース・インターリーブ画像のみを入力として利用し,従来の多視点入力手法よりも優れ,最先端の性能を実現する。
この作業のソースコードは、https://github.com/lingli1724/DenseWarper-ICLR2026で公開されている。
関連論文リスト
- iGaussian: Real-Time Camera Pose Estimation via Feed-Forward 3D Gaussian Splatting Inversion [62.09575122593993]
iGaussianは2段階のフィードフォワードフレームワークで、直接3Dガウス変換によるリアルタイムカメラポーズ推定を実現する。
NeRF Synthetic, Mip-NeRF 360, T&T+DB データセットの実験結果から, 従来の手法に比べて大幅な性能向上が得られた。
論文 参考訳(メタデータ) (2025-11-18T05:22:22Z) - Multiview Image-Based Localization [2.594420805049218]
本稿では、IR方式のように、画像の特徴のみをデータベースに格納するハイブリッド手法を示す。
3Dの手法のように、潜伏した3Dの再構築に頼っているが、3Dのシーンの再構築は維持していない。
提案手法では,7ScenesとCambridge Landmarksのデータセットのパフォーマンス向上に加えて,最先端技術と比較して,タイミングとメモリフットプリントの向上が図られている。
論文 参考訳(メタデータ) (2025-03-30T20:00:31Z) - SPAR3D: Stable Point-Aware Reconstruction of 3D Objects from Single Images [49.7344030427291]
単一画像の3Dオブジェクト再構成の問題点について検討する。
最近の研究は回帰モデルと生成モデルという2つの方向に分かれている。
両方向を最大限に活用するための新しい2段階アプローチであるSPAR3Dを提案する。
論文 参考訳(メタデータ) (2025-01-08T18:52:03Z) - SpaRP: Fast 3D Object Reconstruction and Pose Estimation from Sparse Views [36.02533658048349]
本研究では,3次元テクスチャメッシュを再構成し,スパースビュー画像に対する相対カメラのポーズを推定する新しい手法であるSpaRPを提案する。
SpaRPは2次元拡散モデルから知識を抽出し、それらを微調整し、スパースビュー間の3次元空間関係を暗黙的に推論する。
テクスチャ化されたメッシュを生成するのに、わずか20秒しかかからず、カメラは入力ビューにポーズする。
論文 参考訳(メタデータ) (2024-08-19T17:53:10Z) - PF-LRM: Pose-Free Large Reconstruction Model for Joint Pose and Shape
Prediction [77.89935657608926]
画像から3Dオブジェクトを再構成するためのPF-LRM(Pose-Free Large Restruction Model)を提案する。
PF-LRMは1つのA100 GPU上で1.3秒で相対カメラのポーズを同時に推定する。
論文 参考訳(メタデータ) (2023-11-20T18:57:55Z) - Uplift and Upsample: Efficient 3D Human Pose Estimation with Uplifting
Transformers [28.586258731448687]
時間的にスパースな2Dポーズシーケンスを操作できるTransformerベースのポーズアップリフト方式を提案する。
本稿では,Transformerブロック内の時間的アップサンプリングにマスク付きトークンモデリングをどのように利用できるかを示す。
我々は,Human3.6M と MPI-INF-3DHP の2つのベンチマークデータセットを用いて評価を行った。
論文 参考訳(メタデータ) (2022-10-12T12:00:56Z) - Self-Attentive 3D Human Pose and Shape Estimation from Videos [82.63503361008607]
3D人間のポーズと形状推定のためのビデオベースの学習アルゴリズムを紹介します。
ビデオの時間情報を利用して自己着脱モジュールを提案する。
本手法を3DPW, MPI-INF-3DHP, Human3.6Mデータセット上で評価した。
論文 参考訳(メタデータ) (2021-03-26T00:02:19Z) - Light3DPose: Real-time Multi-Person 3D PoseEstimation from Multiple
Views [5.510992382274774]
いくつかのキャリブレーションされたカメラビューから複数の人物の3次元ポーズ推定を行う手法を提案する。
我々のアーキテクチャは、2次元ポーズ推定器のバックボーンから特徴マップを3次元シーンの包括的表現に集約する。
提案手法は本質的に効率的であり, 純粋なボトムアップ手法として, 現場の人数から計算的に独立している。
論文 参考訳(メタデータ) (2020-04-06T14:12:19Z) - Lightweight Multi-View 3D Pose Estimation through Camera-Disentangled
Representation [57.11299763566534]
空間校正カメラで撮影した多視点画像から3次元ポーズを復元する手法を提案する。
我々は3次元形状を利用して、入力画像をカメラ視点から切り離したポーズの潜在表現に融合する。
アーキテクチャは、カメラプロジェクション演算子に学習した表現を条件付け、ビュー当たりの正確な2次元検出を生成する。
論文 参考訳(メタデータ) (2020-04-05T12:52:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。