論文の概要: Multiview Multi-Person Human Mesh Recovery Under Large Scenes with Occlusions
- arxiv url: http://arxiv.org/abs/2607.24302v1
- Date: Mon, 27 Jul 2026 11:47:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.406483
- Title: Multiview Multi-Person Human Mesh Recovery Under Large Scenes with Occlusions
- Title(参考訳): 閉塞を伴う大規模環境下でのマルチパーソン・ヒューマンメッシュの回復
- Authors: Qi Zhang, Tao Yu, Jiechao He, Antoni B. Chan, Hui Huang,
- Abstract要約: MVMP-HMRと呼ばれる多視点多人数HMRのための大規模合成ベンチマークを提案する。
このベンチマークに基づいて,MVMP-HMRと呼ばれるマルチビューの人体メッシュ回復モデルを提案する。
モデルはまず、マルチビュー機能をシーンレベルの3D特徴量に融合させ、3Dポーズ推定ネットワークによって予測される骨盤関節を利用して、3D特徴量から個人固有のクエリを抽出する。
これらの人間のクエリは、3D特徴量とクロスアタッチされ、各人の3Dメッシュをデコードするために統合される。
- 参考スコア(独自算出の注目度): 53.539496609429015
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Human mesh recovery (HMR) aims to recover 3D human meshes from images. Most existing HMR benchmarks and methods focus on either multi-person reconstruction from a single view or single-person reconstruction from multiple views, where the number of subjects and the scene scale are relatively limited. Such settings are insufficient for real-world applications with large scenes and severe inter-person occlusions. To address this limitation, we introduce a large-scale synthetic benchmark for multiview multi-person HMR, termed MVMP-HMR. The proposed dataset contains 15 complex scenes with up to 50 camera views and 30 interacting persons, featuring large spatial coverage and severe occlusions, which significantly increases the difficulty of human mesh recovery. Based on this benchmark, we further propose a multiview multi-person whole-body human mesh recovery model, referred to as MVMP-HMR model. The model first fuses multiview features into a scene-level 3D feature volume, and then leverages pelvis joints predicted by a 3D pose estimation network to extract person-specific queries from the 3D feature volume. These human queries are cross-attended with the 3D feature volume and integrated to decode each person's 3D mesh. Moreover, we introduce two novel losses--the orientation loss and the 3D joint density loss--to alleviate orientation and pose ambiguities under severe occlusions. Experiments demonstrate that existing state-of-the-art HMR methods struggle on the proposed MVMP-HMR benchmark, while our method consistently outperforms prior SOTAs in large-scale scenes with severe occlusions.
- Abstract(参考訳): ヒューマンメッシュリカバリ(HMR)は、画像から3Dヒューマンメッシュを復元することを目的としている。
既存のHMRベンチマークや手法は、複数の視点からの複数対人再構成や、複数の視点からの1対人再構成に重点を置いており、被験者数とシーンスケールは比較的限られている。
このような設定は、大きなシーンと厳しい対人閉塞を持つ現実世界のアプリケーションには不十分である。
この制限に対処するため,MVMP-HMRと呼ばれる多視点多人数HMRの大規模合成ベンチマークを導入する。
提案したデータセットは、最大50枚のカメラビューを持つ15の複雑なシーンと、30人の対話的な人物を含む。
このベンチマークに基づいて,MVMP-HMRモデルと呼ばれる多視点の人体メッシュ回復モデルを提案する。
モデルはまず、マルチビュー機能をシーンレベルの3D特徴量に融合させ、3Dポーズ推定ネットワークによって予測される骨盤関節を利用して、3D特徴量から個人固有のクエリを抽出する。
これらの人間のクエリは、3D特徴量とクロスアタッチされ、各人の3Dメッシュをデコードするために統合される。
さらに, 配向損失と3次元関節密度損失の2つの新たな損失を導入し, 重度の閉塞下での配向を緩和し, あいまいさを呈する。
実験により,提案したMVMP-HMRベンチマークでは既存のHMR法が苦戦していることが明らかとなった。
関連論文リスト
- CrowdGaussian: Reconstructing High-Fidelity 3D Gaussians for Human Crowd from a Single Image [9.090760020394065]
CrowdGaussianは、複数の人物による3Dガウススティング(3DGS)表現を直接再構成する統合フレームワークである。
CrowdGaussianは、多人数シーンのフォトリアリスティック、幾何学的コヒーレントな再構成を生成する。
論文 参考訳(メタデータ) (2026-03-18T14:42:43Z) - HAMSt3R: Human-Aware Multi-view Stereo 3D Reconstruction [15.368018463074058]
HAMSt3Rは、スパース・アンキャリブレーション画像からのヒトとシーンの3D再構成のためのMASt3Rの拡張である。
提案手法では,人間をセグメント化したり,DensePose経由での密接な通信を推定したり,人中心環境における深度を予測したりするために,追加のネットワークヘッドを組み込んだ。
論文 参考訳(メタデータ) (2025-08-22T14:43:18Z) - Progressive Multi-view Human Mesh Recovery with Self-Supervision [68.60019434498703]
既存のソリューションは通常、新しい設定への一般化性能の低下に悩まされる。
マルチビューヒューマンメッシュリカバリのためのシミュレーションに基づく新しいトレーニングパイプラインを提案する。
論文 参考訳(メタデータ) (2022-12-10T06:28:29Z) - Direct Multi-view Multi-person 3D Pose Estimation [138.48139701871213]
マルチビュー画像からマルチパーソン3Dポーズを推定するためのMulti-view Pose Transformer(MvP)を提案する。
MvPは、中間タスクに頼ることなく、複数の人物の3Dポーズを直接クリーンで効率的な方法で回帰する。
我々は,MvPモデルがより効率的でありながら,いくつかのベンチマークにおいて最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2021-11-07T13:09:20Z) - 3D Multi-bodies: Fitting Sets of Plausible 3D Human Models to Ambiguous
Image Data [77.57798334776353]
単眼・部分閉塞視からヒトの高密度3次元再構成を実現することの問題点を考察する。
身体の形状やポーズをパラメータ化することで、あいまいさをより効果的にモデル化できることを示唆する。
提案手法は, 3次元人間の標準ベンチマークにおいて, あいまいなポーズ回復において, 代替手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2020-11-02T13:55:31Z) - Monocular, One-stage, Regression of Multiple 3D People [105.3143785498094]
我々は、複数の3D人物(ROMP)のための1段階方式で全てのメッシュを回帰することを提案する。
本手法は,体温マップとメッシュマップを同時に予測し,画素レベルの3Dボディメッシュを共同で記述する。
最先端の手法と比較して、ROMPは挑戦的なマルチパーソンベンチマークよりも優れた性能を示した。
論文 参考訳(メタデータ) (2020-08-27T17:21:47Z) - Multi-person 3D Pose Estimation in Crowded Scenes Based on Multi-View
Geometry [62.29762409558553]
マルチパーソナライズされた3次元ポーズ推定手法における特徴マッチングと深さ推定のコアは、エピポーラ制約である。
スパサーの群衆シーンにおけるこの定式化の良好なパフォーマンスにもかかわらず、その効果はより密集した群衆の状況下でしばしば挑戦される。
本稿では,マルチパーソン3次元ポーズ推定式から脱却し,群衆ポーズ推定として再編成する。
論文 参考訳(メタデータ) (2020-07-21T17:59:36Z) - Multi-View Matching (MVM): Facilitating Multi-Person 3D Pose Estimation
Learning with Action-Frozen People Video [38.63662549684785]
MVM法は大規模ビデオデータセットから信頼性の高い3次元ポーズを生成する。
マルチパーソン3Dポーズ推定のための入力として,1つの画像を取るニューラルネットワークを訓練する。
論文 参考訳(メタデータ) (2020-04-11T01:09:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。