論文の概要: A Dataset and Evaluation for Complex 4D Markerless Human Motion Capture
- arxiv url: http://arxiv.org/abs/2604.12765v1
- Date: Tue, 14 Apr 2026 14:06:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-15 19:11:32.481996
- Title: A Dataset and Evaluation for Complex 4D Markerless Human Motion Capture
- Title(参考訳): 複雑な4次元マーカーレスモーションキャプチャのデータセットと評価
- Authors: Yeeun Park, Miqdad Naduthodi, Suryansh Kumar,
- Abstract要約: マーカーベースのモーションキャプチャシステムは、長い間、正確な4D人間のモデリングのための金の標準だった。
複雑な4次元マーカーレスモーションキャプチャのための新しいデータセットと評価法を提案する。
- 参考スコア(独自算出の注目度): 4.81005617256125
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Marker-based motion capture (MoCap) systems have long been the gold standard for accurate 4D human modeling, yet their reliance on specialized hardware and markers limits scalability and real-world deployment. Advancing reliable markerless 4D human motion capture requires datasets that reflect the complexity of real-world human interactions. Yet, existing benchmarks often lack realistic multi-person dynamics, severe occlusions, and challenging interaction patterns, leading to a persistent domain gap. In this work, we present a new dataset and evaluation for complex 4D markerless human motion capture. Our proposed MoCap dataset captures both single and multi-person scenarios with intricate motions, frequent inter-person occlusions, rapid position exchanges between similarly dressed subjects, and varying subject distances. It includes synchronized multi-view RGB and depth sequences, accurate camera calibration, ground-truth 3D motion capture from a Vicon system, and corresponding SMPL/SMPL-X parameters. This setup ensures precise alignment between visual observations and motion ground truth. Benchmarking state-of-the-art markerless MoCap models reveals substantial performance degradation under these realistic conditions, highlighting limitations of current approaches. We further demonstrate that targeted fine-tuning improves generalization, validating the dataset's realism and value for model development. Our evaluation exposes critical gaps in existing models and provides a rigorous foundation for advancing robust markerless 4D human motion capture.
- Abstract(参考訳): マーカベースのモーションキャプチャ(MoCap)システムは、長い間、正確な4Dヒューマンモデリングのゴールドスタンダードであったが、特別なハードウェアやマーカーに依存しているため、スケーラビリティと実世界の展開が制限されている。
信頼性の高いマーカーレス4D人間のモーションキャプチャーの強化には、現実世界の人間のインタラクションの複雑さを反映したデータセットが必要である。
しかし、既存のベンチマークには、現実的なマルチパーソンのダイナミクス、厳しいオクルージョン、困難な相互作用パターンが欠けており、永続的なドメインギャップにつながっています。
本研究では,複雑な4次元マーカーレスモーションキャプチャのための新しいデータセットと評価を行う。
提案したMoCapデータセットは、複雑な動き、頻繁な対人閉塞、類似した服装の被験者間の迅速な位置交換、様々な被写体距離を含む、単体と多体の両方のシナリオをキャプチャする。
同期マルチビューRGBと深度シーケンス、正確なカメラキャリブレーション、Viconシステムからのグラウンドトルース3Dモーションキャプチャ、および対応するSMPL/SMPL-Xパラメータが含まれる。
この設定により、視覚観察と動地真実の正確な一致が保証される。
最先端のマーカーレスMoCapモデルのベンチマークでは、これらの現実的な条件下での大幅なパフォーマンス低下が示され、現在のアプローチの限界が強調されている。
さらに、ターゲットの微調整により一般化が向上し、モデル開発におけるデータセットのリアリズムと価値が検証されることを示す。
本評価は, 既存のモデルにおける重要なギャップを明らかにし, 頑健なマーカーレス4次元モーションキャプチャーを実現するための厳密な基盤を提供する。
関連論文リスト
- GeoMotion: Rethinking Motion Segmentation via Latent 4D Geometry [61.24189040578178]
そこで本研究では,注目機構を介し,潜在特徴表現から移動対象を直接推論する完全学習型アプローチを提案する。
我々の重要な洞察は、明示的な対応推定を回避し、代わりに、モデルが暗黙的にオブジェクトとカメラの動きを歪めることを学ぶことである。
提案手法は,最先端の動作セグメンテーション性能を高い効率で達成する。
論文 参考訳(メタデータ) (2026-02-25T11:36:33Z) - Motion4D: Learning 3D-Consistent Motion and Semantics for 4D Scene Understanding [54.859943475818234]
基礎モデルからの2次元先行を統一された4次元ガウススプラッティング表現に統合する新しいフレームワークであるMotion4Dを提案する。
1) 局所的な一貫性を維持するために連続的に動き場と意味体を更新する逐次最適化,2) 長期的コヒーレンスのために全ての属性を共同で洗練するグローバル最適化,である。
提案手法は,ポイントベーストラッキング,ビデオオブジェクトセグメンテーション,新しいビュー合成など,多様なシーン理解タスクにおいて,2次元基礎モデルと既存の3Dベースアプローチの両方に優れる。
論文 参考訳(メタデータ) (2025-12-03T09:32:56Z) - DynamicVerse: A Physically-Aware Multimodal Framework for 4D World Modeling [67.95038177144554]
物理スケールでマルチモーダルな4DワールドモデリングフレームワークであるDynamicVerseを紹介した。
我々は視覚、幾何学、マルチモーダルモデルを用いて、メートルスケールの静的幾何、実世界の動的運動、インスタンスレベルのマスク、そして全体論的キャプションを解釈する。
DynamicVerseは、100K以上のビデオと800K以上の注釈付きマスク、インターネットビデオから10M以上のフレームからなる大規模なデータセットを提供する。
論文 参考訳(メタデータ) (2025-12-02T18:24:27Z) - Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos [24.111891848073288]
身体的世界モデルは、視覚的な観察と行動を通じて物理的世界と予測し、相互作用することを目的としている。
MTV-Worldは正確なビジュモータ予測のためのマルチビュートラジェクトリ・ビデオ制御を導入した。
MTV-Worldは、複雑なデュアルアームシナリオにおける正確な制御実行と正確な物理的相互作用モデリングを実現する。
論文 参考訳(メタデータ) (2025-11-17T02:17:04Z) - MAMMA: Markerless & Automatic Multi-Person Motion Action Capture [37.06717786024836]
MAMMAはマーカーレスモーションキャプチャパイプラインで、2人のインタラクションシーケンスのマルチビュービデオからSMPL-Xパラメータを復元する。
セグメンテーションマスクに条件付された高密度2次元表面のランドマークを予測する手法を提案する。
提案手法は複雑な対人インタラクションを処理でき,既存の手法よりも精度が高いことを示す。
論文 参考訳(メタデータ) (2025-06-16T02:04:51Z) - Dyn-HaMR: Recovering 4D Interacting Hand Motion from a Dynamic Camera [49.82535393220003]
Dyn-HaMRは、野生のダイナミックカメラで撮影されたモノクロビデオから4Dグローバルハンドモーションを再構築する最初のアプローチである。
提案手法は,4次元メッシュ・リカバリにおいて最先端の手法を著しく上回ることを示す。
これにより、動くカメラでモノクロビデオから手の動きを復元するための新しいベンチマークが確立される。
論文 参考訳(メタデータ) (2024-12-17T12:43:10Z) - MOVIN: Real-time Motion Capture using a Single LiDAR [7.3228874258537875]
我々は,グローバルトラッキングを用いたリアルタイムモーションキャプチャのためのデータ駆動生成法MOVINを提案する。
本フレームワークは,パフォーマーの3次元グローバル情報と局所的な関節の詳細を正確に予測する。
実世界のシナリオでメソッドをデモするために,リアルタイムアプリケーションを実装した。
論文 参考訳(メタデータ) (2023-09-17T16:04:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。