論文の概要: Multi-THuMBS: Multi-person Tracking of 3D Human Meshes Beyond Video Shots
- arxiv url: http://arxiv.org/abs/2607.01626v1
- Date: Thu, 02 Jul 2026 02:48:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.642589
- Title: Multi-THuMBS: Multi-person Tracking of 3D Human Meshes Beyond Video Shots
- Title(参考訳): Multi-ThuMBS:ビデオ撮影以外の3Dメッシュの多人数追跡
- Abstract要約: マルチパーソンの3Dメッシュの追跡は、複雑なインタラクションのために非常に難しい問題である。
本稿では,この制限に対処するため,マルチTHuMBS(Multi-person Tracking of 3D Human Meshes Beyond Video Shots)を提案する。
提案手法は,3次元メッシュ復元,カメラポーズ推定,アイデンティティトラッキングにおいて大きな改善をもたらす。
- 参考スコア(独自算出の注目度): 22.36497523624122
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tracking multi-person 3D human meshes from in-the-wild videos is a highly challenging problem due to complex interactions, frequent occlusions, and severe truncation inherent in unconstrained environments. While recent approaches have improved robustness against these issues, they largely overlook the critical challenge prevalent in real-world footage: frequent shot changes. These abrupt transitions in camera viewpoints often cause existing methods to lose track of human identities and fail in reconstructing temporally coherent trajectories. Although several recent works have explored 3D human mesh tracking under shot changes, they are still limited to single-person scenarios, making them inadequate for real-world videos where multiple people interact and appear simultaneously. To address this limitation, we propose Multi-THuMBS (Multi-person Tracking of 3D Human Meshes Beyond Video Shots) that leverages a state-of-the-art 3D scene prior to reconstruct the two boundary frames in a single shared 3D space. Human meshes are then registered within the shared 3D space, maintaining per-person identity and motion consistency across shot changes. Extensive experiments demonstrate that our approach yields significant improvements in 3D human mesh recovery, camera pose estimation, and identity tracking, thereby ensuring high-fidelity motion reconstruction with consistent identity preservation across shots compared to previous state-of-the-art methods.
- Abstract(参考訳): in-the-wildビデオから複数人の人間のメッシュを追跡することは、複雑なインタラクション、頻繁なオクルージョン、そして制約のない環境に固有の重度のトランケーションなど、非常に難しい問題である。
最近のアプローチでは、これらの問題に対する堅牢性が改善されているが、現実の映像でよく見られる重要な課題である、頻繁な撮影変更を見落としている。
これらのカメラ視点の急激な遷移は、既存の手法が人間のアイデンティティの追跡を失い、時間的に整合した軌跡の再構築に失敗することが多い。
最近のいくつかの研究は、ショットチェンジの下で3Dのメッシュトラッキングを探索しているが、それでもシングルパーソンのシナリオに限られており、複数の人が同時に対話して現れる現実世界のビデオには不十分である。
この制限に対処するために,2つの境界フレームを1つの共有3次元空間で再構成する前に,最先端の3Dシーンを利用するマルチTHuMBS(Multi-person Tracking of 3D Human Meshes Beyond Video Shots)を提案する。
ヒューマンメッシュは共有された3D空間に登録され、ショット変更全体にわたって個人単位のアイデンティティとモーション一貫性が維持される。
広汎な実験により,本手法は3次元メッシュ復元,カメラポーズ推定,アイデンティティトラッキングにおいて顕著な改善をもたらすことが確認された。
関連論文リスト
- Human Video Generation from a Single Image with 3D Pose and View Control [62.676151243249556]
HVG(Human Video Generation in 4D)は、1つの画像から高画質のマルチビュー、時間的コヒーレントな人間の映像を生成できる潜時ビデオ拡散モデルである。
1)新しい2次元骨地図を通して3次元関節の解剖学的関係を捉え、3次元情報を導入して自己閉塞を解消するArticulated Pose Modulation、(ii)参照画像とフレーム間安定性のためのポーズシーケンス間の多視点一貫性と整合性を保証するView and Temporal Alignment、(iii)
論文 参考訳(メタデータ) (2026-02-24T18:42:20Z) - HumanMM: Global Human Motion Recovery from Multi-shot Videos [24.273414172013933]
本稿では,複数のショット遷移を伴って,世界における長時間の人間の動きを再現する新しいフレームワークを提案する。
このような長時間の動作は、モーション生成やモーション理解といった応用に非常に有用である。
論文 参考訳(メタデータ) (2025-03-10T17:57:03Z) - 3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation [83.98251722144195]
制御可能なビデオ生成における従来の方法は、主に物体の動きを操作するために2D制御信号を利用する。
本稿では3次元空間におけるマルチエンタリティダイナミクスを制御する頑健なコントローラである3DTrajMasterを紹介する。
3DTrajMasterは,多心性3D動作を制御するための精度と一般化の両面において,新しい最先端技術を設定する。
論文 参考訳(メタデータ) (2024-12-10T18:55:13Z) - AvatarPose: Avatar-guided 3D Pose Estimation of Close Human Interaction from Sparse Multi-view Videos [31.904839609743448]
既存のマルチビュー手法は、複数の密接な対話の人々の3Dポーズと形状を推定する上で、しばしば課題に直面します。
個人ごとのパーソナライズされた暗黙的神経アバターを前者として活用する新しい手法を提案する。
実験により、いくつかの公開データセット上での最先端の性能を示す。
論文 参考訳(メタデータ) (2024-08-04T18:41:35Z) - Guess The Unseen: Dynamic 3D Scene Reconstruction from Partial 2D Glimpses [9.529416246409355]
本研究では,モノクロ映像から世界と複数の動的人間を3次元に再構成する手法を提案する。
キーとなるアイデアとして、最近出現した3Dガウススプラッティング(3D-GS)表現を通じて、世界と複数の人間の両方を表現します。
論文 参考訳(メタデータ) (2024-04-22T17:59:50Z) - Decaf: Monocular Deformation Capture for Face and Hand Interactions [77.75726740605748]
本稿では,単眼のRGBビデオから人間の顔と対話する人間の手を3Dで追跡する手法を提案する。
動作中の非剛性面の変形を誘発する定形物体として手をモデル化する。
本手法は,マーカーレスマルチビューカメラシステムで取得した現実的な顔変形を伴う手動・インタラクションキャプチャーデータセットに頼っている。
論文 参考訳(メタデータ) (2023-09-28T17:59:51Z) - Scene-Aware 3D Multi-Human Motion Capture from a Single Camera [83.06768487435818]
静止カメラで記録された1枚のRGBビデオから、シーン内の複数の人間の3次元位置を推定し、その身体形状と調音を推定する問題を考察する。
コンピュータビジョンの最近の進歩を,2次元の人体関節,関節角度,正規化不均等マップ,人間のセグメンテーションマスクなど,様々なモダリティのための大規模事前訓練モデルを用いて活用している。
特に,2次元の関節と関節角度を用いた正規化不均等予測から,シーン深度とユニークな人格尺度を推定する。
論文 参考訳(メタデータ) (2023-01-12T18:01:28Z) - HULC: 3D Human Motion Capture with Pose Manifold Sampling and Dense
Contact Guidance [82.09463058198546]
シーンインタラクションを備えたマーカーレスモノクロ3Dモーションキャプチャ(MoCap)は、拡張現実、ロボティクス、仮想アバター生成に関連する挑戦的な研究課題である。
シーン形状を認識した3DヒューマンMoCapの新しいアプローチであるHULCを提案する。
論文 参考訳(メタデータ) (2022-05-11T17:59:31Z) - Human Mesh Recovery from Multiple Shots [85.18244937708356]
疑似地上真理3Dヒューマンメッシュを用いた長期シーケンスの3次元再構築とマイニングの改善のためのフレームワークを提案する。
得られたデータは,様々なメッシュ回復モデルのトレーニングに有用であることを示す。
編集メディアの大規模なライブラリーから3Dコンテンツを処理・分析するための扉を開くツールを開発した。
論文 参考訳(メタデータ) (2020-12-17T18:58:02Z) - Exploring Severe Occlusion: Multi-Person 3D Pose Estimation with Gated
Convolution [34.301501457959056]
本稿では,2次元関節を3次元に変換するために,ゲート型畳み込みモジュールを用いた時間回帰ネットワークを提案する。
また, 正規化ポーズを大域軌跡に変換するために, 単純かつ効果的な局所化手法も実施した。
提案手法は,最先端の2D-to-3Dポーズ推定法よりも優れている。
論文 参考訳(メタデータ) (2020-10-31T04:35:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。