論文の概要: FlowHMR: Physically Plausible Motion Capture from Video
- arxiv url: http://arxiv.org/abs/2610.03691v1
- Date: Fri, 02 Oct 2026 17:52:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.541108
- Title: FlowHMR: Physically Plausible Motion Capture from Video
- Title(参考訳): FlowHMR:動画で見る身体的プラズブルなモーションキャプチャ
- Abstract要約: FlowHMRは、モノクロビデオから物理的に可視なグローバルな3Dモーションを回復するためのフレームワークである。
従来の学習ベースの手法は、通常、ビデオから直接人間の動きを後退させ、幾何学的な監督でネットワークを訓練する。
約4Kのインターネットビデオの大規模で多様なデータセットであるWild-4Kを導入し、野生での人間の動きの回復を評価する。
- 参考スコア(独自算出の注目度): 33.70212521799733
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present FlowHMR, a framework for recovering physically plausible global 3D human motion from monocular video. Previous learning-based methods typically regress human motion directly from video and train the network with geometric supervision. However, recovering human motion from monocular video is inherently ambiguous in depth, and direct regression tends to collapse toward an averaged solution. Moreover, the recovered motions are not guaranteed to be physically plausible, so physics-based tracking of them often fails. To address these challenges, we formulate video motion capture as a video-conditioned motion generation problem and first pretrain a flow matching model for this task. Given an input video, the pretrained model generates diverse motion candidates, but not all of them are faithful to the video or physically trackable. We therefore post-train the model using Group Relative Policy Optimization (GRPO) with two rewards. A fidelity reward encourages consistency with the input video. A tracking reward favors motions that a physics-based controller can track successfully. Together, these rewards shift the model's output preference, so the post-trained model stays faithful to the input video while producing more physically plausible motion. We further introduce Wild-4K, a large and diverse dataset of about 4K internet videos, for evaluating human motion recovery in the wild. Qualitative and quantitative experiments on Wild-4K show that our method outperforms state-of-the-art methods in overall motion fidelity and achieves a physical tracking success rate of 82.47%, compared with 62.82% for the strongest baseline, GVHMR.
- Abstract(参考訳): 本研究では,モノクロ映像から身体的に可視なグローバルな3次元人間の動きを復元するフレームワークであるFlowHMRを提案する。
従来の学習ベースの手法は、通常、ビデオから直接人間の動きを後退させ、幾何学的な監督でネットワークを訓練する。
しかし、単眼ビデオからの人間の動きの復元は本質的に不明瞭であり、直接回帰は平均解に向かって崩壊する傾向にある。
さらに、回復した動きは物理的に妥当であると保証されていないため、物理に基づく追跡は失敗することが多い。
これらの課題に対処するために、ビデオ条件付きモーション生成問題としてビデオモーションキャプチャを定式化し、まず、このタスクのためのフローマッチングモデルを事前訓練する。
入力ビデオが与えられた場合、事前訓練されたモデルは多様な動き候補を生成するが、それらすべてがビデオに忠実で、物理的に追跡可能であるわけではない。
そこで我々は,グループ相対政策最適化 (GRPO) を用いたモデルに2つの報奨を与える。
忠実度報酬は、入力ビデオとの整合性を促進する。
トラッキング報酬は、物理ベースのコントローラが正常に追跡できる動きを好む。
共に、これらの報酬はモデルの出力の好みを変えるので、トレーニング後のモデルは入力ビデオに忠実でありながら、より物理的に妥当な動きを生み出す。
さらに、野生での人間の動きの回復を評価するために、約4Kのインターネットビデオの大規模で多様なデータセットWild-4Kを紹介します。
Wild-4Kの定性的および定量的実験により,本手法は全運動忠実度において最先端の手法より優れ,最強ベースラインであるGVHMRの62.82%に比べて82.47%の物理追跡成功率を達成した。
関連論文リスト
- Proprio: Latent Self-Scoring and Inference-Time Refinement for Physically Plausible Video Generation [78.41956766048308]
Proprioは、凍結したジェネレータが自身の出力の物理的妥当性を評価し改善することを可能にする、トレーニング不要のフレームワークである。
自己運動の生物学的感覚であるプロプリセプションにインスパイアされたプロプリオは、モデルの流れを自己刺激信号として扱う。
Proprioは、テキスト・ツー・ビデオ・ベンチマークと画像・ツー・ビデオ・ベンチマークの物理的妥当性を一貫して改善する。
論文 参考訳(メタデータ) (2026-05-27T09:44:18Z) - PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation [75.96085587438279]
既存のビデオ報酬は主に2D知覚信号に依存しており、3Dの身体状態、接触状態、人間の関節の動きに基づくダイナミクスを明示的にモデル化する必要はない。
物理シミュレータにおける3次元人体軌道の復元を基礎とした構造的,きめ細かな運動報酬であるPhyMotionを提案し,運動の質を多次元の物理的実現性に沿って評価する。
実験により、PhyMotionは既存の報酬の定式化よりも人間の判断と強い相関性が得られることが示された。
論文 参考訳(メタデータ) (2026-05-14T02:12:13Z) - PhysHMR: Learning Humanoid Control Policies from Vision for Physically Plausible Human Motion Reconstruction [52.44375492811009]
物理学に基づくシミュレーターにおいて,ヒューマノイド制御のための視覚行動ポリシーを学習する統合フレームワークであるPhysHMRを提案する。
我々のアプローチの重要な要素はピクセル・アズ・レイ戦略であり、2次元のキーポイントを3次元空間に上げ、それらを大域空間に変換する。
PhysHMRは多種多様なシナリオにまたがって高忠実で物理的に妥当な動きを生じさせ、視覚的精度と身体的リアリズムの両方において以前のアプローチより優れている。
論文 参考訳(メタデータ) (2025-10-02T21:01:11Z) - VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation [66.58048825989239]
VideoPhy-2は、生成されたビデオの物理的常識を評価するアクション中心のデータセットである。
我々は、生成したビデオのセマンティック・アテンデンス、物理コモンセンス、および物理ルールのグラウンド化を評価する人間の評価を行う。
結果より,最高のモデルでも22%のジョイントパフォーマンスを達成できたことが示唆された。
論文 参考訳(メタデータ) (2025-03-09T22:49:12Z) - Optimal-state Dynamics Estimation for Physics-based Human Motion Capture from Videos [6.093379844890164]
オンライン環境での運動学観測に物理モデルを選択的に組み込む新しい手法を提案する。
リカレントニューラルネットワークを導入し、キネマティックス入力とシミュレートされた動作を熱心にバランスするカルマンフィルタを実現する。
提案手法は,物理に基づく人間のポーズ推定作業に優れ,予測力学の物理的妥当性を示す。
論文 参考訳(メタデータ) (2024-10-10T10:24:59Z) - Decoupling Human and Camera Motion from Videos in the Wild [67.39432972193929]
本研究では,野生の映像から地球規模の人間の軌道を再構築する手法を提案する。
カメラと人間の動きを分離することで、人間を同じ世界座標系に配置することができる。
論文 参考訳(メタデータ) (2023-02-24T18:59:15Z) - Contact and Human Dynamics from Monocular Video [73.47466545178396]
既存のディープモデルは、ほぼ正確に見えるエラーを含むビデオから2Dと3Dキネマティックのポーズを予測する。
本稿では,最初の2次元と3次元のポーズ推定を入力として,映像系列から3次元の人間の動きを推定する物理に基づく手法を提案する。
論文 参考訳(メタデータ) (2020-07-22T21:09:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。