論文の概要: PACT: End-to-End Learning of Human Pose, Contacts, and Forces from Video
- arxiv url: http://arxiv.org/abs/2610.00451v2
- Date: Mon, 05 Oct 2026 06:52:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.495655
- Title: PACT: End-to-End Learning of Human Pose, Contacts, and Forces from Video
- Title(参考訳): PACT: ビデオによる人間の姿勢、接触、力のエンド・ツー・エンド学習
- Abstract要約: PACTは、モノクロビデオから人間のポーズ、接触力、接触力を推定するために共同で学習するエンドツーエンドモデルである。
我々は,接触ラベルと物理に基づく動きと力の最適化を組み合わせたデータアノテーションパイプラインを開発した。
実験は、最先端の接触と力の推定を実証し、段階的な再建アプローチよりも優れた結果を得た。
- 参考スコア(独自算出の注目度): 44.19745810264021
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Human motion, environmental contacts, and interaction forces are governed by common physical laws, yet existing approaches typically separate visual pose reconstruction from contact and force estimation. This separation limits joint reasoning and can propagate errors between stages. We introduce PACT, an end-to-end model that jointly learns to estimate human pose, contacts and contact forces from monocular video. Our approach augments a human reconstruction foundation model with learnable contact-force tokens and a temporal transformer that integrates visual features with world-space motion. Joint prediction heads refine human poses and estimate contacts and forces, while physics-based supervision encourages consistency between the reconstructed motion and interaction forces. To address the scarcity of force annotations, we develop a data annotation pipeline that combines contact labeling with physics-based motion and force optimization, producing training supervision from synthetic and real-world videos. We also introduce a real-world climbing benchmark ForceWall with climbing videos and corresponding ground-truth contact forces obtained from the force sensors. Experiments demonstrate state-of-the-art contact and force estimation, outperforming staged reconstruction approaches and generalizing to interactions beyond the training distribution. These results support end-to-end joint learning as an effective approach to recovering human motion and physical interactions from video.
- Abstract(参考訳): 人間の動き、環境接触、相互作用力は、一般的な物理法則によって支配されるが、既存のアプローチは、通常、接触と力の推定から視覚的なポーズの再構築を分離する。
この分離は共同推論を制限し、段階間の誤りを伝播させることができる。
我々は,モノクロ映像から人間のポーズ,接触力,接触力を推定するエンド・ツー・エンド・エンド・モデルであるPACTを紹介した。
提案手法は、学習可能な接触力トークンと、世界空間の動きと視覚的特徴を統合する時間変換器を備えた、人間の再構築基盤モデルを強化する。
共同予測ヘッドは人間のポーズを洗練させ、接触と力を推定し、物理に基づく指導は再構成された動きと相互作用の力の一貫性を促進する。
力アノテーションの不足に対処するため,接触ラベルと物理に基づく動きと力の最適化を組み合わせたデータアノテーションパイプラインを開発し,合成および実世界のビデオからトレーニングの監督を行う。
また、実世界のクライミング・ベンチマークであるForceWallを導入し、クライミング・ビデオと、力センサから得られる接地力について紹介する。
実験は、最先端の接触と力の推定、ステージ化された再構築アプローチよりも優れ、訓練分布を超えた相互作用に一般化することを示した。
これらの結果は、映像から人間の動きや身体的相互作用を回復するための効果的なアプローチとして、エンドツーエンドのジョイントラーニングを支援する。
関連論文リスト
- WT-UMI: Tactile-based Whole-Body Manipulation via Force-Supervised Contact-Aware Planning [7.150534189488604]
ばらばらで変形可能な、共有負荷オブジェクトの全身ヒューマノイド操作には、分散接触センシングと明示的な力規制が必要である。
本稿では,人間の操作者やヒューマノイドに装着したウェアラブルな全身触覚インタフェースである textbfWT-UMI を提案する。
論文 参考訳(メタデータ) (2026-06-11T11:45:58Z) - SocialMirror: Reconstructing 3D Human Interaction Behaviors from Monocular Videos with Semantic and Geometric Guidance [49.69016078147708]
密接な相互作用シナリオにおける人間の行動の正確な再構築は、拡張現実における現実的な仮想インタラクションの実現に不可欠である。
本稿では,これらの問題に効果的に対処するための意味的および幾何学的手がかりを統合する拡散ベースのフレームワークであるSocialMirrorを提案する。
SocialMirrorはインタラクティブなヒューマンメッシュを再構築する上で,最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-04-15T07:41:52Z) - Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning [29.898955971414154]
多エージェント強化学習問題として, 密接に相互作用し, 力量変化する人間の動作系列の模倣を定式化する。
AssistMimicは、確立されたベンチマーク上でのアシストインタラクション動作の追跡に成功できる最初の方法であることを示す。
論文 参考訳(メタデータ) (2026-03-11T22:25:44Z) - MeshMimic: Geometry-Aware Humanoid Motion Learning through 3D Scene Reconstruction [54.36564144414704]
MeshMimicは、3Dシーンの再構築とインテリジェンスを組み込んだ革新的なフレームワークで、ヒューマノイドロボットがビデオから直接「モーション・テライン」インタラクションを学習できるようにする。
現状の3次元視覚モデルを活用することで、我々のフレームワークは、人間の軌跡と基礎となる地形や物体の3次元幾何学の両方を正確にセグメント化し再構築する。
論文 参考訳(メタデータ) (2026-02-17T17:09:45Z) - PhysHMR: Learning Humanoid Control Policies from Vision for Physically Plausible Human Motion Reconstruction [52.44375492811009]
物理学に基づくシミュレーターにおいて,ヒューマノイド制御のための視覚行動ポリシーを学習する統合フレームワークであるPhysHMRを提案する。
我々のアプローチの重要な要素はピクセル・アズ・レイ戦略であり、2次元のキーポイントを3次元空間に上げ、それらを大域空間に変換する。
PhysHMRは多種多様なシナリオにまたがって高忠実で物理的に妥当な動きを生じさせ、視覚的精度と身体的リアリズムの両方において以前のアプローチより優れている。
論文 参考訳(メタデータ) (2025-10-02T21:01:11Z) - Towards Immersive Human-X Interaction: A Real-Time Framework for Physically Plausible Motion Synthesis [51.95817740348585]
Human-Xは、様々な実体をまたいだ没入的で物理的に妥当なヒューマンインタラクションを可能にするために設計された、新しいフレームワークである。
本手法は, 自己回帰型反応拡散プランナを用いて, リアルタイムに反応と反応を同時予測する。
我々のフレームワークは、人間とロボットのインタラクションのための仮想現実インターフェースを含む、現実世界のアプリケーションで検証されている。
論文 参考訳(メタデータ) (2025-08-04T06:35:48Z) - CG-HOI: Contact-Guided 3D Human-Object Interaction Generation [29.3564427724612]
テキストから動的3次元人-物体相互作用(HOI)を生成する最初の方法であるCG-HOIを提案する。
意味的に豊かな人間の動きは、しばしば孤立して起こるので、人間と物体の両方の動きを相互依存的にモデル化する。
我々は,接触に基づく人間と物体の相互作用が現実的かつ物理的に妥当なシーケンスを生成することを示す。
論文 参考訳(メタデータ) (2023-11-27T18:59:10Z) - Physical Interaction: Reconstructing Hand-object Interactions with
Physics [17.90852804328213]
本稿では, 復元のあいまいさを解消する物理に基づく手法を提案する。
まず、手動物体の力に基づく動的モデルを提案し、これは観測されていない接触を回復し、また可塑性接触力の解法である。
実験により,提案手法は物理的に可塑性とより正確な手-物体相互作用の両方を再構成することを示した。
論文 参考訳(メタデータ) (2022-09-22T07:41:31Z) - Contact-Aware Retargeting of Skinned Motion [49.71236739408685]
本稿では,自己接触を保存し,相互接続を防止する動作推定手法を提案する。
入力運動における自己接触と接地を同定し、出力骨格に適用するための動作を最適化する。
実験では,従来の手法を定量的に上回り,近年の成果よりも高い品質で再ターゲットされた動きを評価できるユーザスタディを実施している。
論文 参考訳(メタデータ) (2021-09-15T17:05:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。