論文の概要: Learning human joint torques from pixels
- arxiv url: http://arxiv.org/abs/2608.09083v1
- Date: Mon, 10 Aug 2026 03:29:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.069539
- Title: Learning human joint torques from pixels
- Title(参考訳): 画素からの人間の関節トルクの学習
- Abstract要約: 実物体画像から直接人間の関節トルクを予測するための視覚ベースの逆ダイナミクスデータセットとベンチマークであるVIDを紹介する。
VIDには63,369個のフレームと実際の人間の画像、キネマティックアノテーション、人文的属性、OpenSim由来の動的ラベルが含まれている。
画像列から関節トルクを復元するために,ポーズ制約付き空間確率特性,マーカー回帰,時間的トルク推定を組み合わせたVID-Networkを提案する。
- 参考スコア(独自算出の注目度): 4.463973085741068
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Estimating human joint torques from visual observations is a key step toward bringing biomechanical analysis from controlled laboratories to real-world movement scenarios. Existing torque estimation methods typically depend on surface electromyography, motion-capture markers, force plates, or simulated imitation data, which limits their applicability to ordinary RGB images. In this work, we introduce VID, a vision-based inverse dynamics dataset and benchmark for predicting human joint torques directly from real monocular images. VID contains 63,369 synchronized frames with real human images, kinematic annotations, anthropometric attributes, and OpenSim-derived dynamic labels, providing paired visual and biomechanical supervision for real-image inverse dynamics. We further define a standardized evaluation protocol covering overall torque estimation, joint-specific analysis, and action-specific prediction. To establish a strong reference model, we propose VID-Network, which combines pose-pretrained spatial probabilistic features, marker regression, and temporal torque inference to recover joint torques from image sequences. Experiments on VID show that VID-Network achieves an overall mPJE of 1.7612 N$\cdot$m/kg, improving over the best compared baseline by 39.81\%, and obtains the lowest error across all evaluated joint types and most action categories. VID establishes a first practical benchmark for vision-driven human inverse dynamics and provides a foundation for studying biomechanical inference in less constrained environments.
- Abstract(参考訳): 人間の関節トルクを視覚観測から推定することは、実世界の運動シナリオに制御された実験室から生体力学的解析をもたらすための重要なステップである。
既存のトルク推定法は、通常、表面筋電図、モーションキャプチャーマーカー、力板、または模擬模倣データに依存し、通常のRGB画像に適用性を制限する。
本研究では,視覚に基づく逆動力学データセットであるVIDを導入し,実際の単眼画像から人間の関節トルクを直接予測するベンチマークを行う。
VIDには63,369の同期フレームと実際の人間の画像、キネマティックアノテーション、人文的属性、OpenSim由来の動的ラベルが含まれており、実画像の逆ダイナミクスに対する視覚的および生体力学的監督のペアを提供する。
さらに、全トルク推定、関節特異的分析、行動特異的予測を含む標準化された評価プロトコルを定義する。
画像列から関節トルクを復元するために,ポーズ制約付き空間確率特性,マーカー回帰,時間トルク推定を組み合わせたVID-Networkを提案する。
VID上での実験では、VID-Networkは1.7612 N$\cdot$m/kgの全体的なmPJEを達成し、最高の比較ベースラインを39.81\%改善し、評価された全ての関節タイプとほとんどのアクションカテゴリで最小誤差を得る。
VIDは視覚駆動型人間の逆ダイナミクスのための最初の実用的なベンチマークを確立し、より制約の少ない環境での生体力学的推論の研究の基礎を提供する。
関連論文リスト
- Inter-X++: A Comprehensive Benchmark for Multimodal Human-Human Interaction Analysis [55.78822230833247]
We present Inter-X++, a comprehensive and large-scale benchmark designed to empower useful HHI analysis。
インターX++は11,388個の高忠実な相互作用シーケンスと8.1Mフレームを提供する。
インタラクションの再構築と意味理解を協調的に最適化する,単一かつ統一されたHHI表現とモデリングフレームワークOpenHHIを提案する。
論文 参考訳(メタデータ) (2026-08-20T17:51:48Z) - DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer [86.4618122245946]
DyG$2$Tは動的モデリングフレームワークで、キーポイント表現を空間的に完了し、時間的に識別することでオブジェクトの運動軌跡を推定する。
合成データセットと実世界のデータセットの両方の実験は、DyG$2$Tが正確な動的モデリングと推論を実現することを示した。
論文 参考訳(メタデータ) (2026-08-19T03:44:28Z) - An Opticalmechanics Framework for Dynamic Estimation of Multibody Systems [15.213803098614726]
本研究では,マルチボディシステムのための光学キネマティック・ダイナミック統合推定フレームワークを提案する。
システム力学を記述するために制約付き多体モデルを構築し, 動的推定のための非接触入力として画像計測キネマティック量を用いる。
論文 参考訳(メタデータ) (2026-06-08T11:59:58Z) - SAM 3D Body: Robust Full-Body Human Mesh Recovery [65.0108906331903]
シングルイメージフルボディ3Dヒューマンメッシュリカバリ(HMR)のためのアクセラブルモデルSAM 3D Body (3DB)を紹介する。
3DBは、身体、足、手の人間のポーズを推定します。
骨格構造と表面形状を分離する新しいパラメトリックメッシュ表現であるMomentum Human Rig(MHR)を使用した最初のモデルである。
論文 参考訳(メタデータ) (2026-02-17T20:26:37Z) - Dynamic Avatar-Scene Rendering from Human-centric Context [75.95641456716373]
分離されたモデルと最適化されたモデルをブリッジするbf分離マップ(StM)戦略を提案する。
StMは、視覚的品質とレンダリングの精度の両方において、既存の最先端の手法を著しく上回っている。
論文 参考訳(メタデータ) (2025-11-13T17:39:06Z) - Scaling Up Dynamic Human-Scene Interaction Modeling [58.032368564071895]
TRUMANSは、現在利用可能な最も包括的なモーションキャプチャーHSIデータセットである。
人体全体の動きや部分レベルの物体の動きを複雑に捉えます。
本研究では,任意の長さのHSI配列を効率的に生成する拡散型自己回帰モデルを提案する。
論文 参考訳(メタデータ) (2024-03-13T15:45:04Z) - Predicting Multi-Joint Kinematics of the Upper Limb from EMG Signals
Across Varied Loads with a Physics-Informed Neural Network [0.0]
PINNモデルは、フィードフォワードニューラルネットワーク(ANN)とジョイントトルクモデルを組み合わせることで構成される。
PINNモデルのトレーニングデータセットは、EMGと4つの異なる被験者から収集された時間データを含む。
その結果,関節角度予測では58%から83%の相関が認められた。
論文 参考訳(メタデータ) (2023-11-28T16:55:11Z) - End-to-End Learning of Hybrid Inverse Dynamics Models for Precise and
Compliant Impedance Control [16.88250694156719]
剛体力学モデルの物理的に一貫した慣性パラメータを同定できる新しいハイブリッドモデルの定式化を提案する。
7自由度マニピュレータ上での最先端の逆動力学モデルに対する我々のアプローチを比較した。
論文 参考訳(メタデータ) (2022-05-27T07:39:28Z) - 3D Pose Estimation and Future Motion Prediction from 2D Images [26.28886209268217]
本稿では,3次元人物のポーズを推定し,RGB画像列から将来の3次元動作を予測するという,高相関な課題に共同で取り組むことを検討する。
リー代数のポーズ表現に基づいて、人間の運動キネマティクスを自然に保存する新しい自己投射機構が提案されている。
論文 参考訳(メタデータ) (2021-11-26T01:02:00Z) - TRiPOD: Human Trajectory and Pose Dynamics Forecasting in the Wild [77.59069361196404]
TRiPODは、グラフの注目ネットワークに基づいて身体のダイナミクスを予測する新しい方法です。
実世界の課題を取り入れるために,各フレームで推定された身体関節が可視・視認可能かどうかを示す指標を学習する。
評価の結果,TRiPODは,各軌道に特化して設計され,予測タスクに特化している。
論文 参考訳(メタデータ) (2021-04-08T20:01:00Z) - Appearance Consensus Driven Self-Supervised Human Mesh Recovery [67.20942777949793]
単眼画像から人間のポーズや形状を推定する自己教師付きメッシュ回復フレームワークを提案する。
標準モデルに基づく3次元ポーズ推定ベンチマークの最先端結果を得る。
その結果、色付きメッシュ予測により、ポーズや形状推定以外にも、さまざまな外観関連タスクにフレームワークの使用が開放される。
論文 参考訳(メタデータ) (2020-08-04T05:40:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。