論文の概要: MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation
- arxiv url: http://arxiv.org/abs/2606.09215v1
- Date: Mon, 08 Jun 2026 08:50:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:06.844115
- Title: MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation
- Title(参考訳): MotionWAM: リアルタイムヒューマノイドロコマニピュレーションのための基礎的世界行動モデルを目指して
- Authors: Jia Zheng, Teli Ma, Yudong Fan, Zifan Wang, Shuo Yang, Junwei Liang,
- Abstract要約: 我々は,1台の自家用カメラから自律型ヒューマノイドロコマニピュレーションを駆動するリアルタイムWAMであるMotionWAMを紹介する。
3段階の学習フレームワークは、ビデオワールドモデルをエゴセントリックな視覚力学に徐々に適応させる。
- 参考スコア(独自算出の注目度): 17.392786435444062
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World Action Models (WAMs) couple a video dynamics prior to the policy and have shown encouraging results on tabletop manipulation, but iterative denoising over high-dimensional video-action latents leaves them too slow for real-time humanoid loco-manipulation. The problem is compounded by the dominant hierarchical paradigm, in which a high-level manipulation policy controls only the upper body while a low-level controller tracks coarse base commands -- placing upper and lower body in inconsistent action spaces and reducing the legs to balance-preserving locomotion. We present MotionWAM, a real-time WAM that drives autonomous humanoid loco-manipulation from a single egocentric camera by conditioning the policy on the intermediate denoising features of a video world model. MotionWAM replaces the upper-lower split with a unified motion latent and predicts whole-body motion tokens that jointly cover locomotion, torso motion, height regulation, foot interaction, and hand manipulation in a single action space. A three-stage learning framework progressively adapts the video world model to egocentric visual dynamics and to the target humanoid embodiment. On nine real-world Unitree G1 tasks, MotionWAM runs in real time, substantially outperforms Vision-Language-Action (VLA) baselines fine-tuned on the same demonstrations by over 30% in overall success rate, and executes task-driven foot interaction that decoupled upper-lower policies cannot reach. Our results suggest that video-pretrained WAMs can be lifted from tabletop manipulation to coordinated, human-like whole-body humanoid control.
- Abstract(参考訳): World Action Models (WAMs) は、このポリシーに先立って、ビデオのダイナミックスを結合し、テーブルトップ操作の奨励的な結果を示したが、高次元ビデオアクション潜伏剤を反復的にデノベートすることで、リアルタイムなヒューマノイドロコ操作には遅すぎる。
問題は、高レベルの操作ポリシーが上半身のみを制御し、低レベルのコントローラが粗いベースコマンドを追跡するという支配的な階層的パラダイムによって構成されている。
我々は、ビデオワールドモデルの中間的認知機能にポリシーを定め、単一の自我中心カメラから自律的ヒューマノイドロコ操作を駆動するリアルタイムWAMであるMotionWAMを提案する。
MotionWAMは、上半身のスプリットを統一されたモーションラテントに置き換え、単一のアクション空間における移動、胴体の動き、高さ調節、足の相互作用、手操作を共同でカバーする全身のモーショントークンを予測する。
3段階の学習フレームワークは、ビデオワールドモデルをエゴセントリックな視覚力学や対象のヒューマノイド・エンボディメントに段階的に適応させる。
現実世界の9つのUnitree G1タスクにおいて、MotionWAMはリアルタイムに動作し、Vision-Language-Action(VLA)ベースラインを30%以上の成功率で微調整する。
以上の結果から,ビデオ対応のWAMをテーブルトップ操作から人体全体のヒューマノイド制御へ持ち上げることが可能であることが示唆された。
関連論文リスト
- SPARK: Skeleton-Parameter Aligned Retargeting on Humanoid Robots with Kinodynamic Trajectory Optimization [9.553570391005257]
人間の動きは、汎用的なヒューマノイド制御ポリシーを訓練するための豊富な事前情報を提供するが、生のデモンストレーションはロボットの運動学や力学と相容れないことが多い。
タスク空間の人的データから自然および動的に実行可能な動作参照を生成するための2段階パイプラインを提案する。
論文 参考訳(メタデータ) (2026-03-12T03:03:14Z) - ULTRA: Unified Multimodal Control for Autonomous Humanoid Whole-Body Loco-Manipulation [55.467742403416175]
本稿では,大規模モーションキャプチャをヒューマノイドに変換する物理駆動型ニューラルネットワークを提案する。
我々は高密度参照とスパースタスク仕様の両方をサポートする統合マルチモーダルコントローラを学習する。
その結果,ULTRAは自我中心の知覚から,自律的,目標条件付き全体ロコ操作に一般化することが示された。
論文 参考訳(メタデータ) (2026-03-03T18:59:29Z) - HiWET: Hierarchical World-Frame End-Effector Tracking for Long-Horizon Humanoid Loco-Manipulation [43.43128572722804]
我々は、ヒューマノイドのロコ操作におけるエンドエフェクタトラッキングとしてこの問題を再考する。
動的実行からグローバルな推論を分離する階層的強化学習フレームワークであるHiWETを提案する。
我々は,HuWETが長期のワールドフレームタスクにおいて,高精度かつ安定したエンドエフェクタトラッキングを実現することを示す。
論文 参考訳(メタデータ) (2026-02-06T03:11:56Z) - SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control [85.91101551600978]
モデルキャパシティ,データ,計算のスケールアップにより,自然かつ堅牢な体の動きを生成できる汎用的なヒューマノイドコントローラが得られることを示す。
我々は、ネットワークサイズ、データセットボリューム、計算の3つの軸に沿ってスケーリングすることで、モーショントラッキングのための基礎モデルを構築します。
本研究では,(1)動作追跡を下流タスク実行にブリッジし,自然かつインタラクティブな制御を可能にするリアルタイムユニバーサルキネマティックプランナ,(2)様々な動作入力インタフェースをサポートする統一トークン空間の2つのメカニズムにより,モデルの実用性を示す。
論文 参考訳(メタデータ) (2025-11-11T04:37:40Z) - ResMimic: From General Motion Tracking to Humanoid Whole-body Loco-Manipulation via Residual Learning [59.64325421657381]
ヒューマノイド全体のロコ操作は、日々のサービスや倉庫のタスクにトランスフォーメーション機能を約束する。
ResMimicは、人間の動作データから正確に表現力のあるヒューマノイド制御のための2段階の残差学習フレームワークである。
結果は、強いベースラインよりもタスク成功、トレーニング効率、堅牢性が大幅に向上したことを示している。
論文 参考訳(メタデータ) (2025-10-06T17:47:02Z) - OmniRetarget: Interaction-Preserving Data Generation for Humanoid Whole-Body Loco-Manipulation and Scene Interaction [76.44108003274955]
ヒューマノイドロボットの複雑なスキルを教えるための主要なパラダイムは、強化学習ポリシーの運動学的参照として人間の動きを再ターゲットすることである。
インタラクションメッシュに基づくインタラクション保存データ生成エンジンであるOmniRetargetを紹介する。
人間のメッシュとロボットメッシュの間のラプラシアの変形を最小限にすることで、OmniRetargetは運動学的に実現可能な軌道を生成する。
論文 参考訳(メタデータ) (2025-09-30T17:59:02Z) - TokenMotion: Decoupled Motion Control via Token Disentanglement for Human-centric Video Generation [7.900728371180723]
TokenMotionは、カメラモーションのきめ細かい制御を可能にする、最初のDiTベースのビデオ拡散フレームワークである。
本稿では,人間を意識した動的マスクをブリッジした分離・融合戦略を用いた統一モデリングフレームワークを提案する。
私たちの研究は、コントロール可能なビデオ生成の大幅な進歩を表しており、特にクリエイティブなプロダクションアプリケーションに関係しています。
論文 参考訳(メタデータ) (2025-04-11T00:41:25Z) - Mobile-TeleVision: Predictive Motion Priors for Humanoid Whole-Body Control [18.269588421166503]
ヒューマノイドロボットは頑丈な下半身移動と正確な上半身操作を必要とする。
最近の強化学習アプローチは、全身のロコ操作ポリシーを提供するが、正確な操作はしていない。
Inverses (IK) と Motion を用いた高体力制御を導入し, 高精度な操作を行う。
CVAEは安定性とロバスト性に重要な特徴であり,RLによる全身制御よりも高い精度で操作できることが示唆された。
論文 参考訳(メタデータ) (2024-12-10T18:59:50Z) - Universal Humanoid Motion Representations for Physics-Based Control [71.46142106079292]
物理学に基づくヒューマノイド制御のための総合的な運動スキルを含む普遍的な運動表現を提案する。
まず、大きな非構造運動データセットから人間の動きをすべて模倣できる動き模倣機を学習する。
次に、模倣者から直接スキルを蒸留することで、動作表現を作成します。
論文 参考訳(メタデータ) (2023-10-06T20:48:43Z) - Task-Generic Hierarchical Human Motion Prior using VAEs [44.356707509079044]
人間の動きを記述する深い生成モデルは、幅広いコンピュータビジョンやグラフィックタスクに役立てることができる。
本稿では,グローバル・ローカル・ラテント・スペースの組み合わせを用いて,特定のタスクに依存しない複雑な人間の動作を学習する手法を提案する。
映像に基づく人間のポーズ推定を含む様々なタスクにおいて,階層的な動き変動自動エンコーダの有効性を実証する。
論文 参考訳(メタデータ) (2021-06-07T23:11:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。