論文の概要: $ω$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation
- arxiv url: http://arxiv.org/abs/2608.06375v1
- Date: Thu, 06 Aug 2026 17:59:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.815781
- Title: $ω$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation
- Title(参考訳): $ω$-0: 同時ヒューマノイドロコマニピュレーションのための潜在予測的世界行動モデル
- Authors: Zhe Li, Zhenzhe Zhang, Yangyang Wei, Wenjie Zhang, Xichen Yuan, Peiyuan Zhi, Gen Li, Xinying Guo, Fengjie Gao, Jianfei Yang, Shanghang Zhang,
- Abstract要約: 我々は,実世界におけるヒューマノイド同時ロコ操作のための潜在予測全体ワールドアクションモデルである$-0を提示する。
11の家庭用タスクに関する実世界の実験は、1ドル=0のモデルがスムーズな操作と動作の振る舞いを生み出すことを実証している。
- 参考スコア(独自算出の注目度): 47.948547690479465
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Humanoid household tasks often require concurrent loco-manipulation, where the robot must move, adjust posture, maintain balance, and manipulate objects as a single coordinated behavior. Yet existing humanoid policies typically decompose locomotion and manipulation, while recent world-action models remain either arm-centric or video-centered. We present $ω$-0, a latent predictive whole-body world-action model for real-world humanoid concurrent loco-manipulation. Given a language instruction, current visual observation, and robot proprioceptive state, $ω$-0 directly predicts controller-compatible whole-body action latents for real-robot execution. Rather than reconstructing future videos, $ω$-0 learns compact future observation embeddings as a lightweight predictive objective, coupling latent visual foresight with diffusion-based whole-body action generation. The model supports egocentric RGB, exocentric RGB, and exocentric depth inputs, and leverages controller-based simulation replay to ground human/public visual-motion priors into robot-executable action latents. We further collect $ω$-HOME, a 40+ hour real-world household humanoid dataset with synchronized multi-view observations, whole-body SMPL motions, robot states, and action latents. Real-world experiments on 11 household tasks demonstrate that a single $ω$-0 model can produce smooth manipulate-while-moving behaviors and consistently outperform representative imitation learning, VLA, humanoid, and WAM baselines.
- Abstract(参考訳): ヒューマノイドの家庭用タスクは、ロボットが動き、姿勢を調整し、バランスを保ち、単一の協調行動としてオブジェクトを操作するという、同時的なロコ操作を必要とすることが多い。
しかし、既存のヒューマノイドポリシーは、通常、移動と操作を分解するが、最近の世界アクションモデルは、腕中心またはビデオ中心である。
実世界のヒューマノイド同時ロコ操作のための潜在予測全体ワールドアクションモデルであるω$-0を提示する。
言語命令、現在の視覚観察、ロボットの受容状態が与えられた場合、$ω$-0 は実際のロボット実行のためにコントローラ互換の全身動作潜伏者を直接予測する。
将来の映像を再構成する代わりに、$ω$-0は、軽量な予測目的として、コンパクトな将来の観察埋め込みを学習し、潜望視と拡散に基づく全体アクション生成を結合する。
このモデルは、エゴセントリックなRGB、エゴセントリックなRGB、そしてエゴセントリックな深度入力をサポートし、コントローラベースのシミュレーションリプレイを活用して、人間と公共の視覚運動の先行をロボットが実行可能なアクションラテンダーに分類する。
さらに、40時間以上の実世界のヒューマノイドデータセットであるω$-HOMEを収集し、マルチビューの同時観測、全身SMPLモーション、ロボット状態、行動潜伏者について検討した。
11の家庭用タスクに関する実世界の実験では、1つの$ω$-0モデルがスムーズな操作時の動作を生成でき、代表模倣学習、VLA、ヒューマノイド、WAMベースラインを一貫して上回っている。
関連論文リスト
- Masked Visual Actions for Unified World Modeling [96.12988421978463]
Masked Visual Actionsは、ビデオ内の任意の実体の部分的に明らかな軌跡としてアクションを表現するピクセル空間制御インタフェースである。
Revealing Robot Motionは、このモデルをフォワードダイナミクスモデルとして機能させ、低レベルのロボット動作に対するシーンの反応を予測する一方で、望ましい物体の動きを明らかにすることにより、同じモデルがロボットの動作をその結果と一致させる。
論文 参考訳(メタデータ) (2026-07-21T17:59:11Z) - Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments [32.61025334275917]
ヒト・アス・ヒューマノイド(Humanoid as-Humanoid)は、ヒトからヒトへのハイDoFヒューマノイドの監視フレームワークである。
大規模な人間のデモンストレーションを、対象のヒューマノイドに対する実行可能な観察-アクション監視に変換する。
Humanoidは、データ収集分析において、ヒューマノイド遠隔操作よりも4.8--7.2倍の生のデモンストレーション言語ゲインが得られる。
論文 参考訳(メタデータ) (2026-06-30T17:44:16Z) - ZeroWBC: Learning Natural Visuomotor Humanoid Control Directly from Human Egocentric Video [52.78703020909145]
我々は、人間中心のビデオから直接、自然なヒューマノイドビジュモータ制御ポリシーを学ぶ新しいフレームワークであるZeroWBCを紹介した。
提案手法はまず視覚言語モデル(VLM)を微調整し,テキスト命令とエゴセントリックな視覚コンテキストに基づく将来の身体全体の動作を予測する。
ユニツリーG1ヒューマノイドロボットの実験では,動作の自然性と汎用性において,本手法がベースラインアプローチより優れていることが示された。
論文 参考訳(メタデータ) (2026-03-10T04:19:43Z) - Towards Motion Turing Test: Evaluating Human-Likeness in Humanoid Robots [54.54929302887405]
15のアクションカテゴリにまたがる1000のモーションシーケンスからなるHuman-Humanoid Motionデータセットを提案する。
すべてのモーションシーケンスは、視覚的外観の影響を排除するためにSMPL-X表現に変換される。
収集したデータから、ヒューマノイドの動きが人間の動きと顕著なずれを示すことが明らかとなった。
論文 参考訳(メタデータ) (2026-03-06T11:40:56Z) - MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training [102.850162490626]
人間のロボットによる相互模倣事前学習による視覚-言語-行動モデルであるMiVLAを提案する。
MiVLAは、最先端のVLAよりも優れた、強力な改良された一般化能力を実現する。
論文 参考訳(メタデータ) (2025-12-17T12:59:41Z) - DemoHLM: From One Demonstration to Generalizable Humanoid Loco-Manipulation [29.519071338337685]
シミュレーションにおける1つのデモから,実ロボット上でのヒューマノイドロコ操作のためのフレームワークであるDemoHLMを提案する。
全身のコントローラーは、全身のモーションコマンドを関節トルクにマッピングし、ヒューマノイドロボットのための全方向移動手段を提供する。
実験では, 合成データ量と政策性能との間に正の相関が認められた。
論文 参考訳(メタデータ) (2025-10-13T10:49:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。