論文の概要: Towards a General Humanoid Loco-Manipulation Model via Egocentric Whole-Body Human Data Pretraining
- arxiv url: http://arxiv.org/abs/2610.00438v1
- Date: Wed, 30 Sep 2026 17:25:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.657669
- Title: Towards a General Humanoid Loco-Manipulation Model via Egocentric Whole-Body Human Data Pretraining
- Title(参考訳): Egocentric Whole-Body Human Data Pretrainingによる汎用ヒューマノイドロコマニピュレーションモデルの構築
- Abstract要約: ヒューマノイド全体の操作は急速に進歩し、運動、姿勢、双方向の相互作用、手の動きを協調するポリシーが実現された。
エゴセントリックなヒューマンビデオは、オブジェクトやシーン間の日々のインタラクションのさまざまな例を提供し、ロボット操作なしでスケーラブルな監視を提供する。
我々は,オープンワールド環境における多様なロボット操作行動の500時間データセットであるHumanVerse-500を紹介する。
- 参考スコア(独自算出の注目度): 52.5433937516238
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Humanoid whole-body manipulation has advanced rapidly, enabling policies to coordinate locomotion, posture, bimanual interaction, and dexterous hand movements. Meanwhile, egocentric human videos provide diverse examples of everyday interactions across objects and scenes, offering scalable supervision without robot operation. However, existing supervision from these videos provides limited coverage of whole-body movement and coordination with hand-object interaction, while obtaining such supervision through humanoid teleoperation is also costly and difficult to scale. We therefore explore how human experience can support scalable learning of humanoid loco-manipulation. To support this study, we introduce HumanVerse-500, a 500-hour dataset of diverse human loco-manipulation behaviors in open-world environments, collected with a lightweight wearable system that synchronizes egocentric video with body and hand motion. Building on this dataset, we develop $λ_0$, a whole-body humanoid vision-language-action policy, through three-stage training that first learns interaction from diverse egocentric datasets, then coordinates body and hand motion using HumanVerse-500, and finally adapts the policy to downstream tasks and robot embodiments. Across these stages, $λ_0$ learns a shared representation space for human experience transfer, while domain-specific interfaces handle differences between human and robot states and actions. We evaluate $λ_0$ on SIMPLE and 4 real-world loco-manipulation tasks, achieving state-of-the-art performance, and further analyze its scaling behavior, generalization, and training-stage contributions to understand how human data support downstream whole-body humanoid control. We will release our code, models, and data to support further research.
- Abstract(参考訳): ヒューマノイド全体の操作は急速に進歩し、運動、姿勢、双方向の相互作用、手の動きを協調するポリシーが実現された。
一方、エゴセントリックな人間のビデオは、オブジェクトやシーン間の日々の対話の多様な例を提供し、ロボットの操作なしにスケーラブルな監視を提供する。
しかし、これらのビデオからの既存の監督は、人体全体の動きを限定的にカバーし、手動物体の相互作用と協調する一方で、ヒューマノイド遠隔操作によるそのような監督を得るのにも費用がかかり、スケールも困難である。
そこで我々は,ヒューマノイド・ロコ・マニピュレーションのスケーラブルな学習を支援する人間体験について検討する。
この研究を支援するために、オープンワールド環境での多様な人間操作行動の500時間データセットであるHumanVerse-500を紹介し、エゴセントリックなビデオと身体と手の動きを同期する軽量なウェアラブルシステムを用いて収集した。
このデータセットに基づいて,まず多様なエゴセントリックなデータセットからインタラクションを学習し,次にHumanVerse-500を用いて身体と手の動きをコーディネートし,最後にタスクやロボットの動作を下流に適応させる3段階のトレーニングを通じて,全身のヒューマノイド視覚-言語-アクションポリシーであるλ_0$を開発する。
これらのステージ全体で、$λ_0$は人間の体験伝達のための共有表現空間を学習し、ドメイン固有のインターフェースは人間とロボットの状態と行動の違いを処理する。
我々は、SIMPLEと4つの実世界のロコ操作タスクに対してλ_0$を評価、最先端の性能を実現し、さらにそのスケーリング挙動、一般化、トレーニングステージのコントリビューションを分析し、人体全体のヒューマノイド制御をどのようにサポートするかを理解する。
さらなる研究を支援するために、コード、モデル、データをリリースします。
関連論文リスト
- ViLoMan: Learning Visual-Proprioceptive Whole-Body Loco-Manipulation Skills for Humanoid Robots [56.6238848953359]
ViLoManは、自律的なヒューマノイドロコ操作のためのスケーラブルなフレームワークである。
自我中心の深度観測と主観的測定を直接ジョイントレベル全体の行動にマッピングする統一的なポリシーを学ぶ。
論文 参考訳(メタデータ) (2026-09-16T19:10:13Z) - HumanoidMimicGen: Data Generation for Loco-Manipulation via Whole-Body Planning [52.022681285103126]
我々はHumanoid MimicGenについて述べる。
本手法は,少数の実演から新しい状態へ,接触に富んだ全身スキルを適応させる。
我々は、HumanoidMimicGenが生成したデータと協調してトレーニングされた全身ビズモータポリシーが、実世界のデータでのみトレーニングされたものよりも20%優れていたことを示す。
論文 参考訳(メタデータ) (2026-05-26T21:57:11Z) - HumanNet: Scaling Human-centric Video Learning to One Million Hours [18.004001748422407]
我々は、人間中心のビデオコーパスであるHumanNetを紹介します。
HumanNetは、一対一の視点と三対一の視点の両方にまたがり、きめ細かい活動、人間とオブジェクトの相互作用、ツールの使用、長期の振る舞いをカバーしている。
生のビデオ以外に、データセットは、キャプション、モーション記述、手と体に関する信号など、インタラクション中心のアノテーションを提供する。
論文 参考訳(メタデータ) (2026-05-07T15:21:58Z) - EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World [63.2070298441355]
EgoVerseは、人間のデータ駆動型ロボット学習のためのコラボレーションプラットフォームである。
1,965のタスク、240のシーン、2,087のユニークなデモを行う人間のデモの1,362時間 (80kのエピソード) をリリースします。
複数の実験室、タスク、ロボットのエボディメントにまたがって再現された実験により、人間からロボットへの移動を大規模に研究する。
論文 参考訳(メタデータ) (2026-04-08T21:27:06Z) - ZeroWBC: Learning Natural Visuomotor Humanoid Control Directly from Human Egocentric Video [52.78703020909145]
我々は、人間中心のビデオから直接、自然なヒューマノイドビジュモータ制御ポリシーを学ぶ新しいフレームワークであるZeroWBCを紹介した。
提案手法はまず視覚言語モデル(VLM)を微調整し,テキスト命令とエゴセントリックな視覚コンテキストに基づく将来の身体全体の動作を予測する。
ユニツリーG1ヒューマノイドロボットの実験では,動作の自然性と汎用性において,本手法がベースラインアプローチより優れていることが示された。
論文 参考訳(メタデータ) (2026-03-10T04:19:43Z) - EgoHumanoid: Unlocking In-the-Wild Loco-Manipulation with Robot-Free Egocentric Demonstration [67.13034606664333]
EgoHumanoidは、エゴセントリックな人間のデモを使って視覚言語アクションポリシーを共同訓練する最初のフレームワークである。
スケーラブルな人的データ収集のためのポータブルシステムを開発した。
論文 参考訳(メタデータ) (2026-02-10T18:59:03Z) - Humanoid Manipulation Interface: Humanoid Whole-Body Manipulation from Robot-Free Demonstrations [25.15848825594207]
本稿ではHuMI(Humanoid Manipulation Interface)について述べる。
HuMIは、ポータブルハードウェアを使用して、リッチな全身の動きをキャプチャすることで、ロボットフリーのデータ収集を可能にする。
HuMIは遠隔操作に比べてデータ収集効率が3倍向上し、目に見えない環境では70%の成功率を達成した。
論文 参考訳(メタデータ) (2026-02-06T12:10:47Z) - Humanoid Everyday: A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation [16.701354625940308]
Humanoid Everydayは大規模かつ多様なヒューマノイド操作データセットである。
RGB、deep、LiDAR、触覚入力を含む高品質なマルチモーダル感覚データを自然言語アノテーションとともに集約する。
我々は、データセット上で代表的政策学習手法の分析を行い、その強みと限界について洞察を提供する。
論文 参考訳(メタデータ) (2025-10-09T20:43:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。