論文の概要: HumanoidUMI: Bridging Robot-Free Demonstrations and Humanoid Whole-Body Manipulation
- arxiv url: http://arxiv.org/abs/2606.27239v1
- Date: Thu, 25 Jun 2026 16:23:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.356296
- Title: HumanoidUMI: Bridging Robot-Free Demonstrations and Humanoid Whole-Body Manipulation
- Title(参考訳): HumanoidUMI: ブリッジングロボットフリーデモとヒューマノイド全体操作
- Abstract要約: 我々はHumanoidUMIを提案する。HumanoidはHumanoid全体データ収集のためのポータブルかつロボットフリーなフレームワークである。
軽量なVRデバイスとUMIにインスパイアされたグリッパーを使用して、スパースな人間のキーポイント軌跡、手首視観察、グリッパーアクションを収集します。
5つの実世界のシナリオで実験を行い、提案したフレームワークの有効性を実証した。
- 参考スコア(独自算出の注目度): 6.733928872257592
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-quality demonstration data are essential for humanoid robot skill learning, especially for whole-body behaviors that require coordinated perception, locomotion, and manipulation. Existing data-collection methods largely rely on robot teleoperation, which is constrained by hardware accessibility, operator expertise, and limited efficiency. Inspired by the Universal Manipulation Interface (UMI), we propose HumanoidUMI, a portable and robot-free framework for humanoid whole-body data collection. HumanoidUMI uses lightweight VR devices and UMI-inspired grippers to collect sparse human keypoint trajectories, wrist-view observations, and gripper actions. These demonstrations train a high-level policy to predict future keypoints, which are retargeted to robot-native whole-body references and executed by a whole-body controller. Experiments in five real-world scenarios demonstrate the effectiveness of the proposed framework and validate the collected demonstrations for transferable humanoid whole-body skill learning.
- Abstract(参考訳): 高品質なデモデータはヒューマノイドロボットのスキル学習、特に協調した知覚、移動、操作を必要とする全身行動に不可欠である。
既存のデータ収集手法は、ハードウェアアクセシビリティ、オペレーターの専門知識、限られた効率に制約されるロボット遠隔操作に大きく依存している。
ユニバーサルマニピュレーションインタフェース(UMI)に触発されて,ヒューマノイドデータ収集のためのポータブルかつロボットフリーなフレームワークであるHumanoidUMIを提案する。
HumanoidUMIは軽量のVRデバイスとUMIにインスパイアされたグリッパーを使用して、粗い人間のキーポイント軌跡、手首の視界観察、グリッパーアクションを収集する。
これらのデモでは、将来的なキーポイントを予測するために、ハイレベルなポリシーをトレーニングしている。
5つの実世界のシナリオで実験を行い、提案手法の有効性を実証し、伝達可能なヒューマノイド全身スキル学習のための収集された実演を検証した。
関連論文リスト
- Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments [32.61025334275917]
ヒト・アス・ヒューマノイド(Humanoid as-Humanoid)は、ヒトからヒトへのハイDoFヒューマノイドの監視フレームワークである。
大規模な人間のデモンストレーションを、対象のヒューマノイドに対する実行可能な観察-アクション監視に変換する。
Humanoidは、データ収集分析において、ヒューマノイド遠隔操作よりも4.8--7.2倍の生のデモンストレーション言語ゲインが得られる。
論文 参考訳(メタデータ) (2026-06-30T17:44:16Z) - HumanoidMimicGen: Data Generation for Loco-Manipulation via Whole-Body Planning [52.022681285103126]
我々はHumanoid MimicGenについて述べる。
本手法は,少数の実演から新しい状態へ,接触に富んだ全身スキルを適応させる。
我々は、HumanoidMimicGenが生成したデータと協調してトレーニングされた全身ビズモータポリシーが、実世界のデータでのみトレーニングされたものよりも20%優れていたことを示す。
論文 参考訳(メタデータ) (2026-05-26T21:57:11Z) - BifrostUMI: Bridging Robot-Free Demonstrations and Humanoid Whole-Body Manipulation [6.733928872257592]
BifrostUMIは、ヒューマノイドロボットのためのポータブルで効率的な、ロボットフリーのデータ収集フレームワークである。
2つの異なる実験シナリオにまたがって提案したフレームワークの有効性と汎用性を示す。
論文 参考訳(メタデータ) (2026-05-05T07:35:09Z) - ZeroWBC: Learning Natural Visuomotor Humanoid Control Directly from Human Egocentric Video [52.78703020909145]
我々は、人間中心のビデオから直接、自然なヒューマノイドビジュモータ制御ポリシーを学ぶ新しいフレームワークであるZeroWBCを紹介した。
提案手法はまず視覚言語モデル(VLM)を微調整し,テキスト命令とエゴセントリックな視覚コンテキストに基づく将来の身体全体の動作を予測する。
ユニツリーG1ヒューマノイドロボットの実験では,動作の自然性と汎用性において,本手法がベースラインアプローチより優れていることが示された。
論文 参考訳(メタデータ) (2026-03-10T04:19:43Z) - EgoHumanoid: Unlocking In-the-Wild Loco-Manipulation with Robot-Free Egocentric Demonstration [67.13034606664333]
EgoHumanoidは、エゴセントリックな人間のデモを使って視覚言語アクションポリシーを共同訓練する最初のフレームワークである。
スケーラブルな人的データ収集のためのポータブルシステムを開発した。
論文 参考訳(メタデータ) (2026-02-10T18:59:03Z) - Humanoid Manipulation Interface: Humanoid Whole-Body Manipulation from Robot-Free Demonstrations [25.15848825594207]
本稿ではHuMI(Humanoid Manipulation Interface)について述べる。
HuMIは、ポータブルハードウェアを使用して、リッチな全身の動きをキャプチャすることで、ロボットフリーのデータ収集を可能にする。
HuMIは遠隔操作に比べてデータ収集効率が3倍向上し、目に見えない環境では70%の成功率を達成した。
論文 参考訳(メタデータ) (2026-02-06T12:10:47Z) - MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training [102.850162490626]
人間のロボットによる相互模倣事前学習による視覚-言語-行動モデルであるMiVLAを提案する。
MiVLAは、最先端のVLAよりも優れた、強力な改良された一般化能力を実現する。
論文 参考訳(メタデータ) (2025-12-17T12:59:41Z) - TWIST2: Scalable, Portable, and Holistic Humanoid Data Collection System [79.48781507497769]
既存のヒューマノイド遠隔操作システムは、分離された制御を使用するか、高価なモーションキャプチャー装置に依存している。
本稿では,携帯型モキャップフリーなヒューマノイド遠隔操作・データ収集システムであるTWIST2を紹介する。
長軸的,移動的ヒューマノイドスキルを実証し,約100%の成功率で15分で100個のデモを収集できる。
論文 参考訳(メタデータ) (2025-11-04T18:58:35Z) - Learning from Massive Human Videos for Universal Humanoid Pose Control [46.417054298537195]
本稿では,2000万以上のヒューマノイドロボットの大規模データセットであるHumanoid-Xを紹介する。
我々は、テキスト命令を入力として受け取り、対応する動作を出力してヒューマノイドロボットを制御する、大きなヒューマノイドモデルUH-1を訓練する。
私たちのスケーラブルなトレーニングアプローチは、テキストベースのヒューマノイド制御の優れた一般化につながります。
論文 参考訳(メタデータ) (2024-12-18T18:59:56Z) - Giving Robots a Hand: Learning Generalizable Manipulation with
Eye-in-Hand Human Video Demonstrations [66.47064743686953]
眼内カメラは、視覚に基づくロボット操作において、より優れたサンプル効率と一般化を可能にすることを約束している。
一方、人間がタスクを行うビデオは、ロボット遠隔操作の専門知識を欠いているため、収集コストがずっと安い。
本研究では,広範にラベルのない人間ビデオによるロボット模倣データセットを拡張し,眼球運動ポリシーの一般化を大幅に促進する。
論文 参考訳(メタデータ) (2023-07-12T07:04:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。