論文の概要: Whole-Body UMI: Transferring UMI Manipulation Skills to Humanoid Whole-Body Manipulation via Real-Time Motion Generation
- arxiv url: http://arxiv.org/abs/2609.22829v2
- Date: Tue, 22 Sep 2026 09:15:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.906676
- Title: Whole-Body UMI: Transferring UMI Manipulation Skills to Humanoid Whole-Body Manipulation via Real-Time Motion Generation
- Title(参考訳): 全体UMI:リアルタイムモーション生成によるUMI操作スキルをヒューマノイドに移行
- Abstract要約: Whole-Body UMI (WB-UMI) は、タスク学習から全体コーディネーション学習を分離するタスク非依存、リアルタイムおよびエンドエフェクタ条件付きモーションジェネレータである。
拡散ポリシは、ネイティブなUMIデモから学習する一方で、WB-UMIは、ボディートラッカーやペアのイメージフルボディデモを必要としない、再ターゲットされたモーションキャプチャから独立して学習する。
G1の実ロボット実験は、4つのタスクにわたるリアルタイムクローズドループ転送をサポートし、引き出しのクローズド、シェルフピック・アンド・プレース80%、ロコボールトス30%、40%を達成している。
- 参考スコア(独自算出の注目度): 8.078105172204713
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Collecting whole-body demonstrations for humanoid manipulation mostly relies on teleoperation, which is costly and hard to scale up. The Universal Manipulation Interface (UMI) provides a scalable data collection paradigm, but end-effector trajectories alone underdetermine humanoid whole-body coordination, which is insufficient for whole-body demonstration collection. Therefore, we introduce Whole-Body UMI (WB-UMI), a task-agnostic, real-time and end-effector conditioned motion generator that decouples whole-body coordination learning from task semantics learning through a shared end-effector interface. A diffusion policy learns from native UMI demonstrations, while WB-UMI learns independently from retargeted motion capture, requiring no body trackers or paired image--whole-body demonstrations during task-specific data collection. In real deployment, an asynchronous hierarchy integrates the diffusion policy, motion generator, and a whole-body controller with latency compensation and measured-state feedback. Real-robot experiments on G1 support real-time closed-loop transfer across four tasks, achieving 90% success in drawer closing, 80% in shelf pick-and-place, 30% in ball toss, and 40% in Loco-PnP, which shows the effectiveness of this hierarchy in transferring native UMI skills to humanoid whole-body manipulation.
- Abstract(参考訳): ヒューマノイド操作のための全身デモの収集は、主に遠隔操作に頼っている。
ユニバーサル・マニピュレーション・インタフェース(UMI)はスケーラブルなデータ収集パラダイムを提供するが、エンドエフェクタ・トラジェクタだけでは人体全体の調整が決定できない。
そこで,WB-UMI(Whole-Body UMI)は,タスク非依存,リアルタイム,エンドエフェクタ条件付きモーションジェネレータで,タスクセマンティクスから全体コーディネーション学習を分離する。
拡散ポリシは、ネイティブなUMIデモから学習する一方で、WB-UMIは、タスク固有のデータ収集中に、ボディートラッカーやペアイメージを必要とせずに、再ターゲットされたモーションキャプチャから独立して学習する。
実際のデプロイメントでは、非同期階層は拡散ポリシー、モーションジェネレータ、および遅延補償と測定状態フィードバックを備えた全身コントローラを統合する。
G1における実ロボット実験は、4つのタスクにわたるリアルタイム閉ループ転送をサポートし、引き出しのクローズド、80%の棚のピック・アンド・プレイス、30%のボールトス、40%のLoco-PnPを達成し、ネイティブなUMIスキルを人体操作に移行する際のこの階層の有効性を示している。
関連論文リスト
- ViLoMan: Learning Visual-Proprioceptive Whole-Body Loco-Manipulation Skills for Humanoid Robots [56.6238848953359]
ViLoManは、自律的なヒューマノイドロコ操作のためのスケーラブルなフレームワークである。
自我中心の深度観測と主観的測定を直接ジョイントレベル全体の行動にマッピングする統一的なポリシーを学ぶ。
論文 参考訳(メタデータ) (2026-09-16T19:10:13Z) - UMI-Bridge: Action-Anchored Latent Alignment across Human and Robot Manipulation Data [17.663076909186028]
UMIブリッジ(UMI-Bridge)は,UMIを中間領域として用いて,画素の類似性よりも行動同値性に応じて表現を整列させる。
ロボットのデモを伴わずに人間の操作データに基づいて2視点潜時行動モデル(LAM)をトレーニングし、その手首教師とダイナミクスモデルを凍結し、UMIおよびロボットデータに基づく視覚言語行動(VLA)後トレーニングを規則化する。
UMI-Bridgeは、一致したUMIとロボットデータとのNaive Co-trainingで91.7%の成功率と73.3%を達成している。
論文 参考訳(メタデータ) (2026-09-16T07:03:09Z) - HumanoidUMI: Bridging Robot-Free Demonstrations and Humanoid Whole-Body Manipulation [6.733928872257592]
我々はHumanoidUMIを提案する。HumanoidはHumanoid全体データ収集のためのポータブルかつロボットフリーなフレームワークである。
軽量なVRデバイスとUMIにインスパイアされたグリッパーを使用して、スパースな人間のキーポイント軌跡、手首視観察、グリッパーアクションを収集します。
5つの実世界のシナリオで実験を行い、提案したフレームワークの有効性を実証した。
論文 参考訳(メタデータ) (2026-06-25T16:23:56Z) - HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation [74.34984994596813]
HEXは、ヒューマノイドロボットの協調操作のための状態中心のフレームワークである。
ヘテロジニアスな実施形態をまたいだスケーラブルな学習のための、ヒューマノイドに整合した普遍的状態表現が組み込まれている。
タスクの成功率と一般化における最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-04-09T09:01:43Z) - ULTRA: Unified Multimodal Control for Autonomous Humanoid Whole-Body Loco-Manipulation [55.467742403416175]
本稿では,大規模モーションキャプチャをヒューマノイドに変換する物理駆動型ニューラルネットワークを提案する。
我々は高密度参照とスパースタスク仕様の両方をサポートする統合マルチモーダルコントローラを学習する。
その結果,ULTRAは自我中心の知覚から,自律的,目標条件付き全体ロコ操作に一般化することが示された。
論文 参考訳(メタデータ) (2026-03-03T18:59:29Z) - HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations [15.551927664158695]
Whole-Body Mobile Manipulation Interface (HoMMI)は、ロボットのない人間のデモから直接、全身のモバイル操作を学習する。
我々は、モバイル操作に必要なグローバルコンテキストをキャプチャするために、エゴセントリックな感覚でUMIインタフェースを拡張する。
私たちはこのギャップを、クロス・エボディメント・ハンド・アイ・ポリシー設計で明示的に埋めます。
論文 参考訳(メタデータ) (2026-03-03T18:36:49Z) - CLOT: Closed-Loop Global Motion Tracking for Whole-Body Humanoid Teleoperation [54.7399209456857]
閉ループグローバルモーショントラッキングを実現する,リアルタイムな人型遠隔操作システムCLOTを提案する。
CLOTはオペレータとロボットのポーズをクローズドループで同期させ、長時間のタイムホライズン上でドリフトフリーな人間-人間-ヒューマノイドの模倣を可能にする。
本研究では,報奨評価から観測軌道を分離し,スムーズで安定した大域的補正を可能にするデータ駆動ランダム化手法を提案する。
論文 参考訳(メタデータ) (2026-02-13T12:03:13Z) - UniAct: Unified Motion Generation and Action Streaming for Humanoid Robots [27.794309591475326]
ヒューマノイドロボティクスにおける長年の目標は、人間レベルの柔軟性を持つ多様なマルチモーダル命令に従うことができる汎用エージェントの実現である。
ここでは、微調整MLLMと因果ストリーミングパイプラインを統合した2段階のフレームワークであるUniActを用いて、500ms以下のレイテンシで、ヒューマノイドロボットがマルチモーダル命令を実行できることを示す。
提案手法は, ゼロショット追尾における不完全な参照動作の成功率を19%向上させる。
論文 参考訳(メタデータ) (2025-12-30T16:20:13Z) - DemoHLM: From One Demonstration to Generalizable Humanoid Loco-Manipulation [29.519071338337685]
シミュレーションにおける1つのデモから,実ロボット上でのヒューマノイドロコ操作のためのフレームワークであるDemoHLMを提案する。
全身のコントローラーは、全身のモーションコマンドを関節トルクにマッピングし、ヒューマノイドロボットのための全方向移動手段を提供する。
実験では, 合成データ量と政策性能との間に正の相関が認められた。
論文 参考訳(メタデータ) (2025-10-13T10:49:40Z) - ResMimic: From General Motion Tracking to Humanoid Whole-body Loco-Manipulation via Residual Learning [59.64325421657381]
ヒューマノイド全体のロコ操作は、日々のサービスや倉庫のタスクにトランスフォーメーション機能を約束する。
ResMimicは、人間の動作データから正確に表現力のあるヒューマノイド制御のための2段階の残差学習フレームワークである。
結果は、強いベースラインよりもタスク成功、トレーニング効率、堅牢性が大幅に向上したことを示している。
論文 参考訳(メタデータ) (2025-10-06T17:47:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。