論文の概要: BifrostUMI: Bridging Robot-Free Demonstrations and Humanoid Whole-Body Manipulation
- arxiv url: http://arxiv.org/abs/2605.03452v1
- Date: Tue, 05 May 2026 07:35:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-06 19:35:43.821566
- Title: BifrostUMI: Bridging Robot-Free Demonstrations and Humanoid Whole-Body Manipulation
- Title(参考訳): BifrostUMI: ブリッジングロボットフリーデモとヒューマノイド全体操作
- Authors: Chenhao Yu, Hongwu Wang, Youhao Hu, Jiachen Zhang, Yuanyuan Li, Shaqi Luo,
- Abstract要約: BifrostUMIは、ヒューマノイドロボットのためのポータブルで効率的な、ロボットフリーのデータ収集フレームワークである。
2つの異なる実験シナリオにまたがって提案したフレームワークの有効性と汎用性を示す。
- 参考スコア(独自算出の注目度): 6.733928872257592
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-quality data collection is a fundamental cornerstone for training humanoid whole-body visuomotor policies. Current data acquisition paradigms predominantly rely on robot teleoperation, which is often hindered by limited hardware accessibility and low operational efficiency. Inspired by the Universal Manipulation Interface (UMI), we propose BifrostUMI, a portable, efficient, and robot-free data collection framework tailored for humanoid robots. BifrostUMI leverages lightweight VR devices to capture human demonstrations as sparse keypoint trajectories while simultaneously recording wrist-mounted visual data. These multimodal data are subsequently utilized to train a high-level policy network that predicts future keypoint trajectories conditioned on the captured visual features. Through a robust keypoint retargeting pipeline, keypoint trajectories are precisely mapped onto the robot's morphology and executed via a whole-body controller. This approach enables the seamless transfer of diverse and agile behaviors from natural human demonstrations to humanoid embodiments. We demonstrate the efficacy and versatility of the proposed framework across two distinct experimental scenarios.
- Abstract(参考訳): 高品質なデータ収集は、ヒューマノイド全体のバイスモータポリシーをトレーニングするための基本的な基盤となる。
現在のデータ取得パラダイムは、主にロボットの遠隔操作に依存しており、ハードウェアアクセシビリティの制限と運用効率の低下によってしばしば妨げられる。
The Universal Manipulation Interface (UMI) に触発された我々は,ヒューマノイドロボットに適した,ポータブルで効率的かつロボットフリーなデータ収集フレームワークであるBifrostUMIを提案する。
BifrostUMIは軽量のVRデバイスを利用して、手首に装着された視覚データを同時に記録しながら、人間のデモを粗いキーポイント軌跡として捉えている。
その後、これらのマルチモーダルデータは、キャプチャされた視覚的特徴に照らされた将来のキーポイント軌跡を予測する高レベルなポリシーネットワークのトレーニングに使用される。
頑丈なキーポイント再ターゲットパイプラインを通じて、キーポイント軌跡はロボットの形状に正確にマッピングされ、全身のコントローラを介して実行される。
このアプローチは、多様かつアジャイルな振る舞いを、自然な人間のデモからヒューマノイドの実施形態へシームレスに移行することを可能にする。
2つの異なる実験シナリオにまたがって提案したフレームワークの有効性と汎用性を示す。
関連論文リスト
- WARPED: Wrist-Aligned Rendering for Robot Policy Learning from Egocentric Human Demonstrations [10.024841990710177]
WARPEDは人間のデモビデオからリアルな手首ビューの観察を合成するためのフレームワークである。
ハンドオブジェクトインタラクションパイプラインを使用して、手と操作対象を追跡し、軌道をロボットのエンドエフェクタに再ターゲットする。
我々は、WARPEDが5つのテーブルトップ操作タスクのための遠隔操作デモデータに基づいて訓練されたポリシーに匹敵する成功率を達成することを実証した。
論文 参考訳(メタデータ) (2026-04-12T20:40:59Z) - Grasp as You Dream: Imitating Functional Grasping from Generated Human Demonstrations [23.294838162593184]
本稿では、労働集約的なデータ収集を伴わずにゼロショット機能把握を可能にするGraspDreamerを提案する。
鍵となるアイデアは、VGMがインターネットスケールの人間のデータに基づいて事前訓練されていることだ。
GraspDreamerの優れたデータ効率と一般化性能を示す。
論文 参考訳(メタデータ) (2026-04-08T18:52:16Z) - ZeroWBC: Learning Natural Visuomotor Humanoid Control Directly from Human Egocentric Video [52.78703020909145]
我々は、人間中心のビデオから直接、自然なヒューマノイドビジュモータ制御ポリシーを学ぶ新しいフレームワークであるZeroWBCを紹介した。
提案手法はまず視覚言語モデル(VLM)を微調整し,テキスト命令とエゴセントリックな視覚コンテキストに基づく将来の身体全体の動作を予測する。
ユニツリーG1ヒューマノイドロボットの実験では,動作の自然性と汎用性において,本手法がベースラインアプローチより優れていることが示された。
論文 参考訳(メタデータ) (2026-03-10T04:19:43Z) - EgoHumanoid: Unlocking In-the-Wild Loco-Manipulation with Robot-Free Egocentric Demonstration [67.13034606664333]
EgoHumanoidは、エゴセントリックな人間のデモを使って視覚言語アクションポリシーを共同訓練する最初のフレームワークである。
スケーラブルな人的データ収集のためのポータブルシステムを開発した。
論文 参考訳(メタデータ) (2026-02-10T18:59:03Z) - MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training [102.850162490626]
人間のロボットによる相互模倣事前学習による視覚-言語-行動モデルであるMiVLAを提案する。
MiVLAは、最先端のVLAよりも優れた、強力な改良された一般化能力を実現する。
論文 参考訳(メタデータ) (2025-12-17T12:59:41Z) - DemoHLM: From One Demonstration to Generalizable Humanoid Loco-Manipulation [29.519071338337685]
シミュレーションにおける1つのデモから,実ロボット上でのヒューマノイドロコ操作のためのフレームワークであるDemoHLMを提案する。
全身のコントローラーは、全身のモーションコマンドを関節トルクにマッピングし、ヒューマノイドロボットのための全方向移動手段を提供する。
実験では, 合成データ量と政策性能との間に正の相関が認められた。
論文 参考訳(メタデータ) (2025-10-13T10:49:40Z) - One-Shot Imitation under Mismatched Execution [7.060120660671016]
人間のデモは、ロボットに長距離操作のタスクをプログラムするための強力な方法だ。
これらのデモをロボット実行可能なアクションに変換することは、運動スタイルや身体能力のミスマッチの実行による重大な課題を呈する。
シーケンスレベルの最適輸送コスト関数を用いて,人間とロボットの軌道を自動的にペアリングする新しいフレームワークRHyMEを提案する。
論文 参考訳(メタデータ) (2024-09-10T16:11:57Z) - Transferring Foundation Models for Generalizable Robotic Manipulation [82.12754319808197]
インターネット規模の基盤モデルによって生成された言語推論セグメンテーションマスクを効果的に活用する新しいパラダイムを提案する。
提案手法は,オブジェクトのポーズを効果的かつ堅牢に知覚し,サンプル効率のよい一般化学習を可能にする。
デモは提出されたビデオで見ることができ、より包括的なデモはlink1またはlink2で見ることができます。
論文 参考訳(メタデータ) (2023-06-09T07:22:12Z) - Model Predictive Control for Fluid Human-to-Robot Handovers [50.72520769938633]
人間の快適さを考慮に入れた計画運動は、人間ロボットのハンドオーバプロセスの一部ではない。
本稿では,効率的なモデル予測制御フレームワークを用いてスムーズな動きを生成することを提案する。
ユーザ数名の多様なオブジェクトに対して,人間とロボットのハンドオーバ実験を行う。
論文 参考訳(メタデータ) (2022-03-31T23:08:20Z) - Few-Shot Visual Grounding for Natural Human-Robot Interaction [0.0]
本稿では,人間ユーザによって音声で示される,混み合ったシーンから対象物を分割するソフトウェアアーキテクチャを提案する。
システムのコアでは、視覚的な接地のためにマルチモーダルディープニューラルネットワークを使用します。
公開シーンデータセットから収集した実RGB-Dデータに対して,提案モデルの性能を評価する。
論文 参考訳(メタデータ) (2021-03-17T15:24:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。