論文の概要: UMI-Bridge: Action-Anchored Latent Alignment across Human and Robot Manipulation Data
- arxiv url: http://arxiv.org/abs/2609.18232v1
- Date: Wed, 16 Sep 2026 07:03:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.68699
- Title: UMI-Bridge: Action-Anchored Latent Alignment across Human and Robot Manipulation Data
- Title(参考訳): UMIブリッジ:人間とロボットの操作データにまたがるアクションアンカー付き潜在アライメント
- Abstract要約: UMIブリッジ(UMI-Bridge)は,UMIを中間領域として用いて,画素の類似性よりも行動同値性に応じて表現を整列させる。
ロボットのデモを伴わずに人間の操作データに基づいて2視点潜時行動モデル(LAM)をトレーニングし、その手首教師とダイナミクスモデルを凍結し、UMIおよびロボットデータに基づく視覚言語行動(VLA)後トレーニングを規則化する。
UMI-Bridgeは、一致したUMIとロボットデータとのNaive Co-trainingで91.7%の成功率と73.3%を達成している。
- 参考スコア(独自算出の注目度): 17.663076909186028
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-robot demonstrations are limited, motivating the use of human manipulation data collected without robots, including egocentric videos and handheld Universal Manipulation Interface (UMI) demonstrations. However, differences in viewpoint, embodiment, and available action supervision make it difficult to align representations across these sources according to manipulation motion rather than visual appearance. We introduce UMI-Bridge, which uses UMI as an intermediate domain to align representations according to action equivalence rather than pixel similarity. UMI action supervision anchors the latent representation to end-effector motion and gripper behavior, while synchronized head-wrist observations and paired ego-UMI clips support alignment across views and domains. We train a dual-view latent action model (LAM) on human manipulation data without robot demonstrations, then freeze its wrist teacher and dynamics model to regularize vision-language-action (VLA) post-training on UMI and robot data. The shared wrist interface enables this training-time supervision across both domains while preserving the policy's standard inference architecture. Across three real-robot tasks, UMI-Bridge achieves 91.7% mean success versus 73.3% for Naive Co-training with matched UMI and robot data. On two data-efficiency tasks, it surpasses a full-data Robot-only baseline using 25% of the robot demonstrations together with UMI data. It also achieves 85% and 90% success on two additional tasks learned from UMI demonstrations without task-specific robot demonstrations. These results support action-anchored latent alignment for data-efficient robot learning and UMI-to-robot task transfer.
- Abstract(参考訳): 実ロボットのデモは制限されており、エゴセントリックなビデオやハンドヘルドのユニバーサルマニピュレーションインタフェース(UMI)デモなど、ロボットなしで収集された人間の操作データの使用を動機付けている。
しかし、視点、実施、利用可能な行動監督の相違は、視覚的外観よりも操作運動に応じてこれらのソース間で表現を整列させることを困難にしている。
UMI-Bridgeは,UMIを中間領域として使用して,画素の類似性ではなく,行動等価性に応じて表現を整列する。
UMIアクションインスペクタは、終端エフェクタ動作とグリップパ動作への潜伏表現をアンロックする一方、シンクロナイズドヘッドブラスト観察とペア化されたエゴ-UMIクリップは、ビューとドメイン間のアライメントをサポートする。
ロボットのデモを伴わずに人間の操作データに基づいて2視点潜時行動モデル(LAM)をトレーニングし、その手首教師とダイナミクスモデルを凍結し、UMIおよびロボットデータに基づく視覚言語行動(VLA)後トレーニングを規則化する。
共有手首インターフェースは、ポリシーの標準推論アーキテクチャを維持しながら、両方のドメインをまたがるトレーニングタイムの監視を可能にする。
3つの実際のロボットタスクの中で、UMI-Bridgeは91.7%で成功し、Naive Co-trainingは73.3%で一致したUMIとロボットのデータと一致した。
2つのデータ効率タスクにおいて、UMIデータとともに、25%のロボットデモを使用して、完全なデータのみのベースラインを超える。
また、タスク固有のロボットデモなしで、UMIデモから学んだ2つの追加タスクで85%と90%の成功を達成する。
これらの結果は、データ効率のよいロボット学習とUMI-to-robotタスク転送のためのアクションアンカレート潜在アライメントをサポートする。
関連論文リスト
- Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data [60.94418315274988]
Ego2Robotは、キュレートされたビデオとインザワイルドのビデオの両方をサポートし、15のロボット形態にまたがる18,561時間のトレーニングデータを生成する。
Ego2Robotの合成データとロボットデータの併用による事前学習は、複数のタイプにわたるアウト・オブ・ディストリビューションの一般化を一貫して改善する。
論文 参考訳(メタデータ) (2026-08-03T17:52:26Z) - WSA$_1$: a 3D-Centric World-Spatial-Action Model for Generalizable Robot Control [85.21175469425172]
近年,ロボット基盤モデル(RFM)が汎用ロボットシステムの主要なアプローチとして確立されている。
提案する3D-Centric World-Spatial-Action モデリングパラダイムに基づく新しい RFM である WSA$_1$ を提案する。
将来のロボット行動に対する3D世界認識の視覚的思考を学習するだけでなく、行動一般化を促進するために3D世界遷移とロボット行動の相互制約をモデル化する。
論文 参考訳(メタデータ) (2026-07-04T16:26:39Z) - HumanoidUMI: Bridging Robot-Free Demonstrations and Humanoid Whole-Body Manipulation [6.733928872257592]
我々はHumanoidUMIを提案する。HumanoidはHumanoid全体データ収集のためのポータブルかつロボットフリーなフレームワークである。
軽量なVRデバイスとUMIにインスパイアされたグリッパーを使用して、スパースな人間のキーポイント軌跡、手首視観察、グリッパーアクションを収集します。
5つの実世界のシナリオで実験を行い、提案したフレームワークの有効性を実証した。
論文 参考訳(メタデータ) (2026-06-25T16:23:56Z) - BridgeACT: Bridging Human Demonstrations to Robot Actions via Unified Tool-Target Affordances [11.402773793645244]
ロボットのデモデータを必要とせずに、人間のビデオから直接ロボット操作を学習するフレームワークであるBridgeACTを紹介する。
私たちのキーとなるアイデアは、人間のデモンストレーションとロボットのアクションを橋渡しする、具体化に依存しない中間表現として、余暇をモデル化することです。
得られた余裕は、把握モジュールと軽量閉ループモーションコントローラを介してロボット動作にマッピングされる。
論文 参考訳(メタデータ) (2026-04-25T11:01:27Z) - HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations [15.551927664158695]
Whole-Body Mobile Manipulation Interface (HoMMI)は、ロボットのない人間のデモから直接、全身のモバイル操作を学習する。
我々は、モバイル操作に必要なグローバルコンテキストをキャプチャするために、エゴセントリックな感覚でUMIインタフェースを拡張する。
私たちはこのギャップを、クロス・エボディメント・ハンド・アイ・ポリシー設計で明示的に埋めます。
論文 参考訳(メタデータ) (2026-03-03T18:36:49Z) - MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training [102.850162490626]
人間のロボットによる相互模倣事前学習による視覚-言語-行動モデルであるMiVLAを提案する。
MiVLAは、最先端のVLAよりも優れた、強力な改良された一般化能力を実現する。
論文 参考訳(メタデータ) (2025-12-17T12:59:41Z) - ActiveUMI: Robotic Manipulation with Active Perception from Robot-Free Human Demonstrations [32.570602111692914]
複雑な双方向操作が可能なロボットに人体でのデモンストレーションを転送する,データ収集システムのためのフレームワークであるActiveUMIを提案する。
ActiveUMIは、ロボットのエンドエフェクターをミラーするセンサー付きコントローラーを備えたポータブルVR遠隔操作キットを結合する。
操作者の意図した頭部の動きをヘッドマウントディスプレイで記録することにより,視覚的注意と操作の関係を学習する。
論文 参考訳(メタデータ) (2025-10-02T02:44:21Z) - One-Shot Imitation under Mismatched Execution [7.060120660671016]
人間のデモは、ロボットに長距離操作のタスクをプログラムするための強力な方法だ。
これらのデモをロボット実行可能なアクションに変換することは、運動スタイルや身体能力のミスマッチの実行による重大な課題を呈する。
シーケンスレベルの最適輸送コスト関数を用いて,人間とロボットの軌道を自動的にペアリングする新しいフレームワークRHyMEを提案する。
論文 参考訳(メタデータ) (2024-09-10T16:11:57Z) - MimicGen: A Data Generation System for Scalable Robot Learning using
Human Demonstrations [55.549956643032836]
MimicGenは、少数の人間のデモから大規模でリッチなデータセットを自動的に合成するシステムである。
ロボットエージェントは,この生成したデータセットを模倣学習により効果的に訓練し,長期的・高精度なタスクにおいて高い性能を達成することができることを示す。
論文 参考訳(メタデータ) (2023-10-26T17:17:31Z) - Learning Predictive Models From Observation and Interaction [137.77887825854768]
世界との相互作用から予測モデルを学ぶことで、ロボットのようなエージェントが世界がどのように働くかを学ぶことができる。
しかし、複雑なスキルのダイナミクスを捉えるモデルを学ぶことは大きな課題である。
本研究では,人間などの他のエージェントの観察データを用いて,トレーニングセットを増強する手法を提案する。
論文 参考訳(メタデータ) (2019-12-30T01:10:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。