論文の概要: UMR: Universal Manipulation Representation
- arxiv url: http://arxiv.org/abs/2609.34256v2
- Date: Sat, 03 Oct 2026 07:31:11 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:07:04.578489
- Title: UMR: Universal Manipulation Representation
- Title(参考訳): UMR:Universal Manipulation Representation
- Abstract要約: 汎用的なエンボディド操作は、エンボディメントとスケールを容易に一般化する統一されたアクション表現に基づく。
人間のデモからロボットへのゼロショットスキルの伝達を可能にする統一されたアクション表現であるUniversal Manipulation Representation (UMR)を導入する。
UMRは、操作を2つの異なる幾何学的に連結されたコンポーネント、エンボディメントに依存しないワールドフローとエゴ軌道に分解する。
- 参考スコア(独自算出の注目度): 23.179028811333556
- License:
- Abstract: General-purpose embodied manipulation hinges on a unified action representation that generalizes across embodiments and scales readily. Yet existing policies rely on embodiment-specific action spaces, making cross-embodiment demonstrations difficult to leverage at scale and limiting transfer to new embodiments and spatial variations. To this end, we introduce Universal Manipulation Representation (UMR), a unified action representation that enables zero-shot skill transfer from human demonstrations to heterogeneous robots. UMR decomposes manipulation into two functionally distinct yet geometrically linked components: embodiment-agnostic World Flow, which describes task-relevant object motion in the world frame, and Ego Trajectory, which represents end-effector motion relative to the current pose. We instantiate UMR as World--Ego Point VLA (WEPVLA), a compact 0.5B-parameter policy that learns in the unified geometric action space through a dual-stream Point Action Adapter and a unified Point Action Expert, with an $SE(3)$ conjugation coupling the two components. To improve data efficiency, we complement UMR with a Data-Efficient Strategy (DES) that diversifies object configurations through stage-aware point-cloud editing while preserving demonstrated contact geometry. In simulation, WEPVLA achieves average success rates of 97.5\% on LIBERO and 85.7\% on the 10-task RLBench benchmark. In real-world experiments, a single policy trained on human demonstrations augmented by DES transfers zero-shot to diverse deployment conditions. With about 10 minutes of collected human demonstrations per task and no robot demonstrations, it achieves 91.7\% average success across six evaluation settings, compared with 60.8\% for HumanEgo. Code and additional materials are available at https://umr-wepvla.github.io/.
- Abstract(参考訳): 汎用的なエンボディド操作は、エンボディメントとスケールを容易に一般化する統一されたアクション表現に基づく。
しかし、既存の政策はエンボディメント固有の行動空間に依存しており、クロスボデーメントのデモンストレーションを大規模に活用することは困難であり、新しいエンボディメントや空間変動への移動を制限する。
この目的のために,人間の実演から異種ロボットへのゼロショットスキル伝達を可能にする統一アクション表現であるUniversal Manipulation Representation (UMR)を導入する。
UMRは、操作を2つの機能的に区別され、幾何学的に連結されたコンポーネントに分解する:世界フレームにおけるタスク関連物体の動きを記述したエンボディメント・アグノスティック・ワールド・フローと、現在のポーズに対するエンドエフェクタ・モーションを表すエゴ・トラジェクトリである。
UMR を World-Ego Point VLA (WEPVLA) としてインスタンス化する。これは2ストリームのPoint Action Adapter と統合されたPoint Action Expert を通じて統一された幾何的アクション空間で学習するコンパクトな0.5Bパラメータポリシーであり、これら2つのコンポーネントを結合した$SE(3)$共役である。
データ効率を向上させるため,実演の接触形状を保存しながら,ステージ対応のポイントクラウド編集によりオブジェクト構成を多様化するデータ効率戦略(Data-Efficient Strategy,DES)を用いてUMRを補完する。
シミュレーションでは、WEPVLAはLIBEROで97.5\%、RLBenchベンチマークで85.7\%の平均成功率を達成する。
実世界の実験では、DESによって強化された人間のデモンストレーションに基づいて訓練された単一のポリシーが、ゼロショットをさまざまなデプロイメント条件に転送する。
タスク毎の人間のデモを10分ほど収集し、ロボットによるデモは行わないが、6つの評価設定で平均91.7%の成功を達成している。
コードと追加資料はhttps://umr-wepvla.github.io/で公開されている。
関連論文リスト
- Whole-Body UMI: Transferring UMI Manipulation Skills to Humanoid Whole-Body Manipulation via Real-Time Motion Generation [8.078105172204713]
Whole-Body UMI (WB-UMI) は、タスク学習から全体コーディネーション学習を分離するタスク非依存、リアルタイムおよびエンドエフェクタ条件付きモーションジェネレータである。
拡散ポリシは、ネイティブなUMIデモから学習する一方で、WB-UMIは、ボディートラッカーやペアのイメージフルボディデモを必要としない、再ターゲットされたモーションキャプチャから独立して学習する。
G1の実ロボット実験は、4つのタスクにわたるリアルタイムクローズドループ転送をサポートし、引き出しのクローズド、シェルフピック・アンド・プレース80%、ロコボールトス30%、40%を達成している。
論文 参考訳(メタデータ) (2026-09-19T07:04:01Z) - Acting in Meters: Learning Metric Interactions for Precise Robotic Manipulation [22.037123953765548]
Vision-Language-Action ModelsとWorld-Action Modelsは、高度な言語条件のロボット操作を持つ。
本稿では,オブジェクトレベルのインタラクションとシーンレベルのインタラクションを,共有メトリックスケールでモデル化するメトリクスインタラクションフレームワークを提案する。
LIBEROとRoboTwin 2.0の平均成功率は0.80と3.59ポイントである。
論文 参考訳(メタデータ) (2026-09-16T07:20:18Z) - One Policy, Many Embodiments: Unified Camera-Centric Action Geometry Pre-training for Heterogeneous Embodied Manipulation [17.443768996704033]
UCAG-Pはカメラ中心の統一されたアクション定式化であり、異種エンボディドデータセットを共有された幾何学的アクション空間に整列させる。
幾何条件のアクショントランスレータは、予測運動と目標身体運動を結合して実行可能な制御を生成する。
UCAG-Pは、ロボットとシミュレーションデータの4.03K時間、人間のデモンストレーションの2.34K時間で訓練されている。
論文 参考訳(メタデータ) (2026-08-26T17:27:36Z) - Hydra-0: Action Flow for Generalist World Modeling and Control [64.88849745875753]
Hydra-0はアクションフローを条件とした世界モデルであり、ロボットの動きをピクセルの動きとして表現している。
我々の最良の構成は、90.4%のロボットモーションエラー、60.2%のオブジェクトモーションエラーを達成する。
訓練されたアクションヘッドは、タスク固有の専門家ロボットのデモンストレーションを必要とせずに、得られた潜在機能を実行可能なアクションにマッピングする。
論文 参考訳(メタデータ) (2026-08-18T17:59:30Z) - GHOST: Hierarchical Sub-Goal Policies for Generalizing Robot Manipulation [54.305781492241785]
本稿では,トレーニング分布を超えて一般化したビジュモータ操作ポリシーを学習するための枠組みを提案する。
GHOSTは、(i)多視点RGB-D観測から、3Dエンドエフェクタ上の分布として次のサブゴールを予測する高レベルポリシーに制御を分解する。
一連のタスクの中で、この階層的な分解は、フラットな拡散ポリシーと比較して、パフォーマンスと堅牢性を一貫して改善します。
論文 参考訳(メタデータ) (2026-06-08T18:08:01Z) - RLDX-1 Technical Report [74.70437517338186]
マルチストリーム動作変換器(Multi-Stream Action Transformer:MSAT)上に構築したデクスタス操作のための汎用ロボットポリシーRTDX-1を紹介する。
経験的評価により、RLDX-1は最新のフロンティア・ビジョン・ランゲージ・アクションモデルよりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-05-05T01:40:15Z) - TrajBooster: Boosting Humanoid Whole-Body Manipulation via Trajectory-Centric Learning [79.59753528758361]
両足のVLAを促進するために、豊富な車輪付きヒューマノイドデータを活用するクロス・エボディメント・フレームワークであるTrajBoosterを提案する。
私たちのキーとなる考え方は、形態素に依存しないインターフェースとして、エンドエフェクタ・トラジェクトリを使用することです。
以上の結果から,TrajBoosterは既存の車輪付きヒューマノイドデータにより,二足歩行ヒューマノイドVLAの性能を効率的に向上させることができることがわかった。
論文 参考訳(メタデータ) (2025-09-15T12:25:39Z) - Nonprehensile Riemannian Motion Predictive Control [57.295751294224765]
本稿では,リアル・ツー・シムの報酬分析手法を導入し,リアルなロボット・プラットフォームに対する行動の可能性を確実に予測する。
連続的なアクション空間でオブジェクトを反応的にプッシュするクローズドループコントローラを作成します。
我々は,RMPCが乱雑な環境だけでなく,乱雑な環境においても頑健であり,ベースラインよりも優れていることを観察した。
論文 参考訳(メタデータ) (2021-11-15T18:50:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。