論文の概要: LACE: Latent Visual Representation for Cross-Embodiment Learning
- arxiv url: http://arxiv.org/abs/2605.16743v1
- Date: Sat, 16 May 2026 01:50:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 16:45:22.363616
- Title: LACE: Latent Visual Representation for Cross-Embodiment Learning
- Title(参考訳): LACE: クロス・エボディメント・ラーニングのための潜在視覚表現
- Authors: Yoo Sung Jang, Kanchana Ranasinghe, Cristina Mata, Yichi Zhang, Jorge Mendez-Mendez, Michael S. Ryoo,
- Abstract要約: 人間の実演から学ぶことは、人間とロボットの体格の視覚的ギャップによって妨げられる。
自己教師型学習バックボーンの潜在空間における人間とロボットの視覚表現を協調するフレームワークであるLACEを提案する。
- 参考スコア(独自算出の注目度): 36.1587655731958
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cross-embodiment learning from human demonstrations is hindered by the visual gap between human and robot embodiments. While self-supervised learning (SSL) backbones encode rich inter-class semantics of general objects, we show they fail to establish correspondence between human and robot hands. We propose LACE, a framework that aligns human and robot visual representations in the latent space of these backbones by leveraging correspondences between shared body parts across embodiments as sparse supervision. These annotations can be automatically obtained via forward kinematics, and single robot demonstration is sufficient to train the model. Our semantic alignment loss matches distributions incurred by corresponding features, lifting patch-level supervision to semantic-level alignment, while a Gram loss preserves pretrained feature quality. This alignment enables robot policies to leverage abundant human data when robot demonstrations are scarce: in zero-shot transfer, policies using LACE-DINO outperform those using DINO by a large margin (65\%), with consistent gains in low-data regimes and out-of-distribution environments.
- Abstract(参考訳): 人間の実演から学ぶことは、人間とロボットの体格の視覚的ギャップによって妨げられる。
自己教師付き学習(SSL)バックボーンは汎用オブジェクトのクラス間セマンティクスを豊富にエンコードするが、人間とロボットの手の対応を確立できないことを示す。
本研究では,これらの背骨の潜伏空間における人間とロボットの視覚表現を協調させるフレームワークであるLACEを提案する。
これらのアノテーションは、フォワード・キネマティクス(英語版)を介して自動的に取得でき、単一のロボットのデモはモデルを訓練するのに十分である。
我々のセマンティックアライメント損失は、対応する特徴によって生じる分布と一致し、パッチレベルの監督をセマンティックレベルのアライメントに引き上げる一方、グラマーの損失は事前訓練された特徴品質を保持する。
ゼロショット転送では、LACE-DINOを使用したポリシーは、DINOを使用するポリシーを大きなマージン(65倍)で上回り、低データ体制やアウト・オブ・ディストリビューション環境において一貫して向上する。
関連論文リスト
- Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing [35.3765036136913]
本稿では,クロス・エボディメント・ビデオ編集のための生成フレームワークを提案する。
本手法は,2つの競合対象を強制することにより,実演映像を2つの潜在空間に分解する。
パラメータ効率の良いアダプタは、これらの潜伏コードを凍結ビデオ拡散モデルに注入し、コヒーレントロボット実行ビデオの合成を可能にする。
論文 参考訳(メタデータ) (2026-05-05T11:09:41Z) - UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling [41.44664297185315]
人-人-人-人間移動のための統一物理言語を構築するためのフレームワークであるUniTを紹介する。
アクションは視覚を予測し、キネマティクスを物理的な結果に固定し、視覚はアクションを再構成し、無関係な視覚的共同創設者をフィルタリングする。
論文 参考訳(メタデータ) (2026-04-21T17:57:27Z) - Cross-Hand Latent Representation for Vision-Language-Action Models [49.32460749933983]
器用な操作のための信頼性の高い視覚言語アクションモデルを訓練するには、多くのロボットハンドにわたる大規模な実演が必要である。
XL-VLAは視覚・言語・アクション・フレームワークであり,多種多様な手間で共有される潜在行動空間と統合される。
論文 参考訳(メタデータ) (2026-03-10T18:50:57Z) - Learning a Unified Latent Space for Cross-Embodiment Robot Control [8.76482934005711]
本稿では,人体横断型ロボット制御のためのスケーラブルなフレームワークを提案する。
我々は、人間と多様なヒューマノイドプラットフォームをまたいだ動きを統一する、共通の潜在表現を学ぶ。
本手法は,ロボットの潜伏空間への効率的な付加を支援する。
論文 参考訳(メタデータ) (2026-01-21T19:31:17Z) - MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training [102.850162490626]
人間のロボットによる相互模倣事前学習による視覚-言語-行動モデルであるMiVLAを提案する。
MiVLAは、最先端のVLAよりも優れた、強力な改良された一般化能力を実現する。
論文 参考訳(メタデータ) (2025-12-17T12:59:41Z) - OmniRetarget: Interaction-Preserving Data Generation for Humanoid Whole-Body Loco-Manipulation and Scene Interaction [76.44108003274955]
ヒューマノイドロボットの複雑なスキルを教えるための主要なパラダイムは、強化学習ポリシーの運動学的参照として人間の動きを再ターゲットすることである。
インタラクションメッシュに基づくインタラクション保存データ生成エンジンであるOmniRetargetを紹介する。
人間のメッシュとロボットメッシュの間のラプラシアの変形を最小限にすることで、OmniRetargetは運動学的に実現可能な軌道を生成する。
論文 参考訳(メタデータ) (2025-09-30T17:59:02Z) - One-Shot Imitation under Mismatched Execution [7.060120660671016]
人間のデモは、ロボットに長距離操作のタスクをプログラムするための強力な方法だ。
これらのデモをロボット実行可能なアクションに変換することは、運動スタイルや身体能力のミスマッチの実行による重大な課題を呈する。
シーケンスレベルの最適輸送コスト関数を用いて,人間とロボットの軌道を自動的にペアリングする新しいフレームワークRHyMEを提案する。
論文 参考訳(メタデータ) (2024-09-10T16:11:57Z) - Visual Affordance Prediction for Guiding Robot Exploration [56.17795036091848]
我々は,ロボット探索を導くための視覚能力の学習手法を開発した。
VQ-VAEの潜伏埋め込み空間における条件分布の学習にはTransformerベースのモデルを用いる。
本稿では,ロボット操作における視覚的目標条件付きポリシー学習において,目標サンプリング分布として機能することで探索を導くために,トレーニングされた余裕モデルをどのように利用できるかを示す。
論文 参考訳(メタデータ) (2023-05-28T17:53:09Z) - MILD: Multimodal Interactive Latent Dynamics for Learning Human-Robot
Interaction [34.978017200500005]
我々は,HRI(Human-Robot Interactions)の問題に対処するために,MILD(Multimodal Interactive Latent Dynamics)を提案する。
変分オートエンコーダ(VAE)の潜時空間における相互作用エージェントの結合分布をモデル化するために,Hidden Semi-Markov Models (HSMMs) を用いて実演から相互作用ダイナミクスを学習する。
MILDは、観察されたエージェント(人間の)軌道に条件付けされたときに、制御されたエージェント(ロボット)に対してより正確な軌道を生成する。
論文 参考訳(メタデータ) (2022-10-22T11:25:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。