論文の概要: Cross-Embodiment Transfer via Behavior-Aligned Representations
- arxiv url: http://arxiv.org/abs/2607.27549v1
- Date: Thu, 30 Jul 2026 00:49:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.352944
- Title: Cross-Embodiment Transfer via Behavior-Aligned Representations
- Title(参考訳): 振舞いに適応した表現によるクロス・エンボディメント・トランスファー
- Abstract要約: 本研究では,視覚行動モデルにおける行動整合表現を用いて,身体間の移動を促進する役割について検討する。
そこで我々は, 多様なクロスボデーメントデータから新しいエボデーメントへのトランスファーを評価するためのシミュレーションベースのベンチマークを開発した。
シミュレーションデータに基づいて事前学習した実ロボットポリシーのタスク完了進捗を28%向上させることで,シミュレート・トゥ・リアル・エボディメント・トランスファーを強化できることを実証した。
- 参考スコア(独自算出の注目度): 29.171887164748124
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent progress in large-scale imitation learning for robot manipulation has been driven by leveraging datasets across a wide range of robot embodiments. However, achieving significant cross-embodiment transfer is often still challenging. In this work, we study the role of using behavior-aligned representations (e.g., object bounding boxes, language motions, end-effector traces of robot motion) in vision-language-action (VLA) models to promote cross-embodiment transfer. We hypothesize that by possessing invariances across embodiments while being predictive of robot actions, these representations can help unify large-scale cross-embodiment data to enhance transfer. To assess our hypothesis, we develop a simulation-based benchmark designed to assess transfer with diverse cross-embodiment data to new embodiments. Using this benchmark, we compare different representations and ways of incorporating them. We identify that end-effector traces can be particularly beneficial for transfer, representations are generally more useful with larger prior datasets, and can be used to benefit from action-free data. We also demonstrate that they can enhance sim-to-real cross-embodiment transfer, improving task completion progress of real robot policies pre-trained on simulation data by 28%. We provide videos of our evaluations at our website: https://ajaysridhar.com/barx/.
- Abstract(参考訳): ロボット操作のための大規模な模倣学習の最近の進歩は、幅広いロボットの実施形態のデータセットを活用することによって進められている。
しかし、重要なクロス・エボディメント・トランスファーを達成することは、しばしば困難である。
本研究では,視覚言語行動(VLA)モデルにおける行動整合表現(例えば,オブジェクト境界ボックス,言語運動,ロボット動作の終端効果のトレース)を用いて,身体間移動を促進する役割について検討する。
ロボットの動作を予測しながら、エンボディメントをまたいだ不変性を持つことにより、これらの表現は、大規模なクロス・エボディメントデータを統一し、移動を促進できる、という仮説を立てる。
この仮説を評価するため,多種多様な異種体間データから新しい実施形態への移動を評価するためのシミュレーションベースのベンチマークを開発した。
このベンチマークを用いて、異なる表現とそれらを組み込む方法を比較する。
我々は、エンドエフェクタトレースが転送に特に有用であり、表現は一般的に、より大きな以前のデータセットで有用であり、アクションフリーなデータから恩恵を受けることができると認識している。
また,シミュレーションデータに基づいて事前学習した実際のロボットポリシーのタスク完了進捗を28%向上させることで,シミュレートとリアルのクロス・エボディメント・トランスファーを強化できることを実証した。
私たちは、我々のウェブサイトで評価のビデオを提供しています。
関連論文リスト
- SCAR: Self-Supervised Continuous Action Representation Learning [36.917304453471864]
視覚的遷移から具現化された動作表現を学習するための共同逆フォワード動的フレームワークであるSCARを提案する。
事前訓練された生成バックボーン上に構築されたSCARは、逆ダイナミクスモデル(IDM)を使用して、潜時観測ペアから潜時動作を推論し、フォワードダイナミクスモデル(FDM)を用いて、それらに条件付けられた将来のダイナミクスを予測する。
Procgen と Robotwin のデータセットの実験により、学習された統合潜在行動表現は、具体化固有の生の行動よりも、世界モデリングのためのより強い条件付けインターフェースとして機能することが示された。
論文 参考訳(メタデータ) (2026-05-13T16:23:11Z) - Data Analogies Enable Efficient Cross-Embodiment Transfer [72.88252238231269]
汎用ロボットポリシーは、さまざまなロボット、シーン、視点で収集されたデモに基づいて訓練される。
ロボットのセットアップ間での移動を可能にする上で、最も有用なデモデータの種類は何か?
我々の模擬実験は、視点のような知覚的な変化は幅広い多様性から最も恩恵を受けるが、形態学的な変化は非構造的な多様性から非常に恩恵を受けないことを示している。
論文 参考訳(メタデータ) (2026-03-06T16:42:46Z) - MOTIF: Learning Action Motifs for Few-shot Cross-Embodiment Transfer [55.982504915794514]
クロス・エボディメント・ポリシーは一般的に共有プライベート・アーキテクチャに依存している。
本報告では,MOTIFを効率よく数発のクロスボディーメントトランスファーに適用する。
我々はMOTIFが数発の転送シナリオにおいて強いベースラインを著しく上回ることを示す。
論文 参考訳(メタデータ) (2026-02-14T13:21:40Z) - Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization [65.37179698521766]
VLA(Vision-Language-Action)モデルは、ジェネラリストロボットの制御を強く約束する。
標準的な「スケールデータ」レシピがロボット工学に翻訳されるかどうかはまだ不明だ。
本稿では,多様なロボットを対象とした事前学習のためのコアトレーニング選択を再考する,VLAスケーリングの体系的かつ制御された研究を提案する。
論文 参考訳(メタデータ) (2026-02-10T12:25:43Z) - CEI: A Unified Interface for Cross-Embodiment Visuomotor Policy Learning in 3D Space [7.985647150826696]
クロス・エボデーメント・インタフェース(CEI)は、クロス・エボデーメント・ラーニングのためのフレームワークである。
CEIは勾配に基づく最適化を通じてロボットの軌道を整列させ、その後、目に見えないロボットアームとエンドエフェクターの観察とアクションを合成する。
実験では、CEIはシミュレーションにおいて、データとポリシーをFranka Pandaロボットからtextbf16の異なる実施形態に転送する。
論文 参考訳(メタデータ) (2026-01-14T05:07:11Z) - Trajectory Conditioned Cross-embodiment Skill Transfer [17.361383693716643]
TrajSkillは、Trajectory Conditioned Cross-Embodiment Skill Transferのフレームワークである。
トラジスキルは最先端技術と比較してFVDを39.6%、KVDを36.6%削減することを示した。
論文 参考訳(メタデータ) (2025-10-09T04:26:06Z) - Is Diversity All You Need for Scalable Robotic Manipulation? [50.747150672933316]
ロボット学習におけるデータ多様性の役割について,従来の「より多様な方がよい」という直観に固執する3つの重要な次元(タスク),実施形態(ロボットの使用方法),専門家(専門家)を用いて検討する。
タスクの多様性は、タスクごとのデモンストレーション量よりも重要であり、多様な事前学習タスクから新しい下流シナリオへの移行に有効であることを示す。
本稿では,速度のあいまいさを緩和する分散デバイアス法を提案する。GO-1-Proは,2.5倍の事前学習データを用いて,15%の性能向上を実現している。
論文 参考訳(メタデータ) (2025-07-08T17:52:44Z) - Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy [73.75271615101754]
本稿では,Transformerアーキテクチャを活用した拡張性のあるフレームワークであるDitaについて紹介する。
Ditaはコンテキスト内コンディショニング(context conditioning)を採用しており、歴史的観察から生の視覚トークンと識別されたアクションをきめ細やかなアライメントを可能にする。
Ditaは、さまざまなカメラパースペクティブ、観察シーン、タスク、アクションスペースの横断的なデータセットを効果的に統合する。
論文 参考訳(メタデータ) (2025-03-25T15:19:56Z) - Point Cloud Based Reinforcement Learning for Sim-to-Real and Partial
Observability in Visual Navigation [62.22058066456076]
強化学習(Reinforcement Learning, RL)は、複雑なロボットタスクを解決する強力なツールである。
RL は sim-to-real transfer problem として知られる現実世界では直接作用しない。
本稿では,点雲と環境ランダム化によって構築された観測空間を学習する手法を提案する。
論文 参考訳(メタデータ) (2020-07-27T17:46:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。