論文の概要: DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation
- arxiv url: http://arxiv.org/abs/2608.06374v1
- Date: Thu, 06 Aug 2026 17:59:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.815243
- Title: DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation
- Title(参考訳): DyPES-VLA: 共有ダイナミクスの事前学習と身体制御
- Abstract要約: DyPES-VLAは、DyPES-VLA(英語版)であり、共有されたダイナミクス優先順位と身体特性制御を学習する。
一般化政策として,本手法はシミュレーションや実世界の評価において最先端の性能を実現する。
- 参考スコア(独自算出の注目度): 18.601805553878638
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models have become a powerful paradigm for robot manipulation, but training a single generalist policy for heterogeneous robot embodiments remains an open problem. Existing methods have two main limitations. First, they underuse dynamics priors shared across diverse visual and interaction data, limiting cross-embodiment transfer. Second, they require extensive manual preprocessing to convert embodiment-specific actions into a common format. To overcome these limitations, we propose DyPES-VLA, a cross-embodiment VLA that learns shared Dynamics Priors and Embodiment-Specific control. First, we learn shared dynamics priors by training the vision-language model (VLM) with a future-prediction objective on cross-embodiment data, driving the shared query representation to capture object motion, contact, and interaction-induced scene changes. Second, an embodiment-specific Mixture-of-Experts (MoE) action head translates these shared dynamics priors into executable controls directly in each embodiment's native action space, without manually pre-aligning heterogeneous actions into a common format. This head shares attention layers to capture common temporal action structures, while its embodiment-specific feed-forward experts resolve the unique kinematic constraints and control semantics of distinct embodiments. As a generalist policy, our \ourmethod achieves state-of-the-art performance across simulation and real-world evaluations, reaching 98.0% success on LIBERO, 59.25% on RoboCasa-GR1, and 89.02% on RoboTwin~2.0.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、ロボット操作の強力なパラダイムとなっているが、異種ロボットの体現のために単一のジェネラリストポリシーを訓練することは、未解決の問題である。
既存の方法には2つの主な制限がある。
まず、さまざまな視覚的および相互作用データ間で共有される動的プリミティブをアンダーユースし、異体間移動を制限する。
第2に、エンボディメント固有のアクションを共通のフォーマットに変換するために、広範囲な手作業による事前処理が必要である。
このような制限を克服するために,DyPES-VLAを提案する。
まず,視覚言語モデル(VLM)を,物体の動きや接触,相互作用によって引き起こされるシーンの変化を捉えるために,共用クエリ表現を駆動する。
第2に、エボディメント固有のMixture-of-Experts (MoE) アクションヘッドは、これらの共有ダイナミクスを、手動で異種アクションを共通のフォーマットに調整することなく、それぞれのエボディメントのネイティブアクション空間内で直接実行可能なコントロールに変換する。
このヘッドは、共通の時間的行動構造を捉えるために注意層を共有し、そのエンボディメント固有のフィードフォワードの専門家は、固有のキネマティックな制約を解決し、異なるエンボディメントのセマンティクスを制御する。
一般論の方針として,我々の<ourmethod>はシミュレーションと実世界の評価で最先端のパフォーマンスを達成し,LIBEROで98.0%,RoboCasa-GR1で59.25%,RoboTwin~2.0で89.02%を達成した。
関連論文リスト
- One Policy, Many Embodiments: Unified Camera-Centric Action Geometry Pre-training for Heterogeneous Embodied Manipulation [17.443768996704033]
UCAG-Pはカメラ中心の統一されたアクション定式化であり、異種エンボディドデータセットを共有された幾何学的アクション空間に整列させる。
幾何条件のアクショントランスレータは、予測運動と目標身体運動を結合して実行可能な制御を生成する。
UCAG-Pは、ロボットとシミュレーションデータの4.03K時間、人間のデモンストレーションの2.34K時間で訓練されている。
論文 参考訳(メタデータ) (2026-08-26T17:27:36Z) - Learning Action Priors for Cross-embodiment Robot Manipulation [46.92215687389683]
ほとんどのビジョン・ランゲージ・アクション(VLA)モデルは、アクション・モジュールをアタッチし、完全なポリシーを共同で最適化することでビジョン・ランゲージ・モデル(VLM)のバックボーン上に構築される。
この研究は、モーダルなVLAアライメントの前に、動作先行でアクションモジュールを事前訓練することを提案する。
本稿では,動作モジュールに時間的交叉運動構造を持たせるための2段階のトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-24T17:59:56Z) - Unified Motion-Action Modeling for Heterogeneous Robot Learning [35.20580699433655]
UMAは、物体の動きとロボットの動きを、マスクされた生成目的の下で共進化変数として扱う。
UMAは、手動でアノテートされたタスク命令を必要とせずに、異種データソース間のマルチタスク事前トレーニングを可能にする。
UMAは、各推論モードに特化された最先端のベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-15T16:23:42Z) - PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation [50.8450025321217]
Vision-Language-Action(VLA)モデルは、汎用的なロボットポリシーに有望なパラダイムを提供する。
これらのボトルネックは、一般的なダイレクトインストラクション・トゥ・コントロルマッピング(Direct Instruction-to-Control Mapping)に由来すると我々は主張する。
本稿では,このパラダイムをPrimitive-Centric Disassemble & AssembleパラダイムにシフトさせるフレームワークであるPrimitiveVLAを提案する。
論文 参考訳(メタデータ) (2026-05-27T15:41:18Z) - X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models [39.033717938466246]
本稿では,X-DiffVLA(拡散型VLAモデル)を提案する。
X-DiffVLAは拡散モデルの生成的強度を利用して、クロスボディーデータセットの多様性と潜時相関をキャプチャすることができる。
X-DiffVLAは,それぞれ15.3%,12.5%の改善が得られた。
論文 参考訳(メタデータ) (2026-05-24T12:41:34Z) - Universal Pose Pretraining for Generalizable Vision-Language-Action Policies [83.39008378156647]
既存のVision-Language-Action(VLA)モデルは、しばしば機能崩壊と訓練効率の低下に悩まされる。
本稿では,VLAトレーニングを3次元空間前駆体抽出のための事前学習フェーズに分離する,分離されたパラダイムであるPose-VLAを提案する。
我々のフレームワークは2段階の事前学習パイプラインに従い、ポーズと動きのアライメントによる基本的な空間接地を確立する。
論文 参考訳(メタデータ) (2026-02-23T11:00:08Z) - MOTIF: Learning Action Motifs for Few-shot Cross-Embodiment Transfer [55.982504915794514]
クロス・エボディメント・ポリシーは一般的に共有プライベート・アーキテクチャに依存している。
本報告では,MOTIFを効率よく数発のクロスボディーメントトランスファーに適用する。
我々はMOTIFが数発の転送シナリオにおいて強いベースラインを著しく上回ることを示す。
論文 参考訳(メタデータ) (2026-02-14T13:21:40Z) - MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training [102.850162490626]
人間のロボットによる相互模倣事前学習による視覚-言語-行動モデルであるMiVLAを提案する。
MiVLAは、最先端のVLAよりも優れた、強力な改良された一般化能力を実現する。
論文 参考訳(メタデータ) (2025-12-17T12:59:41Z) - HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies [83.41714103649751]
具体的インテリジェンスモデルの開発は、高品質なロボットのデモデータへのアクセスに依存する。
異種多種多様なロボットデータを扱うための視覚言語アクションフレームワークであるHiMoE-VLAを提案する。
HiMoE-VLAは既存のVLAベースラインよりも一貫したパフォーマンス向上を示し、高い精度と堅牢な一般化を実現している。
論文 参考訳(メタデータ) (2025-12-05T13:21:05Z) - Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance [63.33213516925946]
textbfAlign-Then-stEer(textttATE)は,新しいデータ効率,プラグアンドプレイ適応フレームワークである。
我々の研究は、新しいロボットプラットフォームやタスクにVLAモデルをデプロイする実用性を大幅に向上させる、汎用的で軽量なソリューションを提供する。
論文 参考訳(メタデータ) (2025-09-02T07:51:59Z) - HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model [54.64088247291416]
操作ポリシー設計の基本的な目的は、ロボットに人間の指示を理解し、シーンの手がかりを推論し、動的な環境で一般化されたアクションを実行することである。
近年の自己回帰的視覚言語行動(VLA)法は、視覚言語モデル(VLM)から常識推論能力を継承し、次の行動予測を行う。
拡散に基づく行動の連続的な性質と自己回帰の文脈的推論を吸収する統合フレームワークであるHybridVLAを紹介する。
論文 参考訳(メタデータ) (2025-03-13T17:59:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。