論文の概要: EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation
- arxiv url: http://arxiv.org/abs/2608.02990v1
- Date: Tue, 04 Aug 2026 01:01:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 07:04:20.684579
- Title: EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation
- Title(参考訳): EmbodiedVAE: 効率よく制御可能なEmbodied ManipulationのためのアンタングルドビデオVAE
- Authors: Jiayi Luo, Hanxin Zhu, Chen Gao, Jiankun Wang, Cong Wang, Tianyu He, Jianxin Li, Zhibo Chen,
- Abstract要約: EmbodiedVAEは、ロボット操作の世界モデルに適したコンパクトで制御可能な潜在表現を提供する、新しいビデオVAEである。
提案するEmbodiedVAEは,2dBPSNRの改善によりロボット操作シナリオにおいて,より高精度な動作制御を実現するとともに,高い圧縮速度で再現性を実現する。
- 参考スコア(独自算出の注目度): 35.20482569112933
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Latent diffusion models (LDMs) have recently significantly advanced embodied learning in constructing powerful embodied manipulation world models. However, despite the remarkable performance, existing LDMs predominantly rely on Variational Autoencoders (VAEs) optimized for natural scenes while failing to account for the unique characteristics of embodied manipulation scenarios, yielding latent representations that are neither compact nor controllable, thereby hindering efficient training of LDMs and precise robotic control. To solve this problem, we present EmbodiedVAE, a novel video VAE that provides compact yet controllable latent representations tailored for the robotic manipulation world models. Specifically, EmbodiedVAE adopts a dual-encoder, single-decoder architecture with an asymmetric spatio-temporal compression module, which automatically disentangles the robot arm's motion from background environment, resulting in overall compactness while providing explicit embodied latent to support fine-grained action control. To further preserve the temporal consistency of learned robotic motion latent, we introduce an optimal-transport-based consistency module that explicitly enforces motion fidelity and inter-frame coherence. Extensive experiments demonstrate that our proposed EmbodiedVAE achieves superior reconstruction quality with high compression rate, while enabling more precise action control in robotic manipulation scenarios with an average of 2dB PSNR improvement over state-of-the-art video VAEs.
- Abstract(参考訳): 潜時拡散モデル (LDM) は近年, 強力な操作世界モデルの構築において, かなり高度なエンボディド学習を行っている。
しかし、優れた性能にもかかわらず、既存のLCDは自然の場面に最適化された変分オートエンコーダ(VAE)を主に頼りにしており、具体的操作シナリオのユニークな特徴を考慮せず、コンパクトで制御不能な潜在表現をもたらし、LDMの効率的な訓練や精密なロボット制御を妨げている。
この問題を解決するために、ロボット操作の世界モデルに適したコンパクトで制御可能な潜在表現を提供する新しいビデオVAEであるEmbodiedVAEを提案する。
具体的には、EmbodiedVAEは、非対称な時空間圧縮モジュールを備えたデュアルエンコーダのシングルデコーダアーキテクチャを採用しており、ロボットアームの動作を背景環境から自動的に切り離し、明示的なエンコーダ付き潜水器を提供し、きめ細かいアクション制御をサポートする。
学習したロボットの動きの時間的一貫性をさらに維持するために,運動の忠実度とフレーム間のコヒーレンスを明確に強制する最適なトランスポートベースの一貫性モジュールを導入する。
提案したEmbodiedVAEは, ロボット操作シナリオにおいて, 2dBPSNRの精度向上を図りながら, 高い圧縮速度で高い再現性を実現し, より高精度な動作制御を実現している。
関連論文リスト
- LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments [41.26480439505561]
世界行動モデル(WAM)は、インテリジェンスを具現化する強力なパラダイムとして登場した。
モデルにタスク非関連の視覚的詳細を再構築させると、表現能力が低下し、視覚的邪魔者に対して脆弱なポリシーが現れる。
本稿では,JEPA(Joint-Embedding Predictive Architecture)をワールドアンカーとして運用することで,WAMの新たな予測-遅延パラダイムを確立するLeapBot-WAを提案する。
論文 参考訳(メタデータ) (2026-07-27T03:36:45Z) - Native Video-Action Pretraining for Generalizable Robot Control [77.59831077077176]
LingBot-VA 2.0は、エンボディメントのためにゼロから構築されたビデオアクション基盤モデルである。
高周波推論の要求を満たすため,本モデルは疎いMOEバックボーンを用いる。
現実のデプロイメントは、堅牢な基盤モデルとしてLingBot-VA 2.0を検証する。
論文 参考訳(メタデータ) (2026-07-09T16:15:43Z) - CT-VAM: A Cerebello-Thalamic-Inspired Vision-Action Model for Efficient Visuomotor Control [8.522323773053882]
本稿では,効率的なタスク条件付き視覚運動制御のための視覚行動モデル(CT-VAM)を提案する。
CT-VAMは、デュアルビューの視覚的観察、プロプレセプション、および軽量タスク条件からアクションチャンクを予測する、コンパクトなローカル実行ポリシーとして機能する。
68万のパラメータしか持たないCT-VAMは、かなり大きなVLAモデルと競合するLIBEROの成功率を達成する。
論文 参考訳(メタデータ) (2026-06-08T14:46:43Z) - DisCo: World Models with Discrete Camera Motion Control [79.86256515640231]
本研究では、離散アクションプリミティブのコンパクトなセットで生成し、アクション分離性を改善する制御可能なビデオワールドモデルであるDisCoを提案する。
DisCoは、視覚的品質を維持しながら、はるかに信頼性の高いアクションを達成する。
論文 参考訳(メタデータ) (2026-06-06T03:50:45Z) - Strain-Parameterized Coupled Dynamics and Dual-Camera Visual Servoing for Aerial Continuum Manipulators [0.8594140167290097]
テンドン駆動連続型空中マニピュレータ(TD-ACM)は、無人航空機(UAV)の操縦性と軽量ロボット(CR)のコンプライアンスを組み合わせる
TD-ACMに対する既存の連続結合動的モデリング手法は計算コストが高い。
本稿では,不活性化基底を持つ結合型TD-ACMの一般化された動的定式化について述べる。
論文 参考訳(メタデータ) (2026-03-24T15:33:22Z) - mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs [5.109732854501585]
そこで我々は,事前学習したインターネットスケールのビデオモデルと,その潜在表現に条件付けされたフローマッチングに基づくアクションデコーダを組み合わせた,新しいビデオ・アクション・モデル(VAM)を提案する。
提案手法は,シミュレーションおよび実世界のロボット操作タスクにおける最先端性能を実現し,サンプル効率を10倍,収束速度を2倍向上させる。
論文 参考訳(メタデータ) (2025-12-17T18:47:31Z) - FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation [50.39748673817223]
本稿では,ロボットビデオ生成における明示的な動作パラメータを完全に活用する2つのトレーニング不要な推論時間手法を提案する。
第一に、アクションスケールの分類器フリーガイダンスは、動作の大きさに比例して誘導強度を動的に調整し、運動強度に対する制御性を高める。
第二に、アクションスケールノイズトランケーションは、初期サンプルノイズの分布を調整し、所望の運動力学とよりよく一致させる。
論文 参考訳(メタデータ) (2025-09-29T03:30:40Z) - Physical Autoregressive Model for Robotic Manipulation without Action Pretraining [65.8971623698511]
我々は、自己回帰ビデオ生成モデルを構築し、物理自己回帰モデル(PAR)を提案する。
PARは、アクション事前トレーニングを必要とせず、物理力学を理解するために、ビデオ事前トレーニングに埋め込まれた世界の知識を活用する。
ManiSkillベンチマークの実験は、PARがPushCubeタスクで100%の成功率を達成したことを示している。
論文 参考訳(メタデータ) (2025-08-13T13:54:51Z) - ReCoM: Realistic Co-Speech Motion Generation with Recurrent Embedded Transformer [58.49950218437718]
音声に同期した高忠実で一般化可能な人体動作を生成するための効率的なフレームワークであるReCoMを提案する。
Recurrent Embedded Transformer (RET)は、動的埋め込み正規化(DER)をViT(Vit)コアアーキテクチャに統合する。
モデルロバスト性を高めるため,ノイズ抵抗とクロスドメイン一般化の二重性を持つモデルに,提案したDER戦略を取り入れた。
論文 参考訳(メタデータ) (2025-03-27T16:39:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。