論文の概要: DVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2606.32028v2
- Date: Thu, 02 Jul 2026 02:48:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.505169
- Title: DVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic Manipulation
- Title(参考訳): DVG-WM:ロボットマニピュレーションのための効率的な身体的世界モデルの実現
- Authors: Ziyu Shan, Zhenyu Wu, Xiaofeng Wang, Zheng Zhu, Ziwei Wang,
- Abstract要約: 本稿では、世界モデリングを動的学習と視覚合成に分解する効率的なフレームワークであるDVG-WMを提案する。
LIBEROと現実世界のプラットフォームでの実験では、最大3.97倍の加速で画質が改善された。
- 参考スコア(独自算出の注目度): 41.032627534378065
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video-based embodied world models provide an appealing substrate for robotic manipulation by predicting future states, yet current approaches remain limited by a fundamental entanglement: accurately modeling dynamics typically requires low-level temporal reasoning, while producing high-resolution frames demands expansive visual synthesis according to high-level semantics. This entanglement results in slow inference speed for iterative planning or too coarse predictions to retain contact-rich details. To solve this dilemma, we present Disentangled Video Generation World Model (DVG-WM), an efficient framework that explicitly decomposes world modeling into dynamics learning and visual synthesis. Conditioned on an initial observation and a language instruction, our model first generates a plausible sequence of intermediate visual states to preview the physical interaction and refines them to obtain high-fidelity videos. Furthermore, an efficient cascading mechanism is proposed, where DVG-WM uses flow matching to directly map the dynamics to video latents, and introduces a latent degradation mechanism to regenerate contact-rich details. Experiments on LIBERO and real-world platforms demonstrate improved video quality with up to 3.97 times acceleration, validating that disentangled video generation can be an efficient embodied world model for robotic manipulation.
- Abstract(参考訳): ビデオベースのエンボディドワールドモデルは、将来の状態を予測してロボット操作のための魅力的な基盤を提供するが、現在のアプローチは基本的な絡み合いによって制限されている。
この絡み合いは、反復計画において遅い推測速度をもたらすか、接触に富んだ詳細を維持するために大きすぎる予測をもたらす。
このジレンマを解決するために、動的学習と視覚合成に世界モデリングを明示的に分解する効率的なフレームワークであるDVG-WM(Disentangled Video Generation World Model)を提案する。
初期観測と言語指導を条件に,本モデルではまず,物理的相互作用をプレビューするために可視な中間状態列を生成し,高忠実度ビデオを得るよう改良する。
さらに,DVG-WMはフローマッチングを用いて映像潜伏者を直接マッピングし,接触豊富な詳細を再現するための潜伏劣化機構を提案する。
LIBEROと実世界のプラットフォームでの実験では、最大3.97倍の加速でビデオの品質が向上し、非絡み合いのビデオ生成がロボット操作のための効率的なエンボディド・ワールドモデルであることが証明された。
関連論文リスト
- TeleWorld: Towards Dynamic Multimodal Synthesis with a 4D World Model [53.555353366322464]
我々は,映像生成,動的シーン再構成,長期記憶をクローズドループシステム内で統合するリアルタイム多モード4DワールドモデリングフレームワークTeleWorldを提案する。
提案手法は,動的オブジェクトモデリングと静的シーン表現のシームレスな統合を実現し,現実的でインタラクティブで計算可能な合成システムに向けて世界モデルを推し進める。
論文 参考訳(メタデータ) (2025-12-31T18:31:46Z) - mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs [5.109732854501585]
そこで我々は,事前学習したインターネットスケールのビデオモデルと,その潜在表現に条件付けされたフローマッチングに基づくアクションデコーダを組み合わせた,新しいビデオ・アクション・モデル(VAM)を提案する。
提案手法は,シミュレーションおよび実世界のロボット操作タスクにおける最先端性能を実現し,サンプル効率を10倍,収束速度を2倍向上させる。
論文 参考訳(メタデータ) (2025-12-17T18:47:31Z) - Learning Primitive Embodied World Models: Towards Scalable Robotic Learning [50.32986780156215]
我々は,世界モデリングのための新しいパラダイム--Primitive Embodied World Models (PEWM)を提案する。
ビデオ生成を固定的な短地平線に制限することにより,ロボット行動の言語概念と視覚的表現の微妙なアライメントを可能にする。
我々のフレームワークは、きめ細かい物理的相互作用と高レベルの推論のギャップを埋め、スケーラブルで解釈可能で汎用的なインテリジェンスへの道を開く。
論文 参考訳(メタデータ) (2025-08-28T14:31:48Z) - iVideoGPT: Interactive VideoGPTs are Scalable World Models [70.02290687442624]
世界モデルは、現実の意思決定のために想像された環境の中で、モデルベースのエージェントを対話的に探索し、推論し、計画することを可能にする。
マルチモーダルな信号 – 視覚的観察,アクション,報酬 – を統合した,スケーラブルな自己回帰型トランスフォーマーフレームワークであるInteractive VideoGPTを導入する。
iVideoGPTは、高次元の視覚的観察を効率的に識別する新しい圧縮トークン化技術を備えている。
論文 参考訳(メタデータ) (2024-05-24T05:29:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。