論文の概要: RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2607.06559v1
- Date: Tue, 07 Jul 2026 17:58:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.618586
- Title: RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
- Title(参考訳): RynnWorld-4D:ロボットマニピュレーションのための4次元身体世界モデル
- Abstract要約: RynnWorld-4Dは,1枚のRGB-D画像から,将来のRGBフレーム,深度マップ,光フローを共同生成する生成モデルである。
実験により、RynnWorld-4Dは時間的・空間的に整合した4D予測を生成し、RynnWorld-4D-Policyは実世界の操作タスクで最先端のパフォーマンスを達成することが示された。
- 参考スコア(独自算出の注目度): 43.55126782618712
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robotic manipulation in the open world requires not only recognizing what a scene looks like, but also anticipating how its 3D structure moves under interaction. We argue that synchronized RGB, depth, and optical flow, namely RGB-DF, provide a physically grounded representation that captures the underlying 4D dynamics of a scene. Compared to 2D pixel videos, this multi-modal synergy aligns visual appearance with geometric structure and temporal motion, creating a representation space significantly closer to the low-level end-effector actions demanded by robotic systems, thereby narrowing the gap between world prediction and policy learning. Building on this insight, we introduce RynnWorld-4D, a generative model that co-produces future RGB frames, depth maps, and optical flow from a single RGB-D image and a language instruction within one unified diffusion process. This 4D world model features a tri-branch architecture that integrates cross-modal attention with frame-wise 3D RoPE, ensuring that appearance, geometry, and motion evolve consistently. To supply training data at scale, we curate Rynn4DDataset 1.0, a massive dataset of over 254.4 million frames across egocentric human and robotic manipulation videos with high-quality pseudo-labels for depth and optical flow. We further propose RynnWorld-4D-Policy, an inverse dynamics head that consumes the internal 4D representations of RynnWorld-4D in a single forward pass, bypassing expensive multi-step denoising, to output robot actions in a closed-loop manner. Experiments show that RynnWorld-4D produces temporally and spatially coherent 4D predictions, and that RynnWorld-4D-Policy achieves state-of-the-art performance on real-world dexterous bimanual manipulation tasks, particularly excelling in tasks demanding spatial precision and temporal coordination.
- Abstract(参考訳): オープンな世界でのロボット操作は、シーンがどのようなものかを認識するだけでなく、その3D構造が相互作用の下でどのように動くかを予測する必要がある。
我々は,RGB,深度,光学的流れの同期化,すなわちRGB-DFは,シーンの基盤となる4次元ダイナミクスを捉える物理的に接地された表現であると主張している。
2Dピクセルビデオと比較して、このマルチモーダル・シナジーは、視覚的な外観を幾何学的構造や時間的動きと整合させ、ロボットシステムによって要求される低レベルのエンドエフェクタ動作にかなり近い表現空間を形成し、世界予測と政策学習のギャップを狭める。
この知見に基づいて,1つのRGB-D画像から将来のRGBフレーム,深度マップ,光フローを共同生成する生成モデルRynnWorld-4Dと,1つの統一拡散過程における言語命令を導入する。
この4Dワールドモデルは、クロスモーダルアテンションとフレームワイズな3D RoPEを統合するトリブランチアーキテクチャを備え、外観、幾何学、動きが一貫して進化することを保証する。
大規模なトレーニングデータを提供するため、私たちはRynn4DDataset 1.0をキュレートしました。
さらにRynnWorld-4D-Policyを提案する。これはRynnWorld-4Dの内部4D表現を単一の前方通過で消費し、高価なマルチステップデノベーションを回避し、クローズドループ方式でロボット動作を出力する逆ダイナミクスヘッドである。
実験により、RynnWorld-4Dは時間的・空間的に整合した4次元予測を生成し、RynnWorld-4D-Policyは実世界のデクスタラスな2次元操作タスク、特に空間的精度と時間的調整を必要とするタスクにおいて最先端のパフォーマンスを達成することが示された。
関連論文リスト
- PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation [51.385664546670284]
PAIWorldは3つのコアコンポーネントを通じて拡散変圧器の世界モデルを拡張するフレームワークである。
ロボットベンチマークで最先端のマルチビュー3D一貫性を実現し、WorldArenaのリーダーボードで1位、AgiBot-Challenge2026のリーダーボードで2位にランクインした。
論文 参考訳(メタデータ) (2026-06-16T18:23:23Z) - Embody4D: A Generalist 4D World Model for Embodied AI [13.488596291534243]
Embody4Dは、エンボディされたシナリオのための専用ビデオからビデオの世界モデルである。
モノクロビデオから任意の新しいビューを再生することができる。
最先端のパフォーマンスを実現し、堅牢な世界モデルとして機能する。
論文 参考訳(メタデータ) (2026-05-03T09:39:44Z) - Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied Simulation [46.24300848525144]
Kinema4Dは、ロボットと世界の相互作用を、ロボットの正確な4D表現、すなわち環境反応の生成4Dモデリングに分解する、アクションコンディショナブルな新しい4D生成ロボットシミュレータである。
初めてゼロショット転送能力を示し、次世代のエンボディドシミュレーションを進めるための高忠実度基盤を提供する。
論文 参考訳(メタデータ) (2026-03-17T15:36:38Z) - Robo3R: Enhancing Robotic Manipulation with Accurate Feed-Forward 3D Reconstruction [70.06600045165905]
3D空間認識は、一般的なロボット操作の基本であるが、信頼性が高く高品質な3D形状の取得は依然として困難である。
本稿では,RGB画像やロボットの状態から直接,正確な距離スケールのシーン形状をリアルタイムで予測する操作可能な3次元再構成モデルであるRobo3Rを紹介する。
我々は、ロボット操作のためのこの代替3Dセンシングモジュールの約束を示唆し、パフォーマンスの連続的な向上を観察する。
論文 参考訳(メタデータ) (2026-02-10T18:58:15Z) - VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control [83.92729346325163]
VerseCrafterは、4D対応のビデオワールドモデルであり、カメラとオブジェクトのダイナミクスの両方を明示的で一貫性のある制御を可能にする。
当社のアプローチは,静的な背景点雲を通じて世界状態をエンコードする,新しい4次元幾何制御表現を中心にしている。
これらの4D制御は、事前訓練されたビデオ拡散モデルのための条件付け信号にレンダリングされ、高忠実でビュー一貫性のあるビデオを生成することができる。
論文 参考訳(メタデータ) (2026-01-08T17:28:52Z) - Any4D: Unified Feed-Forward Metric 4D Reconstruction [39.62006179006032]
メトリスケールで高密度なフィードフォワード4D再構成のためのスケーラブルなマルチビュートランスであるAny4Dを提案する。
Any4DはNフレームのピクセル当たりの動きと幾何予測を直接生成する。
精度(2~3倍低いエラー)と計算効率(15倍速い)の両面で、さまざまな設定で優れたパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2025-12-11T18:57:39Z) - TesserAct: Learning 4D Embodied World Models [66.8519958275311]
我々は、RGB-DN(RGB、Depth、Normal)ビデオのトレーニングにより、4Dワールドモデルを学ぶ。
これは従来の2次元モデルを超えるだけでなく、その予測に詳細な形状、構成、時間的変化を組み込むことで、エンボディエージェントの正確な逆動的モデルを効果的に学習することができる。
論文 参考訳(メタデータ) (2025-04-29T17:59:30Z) - 4D Gaussian Splatting: Modeling Dynamic Scenes with Native 4D Primitives [115.67081491747943]
動的3Dシーン表現と新しいビュー合成はAR/VRおよびメタバースアプリケーションの実現に不可欠である。
我々は,その基礎となる4次元体積を近似として,時間変化の異なる3次元シーンの再構成を再構成する。
ストレージのボトルネックに対処するため、メモリフットプリントを効果的に削減するいくつかのコンパクトなバリエーションを導出する。
論文 参考訳(メタデータ) (2024-12-30T05:30:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。