論文の概要: DepthWorld: 3D World Model for Robot Manipulation
- arxiv url: http://arxiv.org/abs/2610.08780v1
- Date: Tue, 06 Oct 2026 17:59:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.163606
- Title: DepthWorld: 3D World Model for Robot Manipulation
- Title(参考訳): DepthWorld:ロボット操作のための3次元世界モデル
- Abstract要約: 現在のビデオベースのワールドモデルは、RGBだけでトレーニングされており、フレームごとに正しいように見えるが、一貫した3Dの世界に構成しないロールアウトを生成する。
我々は,学習したステレオ深度タイリングとジョイントファクターグラフを組み合わせたキャリブレーションパイプラインを導入し,同じ物理ロボットから収集したすべてのエピソードをプールする。
次に、安定なビデオ拡散に基づく世界モデルであるDepthWorldをトレーニングし、空間的タイリングによる多視点深度を共同で予測する。
- 参考スコア(独自算出の注目度): 20.098353800639902
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World models offer a data-driven alternative to traditional simulators for robotics, with applications spanning policy evaluation, improvement, and planning. All of these uses depend on faithful 3D geometry, yet current video-based world models are trained on RGB alone and produce rollouts that look correct frame-by-frame but do not compose into a consistent 3D world. Closing this gap requires progress on two fronts: large-scale 3D supervision for manipulation, and an architecture that can absorb it without disturbing strong pretrained video priors. We introduce a calibration pipeline that combines learned stereo depth with a joint factor graph, pooling all episodes collected from the same physical robot to recover its shared kinematic parameters alongside per-scene extrinsics. Applied to the DROID dataset, this yields DROID-3D, a calibrated 3D dataset providing dense metric depth and recalibrated multi-view extrinsics (achieving <0.7 px reprojection error on 90% of episodes for external cameras). We then train DepthWorld, a Stable Video Diffusion-based world model that jointly predicts multi-view RGB and depth via spatial latent tiling, leaving the pretrained Variational Autoencoder (VAE) unchanged. Depth supervision improves RGB prediction itself by +1.48 dB PSNR over an identical RGB-only baseline at equal training budget, while simultaneously yielding accurate metric depth for downstream geometric reasoning.
- Abstract(参考訳): 世界モデルは、ポリシー評価、改善、計画にまたがるアプリケーションを含む、ロボット工学の伝統的なシミュレータに代わるデータ駆動の代替を提供する。
これらはすべて忠実な3D形状に依存しているが、現在のビデオベースの世界モデルはRGBだけで訓練されており、フレームごとに正しいように見えるが、一貫した3Dの世界に構成されないロールアウトを生成する。
このギャップを埋めるには、操作のための大規模な3D監視と、それを吸収できるアーキテクチャという、2つの面での進歩が必要です。
本研究では,学習したステレオ深度とジョイントファクターグラフを組み合わせたキャリブレーションパイプラインを導入する。
DROIDデータセットに適用されたDROID-3Dは、密集したメートル法深度と再校正されたマルチビュー・エクストリンシクス(外部カメラの90%のエピソードで<0.7 px再投射誤差)を提供するキャリブレーションされた3Dデータセットである。
次に、DepthWorldをトレーニングする。DepthWorldは、安定なビデオ拡散に基づく世界モデルで、マルチビューRGBと空間潜時タイリングによる深度を共同で予測し、事前訓練された変分オートエンコーダ(VAE)は変わらない。
深さの監督は、同じトレーニング予算でRGBのみのベースライン上で+1.48 dB PSNRでRGB予測自体を改善し、同時に下流の幾何学的推論のための正確なメートル法深度を出力する。
関連論文リスト
- 3DROID: A Renderable 3D Gaussian Dataset with Measured Per-Scene Reliability [32.4257215732565]
3DGS表現は、主に測光忠実度のために設計されており、実世界の測光スケールを保存できない可能性がある。
本稿では,再現シーンをロボットのメートル法ワークスペースに固定するキャリブレーション対応パイプラインを提案する。
本稿では,ロボット操作研究のためのシーンレベルの信頼性情報を備えた,レンダリング可能な測位型データセットを提案する。
論文 参考訳(メタデータ) (2026-10-01T14:14:32Z) - RIDE: Relocalization-Informed Depth Estimation with 3D Gaussian Splatting [20.29273985020268]
本稿では,ロボットのRGBマップから深度を推定するRIDEを提案する。
実験では、深度精度が向上し、時間的整合性尺度のみの校正が可能になった。
論文 参考訳(メタデータ) (2026-09-10T04:36:58Z) - Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning [51.799524981291235]
エンドツーエンドの操作ポリシーは、汎用的で巧妙なロボット操作を約束することを示している。
2Dファンデーションモデルから2つの重要な制限を継承する。
これらの問題に対処するために、一連のコントリビューションを提示します。
論文 参考訳(メタデータ) (2026-06-01T14:01:11Z) - Robo3R: Enhancing Robotic Manipulation with Accurate Feed-Forward 3D Reconstruction [70.06600045165905]
3D空間認識は、一般的なロボット操作の基本であるが、信頼性が高く高品質な3D形状の取得は依然として困難である。
本稿では,RGB画像やロボットの状態から直接,正確な距離スケールのシーン形状をリアルタイムで予測する操作可能な3次元再構成モデルであるRobo3Rを紹介する。
我々は、ロボット操作のためのこの代替3Dセンシングモジュールの約束を示唆し、パフォーマンスの連続的な向上を観察する。
論文 参考訳(メタデータ) (2026-02-10T18:58:15Z) - UniPose: Unified Cross-modality Pose Prior Propagation towards RGB-D data for Weakly Supervised 3D Human Pose Estimation [14.52285662885727]
We present UniPose, a unified cross-modality pose before propagation method for weak supervised 3D human pose Estimation。
UniPoseは、大規模RGBデータセットから自己教師付き学習を通じて3Dドメインに2Dアノテーションを転送する。
CMU PanopticとITOPデータセットの実験は、UniPoseが完全に教師されたメソッドと同等のパフォーマンスを達成していることを示している。
論文 参考訳(メタデータ) (2025-09-27T15:49:30Z) - E3D-Bench: A Benchmark for End-to-End 3D Geometric Foundation Models [78.1674905950243]
3次元幾何学基礎モデル(GFM)の総合ベンチマークを初めて提示する。
GFMは、単一のフィードフォワードパスで密度の高い3D表現を直接予測し、スローまたは未使用のカメラパラメータを不要にする。
我々は16の最先端GFMを評価し、タスクやドメイン間の長所と短所を明らかにした。
すべてのコード、評価スクリプト、処理されたデータは公開され、3D空間インテリジェンスの研究が加速される。
論文 参考訳(メタデータ) (2025-06-02T17:53:09Z) - 3D Neural Embedding Likelihood: Probabilistic Inverse Graphics for
Robust 6D Pose Estimation [50.15926681475939]
逆グラフィックスは2次元画像から3次元シーン構造を推論することを目的としている。
確率モデルを導入し,不確実性を定量化し,6次元ポーズ推定タスクにおけるロバスト性を実現する。
3DNELは、RGBから学んだニューラルネットワークの埋め込みと深度情報を組み合わせることで、RGB-D画像からのsim-to-real 6Dオブジェクトのポーズ推定の堅牢性を向上させる。
論文 参考訳(メタデータ) (2023-02-07T20:48:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。