論文の概要: Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models
- arxiv url: http://arxiv.org/abs/2607.04546v1
- Date: Sun, 05 Jul 2026 23:29:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.97678
- Title: Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models
- Title(参考訳): Mask2Real-WM:制御可能なデキスタス世界モデルのためのSim-to-Realブリッジとしてのセグメンテーションマスク
- Authors: Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann,
- Abstract要約: Mask2Real-WMは、デクスタラス操作のためのアクション条件付き世界モデルである。
ダイナミクスモデルは、過去のマスクと23-DoFアクションシーケンスから将来のセグメンテーションマスクを予測する。
レンダリングモデルは、予測されたマスクを、コントロールネット拡張安定ビデオ拡散バックボーンを用いて、フォトリアリスティックなRGBにマッピングする。
- 参考スコア(独自算出の注目度): 9.363412416851231
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Action-conditioned world models allow robots to predict the future consequences of candidate actions without additional physical interaction, supporting policy evaluation, planning, and data augmentation. We present Mask2Real-WM, a two-stage action-conditioned world model for dexterous manipulation that decouples pixel prediction into a dynamics model and a rendering model. The dynamics model predicts future segmentation masks from past masks and 23-DoF action sequences. The rendering model maps the predicted masks to photorealistic RGB using a ControlNet-augmented Stable Video Diffusion backbone. The smaller sim-to-real gap in segmentation space enables the dynamics model to benefit from large-scale pretraining on over 50 h of synthetic simulation data, followed by fine-tuning on fewer than 2.5 h of real demonstrations. Experiments on a dexterous pick-and-place benchmark show that mask conditioning and simulation pretraining are both required for per-DoF action controllability across all 23 degrees of freedom. In contrast, monolithic baselines capture broad hand and end-effector trajectories but do not reliably reflect fine-grained, per-joint action effects.
- Abstract(参考訳): アクション条件付き世界モデルは、追加の物理的相互作用なしにロボットが将来の行動の結果を予測することを可能にし、ポリシー評価、計画、データ拡張をサポートする。
本稿では,2段階の動作条件付き世界モデルであるMask2Real-WMを紹介し,ピクセル予測を動的モデルとレンダリングモデルに分解する。
ダイナミクスモデルは、過去のマスクと23-DoFアクションシーケンスから将来のセグメンテーションマスクを予測する。
レンダリングモデルは、予測されたマスクを、コントロールネット拡張安定ビデオ拡散バックボーンを用いて、フォトリアリスティックなRGBにマッピングする。
セグメンテーション空間におけるより小さなsim-to-realギャップにより、動的モデルは50h以上の合成シミュレーションデータに対して大規模な事前トレーニングの恩恵を受けることができ、続いて2.5h以下の実演を微調整することができる。
厳密なピック・アンド・プレイス・ベンチマークの実験では、マスク条件付けとシミュレーション事前訓練の両方が、23自由度すべてにわたってDoFごとのアクション制御に必要であることが示されている。
対照的に、モノリシックなベースラインは、広い手と端のエフェクター軌道を捉えるが、きめ細かな、接合部ごとの作用効果を確実に反映しない。
関連論文リスト
- From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks [54.32016216994156]
本稿では,DINOv3特徴を生成対象として用い,視覚ノイズから相互作用意味を乱す因果潜在世界モデル(CLWM)を提案する。
メモリスケーリングを克服するため、CLWMはDual-State Test-Time Training (TTT)メモリを備えている。
EmbodiChainは、トレーニング中に物理基底軌道の無限の流れを注入することによって効率法を確立するオンラインフレームワークである。
論文 参考訳(メタデータ) (2026-04-13T03:19:36Z) - Masked Modeling for Human Motion Recovery Under Occlusions [21.05382087890133]
MoRoは、ビデオコンディショニングタスクとしてモーション再構成を定式化する、エンドツーエンドの生成フレームワークである。
MoRoは、1つのH200 GPU上で70FPSのリアルタイム推論を実現する。
論文 参考訳(メタデータ) (2026-01-22T16:22:20Z) - Understanding and Enhancing Mask-Based Pretraining towards Universal Representations [13.262679155411599]
マスクをベースとした事前訓練は、言語、視覚、生物学にまたがる近代的な大規模モデルの基盤となっている。
マスクによる事前学習の動作は,高次元最小ノルム(リッジレス)線形回帰におけるテストリスクによって直接的に特徴付けられることを示す。
我々はRandomly Random Mask Auto (R$2$MAE)を提案する。
論文 参考訳(メタデータ) (2025-09-25T22:08:25Z) - Physical Autoregressive Model for Robotic Manipulation without Action Pretraining [65.8971623698511]
我々は、自己回帰ビデオ生成モデルを構築し、物理自己回帰モデル(PAR)を提案する。
PARは、アクション事前トレーニングを必要とせず、物理力学を理解するために、ビデオ事前トレーニングに埋め込まれた世界の知識を活用する。
ManiSkillベンチマークの実験は、PARがPushCubeタスクで100%の成功率を達成したことを示している。
論文 参考訳(メタデータ) (2025-08-13T13:54:51Z) - Vidar: Embodied Video Diffusion Model for Generalist Manipulation [28.216910600346512]
Vidarは、ほとんどのエンボディメント固有のデータを転送可能なビデオに置き換える、事前駆動のローショット適応パラダイムである。
以上の結果から,強力で安価なビデオプリエントと最小限のオンロボットアライメントという,“先行的かつ多数の実施”のためのスケーラブルなレシピが示唆された。
論文 参考訳(メタデータ) (2025-07-17T08:31:55Z) - MF-VITON: High-Fidelity Mask-Free Virtual Try-On with Minimal Input [69.33864837012202]
本研究では,一人のイメージとターゲット衣服のみを用いて,現実的なVITONを実現するMask-Free VITONフレームワークを提案する。
既存のMaskベースのVITONモデルを利用して高品質なデータセットを合成する。
このデータセットには、多様で現実的な人物画像とそれに対応する衣服が含まれており、背景も様々で、現実世界のシナリオを模倣している。
論文 参考訳(メタデータ) (2025-03-11T17:40:59Z) - MaskGWM: A Generalizable Driving World Model with Video Mask Reconstruction [8.503246256880612]
ビデオマスク再構成を具現化した一般化可能な世界モデルであるMaskGWMを提案する。
本モデルには,長期水平予測に着目したMaskGWM-longと,マルチビュー生成専用のMaskGWM-mviewの2種類が含まれている。
論文 参考訳(メタデータ) (2025-02-17T10:53:56Z) - Masked Autoencoding for Scalable and Generalizable Decision Making [93.84855114717062]
MaskDPは、強化学習と行動クローンのためのシンプルでスケーラブルな自己教師付き事前学習手法である。
我々は,MaskDPモデルにより,単一ゴールや複数ゴール到達といった新しいBCタスクへのゼロショット転送能力が得られることを発見した。
論文 参考訳(メタデータ) (2022-11-23T07:04:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。