論文の概要: Magic-W0: A Structured World-Action Foundation Model for Physical Intelligence
- arxiv url: http://arxiv.org/abs/2609.39870v2
- Date: Sat, 03 Oct 2026 14:49:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.472548
- Title: Magic-W0: A Structured World-Action Foundation Model for Physical Intelligence
- Title(参考訳): Magic-W0:物理インテリジェンスのための構造化ワールド・アクション・ファンデーションモデル
- Abstract要約: 我々は、構造化された物理的状態の進化と連続的な動作を共同でモデル化する世界行動基盤モデルMagic-W0を紹介する。
現在の状態は、視覚言語コンテキストと現在の3D幾何を組み合わせたものであり、遷移は3Dモーションで表される。
将来の状態は、タスク関連の結果を記述する将来のセマンティックスによって表現される。
- 参考スコア(独自算出の注目度): 15.387507304280179
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World-action models (WAMs) augment robot policies with action-conditioned environment dynamics, yet existing approaches largely rely on future observation reconstruction or generic latent prediction and lack structured, control-oriented world representations tightly coupled with action generation. We introduce Magic-W0, a world-action foundation model that jointly models structured physical state evolution and continuous actions. Magic-W0 represents interaction as a Structured World Transition consisting of Current State, Transition, and Future State. Current State combines vision-language context with Current 3D Geometry; Transition is represented by 3D Motion capturing action-induced three-dimensional changes; and Future State is represented by Future Semantics describing task-relevant outcomes. To couple prediction and control, we propose a layer-aligned world-action interaction architecture in which evolving action hypotheses condition world-transition prediction, while predicted world representations continuously inform action generation. Magic-W0 is pre-trained on large-scale egocentric human manipulation, UMI, real-robot, and simulation data, with latent supervision for geometry, 3D motion, and future semantics from pre-trained visual models. Inference-time interventions show that structured world representations respond systematically to changes in candidate actions and that action-related information propagates through shared 3D representations into future semantic predictions. On RoboDojo-Sim, Magic-W0 achieves an average Score of 27.10, the highest among the compared WAMs. Across multiple real-robot tasks, it also demonstrates strong downstream performance after fine-tuning with limited downstream data, supporting generalization and rapid adaptation.
- Abstract(参考訳): 世界行動モデル(WAM)は、アクション条件付き環境力学によるロボットポリシーを強化するが、既存のアプローチは、将来の観察の再構築や一般的な潜伏予測に大きく依存しており、構造化された制御指向の世界表現がアクション生成と密結合している。
我々は、構造化された物理的状態の進化と連続的な動作を共同でモデル化する世界行動基盤モデルMagic-W0を紹介する。
Magic-W0は、現在の状態、遷移状態、将来の状態からなる構造化世界遷移として相互作用を表す。
現在の状態は、視覚言語コンテキストと現在の3次元幾何学を結合し、トランジッションは3次元モーションキャプチャーで表現され、Future Stateはタスク関連結果を記述するFuture Semanticsによって表現される。
予測と制御を両立させるため,進化的行動が状態遷移予測を仮定し,予測的世界表現が連続的に行動生成を通知する階層的世界行動相互作用アーキテクチャを提案する。
Magic-W0は、大規模な人間操作、UMI、実ロボット、シミュレーションデータに基づいて事前トレーニングされており、幾何学、3Dモーション、および事前トレーニングされた視覚モデルからの将来のセマンティクスを監督している。
推論時間の介入は、構造化された世界表現が候補行動の変化に体系的に反応し、行動関連情報が共有された3D表現を通して将来の意味予測へと伝播することを示す。
RoboDojo-Simでは、Magic-W0の平均スコアは27.10で、比較したWAMの中で最高である。
複数の実ロボットタスクにまたがって、ダウンストリームデータに制限のある微調整を行い、一般化と迅速な適応をサポートすることにより、ダウンストリームのパフォーマンスも向上する。
関連論文リスト
- Devol-ONE: One Autoregressive Mixture of Transformers to Unify Vision-Language-Action and Latent World Modeling [0.7329200485567826]
本稿では,視覚言語理解,潜在世界ダイナミクス予測,行動生成をひとつの自己回帰フレームワーク内で統合するトランスフォーマーアーキテクチャであるDevol-ONEを提案する。
LIBERO, LIBERO-PLUS, RoboTwin2.0およびFlexivのシングルアームとデュアルアームの実際の評価を行った。
論文 参考訳(メタデータ) (2026-09-26T03:35:15Z) - Future Dynamic 3D Reconstruction: A 3D World Model with Disentangled Ego-Motion [69.61280478695205]
本研究では,将来の動的3次元再構成のための3次元潜在表現を予測する世界モデルFR3Dを提案する。
実験では、FR3Dが将来的な動的3D再構成において、複数のデータセットにまたがるモノラルな観察から2秒後まで、強力なパフォーマンスを示す。
論文 参考訳(メタデータ) (2026-06-16T17:59:46Z) - Geometric Action Model for Robot Policy Learning [68.6657929619782]
汎用ロボットポリシーは、オブジェクト、カメラ、ロボットアクションが3D物理世界でどのように相互作用するかを推論しながら、ユーザーの指示に従う必要がある。
最近の視覚言語行動モデル(VLA)とビデオ世界行動モデル(WAM)は、大規模基盤モデルから強い意味や時間的先行を継承する。
本稿では,言語条件の操作ポリシーであるGeometric Action Model (GAM)を提案する。
論文 参考訳(メタデータ) (2026-06-15T17:58:03Z) - GWM: Towards Scalable Gaussian World Models for Robotic Manipulation [53.51622803589185]
本稿では,ロボット操作のための世界モデルGawssian World Model (GWM)を提案する。
中心となるのは、潜伏拡散変換器(DiT)と3次元変分オートエンコーダを組み合わせることで、微粒なシーンレベルの将来の状態復元を可能にする。
シミュレーションと実世界の実験の両方で、GWMは多様なロボットのアクションに照らされた未来のシーンを正確に予測できる。
論文 参考訳(メタデータ) (2025-08-25T02:01:09Z) - DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge [41.030494146004806]
本稿では,逆動力学モデリングを実現するために,包括的世界知識予測を統合した新しいVLAフレームワークであるDreamVLAを提案する。
DreamVLAは、動的領域誘導の世界知識予測を導入し、空間的および意味的な手がかりと統合し、アクション計画のためのコンパクトで包括的な表現を提供する。
実世界とシミュレーション環境での実験では、ドリームVLAが実際のロボットタスクで76.7%の成功率を達成したことが示されている。
論文 参考訳(メタデータ) (2025-07-06T16:14:29Z) - Hindsight for Foresight: Unsupervised Structured Dynamics Models from
Physical Interaction [24.72947291987545]
エージェントが世界と対話することを学ぶための鍵となる課題は、オブジェクトの物理的性質を推論することである。
本研究では,ラベルのない3次元点群と画像から直接,ロボットのインタラクションのダイナミクスをモデル化するための新しいアプローチを提案する。
論文 参考訳(メタデータ) (2020-08-02T11:04:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。