論文の概要: Motus2: A Self-Evolving General World Model for Dexterous Manipulation
- arxiv url: http://arxiv.org/abs/2608.30237v1
- Date: Mon, 31 Aug 2026 04:44:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.223627
- Title: Motus2: A Self-Evolving General World Model for Dexterous Manipulation
- Title(参考訳): Motus2: Dexterous Manipulationのための自己進化型汎用世界モデル
- Abstract要約: 一般的な実施エージェントは、統一されたシステム内で知覚し、予測し、行動し、評価し、改善するべきである。
我々は、デクスタラス操作のための自己進化型一般世界モデルであるMotus2を提案する。
- 参考スコア(独自算出の注目度): 44.91498765476382
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: General embodied agents should perceive, predict, act, evaluate, and improve within a unified system. World models have shown great promise in building such agents, yet existing models typically append an action output head to a world simulator, without coupling them into a closed decision-and-learning loop for policy improvement. We present Motus2, a self-evolving general world model for dexterous manipulation. Motus2 advances world modeling through model scaling and data scaling. For model scaling, a single model with shared weights exposes three control interfaces: a policy (world-action model), a simulator (action-conditioned world model), and an evaluator (value model). The policy proposes candidate action chunks, the simulator predicts their visual consequences, and the evaluator assesses the predicted outcomes. Their coupling forms a closed decision-and-learning loop for policy improvement. This formulation uses curated expert demonstrations for action learning, while failed and suboptimal interactions provide valuable evidence for dynamics modeling and value learning. For data scaling, Motus2 progresses from large-scale monocular egocentric data to synchronized stereo egocentric data, followed by robot-domain adaptation with robot trajectories and supplementary human-robot alignment data. Motus2 further studies global-autoregressive and hybrid-memory extensions of its sliding-window context, adds tactile feedback for contact-aware control, and is instantiated on a fully biomimetic platform with stereo vision, dual arms, dual dexterous hands, and tactile sensing. Together, egocentric data scaling and closed-loop general world model scaling provide a general path toward self-evolving dexterous manipulation.
- Abstract(参考訳): 一般的な実施エージェントは、統一されたシステム内で知覚し、予測し、行動し、評価し、改善するべきである。
世界モデルはそのようなエージェントを構築する上で大きな可能性を示してきたが、既存のモデルは一般的に、政策改善のための閉じた決定と学習のループにそれらを結合することなく、アクション出力ヘッドを世界シミュレータに追加する。
我々は、デクスタラス操作のための自己進化型一般世界モデルであるMotus2を提案する。
Motus2は、モデルスケーリングとデータスケーリングを通じて、世界モデリングを進歩させる。
モデルスケーリングでは、共有重みを持つ単一のモデルが、ポリシー(ワールドアクションモデル)、シミュレータ(アクション条件付きワールドモデル)、評価器(バリューモデル)の3つのコントロールインターフェースを公開する。
このポリシーは、候補となるアクションチャンクを提案し、シミュレータはそれらの視覚効果を予測し、評価器は予測結果を評価する。
彼らの結合は、政策改善のためのクローズドな決定と学習のループを形成します。
この定式化は、訓練された専門家によるデモンストレーションをアクションラーニングに用い、失敗と準最適相互作用は、ダイナミクスモデリングとバリューラーニングの貴重な証拠を提供する。
データスケーリングでは、Motus2は大規模モノクル・エゴセントリックデータから同期ステレオ・エゴセントリックデータへと進歩し、続いてロボット・トランジェクトリーと補足的な人間・ロボットアライメントデータによるロボット・ドメイン適応が続く。
Motus2はさらに、そのスライドウインドウコンテキストのグローバル自動およびハイブリッドメモリ拡張を研究し、接触認識制御のための触覚フィードバックを追加し、ステレオビジョン、デュアルアーム、デュアルデキスタラスハンド、触覚センサーを備えた完全な生体模倣プラットフォーム上でインスタンス化されている。
エゴセントリックなデータスケーリングとクローズドループの一般世界モデルスケーリングは、自己進化的なデキスタラスな操作への一般的な道筋を提供する。
関連論文リスト
- Predicting Consequences and Reinforcing Navigation Policies with Latent World Models [31.865100130203317]
ロボットナビゲーションのためのLWM(Latent World Model)を提案する。
我々の重要な洞察は、空間的近接は潜在的特徴の類似性と相関し、潜在的空間において行動結果を直接評価できるということである。
提案手法は,予測精度,ポリシー学習,実世界のナビゲーション性能において,前世界モデルと模倣学習法を著しく上回っている。
論文 参考訳(メタデータ) (2026-08-23T11:58:42Z) - Learning Transferable Dynamics Priors from Action to World Modeling [22.976971391971617]
本研究では,ロボット学習のための移動可能なダイナミクスを学習するスケーラブルな方法として,行動条件付き世界モデリングについて検討する。
アクションがどのように視覚的なシーンの進化を駆動するかを予測するためのモデルを事前訓練することにより、結果の世界モデルは、外観レベルのビデオ生成を超えた再利用可能なインタラクションのダイナミクスをキャプチャする。
シミュレーションベンチマークと実ロボット設定による実験は、アクション条件付きワールドモデル事前学習が転送可能なダイナミクスを先行することを示す。
論文 参考訳(メタデータ) (2026-06-28T17:01:55Z) - WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform [130.8118909583659]
本稿では,世界モデル評価のための拡張ベンチマークであるWorldArena 2.0を紹介する。
WorldArena 2.0は、モダリティ、機能、プラットフォームという3つの次元で、具現化された世界モデルの評価を体系的に拡張する。
WorldArena 2.0は、標準化されたプロトコルの下で、知覚品質、インタラクティブなユーティリティ、クロスプラットフォームのパフォーマンスを包括的に評価する。
論文 参考訳(メタデータ) (2026-05-18T06:18:21Z) - HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models [58.191567345416836]
世界行動モデル(WAM)は、物理力学のモデリングによるロボット制御のための有望なパラダイムとして登場した。
HarmoWAMは、予測と反応の制御を統一するために世界モデルを完全に活用し、一般的なトランジットと正確な操作を可能にする。
実世界の6つのロボットタスクにまたがる3つのトレーニング未確認テスト環境を構築し、背景、位置、オブジェクトの意味のバリエーションをカバーした。
論文 参考訳(メタデータ) (2026-05-11T17:59:56Z) - MotuBrain: An Advanced World Action Model for Robot Control [23.733029557644354]
We present MotuBrain, a unified World Action Model that jointly model video and action under a UniDiffuser formulation。
単一のモデルは、ポリシー学習、世界モデリング、ビデオ生成、逆ダイナミクス、共同ビデオアクション予測をサポートする。
Motus上に構築されているMotuBrainは、言語と相互作用の結合を強くするための独立したテキストストリームである、統一されたマルチビューモデリングも導入している。
我々の推論スタックは、ステップの削減、コンパイル、FP8量子化、DiTキャッシュ、V2Aスタイルのアクション専用推論、リアルタイムチャンククループ実行を組み合わせたものです。
論文 参考訳(メタデータ) (2026-04-30T12:34:44Z) - Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond [209.35045331678043]
2つの軸に沿って組織された「レベルx法」の分類を導入します。
第一に、3つの能力レベルを定義している: 1段階の局所遷移演算子を学ぶL1 Predictor、それらをドメインの法則を尊重する多段階のアクション条件付きロールアウトに構成するL2 Simulator、新しいエビデンスに対して予測が失敗すると自己のモデルを自動で修正するL3 Evolver。
我々は400以上の作品を合成し、モデルに基づく強化学習、ビデオ生成、WebおよびGUIエージェント、マルチエージェント社会シミュレーション、AIによる科学的発見にまたがる100以上の代表システムを要約する。
論文 参考訳(メタデータ) (2026-04-24T17:48:47Z) - Causal World Modeling for Robot Control [56.31803788587547]
ビデオワールドモデルは、アクションと視覚力学の因果関係を理解することによって、近い将来に想像できる能力を提供する。
本稿では,フレーム予測とポリシ実行を同時に学習する自動回帰拡散フレームワークLingBot-VAを紹介する。
シミュレーションベンチマークと実世界のシナリオの両方でモデルを評価したところ、長距離操作、ポストトレーニングにおけるデータ効率、新しい構成への強力な一般化性などに大きな可能性を示唆している。
論文 参考訳(メタデータ) (2026-01-29T17:07:43Z) - Motus: A Unified Latent Action World Model [31.62340897751899]
我々は、既存の一般的な事前学習モデルとリッチで共有可能な動き情報を活用する統合潜在行動世界モデルであるMotusを提案する。
実験により、Motusはシミュレーションと実世界のシナリオの両方において最先端の手法に対して優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-12-15T06:58:40Z) - A Comprehensive Survey on World Models for Embodied AI [14.457261562275121]
エンボディードAIは、アクションがどのように将来の世界国家を形作るかを理解し、行動し、予測するエージェントを必要とする。
この調査は、組み込みAIにおける世界モデルのための統一されたフレームワークを示す。
論文 参考訳(メタデータ) (2025-10-19T07:12:32Z) - DrivingDojo Dataset: Advancing Interactive and Knowledge-Enriched Driving World Model [65.43473733967038]
私たちは、複雑な駆動ダイナミクスを備えたインタラクティブな世界モデルのトレーニング用に作られた最初のデータセットであるDrivingDojoを紹介します。
私たちのデータセットには、完全な運転操作、多様なマルチエージェント・インタープレイ、豊富なオープンワールド運転知識を備えたビデオクリップが含まれています。
論文 参考訳(メタデータ) (2024-10-14T17:19:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。