論文の概要: ABot-M0.5: Unified Mobility-and-Manipulation World Action Model
- arxiv url: http://arxiv.org/abs/2607.00678v2
- Date: Mon, 06 Jul 2026 08:13:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 17:33:48.799451
- Title: ABot-M0.5: Unified Mobility-and-Manipulation World Action Model
- Title(参考訳): ABot-M0.5:Unified Mobility-and-Manipulation World Action Model
- Authors: Ronghan Chen, Yandan Yang, Zuojin Tang, Dongjie Huo, Tong Lin, Haoning Wu, Haoyun Liu, Yuzhi Chen, Lulu Zheng, Botai Yuan, Tianlun Li, Mingxin Wang, Dekang Qi, Bin Hu, Wei Mei, Yuze Xuan, Haolong Yang, Yanqing Zhu, Mu Xu, Zhiheng Ma, Xinyuan Chang,
- Abstract要約: ABot-M0.5は、モバイル操作には時間的粒度、アクションスペース、列車-テスト整合性の3段階のアライメントが必要であるという洞察に基づいて構築されている。
モバイルおよびきめ細かい操作ベンチマークの実験により、ABot-M0.5は、長距離タスクの成功ときめ細かい制御精度の両方において最先端の性能を達成することが示された。
- 参考スコア(独自算出の注目度): 27.262271208923995
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Mobile manipulation is a key capability for general-purpose robots, yet remains challenging for current embodied learning methods. VLA policies are typically reactive and lack explicit world modeling, while existing World Action Models (WAMs) are still poorly aligned with the structure of mobile manipulation: they operate on coarse video chunks, model entangled navigation-manipulation actions, and train inverse dynamics under supervision that does not match autoregressive inference. As a result, they often miss fine-grained contact dynamics, suffer from action-distribution conflicts, and accumulate errors over long-horizon rollouts. We propose ABot-M0.5, a new WAM built on the insight that mobile manipulation requires alignment at three levels: temporal granularity, action space, and train-test consistency. To align temporal granularity, we introduce intermediate latent actions that capture local visual state transitions and serve as an bridging action space between video latents and embodiment-specific controls. To align action space, we design a dual-level Mixture-of-Transformers architecture that disentangles both modality representations and heterogeneous action subspaces such as base movement and arm manipulation. To align inference conditions, we propose the dream-forcing training strategy that progressively trains inverse dynamics on model-predicted videos, improving train-test alignment and robustness during autoregressive prediction. Experiments on challenging mobile and fine-grained manipulation benchmarks demonstrate that ABot-M0.5 achieves state-of-the-art performance in both long-horizon task success and finegrained control accuracy. These results highlight the critical importance of granularity-aligned, action-disentangled, and inference-consistent world-action modeling.
- Abstract(参考訳): モバイル操作は汎用ロボットにとって重要な機能であるが、現在の具体的学習手法では依然として困難である。
既存のワールドアクションモデル(WAM)は、粗いビデオチャンク、モデルの絡み合ったナビゲーション操作アクション、そして自己回帰的推論にマッチしない監督下の逆ダイナミクスを訓練する。
結果として、細粒度の接触ダイナミクスを見逃し、行動分布の衝突に悩まされ、長時間のロールアウトでエラーを蓄積することが多い。
ABot-M0.5は,モバイル操作には時間的粒度,行動空間,列車-テスト整合性の3段階のアライメントが必要であるという知見に基づいて構築された新しいWAMである。
時間的粒度を調整するために,局所的な視覚状態遷移を捉える中間的潜時動作を導入し,映像潜時とエンボディメント特異的制御との間のブリッジング行動空間として機能する。
動作空間を整合させるため,二層混合変圧器アーキテクチャを設計し,基本運動やアーム操作などの不均一な動作部分空間とモダリティ表現を両立させる。
予測条件の整合を図るために,モデル予測ビデオの逆ダイナミクスを段階的に訓練し,自己回帰予測時の列車のアライメントとロバスト性を改善するドリーム強制トレーニング戦略を提案する。
モバイルおよびきめ細かい操作ベンチマークの実験により、ABot-M0.5は、長距離タスクの成功ときめ細かい制御精度の両方において最先端の性能を達成することが示された。
これらの結果は、粒度整合性、アクション不整合性、および推論一貫性のある世界行動モデリングの重要性を浮き彫りにしている。
関連論文リスト
- Local Motion Matters: A Deconstruct-Recompose Paradigm for Reinforcement Learning Pre-training from Videos [30.202149567220356]
既存の方法は通常、エージェントを不可分な実体として扱い、世界中の動きパターンをモデル化する。
本稿では,移動可能な局所運動表現を学習するためのデコンストラクト・コンストラクト・パラダイムを提案する。
本手法は, 多様なロボット制御・操作タスクに効果的に移行し, 試料効率と性能を大幅に向上させる。
論文 参考訳(メタデータ) (2026-07-01T11:36:27Z) - Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation [17.392786435444062]
我々は,1台の自家用カメラから自律型ヒューマノイドロコマニピュレーションを駆動するリアルタイムWAMであるMotionWAMを紹介する。
3段階の学習フレームワークは、ビデオワールドモデルをエゴセントリックな視覚力学に徐々に適応させる。
論文 参考訳(メタデータ) (2026-06-08T08:50:14Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models [58.191567345416836]
世界行動モデル(WAM)は、物理力学のモデリングによるロボット制御のための有望なパラダイムとして登場した。
HarmoWAMは、予測と反応の制御を統一するために世界モデルを完全に活用し、一般的なトランジットと正確な操作を可能にする。
実世界の6つのロボットタスクにまたがる3つのトレーニング未確認テスト環境を構築し、背景、位置、オブジェクトの意味のバリエーションをカバーした。
論文 参考訳(メタデータ) (2026-05-11T17:59:56Z) - AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps [7.710034405765985]
AIMは、明示的な空間的インターフェースを通じてこのギャップを橋渡しする意図認識の統一世界行動モデルである。
事前訓練されたビデオ生成モデルに基づいて構築されたAIMは、共有変換器アーキテクチャ内の将来の観測と値マップを共同でモデル化する。
RoboTwin 2.0ベンチマークの実験では、AIMは平均94.0%の成功率に達し、以前の統合された世界行動ベースラインを著しく上回っている。
論文 参考訳(メタデータ) (2026-04-13T07:48:58Z) - FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation [50.39748673817223]
本稿では,ロボットビデオ生成における明示的な動作パラメータを完全に活用する2つのトレーニング不要な推論時間手法を提案する。
第一に、アクションスケールの分類器フリーガイダンスは、動作の大きさに比例して誘導強度を動的に調整し、運動強度に対する制御性を高める。
第二に、アクションスケールノイズトランケーションは、初期サンプルノイズの分布を調整し、所望の運動力学とよりよく一致させる。
論文 参考訳(メタデータ) (2025-09-29T03:30:40Z) - Pixel Motion Diffusion is What We Need for Robot Control [38.925028601732116]
DAWNは言語条件のロボット操作のための統合拡散ベースのフレームワークである。
高レベルの動き意図と低レベルのロボット動作を、構造化されたピクセルの動き表現を介してブリッジする。
DAWNは、挑戦的なCALVINベンチマークで最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-09-26T17:59:59Z) - Dexplore: Scalable Neural Control for Dexterous Manipulation from Reference-Scoped Exploration [58.4036440289082]
ハンドオブジェクトモーションキャプチャ(MoCap)は、大規模でコンタクトに富んだデモと、器用なロボットスコープの約束を提供する。
Dexploreは、リポジトリとトラッキングを実行し、MoCapから直接ロボット制御ポリシーを学習する、統一された単一ループ最適化である。
論文 参考訳(メタデータ) (2025-09-11T17:59:07Z) - Physical Autoregressive Model for Robotic Manipulation without Action Pretraining [65.8971623698511]
我々は、自己回帰ビデオ生成モデルを構築し、物理自己回帰モデル(PAR)を提案する。
PARは、アクション事前トレーニングを必要とせず、物理力学を理解するために、ビデオ事前トレーニングに埋め込まれた世界の知識を活用する。
ManiSkillベンチマークの実験は、PARがPushCubeタスクで100%の成功率を達成したことを示している。
論文 参考訳(メタデータ) (2025-08-13T13:54:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。