論文の概要: MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight
- arxiv url: http://arxiv.org/abs/2608.04657v1
- Date: Wed, 05 Aug 2026 10:12:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.821611
- Title: MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight
- Title(参考訳): MobileWAM: チェーン・オブ・フォアレストによる世界行動モデルからモバイル操作へ
- Abstract要約: MobileWAMは、トレーニング済みのビデオ拡散トランスフォーマーと軽量アクションエキスパートを融合したトランスフォーマーアーキテクチャである。
MobileWAMは、ManiSkill-HABとファインチューニングに関する最先端のモバイル操作ポリシーを、本物のARX Lift2モバイルマニピュレータに超越している。
- 参考スコア(独自算出の注目度): 29.363322444516044
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World action models (WAMs) built on video generation backbones are a rising recipe for robot learning, yet remain confined to tabletop manipulation. Mobile manipulation demands simultaneous locomotion and whole-body manipulation amid scene-scale dynamics, yet is still dominated by dynamics-blind visual encoders with hand-crafted coordination. We bridge this gap with MobileWAM, a mixture-of-transformers architecture that fuses a pretrained video diffusion transformer with a lightweight action expert through layerwise joint attention, translating internet-scale motion priors into whole-body control. To reconcile the heterogeneous dynamics of moving and manipulating, each feed-forward layer of the action expert becomes a three-expert mixture of shared, locomotion, and manipulation experts, softly routed by the motion intent in the action tokens. To densify supervision, we further propose Chain-of-Foresight (CoF): intermediate representations sequentially predict a chain of future latent chunks, each step conditioned on its predecessor. CoF pairs naturally with our decoupled video--action denoising scheme. At deployment, the WAM serves as a pure current-frame encoder; foresight acts only through gradients, so at inference the foresight chain and video generation are discarded, leaving only policy-level cost. MobileWAM surpasses state-of-the-art mobile manipulation policies on ManiSkill-HAB and fine-tunes to a real ARX Lift2 mobile manipulator across diverse tasks with strong generalization. Code will be released soon.
- Abstract(参考訳): ビデオ生成バックボーン上に構築されたワールドアクションモデル(WAM)は、ロボット学習のレシピとして盛り上がっているが、テーブルトップ操作に限られている。
モバイル操作は、シーンスケールのダイナミックスの中で、同時に移動と全身操作を要求するが、それでも手作りのコーディネーションを備えたダイナミックスブラインド視覚エンコーダが支配している。
このギャップをトランスフォーマーの混合アーキテクチャであるMobileWAMで埋める。このアーキテクチャは、事前訓練されたビデオ拡散トランスフォーマーと軽量なアクションエキスパートとを、階層的な共同注意により融合させ、インターネットスケールのモーションを全体制御に変換する。
動作と操作の不均一なダイナミクスを整合させるために、アクションエキスパートの各フィードフォワード層は、アクショントークンの動作意図によってソフトに経路される共有、移動、操作の専門家の3つの専門家混合となる。
監視を強化するために、我々はさらにChain-of-Foresight (CoF: Chain-of-Foresight)を提案する。
CoFは、分離されたビデオアクションのデノベーションスキームと自然にペアリングします。
WAMは純粋なカレントフレームエンコーダとして機能し、フォレストはグラデーションを通してのみ機能するため、フォレストチェーンとビデオ生成は破棄され、ポリシーレベルのコストのみが残る。
MobileWAMは、ManiSkill-HABとファインチューンに関する最先端のモバイル操作ポリシーを超越し、強力な一般化を伴う多様なタスクにまたがる真のARX Lift2モバイルマニピュレータへと移行する。
コードはまもなくリリースされる。
関連論文リスト
- MobileVLA-R1 2.0: RL-Enhanced Reasoning for Mobile Robot Control [63.85634404397772]
MobileVLA-R1 2.0は、移動ロボットのためのRL拡張ビジョン言語アクションフレームワークである。
教師付きChain-of-Thought(CoT)アライメントと強化学習を通じて、具体的軌道上の多粒性推論を学習する。
VLN-CE, QUARD, およびUnitree Go2およびG1ロボットへの実環境展開を網羅し, 言語誘導ナビゲーション, 四脚制御, ヒューマノイド移動操作の評価を行った。
論文 参考訳(メタデータ) (2026-09-05T20:31:14Z) - DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation [9.154987050049268]
DeCOWAMは、カメラのエゴモーションをベースアクションとアームアクションとを分離する全身世界アクションモデルである。
固定されたリプレイプロトコルでは、DECWAMはFastWAM上での将来のビデオとアクションの予測を改善し、25.95Mのトレーニング可能な適応パラメータでアクションMSEを21.7%削減した。
これらの結果から,運動視点下でのパラメータ効率のよい共同視覚予測と全身制御を支援することが示唆された。
論文 参考訳(メタデータ) (2026-08-20T14:44:11Z) - ABot-M0.5: Unified Mobility-and-Manipulation World Action Model [27.262271208923995]
ABot-M0.5は、モバイル操作には時間的粒度、アクションスペース、列車-テスト整合性の3段階のアライメントが必要であるという洞察に基づいて構築されている。
モバイルおよびきめ細かい操作ベンチマークの実験により、ABot-M0.5は、長距離タスクの成功ときめ細かい制御精度の両方において最先端の性能を達成することが示された。
論文 参考訳(メタデータ) (2026-07-01T09:21:20Z) - MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation [17.392786435444062]
我々は,1台の自家用カメラから自律型ヒューマノイドロコマニピュレーションを駆動するリアルタイムWAMであるMotionWAMを紹介する。
3段階の学習フレームワークは、ビデオワールドモデルをエゴセントリックな視覚力学に徐々に適応させる。
論文 参考訳(メタデータ) (2026-06-08T08:50:14Z) - Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data [93.7685703383343]
視覚言語モデル(VLM)は強力な汎用推論器であるが、ロボット制御ポリシーに変換することは驚くほど難しい。
このギャップは、適切な中間データで徐々にブリッジできると我々は主張する。
本研究では,タスク関連アウト・オブ・ディストリビューションETCデータと少量のアクションデータとを混合することにより,新しい視覚言語条件に一般化できることを示す。
論文 参考訳(メタデータ) (2026-06-07T08:57:51Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs [5.109732854501585]
そこで我々は,事前学習したインターネットスケールのビデオモデルと,その潜在表現に条件付けされたフローマッチングに基づくアクションデコーダを組み合わせた,新しいビデオ・アクション・モデル(VAM)を提案する。
提案手法は,シミュレーションおよび実世界のロボット操作タスクにおける最先端性能を実現し,サンプル効率を10倍,収束速度を2倍向上させる。
論文 参考訳(メタデータ) (2025-12-17T18:47:31Z) - Astra: General Interactive World Model with Autoregressive Denoising [73.6594791733982]
Astraはインタラクティブな汎用世界モデルであり、多様なシナリオのために現実世界の未来を生成する。
本稿では,自己回帰型認知型アーキテクチャを提案し,時間的因果的注意を用いて過去の観測を集約する。
Astraはインタラクティブで一貫性があり、一般的な長期的なビデオ予測を実現し、様々な形式のインタラクションをサポートする。
論文 参考訳(メタデータ) (2025-12-09T18:59:57Z) - FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation [50.39748673817223]
本稿では,ロボットビデオ生成における明示的な動作パラメータを完全に活用する2つのトレーニング不要な推論時間手法を提案する。
第一に、アクションスケールの分類器フリーガイダンスは、動作の大きさに比例して誘導強度を動的に調整し、運動強度に対する制御性を高める。
第二に、アクションスケールノイズトランケーションは、初期サンプルノイズの分布を調整し、所望の運動力学とよりよく一致させる。
論文 参考訳(メタデータ) (2025-09-29T03:30:40Z) - Precise Action-to-Video Generation Through Visual Action Prompts [62.951609704196485]
アクション駆動のビデオ生成は、精度と一般性のトレードオフに直面している。
エージェント中心のアクション信号は、クロスドメイン転送可能性のコストで精度を提供する。
私たちはアクションをドメインに依存しない表現として正確に視覚的なプロンプトに"レンダリング"します。
論文 参考訳(メタデータ) (2025-08-18T17:12:28Z) - Physical Autoregressive Model for Robotic Manipulation without Action Pretraining [65.8971623698511]
我々は、自己回帰ビデオ生成モデルを構築し、物理自己回帰モデル(PAR)を提案する。
PARは、アクション事前トレーニングを必要とせず、物理力学を理解するために、ビデオ事前トレーニングに埋め込まれた世界の知識を活用する。
ManiSkillベンチマークの実験は、PARがPushCubeタスクで100%の成功率を達成したことを示している。
論文 参考訳(メタデータ) (2025-08-13T13:54:51Z) - Diffusion Transformer Policy [48.50988753948537]
本稿では,拡散変圧器ポリシー(Diffusion Transformer Policy)と呼ばれる多モード拡散変圧器を提案し,連続的なエンドエフェクタ動作をモデル化する。
トランスのスケーリング機能を活用することで、提案手法は、多種多様なロボットデータセットにわたる継続的エンドエフェクタアクションを効果的にモデル化することができる。
論文 参考訳(メタデータ) (2024-10-21T12:43:54Z) - Puppet-Master: Scaling Interactive Video Generation as a Motion Prior for Part-Level Dynamics [79.4785166021062]
本稿では,対話型ビデオジェネレータPuppet-Masterを紹介した。
Puppet-Masterは、他のモーションコンディショニングビデオジェネレータとは異なり、パートレベルのモーションを生成することを学習している。
Puppet-Masterはドメイン外の実際のイメージを一般化し、実世界のベンチマークで既存のメソッドよりも優れています。
論文 参考訳(メタデータ) (2024-08-08T17:59:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。