論文の概要: DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation
- arxiv url: http://arxiv.org/abs/2608.20114v2
- Date: Fri, 21 Aug 2026 10:04:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:31.986482
- Title: DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation
- Title(参考訳): DECOWAM:Legged Mobile ManipulationのためのWhole-Body World-Action Modelの分離
- Authors: Siyuan Ma, Boshi Zhang, Yutian Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Qiaojun Yu,
- Abstract要約: DeCOWAMは、カメラのエゴモーションをベースアクションとアームアクションとを分離する全身世界アクションモデルである。
固定されたリプレイプロトコルでは、DECWAMはFastWAM上での将来のビデオとアクションの予測を改善し、25.95Mのトレーニング可能な適応パラメータでアクションMSEを21.7%削減した。
これらの結果から,運動視点下でのパラメータ効率のよい共同視覚予測と全身制御を支援することが示唆された。
- 参考スコア(独自算出の注目度): 9.154987050049268
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mobile manipulation requires a robot to predict how locomotion and arm motion jointly alter future observations and control. Existing world-action models, developed largely for fixed-base platforms, do not explicitly distinguish camera ego-motion from base and arm actions. Here we introduce DECOWAM, a whole-body world-action model that separates these factors through dedicated conditional interfaces. DECOWAM freezes an adapted FastWAM backbone and trains residual adapters, an action-equivalent future bottleneck distilled from privileged observations, adversarially separated base and arm latents, and base-velocity conditioning for video prediction. We further introduce ARMDOG, a real-robot dataset that synchronizes video, whole-body state and action, and language. On a fixed replay protocol, DECOWAM improved both future-video and action prediction over FastWAM, reducing action MSE by 21.7% with 25.95M trainable adaptation parameters. Across 79 closed-loop trials per method, it achieved the highest observed whole-body coordination and base-displacement robustness among the compared systems, while task completion remained comparable to the strongest baseline. These results show that embodiment-aware factorization can support parameter-efficient joint visual prediction and whole-body control under moving viewpoints.
- Abstract(参考訳): 移動操作では、ロボットが移動と腕の動きが将来の観察と制御をどう変えるかを予測する必要がある。
既存のワールドアクションモデルは、主に固定ベースプラットフォーム向けに開発されており、カメラのエゴモーションをベースアクションとアームアクションとを明確に区別していない。
ここでは,これらの要素を専用インタフェースで分離する,全身のワールドアクションモデルであるDECWAMを紹介する。
DECOWAMは適応されたFastWAMバックボーンを凍結し、残留アダプタを訓練する。
さらに、ビデオ、全身の状態と動作、言語を同期するリアルロボットデータセットであるARMDOGを紹介します。
固定されたリプレイプロトコルでは、DECWAMはFastWAM上での将来のビデオとアクションの予測を改善し、25.95Mのトレーニング可能な適応パラメータでアクションMSEを21.7%削減した。
79回のクローズドループ試験では、最強のベースラインに匹敵するタスク完了を保ちながら、最も観測された全身調整とベース変位の堅牢性を達成した。
これらの結果から,運動視点下でのパラメータ効率のよい共同視覚予測と全身制御を支援することが示唆された。
関連論文リスト
- SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation [35.54319311306262]
SLIM はコンパクトな潜在相互作用ポリシーである。
自己教師付きマスク付き軌道予測を通じて表現を学習する。
SLIMは、より少ないパラメータで、大規模なVLAとワールドアクションモデルベースラインとを一致または超える。
論文 参考訳(メタデータ) (2026-08-10T15:58:39Z) - MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight [30.838499233332684]
MobileWAMは、トレーニング済みのビデオ拡散トランスフォーマーと軽量アクションエキスパートを融合したトランスフォーマーアーキテクチャである。
MobileWAMは、ManiSkill-HABとファインチューニングに関する最先端のモバイル操作ポリシーを、本物のARX Lift2モバイルマニピュレータに超越している。
論文 参考訳(メタデータ) (2026-08-05T10:12:37Z) - Overcoming Statistical Bias in Action-Controllable World Models [18.890337378174678]
アクション条件付き世界モデルは、エージェントのアクションの下で視覚環境がどのように進化するかを予測することを目的としている。
将来のフレームは、しばしば視覚的慣性や反復的な動きパターンから非常に予測可能である。
アクション制御性を高めるために,CoCoという対実整合性フレームワークを紹介した。
論文 参考訳(メタデータ) (2026-08-05T10:10:36Z) - ABot-M0.5: Unified Mobility-and-Manipulation World Action Model [27.262271208923995]
ABot-M0.5は、モバイル操作には時間的粒度、アクションスペース、列車-テスト整合性の3段階のアライメントが必要であるという洞察に基づいて構築されている。
モバイルおよびきめ細かい操作ベンチマークの実験により、ABot-M0.5は、長距離タスクの成功ときめ細かい制御精度の両方において最先端の性能を達成することが示された。
論文 参考訳(メタデータ) (2026-07-01T09:21:20Z) - Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation [80.18527639791074]
世界アクションモデルは、自動運転と都市ナビゲーションに非常に有望だ。
既存のアプローチには、重要な制限がある。
我々は,映像生成とアクション予測を分離するエンドツーエンドのWAMフレームワークであるMetisを提案する。
論文 参考訳(メタデータ) (2026-06-14T15:40:49Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models [58.191567345416836]
世界行動モデル(WAM)は、物理力学のモデリングによるロボット制御のための有望なパラダイムとして登場した。
HarmoWAMは、予測と反応の制御を統一するために世界モデルを完全に活用し、一般的なトランジットと正確な操作を可能にする。
実世界の6つのロボットタスクにまたがる3つのトレーニング未確認テスト環境を構築し、背景、位置、オブジェクトの意味のバリエーションをカバーした。
論文 参考訳(メタデータ) (2026-05-11T17:59:56Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - Physical Autoregressive Model for Robotic Manipulation without Action Pretraining [65.8971623698511]
我々は、自己回帰ビデオ生成モデルを構築し、物理自己回帰モデル(PAR)を提案する。
PARは、アクション事前トレーニングを必要とせず、物理力学を理解するために、ビデオ事前トレーニングに埋め込まれた世界の知識を活用する。
ManiSkillベンチマークの実験は、PARがPushCubeタスクで100%の成功率を達成したことを示している。
論文 参考訳(メタデータ) (2025-08-13T13:54:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。