論文の概要: LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies
- arxiv url: http://arxiv.org/abs/2606.15768v1
- Date: Sun, 14 Jun 2026 12:06:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:33.835069
- Title: LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies
- Title(参考訳): LaWAM:高能率ダイナミクス対応ロボットのための潜在世界行動モデル
- Abstract要約: ラワント・アクション条件付きラワント・ワールドモデル(LaWM)を提案する。
LaWAMは、将来のビデオの再構成ではなく、コンパクトで潜伏した視覚サブゴールを通じて、ロボットポリシーに対する予測ダイナミクスを公開する。
LaWAMはアクションチャンク予測あたり187msで動作し、画素空間のWAMよりも最大24倍の遅延時間を実現する。
- 参考スコア(独自算出の注目度): 31.88655699486955
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action models (VLAs) leverage large-scale vision-language pretraining for semantic robot control, but often lack explicit foresight into how robot actions change the scene. World-Action Models (WAMs) address this limitation by conditioning policies on predicted futures, yet existing approaches typically rely on computationally expensive video generation with substantial pixel-level redundancy. We present LaWAM, a Latent World Action Model that exposes predictive dynamics to robot policies through compact latent visual subgoals instead of reconstructed future video. At the core of LaWAM is a latent-action-conditioned Latent World Model (LaWM). We obtain LaWM by training a latent action model in the latent space of a pretrained vision foundation model and repurposing its forward decoder to predict future observation features for scene evolution. LaWAM then conditions action generation on these predicted latent visual subgoals to enable dynamics-aware robot control. LaWAM achieves state-of-the-art or competitive success rates (SRs) across LIBERO (98.6% SR), RoboTwin (91.22% SR), and real-world manipulation tasks while retaining low-latency inference. LaWAM runs in 187 ms per action-chunk prediction and achieves up to 24x lower wall-clock latency than pixel-space WAMs.
- Abstract(参考訳): VLA(Vision-Language-Action Model)は、セマンティックロボット制御のために大規模な視覚言語事前訓練を利用するが、ロボットのアクションがシーンをどう変えるかを明確には見当たらないことが多い。
World-Action Models (WAMs) は、予測される将来についてポリシーを条件付けることでこの制限に対処するが、既存のアプローチは通常、かなりのピクセルレベルの冗長性を持つ計算コストの高いビデオ生成に依存している。
本稿では,遅延世界行動モデルであるLaWAMについて述べる。
LaWAMの中核にはLaWM(Latent-action-conditioned Latent World Model)がある。
我々は、事前訓練された視覚基盤モデルの潜在空間における潜時行動モデルを訓練し、その前方デコーダを再生して、シーン進化の将来の観察特徴を予測することでLaWMを得る。
するとLaWAMは、これらの予測された潜在視覚サブゴールにアクション生成を条件付け、ダイナミックス対応ロボット制御を可能にする。
LaWAMはLIBERO (98.6% SR)、RoboTwin (91.22% SR)、そして低遅延推論を維持しながら現実世界の操作タスクを達成している。
LaWAMはアクションチャンク予測あたり187msで動作し、画素空間のWAMよりも最大24倍の遅延時間を実現する。
関連論文リスト
- LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models [14.629670168049984]
本稿では,映像のブリッジ前処理と低レベル動作の具体的表現として,動作整列潜時ダイナミクスを提案する。
意味再構成と実動作アライメントを訓練した潜在ダイナミクスモデルと、変換器の混合として構築されたワールドダイナミクスアクションモデル(MoT)を組み合わせたLD4WAMを提案する。
LD4WAMは、5000時間以上の人間とロボットのデータの統合データセットに基づいて、RoboTwinシミュレーションや、グリッパーと器用な両手を備えた本物のロボット上で、強力に動作します。
論文 参考訳(メタデータ) (2026-08-23T13:09:30Z) - DELE-w0.5: Inferring Action from Future Latent State for Robotic Manipulation [11.665741844323984]
我々は、ビデオ生成がワールドアクションモデリングの不要な目的であると主張している。
ロボット操作においては、世界モデルの目的は、中間の瞬間に世界がどのように見えるかを再現するのではなく、アクションの実行後に世界が到達する状態を予測することである。
本稿では,映像生成に頼らずに将来予測状態からロボット動作を推定するDELE-w0.5を提案する。
論文 参考訳(メタデータ) (2026-08-22T18:17:36Z) - GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch [66.7936140772745]
本稿では,より効率的なロボット制御を目的としたアクション中心型WAMであるGigaWorld-Policy-0.5を紹介する。
効率的な推論のために、GigaWorld-Policy-0.5はMixture-of-Transformersアーキテクチャを導入している。
GigaWorld-Policy-0.5は,ロボット制御の推論効率を向上しつつ,将来の視覚力学のトレーニング効果を保っている。
論文 参考訳(メタデータ) (2026-07-15T15:46:42Z) - WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos [38.959415159248046]
WALAは、アクションラベル付きデモとアクションフリービデオの両方から実行可能な潜在アクションを学ぶためのフレームワークである。
WALAはRoboTwin上で高いパフォーマンスを実現し,RoboCasa上での最先端の成果を平均75.2%で実現している。
論文 参考訳(メタデータ) (2026-07-13T11:02:04Z) - RotVLA: Rotational Latent Action for Vision-Language-Action Model [54.22746299071677]
本稿では,連続的な回転潜在動作表現に基づくVLAフレームワークであるRotVLAを紹介する。
潜在作用はSO(n) の元としてモデル化され、連続性、構成性、および実世界の作用力学と整合した構造的幾何学を提供する。
RotVLAはVLMバックボーンとフローマッチングアクションヘッドで構成される。
論文 参考訳(メタデータ) (2026-05-13T11:58:02Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA [72.9197085473598]
DIALはハイレベルな意思決定と低レベルなモーター実行を、差別化可能な潜在意図ボトルネックを通じてブリッジするフレームワークである。
VLMベースのSystem-2は、VLMのネイティブな特徴空間内で、潜伏した視覚的フォレストによって潜伏世界モデリングを行う。
軽量のSystem-1ポリシーでは、この予測された意図と現在の観測結果を正確にロボットの動作にデコードする。
論文 参考訳(メタデータ) (2026-03-31T15:02:27Z) - Do World Action Models Generalize Better than VLAs? A Robustness Study [25.418384276142223]
視覚言語アクション(VLA)は、様々なロボットタスクで顕著な成功を収めた。
世界行動モデル(WAM)は、将来の状態を予測するために大量のビデオデータに基づいて訓練された世界モデルに基づいて構築される。
LIBERO-Plus と RoboTwin 2.0-Plus のベンチマークにおいて,様々な視覚的・言語的摂動による性能評価を行った。
論文 参考訳(メタデータ) (2026-03-23T15:13:15Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs [5.109732854501585]
そこで我々は,事前学習したインターネットスケールのビデオモデルと,その潜在表現に条件付けされたフローマッチングに基づくアクションデコーダを組み合わせた,新しいビデオ・アクション・モデル(VAM)を提案する。
提案手法は,シミュレーションおよび実世界のロボット操作タスクにおける最先端性能を実現し,サンプル効率を10倍,収束速度を2倍向上させる。
論文 参考訳(メタデータ) (2025-12-17T18:47:31Z) - Latent Action Pretraining from Videos [156.88613023078778]
一般行動モデル(LAPA)のための潜在行動事前訓練について紹介する。
LAPA(英: LAPA)は、VLA(Vision-Language-Action)モデルに接地型ロボットアクションラベルを含まない教師なしの訓練方法である。
本稿では,ロボットアクションラベルを持たないインターネット規模のビデオから学習する手法を提案する。
論文 参考訳(メタデータ) (2024-10-15T16:28:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。