論文の概要: Latent evolving World Action Model
- arxiv url: http://arxiv.org/abs/2609.27455v2
- Date: Thu, 24 Sep 2026 02:37:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.346184
- Title: Latent evolving World Action Model
- Title(参考訳): 潜在進化型世界行動モデル
- Abstract要約: 世界行動モデル(WAM)における視覚的表現が行動生成に与える影響について検討する。
本稿では,JEPA埋め込みにおけるアクション生成を条件としたLeWAMを提案する。
LeWAMはRoboTwin 2.0の平均成功率は92.28%であり、最先端のVLAやWAMに匹敵する。
- 参考スコア(独自算出の注目度): 58.32634534358966
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: World Action Models (WAMs) jointly model action generation and environment dynamics and are mostly built on pretrained Video Diffusion Models (VDMs). In VDM-based WAMs, observations are first encoded by a VAE, and the resulting compressed latents are then processed by large video diffusion backbones to extract effective features for action generation. However, this paradigm ties WAM performance and training cost to large-scale video generation pretraining, limiting WAM efficiency and scalability. In this paper, we theoretically and empirically investigate how visual representations affect action generation in WAMs. Our results show that predictive embeddings from Joint-Embedding Predictive Architecture (JEPA) encoders better support action generation than compressed VAE latents, with I-JEPA performing best in our encoder comparison. Based on these findings, we propose LeWAM, which conditions action generation on JEPA embeddings and models environment evolution by predicting future embeddings in the same space, without relying on a video diffusion backbone. We further find that imitation learning matches demonstrated actions but does not distinguish better actions from worse ones, even though small action deviations can greatly affect task success. To address this limitation without additional environment interaction or the human oversight required for resets and safety, we introduce Demonstration-Guided DPO (DemoDPO), an offline preference refinement stage that derives preference supervision directly from demonstrations. With only 0.4B trainable parameters, LeWAM achieves an average success rate of 92.28\% on RoboTwin 2.0, comparable to that of state-of-the-art VLAs and WAMs, and maintains practical effectiveness on real-world manipulation tasks.
- Abstract(参考訳): World Action Models (WAM) はアクション生成と環境ダイナミクスを共同でモデル化し、主に事前訓練されたビデオ拡散モデル (VDM) 上に構築されている。
VDMベースのWAMでは、まずVAEによって観測が符号化され、圧縮された潜伏剤は大きなビデオ拡散バックボーンによって処理され、アクション生成に有効な特徴を抽出する。
しかし、このパラダイムは、WAM性能とトレーニングコストを大規模ビデオ生成事前学習に結びつけ、WAM効率とスケーラビリティを制限している。
本稿では,WAMにおける視覚表現が行動生成に与える影響を理論的・実験的に検討する。
以上の結果から,JEPAエンコーダの予測埋め込みは,圧縮されたVAEラテントよりも優れた動作生成をサポートし,I-JEPAはエンコーダ比較において最良であることがわかった。
これらの知見に基づき,ビデオ拡散バックボーンに頼ることなく,同じ空間に将来の埋め込みを予測することで,JEPA埋め込みとモデル環境進化のアクション生成を条件付けるLeWAMを提案する。
さらに、模倣学習は行動を示すが、小さな行動偏差がタスクの成功に大きな影響を及ぼすとしても、より良い行動と悪い行動とを区別しないことがわかった。
この制限に、環境の相互作用や、リセットや安全性に必要な人的監督を伴わずに対処するため、デモから直接優先監督を導出するオフライン優先改善段階であるデモストレーションガイド付きDPO(DemoDPO)を導入する。
トレーニング可能なパラメータはわずか0.4Bで、LWAMはRoboTwin 2.0上で92.28\%の平均成功率を達成し、最先端のVLAやWAMに匹敵する。
関連論文リスト
- JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling [23.76460420882974]
我々は,事前訓練されたV-JEPA空間に構築された潜水型WAMであるJEPA-WAMを紹介する。
遅延遷移予測と、共有予測器による連続的なアクション生成を結合する。
LIBERO-Plusでは、JEPA-WAMは79.2%を達成し、大規模なロボット政策の事前訓練を行わない最も良い結果となった。
論文 参考訳(メタデータ) (2026-08-10T09:57:54Z) - Vid2WAM: Distilling Video Diffusion Priors into World Action Models [59.28345153395937]
世界行動モデル(WAM)は、将来の視覚力学とアクションを共同でモデル化することで、ロボットポリシー学習を改善する。
大規模なビデオ基礎モデルからコンパクトなWAM学生へ視覚拡散を先取りするオフライン蒸留フレームワークであるVid2WAMを提案する。
Vid2WAMは、限られた専門家によるデモンストレーションにおいて、新しいタスクの一般化とデータ効率を向上させる。
論文 参考訳(メタデータ) (2026-08-09T08:02:49Z) - Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models [24.27863433568267]
本稿では,ビデオジェネレータを用いたWAMのポストトレーニング手法であるRobust-WAMを提案する。
学習可能な問合せトークンを用いて、将来の接地木フレームのセマンティックフォアフォアに出力された隠れ状態を調整することで、未来のセマンティクスをアクションストリームに組み込む。
分布外一般化シミュレーションベンチマークおよび実ロボット設定実験により、ロバストWAMは分布内性能を犠牲にすることなく、複数のWAMベースラインの成功率を一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-08-06T11:31:56Z) - Native Video-Action Pretraining for Generalizable Robot Control [77.59831077077176]
LingBot-VA 2.0は、エンボディメントのためにゼロから構築されたビデオアクション基盤モデルである。
高周波推論の要求を満たすため,本モデルは疎いMOEバックボーンを用いる。
現実のデプロイメントは、堅牢な基盤モデルとしてLingBot-VA 2.0を検証する。
論文 参考訳(メタデータ) (2026-07-09T16:15:43Z) - Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model [31.013109374489442]
VLA(Vision-Language-Action)モデルは、最近、具体化されたタスク間で強力なパフォーマンスを示した。
本稿では,拡散行動専門家が複数の候補アクションチャンクをドラフトし,VLMが各候補を1つの前方パスに1つの難易度基準でスコア付けして1つを選択することを提案する。
マッチしたバックボーン、トレーニングデータ、アクション・チャンク長では、ADVは拡散ベースのベースラインよりも実世界の+4.3ポイント、+19.7ポイントで成功率を向上させる。
論文 参考訳(メタデータ) (2026-03-18T09:16:20Z) - Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance [63.33213516925946]
textbfAlign-Then-stEer(textttATE)は,新しいデータ効率,プラグアンドプレイ適応フレームワークである。
我々の研究は、新しいロボットプラットフォームやタスクにVLAモデルをデプロイする実用性を大幅に向上させる、汎用的で軽量なソリューションを提供する。
論文 参考訳(メタデータ) (2025-09-02T07:51:59Z) - CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation [100.25567121604382]
VLA(Vision-Language-Action)モデルは、言語誘導されたタスクの実行と、目に見えないシナリオへの一般化の観点から、ロボット操作を改善した。
VLM(Vision-Language-Models)に基づく新しい高度なVLAアーキテクチャを提案する。
我々のモデルはタスクパフォーマンスにおいて既存のVLAをはるかに上回るだけでなく、新しいロボットへの顕著な適応と、見えないオブジェクトや背景への一般化も示している。
論文 参考訳(メタデータ) (2024-11-29T12:06:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。