論文の概要: JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling
- arxiv url: http://arxiv.org/abs/2608.09381v1
- Date: Mon, 10 Aug 2026 09:57:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.202714
- Title: JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling
- Title(参考訳): JEPA-WAM: 共同組込み世界モデリングによるビジョンランゲージ・アクションポリシーの学習
- Abstract要約: 我々は,事前訓練されたV-JEPA空間に構築された潜水型WAMであるJEPA-WAMを紹介する。
遅延遷移予測と、共有予測器による連続的なアクション生成を結合する。
LIBERO-Plusでは、JEPA-WAMは79.2%を達成し、大規模なロボット政策の事前訓練を行わない最も良い結果となった。
- 参考スコア(独自算出の注目度): 23.76460420882974
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Robust robot control benefits from explicitly modeling state transitions, but video-generation world action models (WAMs) introduce substantial deployment cost. Existing latent WAMs avoid explicit future generation, but often compress predictive representations or separate predictive modeling from the representations used for action generation. We introduce JEPA-WAM, a latent WAM built in a pretrained V-JEPA space, which couples latent transition prediction with continuous action generation through a shared predictor. JEPA-WAM predicts a spatially structured joint current-future target that captures task-shared visual temporal structure between current and future observations, while preserving dense patch-level correspondence. Through the shared predictor, transition supervision directly shapes the backbone, from which dedicated representations are extracted for action prediction. The same design can also be instantiated in pretrained VLA policies while preserving their original perception and action pathways. On LIBERO-Plus, JEPA-WAM achieves 79.2%, the best result without large-scale robot-policy pretraining, while its pretrained $π_{0.5}$ instantiation reaches 86.3%, achieving the best overall performance. Experiments on RoboTwin 2.0 and real-world bimanual manipulation further demonstrate strong generalization under visual and spatial shifts.
- Abstract(参考訳): ロバストなロボット制御は、状態遷移を明示的にモデル化することによる利点があるが、ビデオ生成の世界アクションモデル(WAM)には相当なデプロイメントコストが伴う。
既存の潜在WAMは、明示的な将来の生成を避けるが、しばしば予測表現を圧縮したり、アクション生成に使用される表現から予測モデリングを分離したりする。
本稿では,V-JEPA空間上に構築された潜在WAMであるJEPA-WAMについて紹介する。
JEPA-WAMは、密集したパッチレベルの対応を保ちながら、現在の観測と将来の観測の間のタスク共有された視覚的時間構造をキャプチャする、空間的に構造化された結合電流-未来目標を予測する。
共有予測器を通じて、遷移監督はバックボーンを直接形成し、そこから専用の表現を抽出して行動予測を行う。
同じデザインは、トレーニング済みのVLAポリシーでインスタンス化することもできる。
LIBERO-Plusでは、JEPA-WAMが79.2%を達成し、大規模なロボット政治事前訓練なしでは最高の結果を得る一方、事前訓練された$π_{0.5}$インスタンスは86.3%に達し、全体的なパフォーマンスが最高のものとなる。
RoboTwin 2.0の実験と実世界の双対操作は、視覚的および空間的シフトの下で強い一般化を示す。
関連論文リスト
- SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation [35.54319311306262]
SLIM はコンパクトな潜在相互作用ポリシーである。
自己教師付きマスク付き軌道予測を通じて表現を学習する。
SLIMは、より少ないパラメータで、大規模なVLAとワールドアクションモデルベースラインとを一致または超える。
論文 参考訳(メタデータ) (2026-08-10T15:58:39Z) - Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models [24.27863433568267]
本稿では,ビデオジェネレータを用いたWAMのポストトレーニング手法であるRobust-WAMを提案する。
学習可能な問合せトークンを用いて、将来の接地木フレームのセマンティックフォアフォアに出力された隠れ状態を調整することで、未来のセマンティクスをアクションストリームに組み込む。
分布外一般化シミュレーションベンチマークおよび実ロボット設定実験により、ロバストWAMは分布内性能を犠牲にすることなく、複数のWAMベースラインの成功率を一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-08-06T11:31:56Z) - SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space [12.198811616220835]
World Action Models (WAM)は、将来の状態を予測するアクション生成を結合する。
本稿では,SG-WAMを提案する。SG-WAMは,政策由来の表現空間において,幾何学的行動条件の動的性を直接学習する自己誘導型フレームワークである。
論文 参考訳(メタデータ) (2026-08-02T17:25:08Z) - LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies [31.88655699486955]
ラワント・アクション条件付きラワント・ワールドモデル(LaWM)を提案する。
LaWAMは、将来のビデオの再構成ではなく、コンパクトで潜伏した視覚サブゴールを通じて、ロボットポリシーに対する予測ダイナミクスを公開する。
LaWAMはアクションチャンク予測あたり187msで動作し、画素空間のWAMよりも最大24倍の遅延時間を実現する。
論文 参考訳(メタデータ) (2026-06-14T12:06:58Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models [58.191567345416836]
世界行動モデル(WAM)は、物理力学のモデリングによるロボット制御のための有望なパラダイムとして登場した。
HarmoWAMは、予測と反応の制御を統一するために世界モデルを完全に活用し、一般的なトランジットと正確な操作を可能にする。
実世界の6つのロボットタスクにまたがる3つのトレーニング未確認テスト環境を構築し、背景、位置、オブジェクトの意味のバリエーションをカバーした。
論文 参考訳(メタデータ) (2026-05-11T17:59:56Z) - LaDi-WM: A Latent Diffusion-based World Model for Predictive Manipulation [45.02469804709771]
拡散モデルを用いて将来の状態の潜伏空間を予測する世界モデルLaDi-WMを提案する。
LIBERO-LONGベンチマークでは,LaDi-WMが27.9%,現実シナリオでは20%,政策性能が著しく向上することを示した。
論文 参考訳(メタデータ) (2025-05-13T04:42:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。