論文の概要: LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments
- arxiv url: http://arxiv.org/abs/2607.23969v1
- Date: Mon, 27 Jul 2026 03:36:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.298013
- Title: LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments
- Title(参考訳): LeapBot-WA: 予測潜在アライメントによるワールドアンカーアクションモデル
- Abstract要約: 世界行動モデル(WAM)は、インテリジェンスを具現化する強力なパラダイムとして登場した。
モデルにタスク非関連の視覚的詳細を再構築させると、表現能力が低下し、視覚的邪魔者に対して脆弱なポリシーが現れる。
本稿では,JEPA(Joint-Embedding Predictive Architecture)をワールドアンカーとして運用することで,WAMの新たな予測-遅延パラダイムを確立するLeapBot-WAを提案する。
- 参考スコア(独自算出の注目度): 41.26480439505561
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World Action Models (WAMs) have emerged as a powerful paradigm for embodied intelligence, yet the prevailing reliance on pixel-level video generation creates a fundamental bottleneck. Forcing models to reconstruct task-irrelevant visual details dissipates representational capacity and renders policies vulnerable to visual distractors. In this paper, we propose LeapBot-WA, which establishes a novel Predictive-Latent paradigm for WAMs by operationalizing the Joint-Embedding Predictive Architecture (JEPA) as a World-Anchor. Departing from the traditional reliance on visual synthesis, LeapBot-WA shifts the core of world modeling to Predictive Semantic Alignment, extracting abstract physical dynamics directly within a latent foundation space. To bridge the modality gap between non-Gaussian predictive features and diffusion priors, we introduce the Isotropic Semantic Autoencoder (ISAE), which reshapes the anchor's latent space into a diffusion-friendly manifold to prevent off-manifold drift. Furthermore, we design an Asymmetric Mixture-of-Transformers (MoT) architecture. During training, an Anchor Diffusion Transformer acts as a privileged dynamics expert to guide the Action Diffusion Transformer; at inference, this heavy dynamics branch is pruned, enabling zero-overhead execution. LeapBot-WA achieves state-of-the-art performance among predictive models on LIBERO and matches top-tier generative WAMs on RoboTwin 2.0 without requiring large-scale trajectory pre-training. It further demonstrates superior zero-shot robustness to unseen environments and successful real-world transfer, establishing a highly efficient and robust latent-centric paradigm for scalable robotic control. Code: https://github.com/LeapWM/leapbot-wa.
- Abstract(参考訳): 世界行動モデル(WAM)は、インテリジェンスを具現化する強力なパラダイムとして登場したが、ピクセルレベルのビデオ生成への依存が根本的なボトルネックとなっている。
モデルにタスク非関連の視覚的詳細を再構築させると、表現能力が低下し、視覚的邪魔者に対して脆弱なポリシーが現れる。
本稿では,JEPA(Joint-Embedding Predictive Architecture)をワールドアンカーとして運用することで,WAMの新たな予測-遅延パラダイムを確立するLeapBot-WAを提案する。
従来の視覚合成への依存から離れ、LeapBot-WAは世界モデリングのコアを予測的セマンティックアライメント(Predictive Semantic Alignment)にシフトし、潜在基盤空間内で直接抽象物理力学を抽出する。
非ガウス的予測的特徴と拡散先行性の間のモダリティギャップを埋めるため,Isotropic Semantic Autoencoder (ISAE)を導入する。
さらに,非対称なMixture-of-Transformers (MoT) アーキテクチャを設計する。
トレーニング中、Anchor Diffusion TransformerはAction Diffusion Transformerをガイドするために特権的なダイナミックスエキスパートとして機能する。
LeapBot-WAは、LIBERO上の予測モデル間の最先端のパフォーマンスを達成し、大規模な軌道事前学習を必要とせずに、RoboTwin 2.0上で最上位の生成WAMと一致させる。
さらに、目に見えない環境に対して優れたゼロショットロバスト性を示し、実世界の移動を成功させ、スケーラブルなロボット制御のための非常に効率的で堅牢なラテント中心のパラダイムを確立する。
コード:https://github.com/LeapWM/leapbot-wa。
関連論文リスト
- Semigroup-JEPA: Latent Dynamics Consistency for Zero-Shot Physics Generalization [32.65135632960651]
JEPA(Joint-Embedding Predictive Architecture)の世界モデルは、予測と計画をサポートする世界のコンパクトな潜在表現を学ぶ。
物理制御パラメータを時間モデルに供給することにより,LeWorldModelフレームワークを拡張したSemiGroup-JEPAを提案する。
我々は、同じ物理法則に従うにもかかわらず、定性的に異なる力学を示す異なる重力場の下で動的タスクを設計する。
論文 参考訳(メタデータ) (2026-09-09T17:08:13Z) - Native Video-Action Pretraining for Generalizable Robot Control [77.59831077077176]
LingBot-VA 2.0は、エンボディメントのためにゼロから構築されたビデオアクション基盤モデルである。
高周波推論の要求を満たすため,本モデルは疎いMOEバックボーンを用いる。
現実のデプロイメントは、堅牢な基盤モデルとしてLingBot-VA 2.0を検証する。
論文 参考訳(メタデータ) (2026-07-09T16:15:43Z) - ABot-M0.5: Unified Mobility-and-Manipulation World Action Model [27.262271208923995]
ABot-M0.5は、モバイル操作には時間的粒度、アクションスペース、列車-テスト整合性の3段階のアライメントが必要であるという洞察に基づいて構築されている。
モバイルおよびきめ細かい操作ベンチマークの実験により、ABot-M0.5は、長距離タスクの成功ときめ細かい制御精度の両方において最先端の性能を達成することが示された。
論文 参考訳(メタデータ) (2026-07-01T09:21:20Z) - Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - AttenA+: Rectifying Action Inequality in Robotic Foundation Models [38.61160855341111]
本稿では,速度駆動型アクションアテンションを通じて,運動学的に重要なセグメントを優先するアーキテクチャに依存しないフレームワークであるAttenA+を紹介する。
我々の研究は、本質的な行動列の構造的前提をマイニングすることが、標準的なスケーリング法則に非常に効率的で物理学的な補完をもたらすことを示唆している。
論文 参考訳(メタデータ) (2026-05-13T13:55:37Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA [72.9197085473598]
DIALはハイレベルな意思決定と低レベルなモーター実行を、差別化可能な潜在意図ボトルネックを通じてブリッジするフレームワークである。
VLMベースのSystem-2は、VLMのネイティブな特徴空間内で、潜伏した視覚的フォレストによって潜伏世界モデリングを行う。
軽量のSystem-1ポリシーでは、この予測された意図と現在の観測結果を正確にロボットの動作にデコードする。
論文 参考訳(メタデータ) (2026-03-31T15:02:27Z) - Causal World Modeling for Robot Control [56.31803788587547]
ビデオワールドモデルは、アクションと視覚力学の因果関係を理解することによって、近い将来に想像できる能力を提供する。
本稿では,フレーム予測とポリシ実行を同時に学習する自動回帰拡散フレームワークLingBot-VAを紹介する。
シミュレーションベンチマークと実世界のシナリオの両方でモデルを評価したところ、長距離操作、ポストトレーニングにおけるデータ効率、新しい構成への強力な一般化性などに大きな可能性を示唆している。
論文 参考訳(メタデータ) (2026-01-29T17:07:43Z) - mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs [5.109732854501585]
そこで我々は,事前学習したインターネットスケールのビデオモデルと,その潜在表現に条件付けされたフローマッチングに基づくアクションデコーダを組み合わせた,新しいビデオ・アクション・モデル(VAM)を提案する。
提案手法は,シミュレーションおよび実世界のロボット操作タスクにおける最先端性能を実現し,サンプル効率を10倍,収束速度を2倍向上させる。
論文 参考訳(メタデータ) (2025-12-17T18:47:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。