論文の概要: Toward Physically Grounded JEPA World Models for Goal-Conditioned Robotic Planning
- arxiv url: http://arxiv.org/abs/2609.03565v1
- Date: Thu, 03 Sep 2026 09:11:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.999811
- Title: Toward Physically Grounded JEPA World Models for Goal-Conditioned Robotic Planning
- Title(参考訳): ゴールコンディション型ロボット計画のための物理接地JEPA世界モデルに向けて
- Abstract要約: 我々は、逆ダイナミクス(IDM)と状態アライメント(SA)による潜伏予測を強化するエンド・ツー・エンドのJEPAワールドモデルを導入する。
我々のモデルはTwoRoom (100%), PushT (98%), OGBench-Cube (87%), LeWorldModel on Reacher で高い成功率を達成した。
- 参考スコア(独自算出の注目度): 17.909802735976466
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Action-conditioned JEPA world models enable planning toward visually specified goals without reconstructing future pixels, yet latent prediction alone does not explicitly encourage the learned representations to retain information relevant to robotic control. We introduce an end-to-end JEPA world model that augments latent prediction with inverse dynamics (IDM) and state alignment (SA). While inverse dynamics discourages latent collapse and makes latent transitions informative of the actions that produced them, state alignment grounds consecutive representations in their associated physical configuration and motion. Across four benchmark tasks, our model attains the highest success rates on TwoRoom (100%), PushT (98%), and OGBench-Cube (87%), while performing comparably to LeWorldModel on Reacher. Our ablation further shows that adding state alignment consistently improves planning success over IDM alone across all four tasks. Although LeWorldModel, our primary baseline, attains higher average straightening on OGBench-Cube, transition-subspace analysis shows that its transition energy is concentrated in a substantially lower-dimensional subspace. Our state-aligned model exhibits a higher effective transition dimension than LeWorldModel and improves planning over IDM alone, supporting state alignment as an effective complement to inverse dynamics for robotic planning.
- Abstract(参考訳): アクション条件のJEPAワールドモデルは、将来のピクセルを再構築することなく、視覚的に指定された目標に向けた計画を可能にする。
本稿では,逆ダイナミクス (IDM) と状態アライメント (SA) による潜伏予測を強化するエンド・ツー・エンドのJEPAワールドモデルを提案する。
逆ダイナミクスは潜時崩壊を回避し、それらを生み出した動作を潜時遷移に知らせる一方で、状態アライメントはその関連する物理的構成と運動の連続的な表現を根拠にしている。
4つのベンチマークタスクで、我々のモデルはTwoRoom (100%)、PushT (98%)、OGBench-Cube (87%)で最高成功率に達し、LeWorldModel on Reacherと互換性がある。
当社のアブレーションは、ステートアライメントの追加によって、4つのタスクすべてでIMMよりも計画の成功が一貫して改善されることをさらに示しています。
我々の一次ベースラインであるLeWorldModelは、OGBench-Cube上で平均的な直線化を達成するが、遷移部分空間解析により、遷移エネルギーがかなり低次元の部分空間に集中していることが示されている。
我々の状態アライメントモデルは、LeWorldModelよりも効果的な遷移次元を示し、IMM単独での計画を改善するとともに、ロボット計画における逆ダイナミクスの効果的な補完として状態アライメントをサポートします。
関連論文リスト
- DUET-DINO: Simultaneous Cross-View World Modeling for Latent Planning in Robot Manipulation [19.179682667653328]
アクション条件付き潜在世界モデルは将来の視覚表現を予測し、ゼロショットの目標条件付きロボットの計画と制御を可能にする。
本稿では,静的側カメラと手首カメラの同時観測により,動作条件付き予測を同時学習するDuet-DINOについて紹介する。
補完的なグローバルシーンとグリップ中心の情報を活用することで、DUET-DINOは完全な7-DoFアクション空間の潜在計画を可能にする。
論文 参考訳(メタデータ) (2026-09-09T17:41:38Z) - Semigroup-JEPA: Latent Dynamics Consistency for Zero-Shot Physics Generalization [32.65135632960651]
JEPA(Joint-Embedding Predictive Architecture)の世界モデルは、予測と計画をサポートする世界のコンパクトな潜在表現を学ぶ。
物理制御パラメータを時間モデルに供給することにより,LeWorldModelフレームワークを拡張したSemiGroup-JEPAを提案する。
我々は、同じ物理法則に従うにもかかわらず、定性的に異なる力学を示す異なる重力場の下で動的タスクを設計する。
論文 参考訳(メタデータ) (2026-09-09T17:08:13Z) - GaussianDream++: Efficient 3D Gaussian World Modeling for Robotic Manipulation [55.47130289185285]
VLA(Vision-Language-Action)ポリシーは、高度な言語条件のロボット操作である。
我々は textbfWorld State Tokens と textbfWorld Prediction Tokens を VLA バックボーンに直接挿入する,コンパクトでポリシーネイティブな拡張である textbfMethodname を提示する。
論文 参考訳(メタデータ) (2026-08-26T11:41:55Z) - SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space [12.198811616220835]
World Action Models (WAM)は、将来の状態を予測するアクション生成を結合する。
本稿では,SG-WAMを提案する。SG-WAMは,政策由来の表現空間において,幾何学的行動条件の動的性を直接学習する自己誘導型フレームワークである。
論文 参考訳(メタデータ) (2026-08-02T17:25:08Z) - Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - HaM-World: Soft-Hamiltonian World Models with Selective Memory for Planning [2.28917458387011]
HaM-Worldは、潜在状態を標準部分空間(q, p)と文脈部分空間(c)に分解する構造化世界モデルである。
4つのDeepMind Control Suiteタスクにおいて、HaM-WorldはAUC (117.9, +9.5%) の最高値に達し、長時間のロールアウトエラーを強いベースラインモデルの45%に減らし、3,5,7 MSEセルで11/12 kを獲得した。
論文 参考訳(メタデータ) (2026-05-07T09:58:18Z) - World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry [82.93104394404781]
汎用世界モデルは、スケーラブルなポリシー評価、最適化、計画を約束します。
本稿では,世界モデルによる予測誤りと自己改善を識別するフレームワークであるWorld Action Verifier(WAV)を提案する。
論文 参考訳(メタデータ) (2026-04-02T12:48:36Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - TC-IDM: Grounding Video Generation for Executable Zero-shot Robot Motion [38.88993836311246]
ジェネレーティブワールドモデルは、汎用的なエンボディAIに代わる有望な選択肢を提供する。
視覚計画と身体制御のギャップを埋めるツール中心逆ダイナミクスモデル(TC-IDM)を提案する。
実世界の評価では、TC-IDMを用いた世界モデルの平均成功率は61.11パーセント、単純タスクは77.7%、ゼロショット変形可能なオブジェクトタスクは38.66%である。
論文 参考訳(メタデータ) (2026-01-26T10:06:56Z) - From Forecasting to Planning: Policy World Model for Collaborative State-Action Prediction [57.56072009935036]
政策世界モデル(PWM)と呼ばれる新しい運転パラダイムを導入する。
PWMは、統一アーキテクチャ内での世界モデリングと軌道計画を統合する。
提案手法は,マルチビューおよびマルチモーダル入力に依存する最先端の手法に適合するか,あるいは超越する。
論文 参考訳(メタデータ) (2025-10-22T14:57:51Z) - Vision-Centric 4D Occupancy Forecasting and Planning via Implicit Residual World Models [28.777224599594717]
Implicit Residual World Modelは、世界の現在の状態と進化をモデル化することに焦点を当てている。
IR-WMは4次元占有予測と軌道計画の両方において最高性能を達成する。
論文 参考訳(メタデータ) (2025-10-19T06:45:37Z) - WorldPrediction: A Benchmark for High-level World Modeling and Long-horizon Procedural Planning [52.36434784963598]
我々は、異なるAIモデルのワールドモデリングと手続き計画能力を評価するためのビデオベースのベンチマークであるWorldPredictionを紹介する。
現在のフロンティアモデルでは,WorldPrediction-WMでは57%,WorldPrediction-PPでは38%の精度しか達成できないが,人間は両タスクを完璧に解くことができる。
論文 参考訳(メタデータ) (2025-06-04T18:22:40Z) - LaDi-WM: A Latent Diffusion-based World Model for Predictive Manipulation [45.02469804709771]
拡散モデルを用いて将来の状態の潜伏空間を予測する世界モデルLaDi-WMを提案する。
LIBERO-LONGベンチマークでは,LaDi-WMが27.9%,現実シナリオでは20%,政策性能が著しく向上することを示した。
論文 参考訳(メタデータ) (2025-05-13T04:42:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。