論文の概要: Delta-JEPA: Learning Action-Sensitive World Models via Latent Difference Decoding
- arxiv url: http://arxiv.org/abs/2606.31232v1
- Date: Tue, 30 Jun 2026 07:08:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.111033
- Title: Delta-JEPA: Learning Action-Sensitive World Models via Latent Difference Decoding
- Title(参考訳): Delta-JEPA: 潜在差分デコーディングによる行動感受性世界モデル学習
- Authors: Zhenghao Zhang, Yuanxiang Wang, Zhenyu Guan, Yujia Yang, Bingkang Shi, Tianyu Zong, Hongzhu Yi, Guoqing Chao, Xingchen Chen, Tiankun Yang, Chenxi Bao, Tao Yu, Jingjing Zhou, Jungang Xu,
- Abstract要約: 計画のためのビジュアルワールドモデルを学ぶには、アクションに敏感なコンパクトな潜伏ダイナミクスが必要である。
我々は、遅延差分動作デコーダ(LDAD)を用いて、潜時予測を増強する、エンドツーエンドの復元自由世界モデルであるDelta-JEPAを提案する。
LDADは連続観察間の潜伏変位から実行された動作を再構築する。
- 参考スコア(独自算出の注目度): 25.77502065015808
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learning visual world models for planning requires compact latent dynamics that remain sensitive to actions, yet reconstruction-free joint-embedding objectives can collapse to action-insensitive representations. We propose Delta-JEPA, an end-to-end reconstruction-free world model that augments latent forward prediction with a Latent Difference Action Decoder (LDAD). Unlike inverse decoders that infer actions from concatenated endpoint embeddings, LDAD reconstructs the executed action from the latent displacement between consecutive observations. This displacement-level supervision directly regularizes transition geometry: adjacent embeddings cannot collapse without losing action information, and different actions are encouraged to induce distinguishable latent changes for rollout-based planning. Delta-JEPA uses only latent prediction and action reconstruction, avoiding pixel reconstruction and distribution-matching regularizers. Across four visual continuous-control tasks, Delta-JEPA improves planning over JEPA-based and representation-learning world model baselines. Ablations show that displacement-based action decoding is consistently more effective than endpoint concatenation, and action-sensitivity analyses show clearer action-conditioned latent responses. These results indicate that supervising latent differences is a simple and effective mechanism for collapse-resistant and action-sensitive world model learning.
- Abstract(参考訳): 計画のための視覚世界モデルを学ぶには、アクションに敏感なコンパクトな潜伏ダイナミクスが必要であるが、再構成のない共同埋め込みの目的はアクション非感受性の表現に崩壊する可能性がある。
我々は,遅延差分法デコーダ (LDAD) を用いて遅延予測を増大させる,エンドツーエンドの復元自由世界モデル Delta-JEPA を提案する。
コンカレントエンドポイントの埋め込みからアクションを推論する逆デコーダとは異なり、LDADは連続した観測の間で遅延変位から実行されたアクションを再構成する。
この変位レベルの監督は、遷移幾何学を直接正規化し、隣接する埋め込みはアクション情報を失うことなく崩壊することはできず、異なるアクションはロールアウトベースの計画において識別可能な潜時変化を誘発することを奨励する。
デルタJEPAは潜時予測と行動再構成のみを使用し、画素再構成や分布整合正則化を避ける。
4つの視覚的連続制御タスクの中で、Delta-JEPAはJEPAベースの表現学習ワールドモデルベースラインの計画を改善している。
アブレーションにより、変位に基づく行動復号法は終端連結法よりも一貫して有効であることが示され、行動感度解析により、より明確な行動条件付潜時応答が示される。
これらの結果から,潜時差の監視は,崩壊耐性・行動感受性世界モデル学習のシンプルかつ効果的なメカニズムであることが示唆された。
関連論文リスト
- Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - Stealthy World Model Manipulation via Data Poisoning [6.257560917160816]
SWAAPは、学習の世界モデルのための最初の2段階のデータ中毒フレームワークである。
第一段階では、SWAAPは、計画中の低リターン行動を引き起こす有害な標的世界モデルを特定する。
第2段階では、SWAAPはステルス制約付き勾配マッチングによりこの目標を実現する。
論文 参考訳(メタデータ) (2026-06-17T05:24:18Z) - Latent Action Reparameterization for Efficient Agent Inference [56.42014061367112]
本稿では,複数のステップのセマンティックな振る舞いに対応する,コンパクトな潜在行動空間を学習するフレームワークを提案する。
手作りのマクロや階層型コントローラとは異なり、潜在動作はエージェントの軌跡から学習され、モデルに直接統合される。
論文 参考訳(メタデータ) (2026-05-18T16:07:44Z) - SCAR: Self-Supervised Continuous Action Representation Learning [36.917304453471864]
視覚的遷移から具現化された動作表現を学習するための共同逆フォワード動的フレームワークであるSCARを提案する。
事前訓練された生成バックボーン上に構築されたSCARは、逆ダイナミクスモデル(IDM)を使用して、潜時観測ペアから潜時動作を推論し、フォワードダイナミクスモデル(FDM)を用いて、それらに条件付けられた将来のダイナミクスを予測する。
Procgen と Robotwin のデータセットの実験により、学習された統合潜在行動表現は、具体化固有の生の行動よりも、世界モデリングのためのより強い条件付けインターフェースとして機能することが示された。
論文 参考訳(メタデータ) (2026-05-13T16:23:11Z) - ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models [31.2829405167292]
ALAM(Algebraic Latent Action Model)は、アクションフリービデオにおける時間的関係を構造的監視に変換する。
ALAMは、構成と逆整合性によって規則化されながら、再構成によって基礎付けられた潜伏遷移を学習する。
下流VLA学習では、事前学習したエンコーダを凍結し、その潜伏遷移配列を補助的生成ターゲットとして使用する。
論文 参考訳(メタデータ) (2026-05-11T16:37:07Z) - AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for Vision-Language-Action Models [60.04879435087352]
視覚言語アクション(VLA)ポリシーは、単一の統一空間内でアクションを生成する。
本稿では,VLAの動作モデリングを軌跡アンカーと残留精細化に分解する階層的フレームワークであるAnchorRefineを提案する。
LIBERO、CALVIN、および実ロボットタスクの実験では、AnchorRefineは回帰ベースと拡散ベースの両方のVLAバックボーンを一貫して改善している。
論文 参考訳(メタデータ) (2026-04-20T04:25:24Z) - TD-JEPA: Latent-predictive Representations for Zero-Shot Reinforcement Learning [63.73629127832652]
本稿では,TDに基づく潜在予測表現を教師なしRLに活用するTD-JEPAを紹介する。
TD-JEPAは、明示的な状態とタスクエンコーダ、ポリシー条件付きマルチステップ予測器、パラメータ化されたポリシーのセットを潜時空間で直接訓練する。
実証的には、TD-JEPAは13のデータセットにわたる移動、ナビゲーション、操作のタスクにおいて、最先端のベースラインをマッチまたは上回る。
論文 参考訳(メタデータ) (2025-10-01T10:21:18Z) - Latent Diffusion Planning for Imitation Learning [78.56207566743154]
Latent Diffusion Planning (LDP) は、プランナーと逆ダイナミクスモデルからなるモジュラーアプローチである。
行動予測からプランニングを分離することにより、LDPは最適なデータと行動自由データのより密集した監視信号の恩恵を受けることができる。
シミュレーションされた視覚ロボット操作タスクにおいて、LDPは最先端の模倣学習アプローチより優れている。
論文 参考訳(メタデータ) (2025-04-23T17:53:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。