論文の概要: JEPA-x: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics
- arxiv url: http://arxiv.org/abs/2608.24044v2
- Date: Wed, 26 Aug 2026 02:21:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.140023
- Title: JEPA-x: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics
- Title(参考訳): JEPA-x:予測可能な遅延ダイナミクスのためのクロス予測物理グラウンド
- Abstract要約: 我々は、特権的物理的軌跡の視覚的潜伏ダイナミクスを基盤としたクロス予測型JEPA(JEPA-x)を紹介する。
JEPA-xはアクション条件付き予測器を必要とし、シーンの視覚的および身体的記述の両方に対して共通の遷移ルールを学ぶ。
- 参考スコア(独自算出の注目度): 9.006010556484968
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Latent world models plan by predicting how candidate actions advance learned latent dynamics. In self-predictive models, however, the encoder and predictor are optimized jointly and can co-adapt to latent transitions that are easy to predict but weakly constrained by the physical evolution of the scene. We introduce the cross-predictive JEPA (JEPA-x), which grounds visual latent dynamics in privileged physical trajectories. JEPA-x treats visual observations and physical states as corresponding views of the same action-conditioned trajectory, advances both through a shared predictor, and matches predictions from either view to future representations in both modalities. This requires the action-conditioned predictor to learn a common transition rule for both the visual and physical descriptions of the scene. The physical branch is used only during training, leaving no computational overhead at deployment. Empirical results show that JEPA-x reduces the rollout drift of a newly fitted predictor from $0.361$ to $0.104$ and increases mean control success from $53.6\%$ to $78.2\%$ on a multi-task suite spanning six evaluation subfamilies. We additionally show that making physical state decodable is not the load-bearing factor; rather, the gains arise from how cross-prediction shapes the geometry of the learned latent dynamics.
- Abstract(参考訳): 潜在世界モデルは、候補者の行動がどのように潜時力学を学んだかを予測して計画する。
しかし、自己予測モデルでは、エンコーダと予測器は共同で最適化され、シーンの物理的進化によって予測が容易だが弱く制約された潜伏遷移に適応することができる。
我々は、特権的物理的軌跡の視覚的潜伏ダイナミクスを基盤としたクロス予測型JEPA(JEPA-x)を紹介する。
JEPA-xは、視覚的な観察と物理的状態を、同じ行動条件の軌跡の対応するビューとして扱い、共に共有予測器を通して前進し、両方のモダリティにおけるビューから将来の表現への予測と一致させる。
これにより、アクション条件付き予測器は、シーンの視覚的および身体的記述の両方に対して共通の遷移規則を学ぶ必要がある。
物理的なブランチはトレーニング時にのみ使用され、デプロイ時の計算オーバーヘッドは発生しない。
実証的な結果から、JEPA-xは新しく装着された予測器のロールアウトドリフトを0.361$から0.104$に下げ、平均制御成功を53.6\%から78.2\%に引き上げる。
さらに、物理状態の復号化が負荷負担要因ではなく、クロスプレディションが学習された潜在力学の幾何学をどう形作るかから得られる利益であることを示す。
関連論文リスト
- Semigroup-JEPA: Latent Dynamics Consistency for Zero-Shot Physics Generalization [32.65135632960651]
JEPA(Joint-Embedding Predictive Architecture)の世界モデルは、予測と計画をサポートする世界のコンパクトな潜在表現を学ぶ。
物理制御パラメータを時間モデルに供給することにより,LeWorldModelフレームワークを拡張したSemiGroup-JEPAを提案する。
我々は、同じ物理法則に従うにもかかわらず、定性的に異なる力学を示す異なる重力場の下で動的タスクを設計する。
論文 参考訳(メタデータ) (2026-09-09T17:08:13Z) - Flow-JEPA: Flow Matching for Robust Latent Dynamics in JEPA World Models [18.035166689862205]
JEPA(Joint-Embedding Predictive Architectures)は、コンパクトな予測表現を学習する強力な可能性を示している。
本研究では,現在の観測と動作を条件とした将来の潜伏状態列を共同生成する条件付き流れマッチング力学モデルであるFlow-JEPAを提案する。
論文 参考訳(メタデータ) (2026-08-29T03:40:06Z) - Orthogonal JEPA: Factorized Predictive States for Latent World Models [95.20158869896393]
予測因数分解に基づく潜在的世界モデリングフレームワークであるメソッドを導入する。
そこで本研究では,予測構造を弱め,あるいは矛盾する勾配を抑えつつ,冗長なキャパシティを支配的信号に割り当てる手法を提案する。
制御された視覚、単細胞転写学、縦断的な健康記録、連続的な制御、分子動力学の実験は、表現品質、予測、計画、長期安定性を評価する。
論文 参考訳(メタデータ) (2026-08-20T13:59:57Z) - SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation [35.54319311306262]
SLIM はコンパクトな潜在相互作用ポリシーである。
自己教師付きマスク付き軌道予測を通じて表現を学習する。
SLIMは、より少ないパラメータで、大規模なVLAとワールドアクションモデルベースラインとを一致または超える。
論文 参考訳(メタデータ) (2026-08-10T15:58:39Z) - JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling [23.76460420882974]
我々は,事前訓練されたV-JEPA空間に構築された潜水型WAMであるJEPA-WAMを紹介する。
遅延遷移予測と、共有予測器による連続的なアクション生成を結合する。
LIBERO-Plusでは、JEPA-WAMは79.2%を達成し、大規模なロボット政策の事前訓練を行わない最も良い結果となった。
論文 参考訳(メタデータ) (2026-08-10T09:57:54Z) - Is Forward Prediction Enough? Physical State Grounding for JEPA World Models [18.174985055477666]
PSG-JEPAはその潜在空間を前方予測を超えて2つの補完的な接地目標で形成する。
本研究では,(1)探索による潜伏識別性,(2)凍結した潜伏者に対する目標条件付き計画,(3)シミュレーションおよび実ロボットにおける政策学習の3つのレベルにおいて実験を行う。
論文 参考訳(メタデータ) (2026-08-07T04:44:16Z) - On the Identifiability of Controlled World Models [34.31084112465058]
本稿では,ガウス潜在状態を持つ制御された世界モデルに対する合同識別可能性条件を提案する。
この条件が成立すると、LeJEPAスタイルの予測目標の最小化が潜伏状態と制御力学の両方を回復できることを示す。
また、最も弱い条件-励起マージンで逆スケールする反事実予測誤差の達成可能な増幅を特徴付ける。
論文 参考訳(メタデータ) (2026-07-24T15:49:12Z) - MoP-JEPA: Hard-Assigned Predictor Mixtures for Stochastic JEPA World Models [14.76812870029721]
MoP-JEPAは、有限個の候補セットを1つのパスで生成する。
ホールドアウトのOGBenchトランジションでは、単一出力予測器によるグラフ検索が0.02$--0.09$のクエリで成功し、MoP-JEPAは0.85$に達した。
論文 参考訳(メタデータ) (2026-07-06T15:47:37Z) - Predictive Objectives Discard Exogenous Control-Relevant Features: A Controlled Mechanistic Study [0.0]
共同埋め込み予測(JEPA)の目的は、将来の潜伏者を予測することによって表現を学ぶことである。
これは、制御関連性よりも時間的予測可能性の最適化が目的であるからである。
報酬ラベル付き遷移の2%がこの機能を回復すると、その効果は2つの環境にまたがることがわかった。
論文 参考訳(メタデータ) (2026-06-29T10:00:50Z) - Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models [58.191567345416836]
世界行動モデル(WAM)は、物理力学のモデリングによるロボット制御のための有望なパラダイムとして登場した。
HarmoWAMは、予測と反応の制御を統一するために世界モデルを完全に活用し、一般的なトランジットと正確な操作を可能にする。
実世界の6つのロボットタスクにまたがる3つのトレーニング未確認テスト環境を構築し、背景、位置、オブジェクトの意味のバリエーションをカバーした。
論文 参考訳(メタデータ) (2026-05-11T17:59:56Z) - LeapTS: Rethinking Time Series Forecasting as Adaptive Multi-Horizon Scheduling [74.94985663101906]
本稿では,予測地平線上での動的スケジューリングプロセスとして時系列予測を再構成する新しいフレームワーク LeapTSを提案する。
LeapTSは、Transformerベースのモデルよりも2.6$times$から5.3$times$推論スピードアップを実現しつつ、全体的な予測性能を少なくとも7.4%向上させる。
論文 参考訳(メタデータ) (2026-05-11T09:54:02Z) - Out-of-distribution transfer of PDE foundation models to material dynamics under extreme loading [86.6550968435969]
ほとんどのPDEファンデーションモデルは、流体中心のベンチマークに基づいて事前訓練され、微調整されている。
衝撃, 進化する界面, 破壊が非平滑な場を生み出す2つの不連続支配的体制について, 分布外移動をベンチマークする。
我々は,PDE基礎モデルであるPOSEIDONとMORPHを2つのオープンソースとして評価し,事前学習した重みからの微調整と,トレーニングセットのサイズによるスクラッチからのトレーニングを比較し,分散シフト下でのサンプル効率の定量化を行った。
論文 参考訳(メタデータ) (2026-03-04T18:19:35Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - TD-JEPA: Latent-predictive Representations for Zero-Shot Reinforcement Learning [63.73629127832652]
本稿では,TDに基づく潜在予測表現を教師なしRLに活用するTD-JEPAを紹介する。
TD-JEPAは、明示的な状態とタスクエンコーダ、ポリシー条件付きマルチステップ予測器、パラメータ化されたポリシーのセットを潜時空間で直接訓練する。
実証的には、TD-JEPAは13のデータセットにわたる移動、ナビゲーション、操作のタスクにおいて、最先端のベースラインをマッチまたは上回る。
論文 参考訳(メタデータ) (2025-10-01T10:21:18Z) - Panoptic Segmentation Forecasting [71.75275164959953]
我々の目標は、最近の観測結果から近い将来の予測を行うことです。
この予測能力、すなわち予測能力は、自律的なエージェントの成功に不可欠なものだと考えています。
そこで我々は,2成分モデルを構築した。一方のコンポーネントは,オードメトリーを予測して背景物の力学を学習し,他方のコンポーネントは検出された物の力学を予測する。
論文 参考訳(メタデータ) (2021-04-08T17:59:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。