論文の概要: UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling
- arxiv url: http://arxiv.org/abs/2608.07409v1
- Date: Fri, 07 Aug 2026 16:55:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.569171
- Title: UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling
- Title(参考訳): UniJEPA:タスク非依存のビジュアルワールドモデリングのための統合型統合組込み予測アーキテクチャ
- Abstract要約: JEPA(Joint-Embedding Predictive Architectures)は、コンパクトな潜在空間における世界モデルの自己教師型学習のためのフレームワークとして登場した。
我々は,光度予測(画像レベルの変換)と時間的予測(映像レベルの次状態ダイナミクス)を協調的に学習する統合JEPAであるUniJEPAを提案する。
- 参考スコア(独自算出の注目度): 24.745715007832953
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Joint-Embedding Predictive Architectures (JEPAs) have emerged as a principled framework for self-supervised learning of world models in compact latent spaces, yet existing methods are fragmented: some predict masked parts of a single image in latent space (I-JEPA), others learn to predict global photometric transformations (Image World Models), while video-scale JEPAs predict future temporal states and are post-trained for action-conditioned planning (V-JEPA~2, DINO-World, DINO-WM). These objectives are treated as distinct recipes with separate encoders, predictors, and anti-collapse regularizers, hindering a single model from unifying image-level and video-level world modeling. We present UniJEPA, a unified JEPA that jointly learns photometric prediction (image-level transformations) and temporal prediction (video-level next-state dynamics) in one shared latent space. A single end-to-end objective, composed of a next-embedding prediction loss and a Gaussian regularizer, yields a provably anti-collapse encoder-predictor pair trainable from raw pixels without EMA, stop-gradient, or pre-trained encoders. We show that the same latent space supports controllable abstraction: photometric prediction learns invariant structure while temporal prediction learns equivariant dynamics. After action-conditioned post-training on offline trajectories, UniJEPA enables zero-shot planning by treating goal features as prediction targets. On image, video, and control benchmarks, UniJEPA matches or surpasses task-specific JEPAs while requiring a single loss hyperparameter, and plans up to tens of times faster than generative world models at comparable accuracy.
- Abstract(参考訳): JEPA(Joint-Embedding Predictive Architectures)は、コンパクトな潜伏空間における世界モデルの自己教師型学習の原則として登場したが、既存の手法は断片化されている: 潜伏空間(I-JEPA)における単一の画像の予測された部分、グローバルな測光変換(画像世界モデル)を予測することを学ぶもの、ビデオスケールのJEPAは将来の時間状態を予測するもので、行動調和計画(V-JEPA~2, DINO-World, DINO-WM)のために後訓練されている。
これらの目的は、別個のエンコーダ、予測器、および反崩壊正則化器を用いて異なるレシピとして扱われ、単一のモデルが画像レベルとビデオレベルの世界モデリングを統一することを妨げる。
我々は,光度予測(画像レベルの変換)と時間的予測(映像レベルの次状態ダイナミクス)を協調的に学習する統合JEPAであるUniJEPAを提案する。
次埋め込み予測損失とガウス正規化器からなる単一のエンドツーエンド目的物は、EMA、停止勾配、または事前訓練されたエンコーダのない原画素からトレーニング可能な、確実に反崩壊防止エンコーダ・予測器対を生成する。
光度予測は不変構造を学習し、時間的予測は同変ダイナミクスを学習する。
オフライン軌道での動作条件付き後トレーニングの後、UniJEPAは目標特徴を予測対象として扱うことでゼロショット計画を可能にする。
画像、ビデオ、制御のベンチマークでは、UniJEPAはタスク固有のJEPAと一致またはオーバーし、単一損失ハイパーパラメータを必要とする。
関連論文リスト
- Orthogonal JEPA: Factorized Predictive States for Latent World Models [95.20158869896393]
予測因数分解に基づく潜在的世界モデリングフレームワークであるメソッドを導入する。
そこで本研究では,予測構造を弱め,あるいは矛盾する勾配を抑えつつ,冗長なキャパシティを支配的信号に割り当てる手法を提案する。
制御された視覚、単細胞転写学、縦断的な健康記録、連続的な制御、分子動力学の実験は、表現品質、予測、計画、長期安定性を評価する。
論文 参考訳(メタデータ) (2026-08-20T13:59:57Z) - UWM-JEPA: Predictive World Models That Imagine in Belief Space [0.2864713389096699]
本稿では,JEPAの世界モデルであるUnitary World Model JEPAを紹介した。
この構造はロールアウト中に関節状態スペクトルを正確に保存するため、予測器自体が表現された不確かさを解消することはできない。
JEPAの世界モデルでは、部分的な可観測性、潜伏幾何学、予測力学が重要であり、フリーズされたコンテキストエンコーディング能力だけではありません。
論文 参考訳(メタデータ) (2026-05-25T00:28:51Z) - PnP-Corrector: A Universal Correction Framework for Coupled Spatiotemporal Forecasting [62.22445401483844]
既存の手法は複雑なエラーのボトルネックによって厳しく制約されている。
我々は-Cast-Corrector (Plug-and-Play Corrector)と呼ばれる普遍的なフレームワークを提案する。
本手法は,結合予測システムの長期安定性を著しく向上させる。
論文 参考訳(メタデータ) (2026-05-09T13:12:33Z) - ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model [53.15040805435013]
視覚言語モデル(VLM)は、一様にサンプリングされたフレームを解析することで、強力なセマンティックグラウンドと一般的な知識を提供する。
本稿では,高密度フレーム・ダイナミックス・モデリングと長軸意味指導を組み合わせたVLM誘導型JEPA型潜在世界モデリングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-23T17:59:42Z) - LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels [49.35636088613484]
JEPA(Joint Embedding Predictive Architectures)は、コンパクトな潜在空間で世界モデルを学習するための魅力的なフレームワークを提供する。
最初のJEPAであるLeModelWorldを紹介します。
数時間で1つのGPU上で15万のパラメータをトレーニングできるため、LeWMはファンデーションモデルベースの世界モデルよりも48倍高速に計画している。
論文 参考訳(メタデータ) (2026-03-13T19:48:14Z) - BiJEPA: Bi-directional Joint Embedding Predictive Architecture for Symmetric Representation Learning [0.0]
BiJEPAは、データセグメント間のサイクル一貫性予測を強制する。
合成周期信号,カオス的ロレンツ誘導軌道,高次元画像データという3つの異なるモードでBiJEPAを評価した。
論文 参考訳(メタデータ) (2026-02-10T01:16:20Z) - VJEPA: Variational Joint Embedding Predictive Architectures as Probabilistic World Models [0.0]
EmphVariational JEPA (VJEPA) はテキスト確率論的な一般化であり、変動目的を通して将来の潜伏状態の予測分布を学習する。
VJEPA表現は、画素再構成なしで最適な制御のための十分な情報状態として機能し、崩壊回避の正式な保証を提供する。
我々は、予測的信念を学習力学の専門家とモジュラー事前専門家に分解する拡張であるEmphBayesian JEPA (BJEPA)を提案する。
論文 参考訳(メタデータ) (2026-01-20T18:04:16Z) - LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics [53.247652209132376]
JEPA(Joint-Embedding Predictive Architectures)は、有望な青写真を提供するが、実践的なガイダンスや理論の欠如がアドホックな研究開発につながっている。
我々はJEPAの包括的な理論を示し、それをbf LeJEPAでインスタンス化する。
論文 参考訳(メタデータ) (2025-11-11T18:21:55Z) - ACT-JEPA: Novel Joint-Embedding Predictive Architecture for Efficient Policy Representation Learning [90.41852663775086]
ACT-JEPAは模倣学習と自己教師型学習を統合する新しいアーキテクチャである。
我々はアクションシーケンスと抽象的な観察シーケンスを予測するポリシーを訓練する。
実験の結果,ACT-JEPAは時間環境の動的学習によって表現の質を向上させることがわかった。
論文 参考訳(メタデータ) (2025-01-24T16:41:41Z) - Denoising with a Joint-Embedding Predictive Architecture [21.42513407755273]
私たちはD-JEPA(Joint-Embedding Predictive Architecture)でDenoisingを紹介します。
本稿では,JEPAをマスク画像モデリングの一形態として認識することにより,一般化した次世代予測戦略として再解釈する。
また,拡散損失を利用して確率分布をモデル化し,連続空間におけるデータ生成を可能にする。
論文 参考訳(メタデータ) (2024-10-02T05:57:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。