論文の概要: FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds
- arxiv url: http://arxiv.org/abs/2608.01049v1
- Date: Sun, 02 Aug 2026 07:32:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.072292
- Title: FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds
- Title(参考訳): FactorJEPA: 集合的・カオス的南都市社会におけるモノリシック・フューチャーをレイアウト・エージェント・インタラクション・チャネルに分解する
- Abstract要約: 我々は、人口が多く、混雑し、混乱したグローバル・サウスの都市環境について、ほとんど調査されていない体制について研究している。
既存の評価に支配的な低密度、車線構造の設定とは異なり、これらのシーンは柔らかい空間境界を示す。
私たちはこの体制のための最初の大規模なデータセットを紹介します。ドライブスルー、ウォークスルー、および22都市にわたる空中ビデオの1,000時間です。
- 参考スコア(独自算出の注目度): 20.90457097908955
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World models have attracted significant attention for their ability to capture and predict the structure and dynamics of the physical world. In this emerging landscape, Joint Embedding Predictive Architectures (JEPA) offer a particularly compelling direction. We study a largely unexplored regime: populous, crowded, and chaotic Global South urban environments, which we call DENSEWORLD. Unlike the lower-density, lane-structured settings that dominate existing evaluations, these scenes exhibit soft spatial boundaries, extreme agent heterogeneity, persistent occlusion, and rapid social negotiation under mixed traffic. We introduce the first large-scale dataset for this regime: 1,000 hours of drive-through, walk-through, and aerial video across 22 cities. Existing JEPA formulations struggle to preserve dense interaction dynamics under heterogeneity and partial observability. We introduce FactorJEPA, which makes world structure a first-class predictive primitive. Rather than encoding the future in a monolithic latent, it composes layout, entities, and interactions, using a visibility gate and separated subspaces to preserve partially observed agents and discourage cross-factor shortcuts. FactorJEPA improves (i) future-latent accuracy (Future-frame L1), (ii) intervention-sensitive prediction (Causal L1), and (iii) robustness to reduced visual evidence (Mask-ratio slope), while exposing (iv) a reproducible motion-information trade-off (Motion cosine). Method rankings replicate across 2B and 1B V-JEPA 2.1 backbones, with rho = 0.895 to 0.978. We publicly release the DENSEWORLD-115k dataset (https://huggingface.co/datasets/anonymousML123/denseworld-115k) and the surgery-trained FactorJEPA checkpoints (https://huggingface.co/datasets/anonymousML123/factorjepa-outputs/tree/main/outputs/full/vjepa_2_1_ vitg_1B/train/m09c_surgery_3stage_DI_diheavy_encoder).
- Abstract(参考訳): 世界モデルは、物理世界の構造と力学を捉え予測する能力によって大きな注目を集めている。
この新興の状況において、JEPA(Joint Embedding Predictive Architectures)は特に魅力的な方向性を提供します。
DENSEWORLDという,人口の多い,人口の多い,混み合った,カオス的なグローバルサウスの都市環境について研究している。
既存の評価に支配的な低密度の車線構造設定とは異なり、これらのシーンはソフトな空間境界、極端なエージェントの不均一性、永続的な閉塞、混在した交通下での迅速な社会交渉を示す。
私たちはこの体制のための最初の大規模なデータセットを紹介します。ドライブスルー、ウォークスルー、および22都市にわたる空中ビデオの1,000時間です。
既存のJEPAの定式化は、不均一性と部分可観測性の下での密接な相互作用のダイナミクスを保存するのに苦労する。
我々は、世界構造を第一級予測プリミティブにするFacterJEPAを紹介する。
モノリシックなラテントで未来をエンコードするのではなく、可視性ゲートと分離されたサブスペースを使用してレイアウト、エンティティ、インタラクションを構成し、部分的に観察されたエージェントを保持し、クロスファクタのショートカットを阻止する。
FactorJEPAの改善
(i)フューチャーラテント精度(フューチャーフレームL1)
(ii)介入感受性予測(Causal L1)、及び
三 視覚的証拠の減少(マスク比勾配)に対する露光時の頑健性
(四)再現可能な運動情報トレードオフ(運動コサイン)
メソッドランキングは2Bと1BのV-JEPA 2.1バックボーンで再現され、rho = 0.895 から 0.978 となる。
DENSEWORLD-115kデータセット(https://huggingface.co/datasets/anonymousML123/anonymousML123/anonymousML123/factorjepa-outputs/tre e/main/outputs/full/vjepa_2_1_vitg_1B/train/m09c_diheavy_encoder)と、手術訓練されたFactJEPAチェックポイント(https://huggingface.co/datasets/anonymousML123/factorjepa-outputs/tree/main/outputs/full/vjepa_2_1_ vitg_1B/train/m09c_diheavy_encoder)を公開します。
関連論文リスト
- UWM-JEPA: Predictive World Models That Imagine in Belief Space [0.2864713389096699]
本稿では,JEPAの世界モデルであるUnitary World Model JEPAを紹介した。
この構造はロールアウト中に関節状態スペクトルを正確に保存するため、予測器自体が表現された不確かさを解消することはできない。
JEPAの世界モデルでは、部分的な可観測性、潜伏幾何学、予測力学が重要であり、フリーズされたコンテキストエンコーディング能力だけではありません。
論文 参考訳(メタデータ) (2026-05-25T00:28:51Z) - Entity-Centric World Models: Interaction-Aware Masking for Causal Video Prediction [0.0]
JEPA(Joint Embedding Predictive Architectures)はセマンティックな分類のベンチマークを新たに設定した。
本稿では,自己監督型動き中心マスキング戦略を利用したInteraction-Aware JEPA (IA-JEPA)を提案する。
IA-JEPAは因果推論タスクで14.26%の精度を達成しており、標準的なパッチメイクベースラインで達成された3.22%を大きく上回っている。
論文 参考訳(メタデータ) (2026-05-14T23:10:04Z) - ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model [53.15040805435013]
視覚言語モデル(VLM)は、一様にサンプリングされたフレームを解析することで、強力なセマンティックグラウンドと一般的な知識を提供する。
本稿では,高密度フレーム・ダイナミックス・モデリングと長軸意味指導を組み合わせたVLM誘導型JEPA型潜在世界モデリングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-23T17:59:42Z) - Probing the Latent World: Emergent Discrete Symbols and Physical Structure in Latent Representations [0.0]
JEPA(Joint Embedding Predictive Architectures)で訓練されたビデオワールドモデルは、ピクセルの再構成ではなく、潜在空間のマスキング領域を予測することによってリッチな表現を得る。
この経路は生成モデルの視覚的検証を除去し、構造的解釈可能性のギャップを生じさせる。
本稿では,AIM(AIM)フレームワークを受動的量子化プローブとして,V-JEPA2連続潜時ベクトルをタスク固有の監督やエンコーダの変更なしに離散シンボルシーケンスに変換する軽量なボキャブラリフリープローブとして提案する。
論文 参考訳(メタデータ) (2026-03-20T01:30:59Z) - LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels [49.35636088613484]
JEPA(Joint Embedding Predictive Architectures)は、コンパクトな潜在空間で世界モデルを学習するための魅力的なフレームワークを提供する。
最初のJEPAであるLeModelWorldを紹介します。
数時間で1つのGPU上で15万のパラメータをトレーニングできるため、LeWMはファンデーションモデルベースの世界モデルよりも48倍高速に計画している。
論文 参考訳(メタデータ) (2026-03-13T19:48:14Z) - BiJEPA: Bi-directional Joint Embedding Predictive Architecture for Symmetric Representation Learning [0.0]
BiJEPAは、データセグメント間のサイクル一貫性予測を強制する。
合成周期信号,カオス的ロレンツ誘導軌道,高次元画像データという3つの異なるモードでBiJEPAを評価した。
論文 参考訳(メタデータ) (2026-02-10T01:16:20Z) - UniSH: Unifying Scene and Human Reconstruction in a Feed-Forward Pass [83.7071371474926]
UniSHは、統合されたフィードフォワードフレームワークで、共同でメートルスケールの3Dシーンと人間の再構築を行う。
我々のフレームワークは、シーン再構築とHMRとの違いを強く橋渡しします。
本モデルは,人間中心のシーン再構築における最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-01-03T16:06:27Z) - LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics [53.247652209132376]
JEPA(Joint-Embedding Predictive Architectures)は、有望な青写真を提供するが、実践的なガイダンスや理論の欠如がアドホックな研究開発につながっている。
我々はJEPAの包括的な理論を示し、それをbf LeJEPAでインスタンス化する。
論文 参考訳(メタデータ) (2025-11-11T18:21:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。