論文の概要: Subspace-Decomposed JEPAs: Disentangling Progression and Content in Latent World Models
- arxiv url: http://arxiv.org/abs/2605.31111v1
- Date: Fri, 29 May 2026 10:23:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.535803
- Title: Subspace-Decomposed JEPAs: Disentangling Progression and Content in Latent World Models
- Title(参考訳): サブスペース分解JEPA: 潜在世界モデルにおける拡張進行とコンテンツ
- Abstract要約: 統合埋め込み予測アーキテクチャは、将来の埋め込みを予測することによって、コンパクトな潜在世界モデルを学ぶ。
JEPAラテントを2つのサブスペースに彫ります。
2つの反崩壊力が解離座標に作用することを証明し、同じ次元で競合するのではなく、加法的に構成する。
- 参考スコア(独自算出の注目度): 1.034052616244602
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Joint-Embedding Predictive Architectures (JEPAs) learn compact latent world models by predicting future embeddings, but no single coordinate of the latent is designated to encode task progression. We carve the JEPA latent into two orthogonal subspaces with disjoint roles: a low-dimensional progression subspace shaped by a cosine-margin triplet loss, and a high-dimensional content subspace regularised by the existing SIGReg objective of LeWM. We prove that the two anti-collapse forces act on disjoint coordinates, so they compose additively rather than competing on the same dimensions. Our method, SD-JEPA improves over the LeWM baseline on the majority of its control benchmarks at matched compute, and outperforms the strongest non-LeWM JEPA baseline on Push-T; a subspace-ablation falsifier confirms the split is the load-bearing ingredient. Beyond planning, the resulting 1-D angular progression coordinate functions as a scene-aware compass on the latent. It advances with task progress, regresses when the agent backtracks, and under controlled perturbations both spikes and relocalises to a semantically appropriate new task-phase sector, separating the moment of surprise from its meaning in a way that prediction-error scalars cannot. Three quantitative tests back this up: $|Δθ_t|$ outperforms the standard latent-prediction-error surprise at localising semantic events on 40 held-out cube episodes by up to +0.18 pooled AUROC (97.5% per-episode win rate at $\pm 1$-step tolerance); a within-episode linear probe across all four environments (40 episodes per env) shows the 8-dimensional progression subspace (4.2% of the latent) explains 72-95% of task-progress variance..
- Abstract(参考訳): JEPA(Joint-Embedding Predictive Architectures)は、将来の埋め込みを予測することで、コンパクトな潜伏世界モデルを学習するが、タスク進行をエンコードするために、潜伏の単一の座標は指定されない。
我々はJEPAラテントを2つの直交部分空間に彫り、コサインマージン三重項損失によって形成される低次元進行部分空間と、LeWMの既存のSIGReg目的によって正規化された高次元コンテンツ部分空間である。
2つの反崩壊力が解離座標に作用することを証明し、同じ次元で競合するのではなく、加法的に構成する。
SD-JEPAは、一致した計算における制御ベンチマークの大部分のLeWMベースラインを改良し、Push-T上で最強のLeWM非LeWMJEPAベースラインを上回った。
計画の他に、結果として生じる1次元角進行座標は、潜伏者のシーン認識コンパスとして機能する。
タスクの進行、エージェントの追跡時の回帰、制御された摂動の下でスパイクと再ローカライズの両方が意味的に適切な新しいタスクフェーズセクターに移行し、予測エラースカラーが不可能な方法で驚きの瞬間をその意味から分離する。
$|Δθ_t|$は、40個の保持された立方体エピソードのセマンティックイベントを最大で0.18プールしたAUROC($\pm 1$-step toleranceで97.5%)でローカライズする標準的なラテント・プレディション・エラー・サプライズを上回り、すべての4つの環境(envあたり40話)にわたるエピソード内線形プローブは8次元の進行部分空間(潜者のうち4.2%)で72-95%のタスクプログレス分散を説明できる。
と。
関連論文リスト
- A*-Thought-V2: Efficient Latent Reasoning via Geometric Dynamics of LLM [40.07171947823021]
CoT(Chain-of-Thought)は、LLM(Large Language Models)の推論能力を改善するが、かなりの計算とコンテキストコストを発生させる。
A*-Thought-V2 は LLM ガイドフレームワークの幾何学的ダイナミクスであり,COT を隠れ状態軌道としてモデル化し,ハード削除を明示的かつ単純でインターリーブな潜在アーキテクチャに置き換える。
論文 参考訳(メタデータ) (2026-09-07T17:56:20Z) - Cut-ViT: Task-Specific Model Pruning via Gram Anchoring Subspace Consistency [71.81785123423516]
そこで本稿では,視覚基盤モデルのプルーニングのためのタスク固有のプルーニングパイプラインであるCut-ViTを提案する。
基底非依存および残留制約は、ネイティブモデルとプルーニングされたDINOv3モデルのグラム部分空間を整列するために採用される。
実験によると、Cut-ViTは1つのA100 GPU上で1分程度必要であり、様々な範囲で作業を行うことができる。
論文 参考訳(メタデータ) (2026-08-28T11:25:36Z) - GaussianDream++: Efficient 3D Gaussian World Modeling for Robotic Manipulation [55.47130289185285]
VLA(Vision-Language-Action)ポリシーは、高度な言語条件のロボット操作である。
我々は textbfWorld State Tokens と textbfWorld Prediction Tokens を VLA バックボーンに直接挿入する,コンパクトでポリシーネイティブな拡張である textbfMethodname を提示する。
論文 参考訳(メタデータ) (2026-08-26T11:41:55Z) - Qantara: Bridge-Flow Training for Multi-Paradigm JEPA Control [5.357451930622806]
共同埋め込み予測アーキテクチャは、生のピクセルから制御する潜在世界モデルの家族を支えている。
両方を提供する単一のチェックポイントは、デプロイメントの制約がどのパスが勝つかを決定するとき、この選択を推論に延期する。
本稿では,連続した清潔な潜伏者間のブラウン橋補間を共同訓練対象とするエンドツーエンドのJEPAであるQantaraを紹介する。
論文 参考訳(メタデータ) (2026-07-06T12:12:50Z) - UWM-JEPA: Predictive World Models That Imagine in Belief Space [0.2864713389096699]
本稿では,JEPAの世界モデルであるUnitary World Model JEPAを紹介した。
この構造はロールアウト中に関節状態スペクトルを正確に保存するため、予測器自体が表現された不確かさを解消することはできない。
JEPAの世界モデルでは、部分的な可観測性、潜伏幾何学、予測力学が重要であり、フリーズされたコンテキストエンコーディング能力だけではありません。
論文 参考訳(メタデータ) (2026-05-25T00:28:51Z) - High-Dimensional Latents Should Be Diagnosed Through Phase Structure [56.362776482614976]
スピングラス理論のレンズによるオートエンコーダと変分オートエンコーダの潜在空間について検討した。
固定復号器用の潜時空間スピングラス辞書を定式化する。
トポロジカルな自明化機構のエッジ・オブ・ステイティに向けて潜伏系を駆動することは、下流に具体的な結果をもたらすことを示す。
論文 参考訳(メタデータ) (2026-05-23T06:17:23Z) - iGSP:Implicit Gradient Subspace Projection for Efficient Continual Learning of Vision-Language Models [14.623213614166259]
iGSPは暗黙の勾配部分空間投影による効率的な適応を実現する新しいフレームワークである。
MTILベンチマークの実験は、iGSPが最先端の精度を達成することを示した。
論文 参考訳(メタデータ) (2026-05-19T03:22:14Z) - Looped SSMs: Depth-Recurrence and Input Reshaping for Time Series Classification [50.994194925685434]
パラメータが$k$のループSSMが$L$倍に反復され、標準SSMと一貫して一致し、性能が良くなることを示す。
また、入力再フォーマットは等しく無視された設計軸であることを示す。
論文 参考訳(メタデータ) (2026-05-15T15:18:12Z) - In-Context Learning Operates as Concept Subspace Learning [20.051573945788963]
構造化された実演が低次元概念推論を誘導するかどうかを考察する。
リッジおよび最小二乗 ICL プロキシでは、予測は正確に概念座標回帰と非部分空間リークに分解される。
これらの結果は、回復可能なICL振舞いのコンパクトなタスク整列メディエータとして概念部分空間をサポートする。
論文 参考訳(メタデータ) (2026-05-12T21:43:48Z) - SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments [49.966170814478915]
UAV VLNのための幾何学誘導空間表現フレームワークを提案する。
明示的な3次元再構成を伴わないRGB観測において、SpatialFlyは幾何学誘導2次元表示アライメント機構を導入する。
実験結果から、SpatialFlyは現状のUAV VLNベースラインを目に見える環境と見えない環境の両方で一貫して上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2026-03-22T03:56:58Z) - Probing the Latent World: Emergent Discrete Symbols and Physical Structure in Latent Representations [0.0]
JEPA(Joint Embedding Predictive Architectures)で訓練されたビデオワールドモデルは、ピクセルの再構成ではなく、潜在空間のマスキング領域を予測することによってリッチな表現を得る。
この経路は生成モデルの視覚的検証を除去し、構造的解釈可能性のギャップを生じさせる。
本稿では,AIM(AIM)フレームワークを受動的量子化プローブとして,V-JEPA2連続潜時ベクトルをタスク固有の監督やエンコーダの変更なしに離散シンボルシーケンスに変換する軽量なボキャブラリフリープローブとして提案する。
論文 参考訳(メタデータ) (2026-03-20T01:30:59Z) - LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels [49.35636088613484]
JEPA(Joint Embedding Predictive Architectures)は、コンパクトな潜在空間で世界モデルを学習するための魅力的なフレームワークを提供する。
最初のJEPAであるLeModelWorldを紹介します。
数時間で1つのGPU上で15万のパラメータをトレーニングできるため、LeWMはファンデーションモデルベースの世界モデルよりも48倍高速に計画している。
論文 参考訳(メタデータ) (2026-03-13T19:48:14Z) - Coordinate Transformer: Achieving Single-stage Multi-person Mesh
Recovery from Videos [91.44553585470688]
ビデオから複数人の3Dメッシュを回収することは、バーチャルリアリティーや理学療法などにおけるグループ行動の自動認識に向けた重要な第一歩である。
本稿では,複数人物の時空間関係を直接モデル化し,同時にエンドツーエンドでマルチ・メッシュ・リカバリを行うコーディネート・トランスフォーマーを提案する。
3DPWデータセットの実験では、CoordFormerが最先端の精度を大幅に向上し、MPJPE、PAMPJPE、PVEの計測値でそれぞれ4.2%、8.8%、そして4.7%を上回った。
論文 参考訳(メタデータ) (2023-08-20T18:23:07Z) - Auxiliary Tasks Benefit 3D Skeleton-based Human Motion Prediction [106.06256351200068]
本稿では,補助的なタスクを伴うモデル学習フレームワークを提案する。
補助作業では、部分体関節の座標はマスキングまたはノイズ付加によって損なわれる。
本稿では,不完全かつ破損した動作データを処理できる新しい補助適応変換器を提案する。
論文 参考訳(メタデータ) (2023-08-17T12:26:11Z) - Simple and Effective Prevention of Mode Collapse in Deep One-Class
Classification [93.2334223970488]
深部SVDDにおける超球崩壊を防止するための2つの正則化器を提案する。
第1の正則化器は、標準のクロスエントロピー損失によるランダムノイズの注入に基づいている。
第2の正規化器は、小さすぎるとミニバッチ分散をペナライズする。
論文 参考訳(メタデータ) (2020-01-24T03:44:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。