論文の概要: Spectral-Target Physical Latent Structuring for JEPA-Style World Models
- arxiv url: http://arxiv.org/abs/2609.04264v2
- Date: Mon, 07 Sep 2026 02:13:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:41.962474
- Title: Spectral-Target Physical Latent Structuring for JEPA-Style World Models
- Title(参考訳): JEPA-Style Worldモデルのためのスペクトルターゲット物理遅延構造
- Authors: Penghao Zhu, Salvatore Penachio, Kaustav Mukherjee, Aneesh Jonelagadda,
- Abstract要約: 軽量な「フーリエ補助ヘッド」を用いた訓練時間補助監視の提案
補助ヘッドは動的環境における計画成功率を大幅に向上させることを示す。
また,重要な物理特性と高い遅延空間相関を伴い,優れた計画性能を示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Latent world models have become increasingly popular as a method to predict and plan in latent space rather than pixel space. Recent architectures, such as LeWorldModel (LeWM), jointly train the encoder and predictor using regularization techniques like SIGReg to prevent representation collapse. Even with such regularization preventing representation collapse, we identify a new world model failure mode of physical representation laziness, particularly noted in highly dynamic environments. For these lazy cases, the learned latent states do not collapse but nonetheless fail to represent key physical properties, causing ubiquitous downstream planning failure. To resolve this issue, we propose training-time auxiliary supervision with a lightweight "Fourier auxiliary head", which enforces physically-informed structuring of the latent space with no additional inference-time cost and can be generalized to any environment. Experimentally, we show that the auxiliary head substantially improves planning success rates in dynamic environments where the baseline LeWM exhibits physical representation laziness. It also leads to modest improvements in other environments, even when the baseline does not exhibit physical representation laziness. We further observe superior planning performance being accompanied by higher latent space correlations with key physical properties, indicating both the ability of our method to physically structure latent states and the potential planning-side benefit to the learned representation being physically structured. We also see in low-data regimes, auxiliary supervision is particularly impactful in increasing success rate. These findings support the use of our Fourier auxiliary head method to improve both overall success rate and data efficiency, while avoiding representation laziness in latent world models.
- Abstract(参考訳): 潜在世界モデルは、ピクセル空間ではなく、潜在空間で予測と計画を行う方法として、ますます人気が高まっている。
LeWorldModel (LeWM) のような最近のアーキテクチャでは、エンコーダと予測器をSIGRegのような正規化技術を使って共同で訓練し、表現の崩壊を防ぐ。
このような正規化による表現の崩壊を防ぎつつも、特に高ダイナミックな環境では、物理表現遅延の新たな世界モデル失敗モードを同定する。
これらの遅延の場合、学習された潜伏状態は崩壊しないが、しかしながら重要な物理的特性を表現できず、ユビキタスな下流計画の失敗を引き起こす。
この問題を解決するために, 遅延空間の物理的インフォームド構成を追加の推論時間コストなしで実施し, 任意の環境に一般化できる軽量な「フーリエ補助ヘッド」による訓練時補助監視を提案する。
実験により,LWMが物理表現遅延を示す動的環境において,補助ヘッドは計画成功率を大幅に向上することを示した。
また、ベースラインが物理的表現遅延を示していなくても、他の環境ではわずかに改善される。
さらに,本手法が潜在状態を物理的に構造化する能力と,学習された表現が物理的に構造化されていることに対する潜在的計画側利益の両方を示す,高い遅延空間相関が鍵となる物理特性に付随する優れた計画性能を示す。
また、低データ体制においても、補助的な監督は特に成功率の上昇に影響を及ぼす。
これらの知見は、潜在世界モデルにおける表現遅延を回避しつつ、全体的な成功率とデータ効率の両方を改善するために、フーリエ補助ヘッド法の使用を支援する。
関連論文リスト
- CASA-SDF: Curriculum-Aware Spatial Adaptation with Curvature-Guided Density for Neural Implicit Surface Reconstruction [16.213539439407754]
室内表面の高忠実化は依然として大きな課題である。
既存のアプローチは、しばしば空間的に無差別な事前監視とシーン・グローバルなSDF-to-density変換に依存している。
我々は,この課題に対処する統一的な枠組みを,監督能力と表現能力の相補的適応を通じて提案する。
論文 参考訳(メタデータ) (2026-07-15T06:38:23Z) - Towards Predictive, Aligned, and Scalable Robot Learning [11.830982964522605]
本稿では、潜在空間における世界ダイナミクスを推論して行動を生成する潜在世界行動モデルであるLumo-2を紹介する。
我々は、潜在世界モデリングとモダリティアライメントについて研究し、スケーリング法則とアウト・オブ・ディストリビューションの一般化におけるそれらの役割を分析した。
その結果,Lumo-2は強い視覚言語モデル(VLA)と世界行動モデル(WAM)のベースラインを一貫して上回っていることがわかった。
論文 参考訳(メタデータ) (2026-07-13T08:53:34Z) - Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - Self-supervised Hierarchical Visual Reasoning with World Model [82.64295546475257]
対戦相手を持つ3Dオープンワールド環境は、強化学習における中核的な課題である。
階層型世界モデルであるResDreamerを提案し、各上位層をトレーニングし、下層の残余を再構築する。
この設計は、ますます洗練された世界力学の進歩的な抽象化を可能にし、よりリッチな潜在表現の出現を促進する。
論文 参考訳(メタデータ) (2026-05-17T16:42:42Z) - Temporal Straightening for Latent Planning [58.131390107122456]
潜時計画のための表現学習を改善するために時間的ストレート化を導入する。
曲率の減少は、ラテント空間におけるユークリッド距離が測地線距離のより良いプロキシとなることを示す。
論文 参考訳(メタデータ) (2026-03-12T17:49:47Z) - Diagnosing Generalization Failures from Representational Geometry Markers [8.403001493770427]
医用バイオマーカーにインスパイアされた一般化失敗について検討する。
我々は,ネットワークマーカーを設計,テストし,構造や機能リンクの探索,予後指標の同定,実環境における予測の検証を行う。
この研究は、表現幾何学が隠れた脆弱性を隠蔽し、モデル選択とAI解釈可能性に関するより堅牢なガイダンスを提供することを示した。
論文 参考訳(メタデータ) (2026-03-02T13:59:19Z) - Understanding Degradation with Vision Language Model [56.09241449206817]
視覚的劣化を理解することは、コンピュータビジョンにおいて重要な問題であるが、難しい問題である。
本稿では,教師付き微調整と強化学習を併用したマルチモーダル・チェーン・オブ・ソート・モデルであるDU-VLMを紹介する。
また,110,000個のクリーン劣化ペアと接地された物理アノテーションからなる大規模データセットである textbfDU-110k も導入した。
論文 参考訳(メタデータ) (2026-02-04T13:51:15Z) - Aligning Agentic World Models via Knowledgeable Experience Learning [68.85843641222186]
環境フィードバックをシンセサイザー化したWorld Knowledge Repositoryを構築するフレームワークであるWorldMindを紹介する。
WorldMindは、優れたクロスモデルとクロス環境転送性を備えたベースラインよりも優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-01-19T17:33:31Z) - From Local Cues to Global Percepts: Emergent Gestalt Organization in Self-Supervised Vision Models [7.7536110932446265]
我々は、現代の視覚モデルが類似した行動を示すかどうか、そしてこれらがどのような訓練条件で現れるかを検討する。
Masked Autoencoding (MAE) で訓練された視覚変換器 (ViT) はゲシュタルト法則と整合したアクティベーションパターンを示す。
本研究では,局所的なテクスチャを保ちながら,地球規模の空間摂動に対する感受性を評価するためのディストーテッド空間関係テストベンチ(DiSRT)を紹介する。
論文 参考訳(メタデータ) (2025-05-31T21:35:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。