論文の概要: Latent-Foresight: End-to-End Learning Predictable Representations for Latent World Models
- arxiv url: http://arxiv.org/abs/2610.01942v1
- Date: Thu, 01 Oct 2026 16:09:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.256454
- Title: Latent-Foresight: End-to-End Learning Predictable Representations for Latent World Models
- Title(参考訳): 潜在予測:潜在世界モデルのためのエンドツーエンド学習予測可能な表現
- Abstract要約: Latent-Foresightは、潜在トークン化器とフローベースの生成ダイナミクスモデルを共同で学習するエンドツーエンドフレームワークである。
提案手法は時間的コヒーレントな潜在表現を学習し、2段階のベースラインを一貫して上回ることを示す。
- 参考スコア(独自算出の注目度): 12.661995278049764
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Predicting the future evolution of a scene is a fundamental capability for world modeling. Recent work has shown that operating in the feature space of Vision Foundation Models (VFMs) yields semantically rich representations that support diverse future scene understanding tasks. However, existing approaches rely on two-stage pipelines, where VFM features are first compressed using fixed dimensionality reduction (e.g., PCA) or independently trained autoencoders, and a separate predictor is trained on top of the resulting frozen latent space. This decoupling between representation learning and temporal prediction, as well as approaches that apply predictors directly on raw VFM features, provides no guarantee that the latent space is structured for predictable dynamics. In this work, we propose Latent-Foresight, an end-to-end framework that jointly learns a latent tokenizer and a flow-based generative dynamics model, explicitly shaping the representation to support temporal predictability. To enable stable joint optimization, we introduce several key design choices that prevent latent collapse and align reconstruction with generative objectives. Extensive experiments show that our approach learns more temporally coherent latent representations and consistently outperforms two-stage baselines across multiple future scene understanding tasks and prediction horizons, while eliminating separate training stages, including during high-resolution adaptation. We provide the implementation code and model weights at https://github.com/Sta8is/Latent-Foresight
- Abstract(参考訳): シーンの将来的な進化を予測することは、世界モデリングの基本的な能力である。
近年の研究では、視覚基礎モデル(VFM)の機能空間における操作は、様々な未来のシーン理解タスクをサポートする意味的に豊かな表現をもたらすことが示されている。
しかし、既存のアプローチは2段階のパイプラインに依存しており、VFMの特徴は固定次元還元(例えばPCA)または独立に訓練されたオートエンコーダを用いて最初に圧縮され、結果として凍結した潜在空間の上に個別の予測器が訓練される。
この表現学習と時間予測の分離、および生のVFM特徴に直接予測子を適用するアプローチは、潜在空間が予測可能なダイナミクスのために構造化されていることを保証しない。
本研究では,遅延トークン化器とフローベース生成力学モデルとを協調的に学習し,時間的予測可能性をサポートするために表現を明示的に形成するエンドツーエンドフレームワークであるLatent-Foresightを提案する。
安定な共同最適化を実現するために, 潜時崩壊を防止し, 再生目標に整合性を持たせるための重要な設計選択をいくつか導入する。
広汎な実験により,提案手法はより時間的コヒーレントな潜在表現を学習し,複数の将来のシーン理解タスクや予測地平線において連続的に2段階のベースラインを上回り,高分解能適応を含む個別の訓練段階を排除した。
実装コードとモデルウェイトはhttps://github.com/Sta8is/Latent-Foresightで公開しています。
関連論文リスト
- Flow Matching in Feature Space for Stochastic World Modeling [21.159664319255665]
本研究では,事前学習した特徴空間内で直接フローマッチングを行う世界モデルであるFlowWMを提案する。
事前訓練された特徴はかなり高次元であり、標準的な拡散レシピが最適ではないため、これは難しい。
FlowWMを2つのベンチマークで評価する: 精度と多様性の体系的評価のための総合ベンチマークと、現実のベンチマークFuturePerceptionである。
論文 参考訳(メタデータ) (2026-06-27T19:35:27Z) - GeoSem-WAM: Geometry- and Semantic-Aware World Action Models [13.18627268862803]
本稿では,幾何学的・意味的監督を通じて潜在表現を強化する構造化世界モデリングフレームワークを提案する。
提案手法は,テスト時の映像生成や自動ロールアウトを回避し,効率的な推論を行う。
論文 参考訳(メタデータ) (2026-06-02T05:48:02Z) - LeapTS: Rethinking Time Series Forecasting as Adaptive Multi-Horizon Scheduling [74.94985663101906]
本稿では,予測地平線上での動的スケジューリングプロセスとして時系列予測を再構成する新しいフレームワーク LeapTSを提案する。
LeapTSは、Transformerベースのモデルよりも2.6$times$から5.3$times$推論スピードアップを実現しつつ、全体的な予測性能を少なくとも7.4%向上させる。
論文 参考訳(メタデータ) (2026-05-11T09:54:02Z) - ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model [53.15040805435013]
視覚言語モデル(VLM)は、一様にサンプリングされたフレームを解析することで、強力なセマンティックグラウンドと一般的な知識を提供する。
本稿では,高密度フレーム・ダイナミックス・モデリングと長軸意味指導を組み合わせたVLM誘導型JEPA型潜在世界モデリングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-23T17:59:42Z) - FRAPPE: Infusing World Modeling into Generalist Policies via Multiple Future Representation Alignment [45.21358158991569]
VLAモデルは、世界モデリングとして知られる環境力学を予測することができる。
現在のアプローチでは,1) セマンティックラーニングと一般化を制約する画素レベルの再構成を過度に強調する訓練対象モデル,2) 推論中に予測される将来の観測への信頼が,しばしばエラーの蓄積につながる,という2つの問題に直面している。
これらの課題に対処するために、並列プログレッシブ拡張(FRAPPE)を介して、Future Representation Alignmentを導入する。
論文 参考訳(メタデータ) (2026-02-19T11:00:46Z) - EIDOS: Latent-Space Predictive Learning for Time Series Foundation Models [37.917978019436674]
EIDOSは、将来の価値予測から潜在空間予測学習に移行する基礎モデルファミリーである。
我々は、潜伏表現の進化を予測するために因果変換器を訓練し、構造化および時間的に整合した潜伏状態の出現を促す。
論文 参考訳(メタデータ) (2026-02-15T07:07:20Z) - VFMF: World Modeling by Forecasting Vision Foundation Model Features [67.09340259579761]
本稿では,視覚基礎モデルの特徴空間における自己回帰フローマッチングを行う生成予測器を提案する。
この潜伏情報の方がPCAベースの代替案よりも効果的であることを示す。
一致したアーキテクチャと計算により、本手法はすべてのモダリティにおける回帰よりもシャープで正確な予測を生成する。
論文 参考訳(メタデータ) (2025-12-12T02:10:05Z) - A Time-Series Foundation Model by Universal Delay Embedding [4.221753069966852]
本研究は,時系列予測に革命をもたらすための事前訓練された基礎モデルであるUniversal Delay Embedding (UDE)を紹介する。
観測データの動的表現としてのUDEは、ハンケル行列から2次元部分空間パッチを構成する。
特に、学習された動的表現とパッチからのクープマン作用素予測形式は例外的な解釈可能性を示す。
論文 参考訳(メタデータ) (2025-09-15T16:11:49Z) - UniSTD: Towards Unified Spatio-Temporal Learning across Diverse Disciplines [64.84631333071728]
本稿では,時間的モデリングのためのトランスフォーマーベースの統合フレームワークであるbfUnistageを紹介する。
我々の研究は、タスク固有の視覚テキストが時間学習のための一般化可能なモデルを構築することができることを示した。
また、時間的ダイナミクスを明示的に組み込むための時間的モジュールも導入する。
論文 参考訳(メタデータ) (2025-03-26T17:33:23Z) - Will Pre-Training Ever End? A First Step Toward Next-Generation Foundation MLLMs via Self-Improving Systematic Cognition [89.50068130832635]
自己改善認知 (SIcog) は、マルチモーダル知識によって次世代のMLLMを構築するための自己学習フレームワークである。
ステップバイステップの視覚的理解のためのChain-of-Descriptionを提案し、詳細なマルチモーダル推論をサポートするために構造化されたChain-of-Thought(CoT)推論を統合する。
実験は、マルチモーダル認知を増強したMLLMの開発におけるSIcogの有効性を示す。
論文 参考訳(メタデータ) (2025-03-16T00:25:13Z) - Skeleton2vec: A Self-supervised Learning Framework with Contextualized
Target Representations for Skeleton Sequence [56.092059713922744]
予測対象として高レベルな文脈化機能を使用することで,優れた性能が得られることを示す。
具体的には、シンプルで効率的な3D行動表現学習フレームワークであるSkeleton2vecを提案する。
提案するSkeleton2vecは,従来の手法より優れ,最先端の結果が得られる。
論文 参考訳(メタデータ) (2024-01-01T12:08:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。