論文の概要: Orbis 2: A Hierarchical World Model for Driving
- arxiv url: http://arxiv.org/abs/2607.15898v1
- Date: Fri, 17 Jul 2026 12:12:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.846057
- Title: Orbis 2: A Hierarchical World Model for Driving
- Title(参考訳): Orbis 2: 運転のための階層的世界モデル
- Abstract要約: 本稿では,異なる時間的・抽象的なスケールで動作する2段階にわたる将来の予測を分解する階層駆動世界モデルを提案する。
この分解は、強い空間的および意味的表現をキャプチャしながら、高い知覚的忠実性をもたらす。
本稿では,拡散強制モデルと教師強制モデルを用いた2段階学習パラダイムを提案する。
- 参考スコア(独自算出の注目度): 21.534159792492186
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current world models operate at a single level of abstraction, with most prioritizing perceptual fidelity while lacking the spatial reasoning and semantic understanding required for real-world downstream tasks. We present a hierarchical driving world model that factorizes future prediction across two levels operating at distinct temporal and abstraction scales: a high-level predictor that forecasts coarse scene structure over extended temporal horizons, and a low-level generator that produces detailed predictions conditioned on the high-level output. This decomposition yields high perceptual fidelity while also capturing strong spatial and semantic representations. We further show that pretraining with a diffusion forcing objective yields substantially richer internal representations than the standard teacher forcing objective, while teacher forcing -- predicting only the next frame from clean context -- produces more stable autoregressive rollouts. We therefore introduce a generic two-stage training paradigm that pretrains the model with diffusion forcing and fine-tunes with teacher forcing, combining the representational benefits of the former with the rollout stability of the latter. Our approach achieves state-of-the-art results across the standard suite of driving world model evaluations on established benchmarks, including long-horizon generation fidelity, steering responsiveness evaluated on counterfactual scenarios, and internal representation quality. Project page with code, demo, checkpoints and qualitative results: https://lmb-freiburg.github.io/orbis2.github.io/
- Abstract(参考訳): 現在の世界モデルは、現実の下流のタスクに必要な空間的推論と意味的理解を欠きながら、知覚の忠実さを最優先して、単一の抽象化レベルで運用されている。
本研究では,時間的,抽象的な2段階にわたる将来の予測を,時間的・抽象的な異なるスケールで決定する階層型駆動世界モデルを提案する。
この分解は、強い空間的および意味的表現をキャプチャしながら、高い知覚的忠実性をもたらす。
さらに,拡散強制目標を用いた事前学習は,教師の強制目標よりも内部表現がかなりリッチであること,教師の強制目標がクリーンな文脈から次のフレームのみを予測することによって,より安定した自己回帰的ロールアウトを生み出すこと,などが示されている。
そこで本研究では,拡散強制モデルと教師強制モデルを用いた2段階学習パラダイムを導入し,前者の表現的メリットと後者のロールアウト安定性を組み合わせた。
提案手法は,時間軸生成忠実度,非現実シナリオで評価された操舵応答性,内部表現品質など,確立されたベンチマーク上での駆動世界モデル評価の標準スイートにまたがって,最先端の成果を達成している。
コード、デモ、チェックポイント、定性的な結果を含むプロジェクトページ:https://lmb-freiburg.github.io/orbis2.github.io/
関連論文リスト
- HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving [11.703169226106288]
我々は,画素レベルの監視と潜在表現学習を統合するハイブリッドワールドVLAフレームワークHyWorldVLAを提案する。
事前トレーニング段階では、HyWorldVLAは、事前トレーニングされたビデオVAEによって符号化された潜伏映像を予測し、同時にビデオフレームを再構築し、正確なピクセルレベルのグラウンドを提供する。
その後のコファインチューニングフェーズでは、モデルは遅延した特徴のみを予測し、それをアクションエキスパートに入力して軌道を生成する。
論文 参考訳(メタデータ) (2026-07-23T07:11:41Z) - Flow Matching in Feature Space for Stochastic World Modeling [21.159664319255665]
本研究では,事前学習した特徴空間内で直接フローマッチングを行う世界モデルであるFlowWMを提案する。
事前訓練された特徴はかなり高次元であり、標準的な拡散レシピが最適ではないため、これは難しい。
FlowWMを2つのベンチマークで評価する: 精度と多様性の体系的評価のための総合ベンチマークと、現実のベンチマークFuturePerceptionである。
論文 参考訳(メタデータ) (2026-06-27T19:35:27Z) - ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model [53.15040805435013]
視覚言語モデル(VLM)は、一様にサンプリングされたフレームを解析することで、強力なセマンティックグラウンドと一般的な知識を提供する。
本稿では,高密度フレーム・ダイナミックス・モデリングと長軸意味指導を組み合わせたVLM誘導型JEPA型潜在世界モデリングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-23T17:59:42Z) - Open-World Motion Forecasting [15.508091258980143]
モーション予測は、シーン内のダイナミックエージェントの将来の軌跡を予測することを目的としており、自動運転車がシーンの進化について推論できるようにする。
既存のアプローチはクローズドワールド体制の下で動作し、固定オブジェクト分類と高品質な知覚へのアクセスを仮定する。
我々は,時間とともに新しいオブジェクトクラスを順次導入し,将来的なオブジェクトの軌跡をカメラ画像から直接推定する,オープンワールドモーション予測を導入する。
論文 参考訳(メタデータ) (2026-03-10T09:35:08Z) - StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models [98.72926158261937]
本稿では,Visual AutoRegressive モデルのためのトレーニングフリートークン解析フレームワークを提案する。
我々は局所的なテクスチャの詳細を捉えるために軽量なハイパスフィルタを使用し、グローバルな構造情報を保存するために主成分分析(PCA)を活用している。
スパーストークンの下で有効な次世代の予測を維持するために,近接した特徴伝達戦略を導入する。
論文 参考訳(メタデータ) (2026-03-02T11:35:05Z) - FRAPPE: Infusing World Modeling into Generalist Policies via Multiple Future Representation Alignment [45.21358158991569]
VLAモデルは、世界モデリングとして知られる環境力学を予測することができる。
現在のアプローチでは,1) セマンティックラーニングと一般化を制約する画素レベルの再構成を過度に強調する訓練対象モデル,2) 推論中に予測される将来の観測への信頼が,しばしばエラーの蓄積につながる,という2つの問題に直面している。
これらの課題に対処するために、並列プログレッシブ拡張(FRAPPE)を介して、Future Representation Alignmentを導入する。
論文 参考訳(メタデータ) (2026-02-19T11:00:46Z) - Understanding Degradation with Vision Language Model [56.09241449206817]
視覚的劣化を理解することは、コンピュータビジョンにおいて重要な問題であるが、難しい問題である。
本稿では,教師付き微調整と強化学習を併用したマルチモーダル・チェーン・オブ・ソート・モデルであるDU-VLMを紹介する。
また,110,000個のクリーン劣化ペアと接地された物理アノテーションからなる大規模データセットである textbfDU-110k も導入した。
論文 参考訳(メタデータ) (2026-02-04T13:51:15Z) - Scaling Up Occupancy-centric Driving Scene Generation: Dataset and Method [54.461213497603154]
作業中心の手法は、最近、フレームとモダリティをまたいだ一貫した条件付けを提供することで、最先端の結果を得た。
Nuplan-Occは、広く使われているNuplanベンチマークから構築された、これまでで最大の占有率データセットである。
高品質な占有、多視点ビデオ、LiDAR点雲を共同で合成する統合フレームワークを開発した。
論文 参考訳(メタデータ) (2025-10-27T03:52:45Z) - Generalist Forecasting with Frozen Video Models via Latent Diffusion [35.96406989431198]
本稿では,視覚モデルの知覚能力と,短時間の地平線上での予測性能との間に強い相関関係を示す。
本研究は,映像理解のためのブリッジング表現学習と生成モデリングの価値を強調した。
論文 参考訳(メタデータ) (2025-07-18T14:14:19Z) - OPUS: Occupancy Prediction Using a Sparse Set [64.60854562502523]
学習可能なクエリの集合を用いて、占有された場所とクラスを同時に予測するフレームワークを提案する。
OPUSには、モデルパフォーマンスを高めるための非自明な戦略が組み込まれている。
最も軽量なモデルではOcc3D-nuScenesデータセットの2倍 FPS に優れたRayIoUが得られる一方、最も重いモデルは6.1 RayIoUを上回ります。
論文 参考訳(メタデータ) (2024-09-14T07:44:22Z) - Skeleton2vec: A Self-supervised Learning Framework with Contextualized
Target Representations for Skeleton Sequence [56.092059713922744]
予測対象として高レベルな文脈化機能を使用することで,優れた性能が得られることを示す。
具体的には、シンプルで効率的な3D行動表現学習フレームワークであるSkeleton2vecを提案する。
提案するSkeleton2vecは,従来の手法より優れ,最先端の結果が得られる。
論文 参考訳(メタデータ) (2024-01-01T12:08:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。