論文の概要: Drive-HWM: Hierarchical World Models for Dynamic-Latent Guided Autonomous Driving
- arxiv url: http://arxiv.org/abs/2609.03572v1
- Date: Thu, 03 Sep 2026 09:21:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.000638
- Title: Drive-HWM: Hierarchical World Models for Dynamic-Latent Guided Autonomous Driving
- Title(参考訳): Drive-HWM:動的遅延誘導自律運転のための階層的世界モデル
- Authors: Zhaoxin Fan, Tianbao Zhang, Wenjun Wu, Xiaofeng Wang, Yeying Jin, Jian Zhao, Zheng Zhu, Shuicheng Yan,
- Abstract要約: Drive-HWMは階層的なスローファーストな世界モデリングフレームワークで、将来の表現予測とアクション生成を補完的な時間スケールで構成する。
次のフレーム予測では、高速モデルが差し迫ったシーンの進化を捉え、一方1ステップのアクション生成は、新しい観察が到着すると、決定を継続的に更新することを可能にする。
- 参考スコア(独自算出の注目度): 78.83165764484562
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World models offer a promising paradigm for autonomous driving by predicting how traffic scenes may evolve and using such predictions to support action generation. However, existing approaches either separate future prediction from action generation or jointly predict them at the same temporal scale, making it difficult to simultaneously achieve long-horizon anticipation and responsive, observation-grounded decision making. We present Drive-HWM, a hierarchical slow--fast world modeling framework that organizes future representation prediction and action generation at complementary temporal scales. The slow world model predicts multi-step future representations to capture extended scene evolution. To explicitly model the abundant motion dynamics in driving environments, we introduce Dynamic-Aware Latents learned through optical-flow prediction. Guided by these future representations, the fast model uses a lightweight multimodal backbone and an autoregressive expert to jointly predict the next frame and the immediate action from the latest observation. Next-frame prediction encourages the fast model to capture imminent scene evolution, while one-step action generation allows decisions to be continuously updated as new observations arrive. Extensive experiments on NAVSIM v1 and v2 demonstrate the strong driving performance of Drive-HWM. Comprehensive ablation studies further validate the effectiveness of the hierarchical slow--fast design, dynamics-aware future representations, and joint next-frame and action prediction.
- Abstract(参考訳): 世界モデルは、交通シーンがどのように進化するかを予測し、そのような予測を使用してアクション生成をサポートすることで、自律運転に有望なパラダイムを提供する。
しかし、既存のアプローチでは、将来の予測を行動生成から切り離すか、同じ時間スケールで予測するかのいずれかで、長期の予測と応答性、観察に基づく意思決定を同時に達成することは困難である。
本稿では,将来の表現予測と行動生成を相補的時間スケールでまとめる階層的低速世界モデリングフレームワークDrive-HWMを提案する。
遅い世界モデルは、拡張シーンの進化を捉えるために、多段階の将来の表現を予測する。
運転環境における運動動態をモデル化するために,光フロー予測により学習した動的認識ラテントを導入する。
これらの将来の表現によって導かれた高速モデルは、軽量なマルチモーダルバックボーンと自己回帰の専門家を使用して、最新の観測から次のフレームと即時動作を共同で予測する。
次のフレーム予測では、高速モデルが差し迫ったシーンの進化を捉え、一方1ステップのアクション生成は、新しい観察が到着すると、決定を継続的に更新することを可能にする。
NAVSIM v1とv2の大規模な実験は、Drive-HWMの強い駆動性能を示している。
包括的アブレーション研究は、階層的低速設計、動的に認識される将来の表現、および次のフレームとアクションの合同予測の有効性をさらに検証する。
関連論文リスト
- ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving [12.68658021226119]
本稿では,ビジュアルアクション・クロスコンディショニングを備えた自動回帰拡散フレームワークForgeDriveを紹介する。
ForgeDriveは、運転シミュレーション、計画、視覚計測を単一のモデルに統合するだけでなく、訓練後の戦略を使わずに既存の強力なプランナーよりも優れています。
論文 参考訳(メタデータ) (2026-06-30T07:05:48Z) - IDOL: Inverse-Dynamics-Guided Future Prediction for End-to-End Autonomous Driving [6.515607168928518]
IDOLは、潜在BEV空間におけるワールドモデルに基づくエンド・ツー・エンド・プランニングのための逆力学誘導型将来の予測フレームワークである。
IDOLはまず、BEVワールドモデルを用いて複数の将来の潜伏シーン状態を予測し、次に隣接する潜伏未来に逆ダイナミクスモデルを適用する。
これらの逆力学に基づく信号は、計画された軌道を最適化するために使用され、受動シーン予測から将来の予測を実行可能な計画ガイダンスに変える。
論文 参考訳(メタデータ) (2026-05-29T16:05:42Z) - Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation [66.7879424097418]
We present WorldDrive, a holistic framework that couples scene generation and real-time planning through unified vision and motion representation。
動きの表現、視覚的表現、エゴ状態の間の単純な相互作用は、高品質でマルチモーダルな軌道を生成することができる。
NAVSIM、NAVSIM-v2、nuScenesベンチマークの実験は、WorldDriveが視覚のみの手法で主要な計画性能を達成することを示した。
論文 参考訳(メタデータ) (2026-03-16T07:59:39Z) - Future-Aware End-to-End Driving: Bidirectional Modeling of Trajectory Planning and Scene Evolution [96.25314747309811]
将来的なシーンの進化と軌道計画を共同でモデル化する,新たなエンドツーエンドフレームワークであるSeerDriveを紹介する。
本手法はまず,周辺環境の動態を予測するために,将来の鳥眼ビュー(BEV)の表現を予測する。
2つの重要な要素がこれを可能にする:(1)予測されたBEV機能を軌道プランナーに注入する将来対応計画、(2)反復的なシーンモデリングと車両計画。
論文 参考訳(メタデータ) (2025-10-13T07:41:47Z) - Ego-centric Predictive Model Conditioned on Hand Trajectories [52.531681772560724]
自我中心のシナリオでは、次の行動とその視覚的結果の両方を予測することは、人間と物体の相互作用を理解するために不可欠である。
我々は,エゴセントリックなシナリオにおける行動と視覚的未来を共同でモデル化する,統合された2段階予測フレームワークを提案する。
我々のアプローチは、エゴセントリックな人間の活動理解とロボット操作の両方を扱うために設計された最初の統一モデルである。
論文 参考訳(メタデータ) (2025-08-27T13:09:55Z) - MDMP: Multi-modal Diffusion for supervised Motion Predictions with uncertainty [7.402769693163035]
本稿では,運動予測のための多モード拡散モデルを提案する。
骨格データと行動のテキスト記述を統合し、定量性のある不確実性を伴う洗練された長期動作予測を生成する。
我々のモデルは、長期動作を正確に予測する上で、既存の生成技術よりも一貫して優れている。
論文 参考訳(メタデータ) (2024-10-04T18:49:00Z) - State-space Decomposition Model for Video Prediction Considering Long-term Motion Trend [3.910356300831074]
本稿では,全体の映像フレーム生成を決定論的外観予測と動き予測に分解する状態空間分解ビデオ予測モデルを提案する。
条件付きフレームから長期動作傾向を推定し,条件付きフレームとの高整合性を示す将来のフレームの生成を導く。
論文 参考訳(メタデータ) (2024-04-17T17:19:48Z) - AMP: Autoregressive Motion Prediction Revisited with Next Token Prediction for Autonomous Driving [59.94343412438211]
本稿では,GPT方式の次のトークン動作予測を動作予測に導入する。
同種単位-ワードからなる言語データとは異なり、運転シーンの要素は複雑な空間的・時間的・意味的な関係を持つ可能性がある。
そこで本稿では,情報集約と位置符号化スタイルの異なる3つの因子化アテンションモジュールを用いて,それらの関係を捉えることを提案する。
論文 参考訳(メタデータ) (2024-03-20T06:22:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。