論文の概要: ForeDrive: Foresight-Guided End-to-End Autonomous Driving with a Planning-Relevant Latent World Model
- arxiv url: http://arxiv.org/abs/2609.26299v2
- Date: Wed, 23 Sep 2026 03:41:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.676472
- Title: ForeDrive: Foresight-Guided End-to-End Autonomous Driving with a Planning-Relevant Latent World Model
- Title(参考訳): ForeDrive: 計画関連潜在世界モデルによる先導型エンド・ツー・エンド自動運転
- Abstract要約: 本稿では,計画関連潜在表現を学習し,Diffusion Transformer(DiT)プランナーと非対称に結合するForeDriveを提案する。
予測された未来は地平線にまたがって様々な信頼性を持ち、BEV軌道は画像トークンと不一致であるので、ゲート型視覚融合、未来統計注入、およびトラジェクティブ適応バイアス(TAB)を用いて将来の潜伏者を誘導する。
- 参考スコア(独自算出の注目度): 43.1409061166961
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing latent world models are typically optimized for future predictability, yet the resulting representations are not necessarily useful for planning in autonomous driving. Predictions are commonly used for pretraining or auxiliary supervision rather than as direct conditioning signals for trajectory generation. We propose ForeDrive, which learns a planning-relevant latent representation and couples it asymmetrically to a Diffusion Transformer (DiT) planner. The planner consumes multi-horizon latent future representations learned with a JEPA-style world model; planning gradients update the shared online encoder, while stop-gradient routing trains the latent predictor with forecasting losses only. Because predicted futures have varying reliability across horizons and BEV trajectories are misaligned with image tokens, we use gated visual fusion, future-status injection, and Trajectory-Adaptive Bias (TAB) to inject future latents as guidance without overriding the current observation. Trained with pure imitation learning and using only the current front-view image as visual input at inference, ForeDrive attains 89.9 PDMS on NAVSIM v1 and 90.0 one-stage EPDMS on NAVSIM v2, without reinforcement learning or an external trajectory scorer.
- Abstract(参考訳): 既存の潜在世界モデルは、一般的に将来の予測可能性のために最適化されているが、結果の表現は必ずしも自律運転の計画に有用ではない。
予測は、軌道生成のための直接条件信号としてではなく、事前訓練や補助的な監視のために一般的に用いられる。
本稿では,計画関連潜在表現を学習し,Diffusion Transformer(DiT)プランナーと非対称に結合するForeDriveを提案する。
計画立案者はJEPAスタイルの世界モデルで学習した複数水平の潜在未来表現を消費し、計画立案勾配は共有オンラインエンコーダを更新し、停止段階のルーティングは遅延予測器を予測損失のみで訓練する。
予測された未来は水平線にまたがって信頼性が変化しており、BEV軌道は画像トークンと不一致であるため、ゲート型視覚融合、未来統計注入、トラジェクティブ・アダプティブ・バイアス(TAB)を用いて、現在の観測をオーバーライドすることなく、将来の潜伏者を誘導する。
純粋な模倣学習と、現在のフロントビューイメージのみを推論時に視覚入力として使用することにより、フォアドライブはNAVSIM v1では89.9PDMS、NAVSIM v2では90.01ステージのEPDMSを、強化学習や外部軌跡スコアラーなしで達成できる。
関連論文リスト
- DA-WAM: Decision-Aligned Future Latents for Driving World Models [6.756366477497099]
DA-WAMは、予測表現学習、行動条件付き将来のモデリング、軌道スコアを単一の意思決定目標の下で統一するフレームワークである。
動作条件付き予測器は、トラジェクトリ候補毎の異なる将来の潜在状態を生成し、将来の遅延条件付き因子化スコアラによって評価される。
NAVSIM-v1とNAVSIM-v2の実験は、最先端の性能を示し、改善と診断分析は鍵となる構成要素を検証する。
論文 参考訳(メタデータ) (2026-08-19T16:33:02Z) - Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving [3.174313305594326]
我々は,共同埋め込み予測により,継続的な未来の運転意図を学習する行動指向潜在世界モデルであるAuto-JEPAを提案する。
軌道表現、意図予測、候補選択のためのタスク固有のモジュールのみを最適化することにより、Auto-JEPAはNAVSIM v1では91.3 PDMS、NAVSIM v2では89.1Sを達成する。
論文 参考訳(メタデータ) (2026-07-31T05:10:23Z) - IDOL: Inverse-Dynamics-Guided Future Prediction for End-to-End Autonomous Driving [6.515607168928518]
IDOLは、潜在BEV空間におけるワールドモデルに基づくエンド・ツー・エンド・プランニングのための逆力学誘導型将来の予測フレームワークである。
IDOLはまず、BEVワールドモデルを用いて複数の将来の潜伏シーン状態を予測し、次に隣接する潜伏未来に逆ダイナミクスモデルを適用する。
これらの逆力学に基づく信号は、計画された軌道を最適化するために使用され、受動シーン予測から将来の予測を実行可能な計画ガイダンスに変える。
論文 参考訳(メタデータ) (2026-05-29T16:05:42Z) - Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving [52.04950569530877]
我々は、将来のフレーム予測と軌道計画の密接なインターリーブを行う統合視覚言語行動モデルUni-World VLAを提案する。
提案手法は,高忠実度将来のフレーム予測を行いながら,競合する閉ループ計画性能を実現する。
論文 参考訳(メタデータ) (2026-03-28T14:39:51Z) - FutureX: Enhance End-to-End Autonomous Driving via Latent Chain-of-Thought World Model [103.2513470454204]
FutureXは、エンド・ツー・エンドのプランナを強化し、将来のシーンの遅延推論と軌道修正を通じて複雑な動作計画を実行するパイプラインである。
FutureXは、より合理的な運動計画と衝突を減らすことで、効率を損なうことなく既存の方法を強化する。
論文 参考訳(メタデータ) (2025-12-12T02:12:49Z) - Future-Aware End-to-End Driving: Bidirectional Modeling of Trajectory Planning and Scene Evolution [96.25314747309811]
将来的なシーンの進化と軌道計画を共同でモデル化する,新たなエンドツーエンドフレームワークであるSeerDriveを紹介する。
本手法はまず,周辺環境の動態を予測するために,将来の鳥眼ビュー(BEV)の表現を予測する。
2つの重要な要素がこれを可能にする:(1)予測されたBEV機能を軌道プランナーに注入する将来対応計画、(2)反復的なシーンモデリングと車両計画。
論文 参考訳(メタデータ) (2025-10-13T07:41:47Z) - End-to-End Driving with Online Trajectory Evaluation via BEV World Model [52.10633338584164]
本稿では,BEV Worldモデルを活用し,将来のBEV状態を予測するためのエンドツーエンド駆動フレームワークWoTEを提案する。
我々は,NAVSIMベンチマークとCARLAシミュレータに基づく閉ループBench2Driveベンチマークを用いて,最先端性能を実現する。
論文 参考訳(メタデータ) (2025-04-02T17:47:23Z) - GenAD: Generative End-to-End Autonomous Driving [13.332272121018285]
GenADは、ジェネレーティブモデリング問題に自律運転を組み込むジェネレーティブフレームワークである。
本稿では,まず周囲のシーンをマップ対応のインスタンストークンに変換するインスタンス中心のシーントークン化手法を提案する。
次に、変動型オートエンコーダを用いて、軌道先行モデリングのための構造潜在空間における将来の軌道分布を学習する。
論文 参考訳(メタデータ) (2024-02-18T08:21:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。