論文の概要: SUV: Future Scene Understanding as Video Generation for End-to-End Driving
- arxiv url: http://arxiv.org/abs/2608.03084v1
- Date: Tue, 04 Aug 2026 03:51:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.023601
- Title: SUV: Future Scene Understanding as Video Generation for End-to-End Driving
- Title(参考訳): SUV: エンド・ツー・エンドの運転ビデオとしての未来を理解する
- Authors: Yibo Yuan, Jiacheng Fu, Jiangtong Zhu, Yi Li, Jianhua Han, Meng Tian, Zhuohan Liu, Zhiwei Xiong, Hang Xu, Jianwu Fang, Jianru Xue,
- Abstract要約: 我々は、将来のシーン理解をビデオ生成として活用する統合エンドツーエンド駆動フレームワークであるSUVを紹介する。
SUVは、将来の外観、セマンティクス、相対深度、および共有ビデオ専門家によるビデオストリームとしてのインスタンスレベルのダイナミクスをモデル化する。
実験の結果、SUVは将来の4つのストリームを直接予測する一方で、制御されたアブリゲーションは、将来の監視構造と、将来のストリームに直接アクセスすることで、より高い軌道計画スコアが得られることを示している。
- 参考スコア(独自算出の注目度): 71.39332228514006
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: End-to-end driving requires a coherent understanding of future scenes, yet existing methods model these scenes using task-specific heads and output formats, with limited scalability. Can video generation instead provide a shared predictor? We introduce SUV, a unified end-to-end driving framework that casts future Scene Understanding as Video generation using a pretrained video foundation model. SUV models future appearance, semantics, relative depth, and instance-level dynamics as video streams with a shared video expert, without stream-specific visual prediction heads. Through joint video-action attention, the action expert attends to the latent representations of all future streams and generates the ego trajectory. Experiments show that SUV directly predicts all four future streams, while controlled ablations show that structured future supervision and direct future-stream access yield higher trajectory planning scores. With only a single front camera and no candidate-trajectory selection, SUV outperforms a broad set of recent state-of-the-art methods on both NAVSIM-v2 splits, achieving 91.0 EPDMS on navtest and 36.9 on navhard. On the long-tail WOD-E2E benchmark, SUV achieves a competitive RFS of 7.94.
- Abstract(参考訳): エンド・ツー・エンドのドライブには、将来のシーンを一貫した理解が必要ですが、既存のメソッドはタスク固有のヘッドと出力フォーマットを使用してこれらのシーンをモデル化し、スケーラビリティは制限されます。
ビデオ生成は、共有予測器を提供することができるのか?
本稿では,ビデオファウンデーションモデルを用いて,将来のシーン理解をビデオ生成として活用する統合エンドツーエンド駆動フレームワークであるSUVを紹介する。
SUVは、将来の外観、セマンティクス、相対深度、インスタンスレベルのダイナミクスを、ストリーム固有のビジュアル予測ヘッドなしで、共有ビデオ専門家とビデオストリームとしてモデル化する。
アクションエキスパートは、共同ビデオアクションの注意を通して、将来のすべてのストリームの潜在表現に参加し、エゴ軌道を生成する。
実験の結果、SUVは将来の4つのストリームを直接予測する一方、制御されたアブリゲーションは、将来の監視構造と、将来のストリームに直接アクセスすることで、より高い軌道計画スコアが得られることを示している。
単一のフロントカメラのみで軌道選択は行わないため、SUVは両方のNAVSIM-v2スプリットで最新の最先端の手法を幅広く上回り、ナヴテストで91.0 EPDMS、ナヴハルトで36.9を達成している。
WOD-E2Eベンチマークでは、SUVの競争力は7.94である。
関連論文リスト
- UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation [23.675212404889805]
世界行動モデル(WAM)は、自律運転における行動一般化を改善する強力な可能性を示している。
既存のカスケードまたはデュアルDiTは、アクション予測からビデオイマジネーションを分離する。
マスク変調トランス上に構築された統合ビデオアクションモデルであるUNIVERSEを提案する。
論文 参考訳(メタデータ) (2026-07-06T14:18:18Z) - DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving [19.231942908215174]
本稿では、事前学習したビデオ拡散変換器を自己回帰型ビデオアクションポリシーに適応させる駆動ワールドアクションモデルDriveWAMを提案する。
DriveWAMは、ビデオストリームとアクションストリームを統合された時間トークンシーケンスに編成し、それらをジョイントフローマッチングの目的の下でトレーニングする。
NAVSIMとPhysicalAI-Autonomous-Vehiclesベンチマークの実験は、DriveWAMが強力な計画性能を発揮することを示している。
論文 参考訳(メタデータ) (2026-05-27T14:36:26Z) - LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving [60.31765454895336]
本稿では、マルチモーダル理解と生成世界モデルを組み合わせた、エンドツーエンドのクローズドループ駆動のための最初のフレームワークLMGenDriveを紹介する。
本稿では,視覚前訓練から多段階長距離運転に至るまでの3段階訓練戦略を提案し,安定性と性能の向上を図る。
論文 参考訳(メタデータ) (2026-04-09T19:13:14Z) - Future-Aware End-to-End Driving: Bidirectional Modeling of Trajectory Planning and Scene Evolution [96.25314747309811]
将来的なシーンの進化と軌道計画を共同でモデル化する,新たなエンドツーエンドフレームワークであるSeerDriveを紹介する。
本手法はまず,周辺環境の動態を予測するために,将来の鳥眼ビュー(BEV)の表現を予測する。
2つの重要な要素がこれを可能にする:(1)予測されたBEV機能を軌道プランナーに注入する将来対応計画、(2)反復的なシーンモデリングと車両計画。
論文 参考訳(メタデータ) (2025-10-13T07:41:47Z) - ProphetDWM: A Driving World Model for Rolling Out Future Actions and Videos [13.630119246378518]
我々は、世界モデルを駆動するには、アクションコントロールとアクション予測の2つの追加能力が必要であると論じる。
ProphetDWMは、未来のビデオやアクションを共同で予測する新しいエンド・ツー・エンドの運転世界モデルである。
論文 参考訳(メタデータ) (2025-05-24T11:35:09Z) - GenAD: Generalized Predictive Model for Autonomous Driving [75.39517472462089]
本稿では,自動運転分野における最初の大規模ビデオ予測モデルを紹介する。
我々のモデルはGenADと呼ばれ、新しい時間的推論ブロックでシーンを駆動する際の挑戦的なダイナミクスを扱う。
アクション条件付き予測モデルやモーションプランナーに適応することができ、現実世界の運転アプリケーションに大きな可能性を秘めている。
論文 参考訳(メタデータ) (2024-03-14T17:58:33Z) - Policy Pre-training for End-to-end Autonomous Driving via
Self-supervised Geometric Modeling [96.31941517446859]
PPGeo (Policy Pre-training via Geometric Modeling) は,視覚運動運転における政策事前学習のための,直感的かつ直接的な完全自己教師型フレームワークである。
本研究では,大規模な未ラベル・未校正動画の3次元幾何学シーンをモデル化することにより,ポリシー表現を強力な抽象化として学習することを目的とする。
第1段階では、幾何モデリングフレームワークは、2つの連続したフレームを入力として、ポーズと深さの予測を同時に生成する。
第2段階では、視覚エンコーダは、将来のエゴモーションを予測し、現在の視覚観察のみに基づいて測光誤差を最適化することにより、運転方針表現を学習する。
論文 参考訳(メタデータ) (2023-01-03T08:52:49Z) - Vision-Guided Forecasting -- Visual Context for Multi-Horizon Time
Series Forecasting [0.6947442090579469]
2つのモードを融合させて車両状態のマルチ水平予測に取り組む。
我々は,視覚的特徴抽出のための3次元畳み込みと,速度と操舵角度トレースからの特徴抽出のための1次元畳み込みの設計と実験を行った。
我々は,車両の状態を様々な地平線に予測でき,運転状態推定のタスクにおいて,現在の最先端結果よりも優れた結果が得られることを示す。
論文 参考訳(メタデータ) (2021-07-27T08:52:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。