論文の概要: GeoWAM: Visual Geometry World Action Models for Autonomous Driving
- arxiv url: http://arxiv.org/abs/2608.23486v2
- Date: Tue, 25 Aug 2026 05:05:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.325527
- Title: GeoWAM: Visual Geometry World Action Models for Autonomous Driving
- Title(参考訳): GeoWAM: 自律運転のためのビジュアルジオメトリワールドアクションモデル
- Authors: Yiren Lu, Xin Ye, Jiaming Liu, Philip Jacobson, Jin Yao, Yi-chung Chen, Liam Merino, Dhruva Dixith Kurra, Min Cai, Tom Lampo, Yu Yin, Danhua Guo, Burhan Yaman,
- Abstract要約: 自律運転のための視覚幾何学的世界行動モデルである textbfGeoWAM を紹介する。
将来の画像を予測する代わりに、GeoWAMは将来のシーン形状を予測するために事前訓練されている。
幾何条件のアクションヘッドは、これらの学習された幾何学的ダイナミクスを利用して将来のエゴ軌道を予測する。
- 参考スコア(独自算出の注目度): 14.05425826273513
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World action models (WAMs) have recently gained increasing attention as a framework for jointly modeling scene evolution and ego actions in autonomous driving. Most existing WAMs learn scene dynamics in pixel space by combining a video-generation backbone for future-observation prediction with an action head for ego-trajectory prediction. Pixels, however, provide only an indirect representation of these dynamics: they entangle geometry and motion with appearance, texture, and illumination, forcing the model to infer three-dimensional transformations from two-dimensional observations. We argue that geometry, represented by point clouds, offers a more natural state space for driving because it explicitly captures spatial structure and the rigid and non-rigid transformations that govern scene evolution while directly aligning with the space in which driving actions are executed. Building on this insight, we introduce \textbf{GeoWAM}, a visual geometry world action model for autonomous driving. Rather than predicting future images, GeoWAM is pretrained to forecast future scene geometry, yielding representations that jointly encode spatial structure and temporal evolution. A geometry-conditioned action head then leverages these learned geometric dynamics to predict future ego trajectories. Extensive open-loop and closed-loop evaluations show that visual geometry world modeling yields substantially stronger driving policies than image-based alternatives, establishing future-geometry prediction as an effective pretraining objective for autonomous driving.
- Abstract(参考訳): 世界行動モデル(WAM)は、近年、自動運転におけるシーンの進化とエゴ行動の共同モデリングの枠組みとして注目されている。
多くの既存のWAMは、将来の観測予測のためのビデオ生成バックボーンと、エゴ軌道予測のためのアクションヘッドを組み合わせることで、ピクセル空間におけるシーンダイナミクスを学習する。
しかし、レンズはこれらのダイナミクスを間接的に表現するだけであり、幾何学と運動を外観、テクスチャ、照明で絡み合わせ、モデルに2次元の観測から3次元の変換を推論させる。
点雲に代表される幾何学は、空間構造を明示的に捉え、運転動作が実行される空間と直接整合しながら、シーンの進化を管理する厳密で非剛性な変換を行うので、運転のためのより自然な状態空間を提供する、と我々は主張する。
この知見に基づいて,自律運転のための視覚幾何学的世界行動モデルである \textbf{GeoWAM} を紹介する。
将来の画像を予測する代わりに、GeoWAMは将来のシーンの幾何学を予測し、空間構造と時間的進化を共同でエンコードする表現を生成するように事前訓練されている。
幾何条件のアクションヘッドは、これらの学習された幾何学的ダイナミクスを利用して将来のエゴ軌道を予測する。
広範に開かれたオープンループとクローズドループの評価により、視覚幾何学の世界モデリングは、画像に基づく代替手段よりもはるかに強力な駆動ポリシーをもたらすことが示され、将来の幾何学予測が自律運転の効果的な事前訓練対象として確立された。
関連論文リスト
- GeoWorldAD: Geometry World Action Model for Autonomous Driving [45.0114703918243]
我々は,エゴアライメントされた3次元空間における軌道計画に基づく幾何学的世界行動モデルGeoWorldADを提案する。
現在の幾何学は安全な計画に不可欠な空間的制約を提供するが、将来の幾何学は周囲のエージェントとエゴ中心の自由空間がどのように進化するかを明らかにする。
NAVSIM v1とv2の実験は最先端の性能を示し、明示的な3次元幾何学的接地の有効性を強調した。
論文 参考訳(メタデータ) (2026-07-20T03:56:07Z) - LiAuto-GeoX: Efficient Grounded Driving Transformer [54.23823436153608]
デプロイ可能なエゴ中心の3Dシーン理解のための効率的な基底駆動トランスフォーマである textbfLiAuto-GeoX を提案する。
textbfLiAuto-GeoX は KITTI 上で 220 FPS で動作し,高忠実度高密度化を保ち,リアルタイムな展開を実現している。
論文 参考訳(メタデータ) (2026-06-04T06:58:44Z) - HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation [83.31948299340782]
HERMES++は、単一のフレームワーク内で3Dシーン理解と将来の幾何学的予測を統合する統合駆動世界モデルである。
Hermes++は、将来のクラウド予測と3Dシーン理解タスクの両方において、優れたパフォーマンスと優れたスペシャリストのアプローチを実現している。
論文 参考訳(メタデータ) (2026-04-30T17:59:58Z) - Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation [66.7879424097418]
We present WorldDrive, a holistic framework that couples scene generation and real-time planning through unified vision and motion representation。
動きの表現、視覚的表現、エゴ状態の間の単純な相互作用は、高品質でマルチモーダルな軌道を生成することができる。
NAVSIM、NAVSIM-v2、nuScenesベンチマークの実験は、WorldDriveが視覚のみの手法で主要な計画性能を達成することを示した。
論文 参考訳(メタデータ) (2026-03-16T07:59:39Z) - Future-Aware End-to-End Driving: Bidirectional Modeling of Trajectory Planning and Scene Evolution [96.25314747309811]
将来的なシーンの進化と軌道計画を共同でモデル化する,新たなエンドツーエンドフレームワークであるSeerDriveを紹介する。
本手法はまず,周辺環境の動態を予測するために,将来の鳥眼ビュー(BEV)の表現を予測する。
2つの重要な要素がこれを可能にする:(1)予測されたBEV機能を軌道プランナーに注入する将来対応計画、(2)反復的なシーンモデリングと車両計画。
論文 参考訳(メタデータ) (2025-10-13T07:41:47Z) - GASP: Unifying Geometric and Semantic Self-Supervised Pre-training for Autonomous Driving [12.889523014369884]
本稿では,時空における任意の将来点を予測して統一表現を学習する幾何学的,意味論的自己教師型事前学習手法GASPを提案する。
実測値の代わりに幾何学的および意味論的4次元占有場をモデル化することにより、モデルは、時間を通して環境と環境の一般的な表現を学習する。
論文 参考訳(メタデータ) (2025-03-19T20:00:27Z) - GenAD: Generative End-to-End Autonomous Driving [13.332272121018285]
GenADは、ジェネレーティブモデリング問題に自律運転を組み込むジェネレーティブフレームワークである。
本稿では,まず周囲のシーンをマップ対応のインスタンストークンに変換するインスタンス中心のシーントークン化手法を提案する。
次に、変動型オートエンコーダを用いて、軌道先行モデリングのための構造潜在空間における将来の軌道分布を学習する。
論文 参考訳(メタデータ) (2024-02-18T08:21:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。