論文の概要: GeoWorldAD: Geometry World Action Model for Autonomous Driving
- arxiv url: http://arxiv.org/abs/2607.17521v2
- Date: Thu, 23 Jul 2026 04:08:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 14:12:06.731395
- Title: GeoWorldAD: Geometry World Action Model for Autonomous Driving
- Title(参考訳): GeoWorldAD: 自律運転のための幾何学的世界行動モデル
- Authors: Songyan Zhang, Jinyuan Tian, Hanbing Li, Daqi Liu, Hao Chen, Wenhui Huang, Fang Li, Guang Chen, Hangjun Ye, Long Chen, Kuiyuan Yang, Chen Lv,
- Abstract要約: 我々は,エゴアライメントされた3次元空間における軌道計画に基づく幾何学的世界行動モデルGeoWorldADを提案する。
現在の幾何学は安全な計画に不可欠な空間的制約を提供するが、将来の幾何学は周囲のエージェントとエゴ中心の自由空間がどのように進化するかを明らかにする。
NAVSIM v1とv2の実験は最先端の性能を示し、明示的な3次元幾何学的接地の有効性を強調した。
- 参考スコア(独自算出の注目度): 45.0114703918243
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Autonomous driving requires both safe and efficient planning decisions in dynamic 3D environments. Although recent Vision/Video-Action models learn policies directly from visual observations and scale well with advances in vision transformers and large-scale training data, they often lack explicit geometric grounding and future-aware spatial guidance, limiting their ability to balance collision avoidance and driving progress. In this work, we propose GeoWorldAD, a geometry world action model that grounds trajectory planning in ego-aligned 3D space and anticipates short-horizon scene evolution with latent future geometry tokens. Present geometry provides essential spatial constraints for safe planning, while future geometry reveals how surrounding agents and ego-centric free space may evolve, reducing overly conservative decisions without sacrificing safety. To efficiently exploit these geometric cues, GeoWorldAD progressively aggregates multi-scale present geometry and latent future geometry through iterative trajectory refinement. Experiments on NAVSIM v1 and v2 demonstrate state-of-the-art performance, highlighting the effectiveness of explicit 3D geometry grounding and future geometry world modeling for safe and efficient autonomous driving.
- Abstract(参考訳): 自律運転には、動的3D環境における安全かつ効率的な計画決定が必要である。
近年のビジョン/ビデオ・アクションモデルは、視覚観察から直接ポリシーを学習し、視覚変換器の進歩や大規模な訓練データとうまく対応できるが、視覚幾何学的根拠と将来の空間的ガイダンスが欠如しており、衝突回避と進行のバランスを取る能力が制限されている。
本研究では,エゴアライメントされた3次元空間における軌道計画の基礎となる幾何学的世界行動モデルGeoWorldADを提案する。
現在の幾何学は安全な計画に不可欠な空間的制約を提供するが、将来の幾何学は周囲のエージェントとエゴ中心の自由空間がどのように進化するかを明らかにし、安全を犠牲にすることなく過度に保守的な決定を減らしている。
これらの幾何学的手法を効果的に活用するために、GeoWorldADは、反復軌道修正により、多スケールの現在の幾何学と潜在将来の幾何学を段階的に集約する。
NAVSIM v1 と v2 の実験は、安全かつ効率的な自律運転のための明示的な3次元幾何接地と将来の幾何学世界モデリングの有効性を強調し、最先端の性能を実証している。
関連論文リスト
- LiAuto-GeoX: Efficient Grounded Driving Transformer [54.23823436153608]
デプロイ可能なエゴ中心の3Dシーン理解のための効率的な基底駆動トランスフォーマである textbfLiAuto-GeoX を提案する。
textbfLiAuto-GeoX は KITTI 上で 220 FPS で動作し,高忠実度高密度化を保ち,リアルタイムな展開を実現している。
論文 参考訳(メタデータ) (2026-06-04T06:58:44Z) - HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation [83.31948299340782]
HERMES++は、単一のフレームワーク内で3Dシーン理解と将来の幾何学的予測を統合する統合駆動世界モデルである。
Hermes++は、将来のクラウド予測と3Dシーン理解タスクの両方において、優れたパフォーマンスと優れたスペシャリストのアプローチを実現している。
論文 参考訳(メタデータ) (2026-04-30T17:59:58Z) - DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale [63.05446464787182]
本稿では,高密度な3次元形状を自律運転のクリティカルキューとして提唱するビジョン・ジオメトリ・アクションのパラダイムを提案する。
本稿では,DVGT-2(Stream Driving Visual Geometry Transformer)を導入し,入力をオンラインに処理し,現行のフレームに対して高密度なジオメトリとトラジェクトリプランニングを共同で出力する。
高速にもかかわらず、DVGT-2は様々なデータセット上で優れた幾何再構成性能を達成する。
論文 参考訳(メタデータ) (2026-04-01T12:21:26Z) - GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation [26.632472450402947]
VLA(Vision-Language-Action)モデルは、ロボット操作において強力な一般化を実現するが、主に反応性と2D中心のままである。
予測力学および幾何学的先行性を持つ連続作用ポリシーを付加する幾何学的VLAフレームワークであるGeoPredictを提案する。
RoboCasa Human-50、LIBERO、実世界の操作タスクの実験は、GeoPredictが強いVLAベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-12-18T17:51:42Z) - LSD-3D: Large-Scale 3D Driving Scene Generation with Geometry Grounding [34.74478301165912]
本稿では,大規模3次元運転シーンを正確な形状で直接生成する手法を提案する。
提案手法は, 学習した2次元画像の先行画像からのスコアの蒸留と, プロキシ幾何の生成と環境表現を組み合わせたものである。
このアプローチは高い制御性を実現し、高速誘導幾何と高忠実度テクスチャと構造を実現する。
論文 参考訳(メタデータ) (2025-08-26T17:04:49Z) - GeoDrive: 3D Geometry-Informed Driving World Model with Precise Action Control [50.67481583744243]
実世界モデルにロバストな3次元形状条件を明示的に統合したGeoDriveを紹介する。
車両の位置を編集することでレンダリングを強化するため,トレーニング中の動的編集モジュールを提案する。
動作精度と空間認識の両面で既存のモデルよりも優れていた。
論文 参考訳(メタデータ) (2025-05-28T14:46:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。