論文の概要: WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
- arxiv url: http://arxiv.org/abs/2607.08375v1
- Date: Thu, 09 Jul 2026 11:49:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.512352
- Title: WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
- Title(参考訳): WCog-VLA: エンド・ツー・エンド自動走行のための2レベル世界認識型ビジョンランゲージ・アクションモデル
- Authors: Xuerun Yan, Zhexi Lian, Nuoheng Zhang, Shiyu Fang, Haoran Wang, Chen Lv, Jia Hu, Binyang Song,
- Abstract要約: WCog-VLAは、プロアクティブな自律運転を実現するために、生成的世界進化とセマンティックワールド予測を橋渡しする。
意味レベルでは、WCog-VLAは3次元空間知覚を取り入れることで世界認知と推論を統一する。
生成レベルでは、Aligned Decoupled Diffusion Transformer (ADDT) を強力な生成世界モデルとして紹介する。
- 参考スコア(独自算出の注目度): 34.82552727391738
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models have advanced end-to-end autonomous driving. However, existing methods either lack comprehensive world cognition or suffer from fragmented world foresight, inherently confining these models to reactive driving. To address this limitation, we propose WCog-VLA, a novel dual-level World-Cognitive VLA framework that successfully bridges semantic world forecasting with generative world evolution to achieve proactive autonomous driving. At the semantic level, WCog-VLA unifies world cognition and reasoning by incorporating 3D spatial perception and injecting agent tokens to capture the world dynamics, while concurrently enabling Game-theoretic Chain-of-Thought (Game-CoT) reasoning. At the generative level, we introduce the Aligned Decoupled Diffusion Transformer (ADDT) as a powerful generative world model that synthesizes physically-plausible joint multi-agent trajectories. Through scene representation alignment, ADDT reduces the number of denoising steps required and thus significantly accelerates inference. To facilitate strategic reasoning, we further construct a large-scale dataset featuring 85k Game-CoT annotations. Extensive experiments on the NAVSIM benchmark demonstrate that WCog-VLA achieves a State-Of-The-Art (SOTA) PDMS score of 92.9.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルには、高度なエンドツーエンドの自動運転がある。
しかし、既存の手法には包括的世界認識が欠如しているか、断片化された世界観に悩まされているかのいずれかであり、本質的にこれらのモデルを反応性駆動に集約している。
この制限に対処するため、我々はWCog-VLAを提案する。WCog-VLAは、アクティブな自律運転を実現するために、生成的世界進化とセマンティックワールド予測をブリッジする新しい2段階の世界認知VLAフレームワークである。
セマンティックレベルでは、WCog-VLAは3次元空間認識とエージェントトークンを注入することで世界認識と推論を統一し、同時にゲーム理論的連鎖理論(Game-CoT)推論を可能にする。
生成レベルでは、物理的に解明可能な多エージェント軌道を合成する強力な生成世界モデルとして、アラインドデカップリング拡散変換器(ADDT)を導入する。
シーン表示アライメントにより、ADDTは必要なデノイングステップ数を削減し、推論を大幅に高速化する。
戦略的推論を容易にするため,85k Game-CoTアノテーションを付加した大規模データセットを構築した。
NAVSIMベンチマークの大規模な実験により、WCog-VLA が State-Of-The-Art (SOTA) の PDMS スコア 92.9 を達成したことが示されている。
関連論文リスト
- CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving [4.4380564455353975]
CoWorld-VLAは、自動運転のための多専門家の世界推論フレームワークである。
世界表現は行動計画を導くための明確な条件として機能する。
実験によると、CoWorld-VLAは将来のシーン生成と計画の両方で競争力を発揮する。
論文 参考訳(メタデータ) (2026-05-11T12:01:13Z) - OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation [61.18260993245354]
Chain-of-Thought(CoT)推論は、VLAベースの自律運転において、軌道予測の強力なドライバである。
本稿では,2つの補助デコーダによって制御されるコンパクトな潜在トークンを通じて推論をルーティングする,統一VLAおよびワールドモデルフレームワークであるOneVLを提案する。
OneVLは、明示的なCoTを超える最初の遅延CoTメソッドとなり、応答のみのレイテンシで最先端の精度を提供する。
論文 参考訳(メタデータ) (2026-04-20T16:37:22Z) - UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving [48.461267171124945]
自動運転のためのUnified Driving Vision-Language-ActionモデルであるUniDriveVLAを提案する。
理解、シーン認識、行動計画の3つの専門家で構成されており、マスク付き共同注意を通して調整されている。
nuScenesのオープンループ評価とBench2Driveのクローズループ評価における最先端性能を実現する。
論文 参考訳(メタデータ) (2026-04-02T15:48:45Z) - DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving [25.94896726674773]
DriveWorld-VLAは、潜在空間内での世界モデリングと計画を統合する新しいフレームワークである。
機能レベルでは、コントロール可能でアクション条件付きイマジネーションをサポートする。
NAVSIMv1では91.3PDMS、NAVSIMv2では86.8S、nuScenesでは0.163秒の平均衝突速度で最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2026-02-06T09:25:48Z) - dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning [69.36145467833498]
本稿では,拡散に基づく視覚言語モデルであるdVLM-ADを導入する。
nuScenes と WOD-E2E で評価すると、dVLM-AD はより一貫性のある推論・アクションのペアとなり、既存の駆動VLM/VLAシステムに匹敵する計画性能を達成する。
論文 参考訳(メタデータ) (2025-12-04T05:05:41Z) - dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought [66.78110237549087]
VLA(Vision-Language-Action)モデルは、ロボット工学の次世代パラダイムとして登場しつつある。
単一システムにおける視覚認識,言語推論,ロボット制御を統一する拡散型VLAであるdVLAを紹介する。
論文 参考訳(メタデータ) (2025-09-30T02:36:11Z) - ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving [49.07731497951963]
ReCogDriveは、エンドツーエンドの自動運転のための新しい強化認知フレームワークである。
我々は、人間のドライバーのシーケンシャルな認知過程を模倣する階層的なデータパイプラインを導入する。
次に、VLMの学習した運転先を拡散プランナーに注入することで、言語行動ミスマッチに対処する。
論文 参考訳(メタデータ) (2025-06-09T03:14:04Z) - OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning [68.45848423501927]
本稿では,エージェントモデルと3次元駆動タスクを対応づける総合的視覚言語データセットを提案する。
提案手法は,代替行動を検討する人間ドライバーと同様,潜在的なシナリオとその成果を評価することによって意思決定を促進する。
論文 参考訳(メタデータ) (2025-04-06T03:54:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。