論文の概要: Roadside-Cooperative Autonomous Driving: From Data Platform to Vision-Language End-to-End Reasoning
- arxiv url: http://arxiv.org/abs/2608.21032v1
- Date: Fri, 21 Aug 2026 12:29:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.525818
- Title: Roadside-Cooperative Autonomous Driving: From Data Platform to Vision-Language End-to-End Reasoning
- Title(参考訳): 道路側協力型自律運転:データ・プラットフォームからビジョン・ランゲージ・エンド・エンド・ツー・エンド・推論へ
- Abstract要約: AURORAはエンドツーエンドの協調運転フレームワークである。
AURORAは、エゴと道路側における空間的および意味的差異を緩和する。
LoRAに適応したVLMブリッジは意味的推論と生成軌道計画を行う。
- 参考スコア(独自算出の注目度): 19.188066393763407
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vehicle-to-Everything (V2X) cooperation enables beyond-line-of-sight perception, mitigating occlusions in single-vehicle sensing. However, existing V2X benchmarks provide limited support for closed-loop evaluation and language-grounded supervision, hindering the development of vision-language models (VLMs) for end-to-end cooperative driving. To address these limitations, we introduce V2XBench, a simulation platform featuring synchronized ego--roadside sensing and closed-loop evaluation, together with Chat-V2XBench, a progressively structured VQA dataset for cooperative reasoning. Building upon this benchmark infrastructure, we propose AURORA, an end-to-end cooperative driving framework. Equipped with a dual-view perception architecture, AURORA mitigates spatial and semantic discrepancies across ego and roadside viewpoints through a query-level Cross-View Query Alignment and Fusion (CQAF) module. Leveraging the resulting unified tokens, a LoRA-adapted VLM bridges semantic reasoning and generative trajectory planning. Extensive closed-loop evaluations on V2XBench demonstrate that AURORA achieves state-of-the-art performance in heavily occluded scenarios, with a Route Completion rate of 98.21% and a Driving Score of 76.02, while requiring low roadside communication bandwidth. Ultimately, this work pioneers an extensible V2X--VLM paradigm, paving the way for next-generation cooperative autonomous driving.
- Abstract(参考訳): V2X(Van-to-Everything)の協力により、視線を越えての知覚が可能となり、単一車両センシングにおける閉塞を軽減できる。
しかしながら、既存のV2Xベンチマークでは、クローズドループ評価と言語による監視が限定的にサポートされており、エンドツーエンドの協調運転のための視覚言語モデル(VLM)の開発を妨げている。
これらの制約に対処するため、我々は、協調推論のための段階的に構造化されたVQAデータセットであるChat-V2XBenchとともに、Ego-roadsideの同時検出と閉ループ評価を備えたシミュレーションプラットフォームであるV2XBenchを紹介した。
本稿では,このベンチマーク基盤を基盤として,エンドツーエンドの協調運転フレームワークであるAURORAを提案する。
AURORAは、二重視点知覚アーキテクチャを備え、クエリレベルのクロスビュークエリアライメント・アンド・フュージョン(CQAF)モジュールを通じて、エゴおよび路面の視点における空間的および意味的差異を緩和する。
結果として生じる統一トークンを利用することで、LORAに適応したVLMは意味論的推論と生成的軌道計画を橋渡しする。
V2XBenchの大規模クローズループ評価は、AURORAが道路側通信帯域を低くしながら、98.21%のルート完了率と76.02のドライビングスコアで最先端の性能を達成することを示した。
最終的に、この研究は拡張可能なV2X-VLMパラダイムを開拓し、次世代の協力型自動運転への道を開いた。
関連論文リスト
- VIPS: Vehicle-Infrastructure Cooperative Planning Benchmark via Pseudo-Simulation [50.18051979020699]
VIPSは擬似シミュレーションに基づくV2I設定における協調自動運転のベンチマークである。
CoS-V2Xはスパース表現に基づく協調計画フレームワークである。
論文 参考訳(メタデータ) (2026-09-02T11:32:52Z) - A Collaborative Multi-Modality Interaction for VLA-based End-to-End Autonomous Driving [96.81243316566764]
VLA(Vision-Language-Action)モデルは、エンドツーエンドの自動運転の強力なパラダイムとして登場した。
マルチモーダリティインタラクションと多軌道計画と最適化を組み合わせた,堅牢なVLAベースのエンドツーエンド自動運転システムを提案する。
論文 参考訳(メタデータ) (2026-08-21T09:06:16Z) - V2X-QA: A Comprehensive Reasoning Dataset and Benchmark for Multimodal Large Language Models in Autonomous Driving Across Ego, Infrastructure, and Cooperative Views [22.24590004859344]
V2X-QAは、車側、インフラ側、協調的な視点でMLLMを評価するための実世界のデータセットとベンチマークである。
その結果、視点アクセシビリティは性能に大きく影響し、インフラ側の推論は意味のあるマクロなトラフィック理解を支援することがわかった。
V2X-MoEは、明示的なビュールーティングと視点固有のLoRAエキスパートを備えたベンチマークアラインベースラインである。
論文 参考訳(メタデータ) (2026-04-03T04:07:35Z) - Bench2Drive-VL: Benchmarks for Closed-Loop Autonomous Driving with Vision-Language Models [50.22099309218635]
自律運転においては、閉ループ評価はオープンループ評価よりも信頼性の高い検証方法として広く認識されている。
本稿では,VLM駆動における閉ループ評価を実現するBench2Drive-VLについて述べる。
論文 参考訳(メタデータ) (2026-04-01T11:38:46Z) - CoReVLA: A Dual-Stage End-to-End Autonomous Driving Framework for Long-Tail Scenarios via Collect-and-Refine [73.74077186298523]
CoReVLAは、自動運転のための継続的学習フレームワークである。
データコレクションとビヘイビアリファインメントの2段階プロセスを通じて、ロングテールシナリオのパフォーマンスを改善する。
CoReVLAは72.18のドライビングスコア(DS)と50%の成功率(SR)を達成し、7.96DSの最先端手法と15%SRの長期的安全クリティカルシナリオで性能を向上する。
論文 参考訳(メタデータ) (2025-09-19T13:25:56Z) - Research Challenges and Progress in the End-to-End V2X Cooperative Autonomous Driving Competition [54.341718589800855]
車両間通信(V2X)は、知覚範囲を拡大し運転安全性を高めるための重要な手段となっている。
我々は,協調的時間知覚と協調的エンドツーエンド計画という2つのトラックを特徴とする,V2X協力によるエンドツーエンド自律運転を組織した。
本稿では,バンド幅認識融合,堅牢なマルチエージェント計画,異種センサ統合といった重要な研究課題を取り上げ,課題の設計と成果について述べる。
論文 参考訳(メタデータ) (2025-07-29T09:06:40Z) - V2X-VLM: End-to-End V2X Cooperative Autonomous Driving Through Large Vision-Language Models [13.716889927164383]
自動車間協力(V2X)は、古典的な自動運転の認識限界を克服するための有望なパラダイムとして浮上している。
本稿では、視覚言語モデル(VLM)に基づく新しいエンドツーエンド(E2E)協調自動運転フレームワークであるV2X-VLMを紹介する。
V2X-VLMは、車両やインフラからの多視点カメラビューとテキストベースのシーン記述を統合し、運転環境のより包括的な理解を可能にする。
論文 参考訳(メタデータ) (2024-08-17T16:42:13Z) - Learning Cooperative Trajectory Representations for Motion Forecasting [4.380073528690906]
協調情報から動きと相互作用の特徴を利用するための予測指向表現パラダイムを提案する。
V2X-Graphは、協調動作予測のための解釈可能かつエンドツーエンドな特徴量融合を実現するための代表的なフレームワークである。
車両から全車まで(V2X)のシナリオを更に評価するため,V2X-Traj を用いたV2X運動予測データセットを構築した。
論文 参考訳(メタデータ) (2023-11-01T08:53:05Z) - V2X-ViT: Vehicle-to-Everything Cooperative Perception with Vision
Transformer [58.71845618090022]
我々は、道路上のエージェント間で情報を融合するために、V2X-ViTという全体論的アテンションモデルを構築した。
V2X-ViTは異質なマルチエージェント自己アテンションとマルチスケールウィンドウ自己アテンションの交互層から構成される。
我々のアプローチを検証するために、我々は大規模なV2X知覚データセットを作成します。
論文 参考訳(メタデータ) (2022-03-20T20:18:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。