論文の概要: CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving
- arxiv url: http://arxiv.org/abs/2607.02841v1
- Date: Fri, 03 Jul 2026 00:34:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.431919
- Title: CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving
- Title(参考訳): CLEAR: エンドツーエンド自動運転のための大規模閉ループ強化学習
- Abstract要約: E2E-ADのための大規模強化学習(RL)を用いた閉ループ訓練システムであるCLEARを提案する。
簡単な報奨により、CLEARは従来の手法よりも大幅に優れ、新しい最先端性能を設定できることが示される。
- 参考スコア(独自算出の注目度): 66.77752555295355
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: End-to-end autonomous driving (E2E-AD) aims to directly map raw sensor information to driving actions. Recently, with the rapid advancement of multi-modal large language models (MLLMs), researchers have proposed the paradigm of Vision-Language-Action (VLA) models for E2E-AD, where it seeks to integrate visual perception, language understanding and action prediction within a single policy. However, existing VLA-based policies largely adopts imitation learning, where it only learns to drive by optimizing distance-based metrics w.r.t. logged expert trajectories. Such distribution shift between open-loop training and closed-loop inference leads to suboptimal performance in closed-loop planning. To close this gap, we present CLEAR, a system that enables closed-loop training using Reinforcement Learning (RL) at scale for E2E-AD. We propose to learn a novel residual waypoint policy around the waypoint prior from pretrained VLA policies, effectively harnessing the knowledge within. On another front, one of the key challenges to scale up RL for vision-based policies is the number of parallel simulation environments since RL is data hungry. To that end, we design a heterogeneous pipeline that places the simulator and the VLA learner on distinct compute groups, which allows us to dramatically increase the number of simulation environments running in parallel while avoiding resource contention and maintaining training stability. We show that with a simple reward, CLEAR significantly outperforms previous methods and sets new state-of-the-art performance on the challenging benchmarks of CARLA longest6 v2 and Bench2Drive.
- Abstract(参考訳): エンドツーエンド自動運転(E2E-AD)は、生のセンサー情報を運転行動に直接マッピングすることを目的としている。
近年,Multi-Modal Large Language Model (MLLM) の急速な進歩に伴い,研究者らは,視覚認識,言語理解,行動予測を単一のポリシーに統合することを目的とした,E2E-ADのためのビジョン・ランゲージ・アクション・モデル(VLA)のパラダイムを提案している。
しかしながら、既存のVLAベースのポリシーは主に模倣学習を採用しており、距離ベースのメトリクスw.r.t.ログされた専門家の軌跡を最適化することによってのみ、運転を学習する。
このようなオープンループトレーニングとクローズドループ推論の分布シフトは、クローズドループ計画における準最適性能をもたらす。
このギャップを埋めるために,E2E-ADのための大規模強化学習(Reinforcement Learning, RL)を用いた閉ループ訓練を可能にするシステムであるCLEARを提案する。
我々は、事前訓練されたVLAポリシーから経路点周辺の新たな残留経路点ポリシーを学習し、内部の知識を効果的に活用することを提案する。
別の面では、視覚ベースのポリシーのためにRLをスケールアップする上で重要な課題の1つは、RLがデータに飢えているため、並列シミュレーション環境の数である。
そこで我々は,シミュレータとVLA学習者を異なる計算グループに配置するヘテロジニアスパイプラインを設計し,資源競合を回避し,トレーニング安定性を保ちながら,並列に実行されるシミュレーション環境の数を劇的に増加させることができる。
簡単な報奨により、CLEARは従来の手法よりも大幅に優れており、CARLAlong6 v2とBench2Driveの挑戦的なベンチマークに対して、新しい最先端のパフォーマンスを設定できることが示される。
関連論文リスト
- MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving [62.43744546817599]
視覚言語-アクション(VLA)モデルは、エンドツーエンドのモーションプランナーとして有効であるが、クローズドループ設定で評価すると不安定である。
本稿では, VLAモデルの潜在空間における動的駆動シナリオの, リアクティブでマルチエージェントなロールアウトのための新しいフレームワークMAPLEを提案する。
MAPLEはBench2Driveで最先端の駆動性能を実現し、堅牢なE2E自動運転システムのためのスケーラブルでクローズループなマルチエージェントプレイを実演する。
論文 参考訳(メタデータ) (2026-05-13T23:35:14Z) - GSDrive: Reinforcing Driving Policies by Multi-mode Trajectory Probing with 3D Gaussian Splatting Environment [6.425301529118419]
E2E(End-to-end autonomous driving)は、知覚入力を直接駆動動作に変換するための有望なアプローチである。
GSDriveは,E2E駆動ポリシーの改善において,3次元ガウシアンスプラッティング(3DGS)を微分可能な物理ベースの報酬形成に活用するフレームワークである。
論文 参考訳(メタデータ) (2026-04-30T16:59:07Z) - PerlAD: Towards Enhanced Closed-loop End-to-end Autonomous Driving with Pseudo-simulation-based Reinforcement Learning [23.599241673009956]
Pseudo-simulation-based RL method for closed-loop end-to-end autonomous driving, PerlAD。
オフラインデータセットに基づいて、PerlADはベクトル空間で動作する擬似シミュレーションを構築し、効率的でレンダリング不要なトライアルとエラーのトレーニングを可能にする。
PerlADはBench2Driveベンチマークで最先端のパフォーマンスを達成し、以前のE2E RL法を10.29%上回った。
論文 参考訳(メタデータ) (2026-03-16T07:09:07Z) - AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering [52.67783579040657]
AceGRPOは、エージェントの学習フロンティアにおけるタスクを優先順位付けして学習効率を最大化する機械学習システムである。
我々のトレーニングされたAce-30Bモデルは、MLE-Bench-Lite上で100%有効な応募率を実現し、プロプライエタリなフロンティアモデルの性能にアプローチし、より大きなオープンソースベースラインを上回ります。
論文 参考訳(メタデータ) (2026-02-08T10:55:03Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - Model-Based Policy Adaptation for Closed-Loop End-to-End Autonomous Driving [54.46325690390831]
本稿では,事前学習したE2E運転エージェントのロバスト性と安全性を高めるための汎用フレームワークとして,モデルベースポリシー適応(MPA)を提案する。
MPAは、ジオメトリ一貫性のあるシミュレーションエンジンを用いて、まず様々な対物軌道を生成する。
MPAは拡散ベースのポリシーアダプタを訓練し、基本方針の予測を洗練させ、Q値モデルを多段階に分けて長期的な結果を評価する。
論文 参考訳(メタデータ) (2025-11-26T17:01:41Z) - ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation [57.399685080574756]
既存のMLLMベースのVLNメソッドは模倣学習(IL)に依存しており、ポストトレーニングにDAggerを使用することが多い。
マルチターンRLによるアクティブな探索を可能にするVLNフレームワークであるActiveVLNを提案する。
実験の結果,ActiveVLN は DAgger ベースと RL ベースのポストトレーニング手法と比較して,IL ベースラインよりも最大の性能向上を実現していることがわかった。
論文 参考訳(メタデータ) (2025-09-16T03:31:46Z) - IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model [19.141499640543138]
IRL-VLA は textbfInverse textbfReinforcement textbfLearning reward world model による新しいループ強化学習である。
本稿では, 自己構築型VLAアプローチを用いて, textbfInverse textbfReinforcement textbfLearning reward world model を用いた新しいループ強化学習であるIRL-VLAを紹介する。
論文 参考訳(メタデータ) (2025-08-07T06:30:05Z) - ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving [49.07731497951963]
ReCogDriveは、エンドツーエンドの自動運転のための新しい強化認知フレームワークである。
我々は、人間のドライバーのシーケンシャルな認知過程を模倣する階層的なデータパイプラインを導入する。
次に、VLMの学習した運転先を拡散プランナーに注入することで、言語行動ミスマッチに対処する。
論文 参考訳(メタデータ) (2025-06-09T03:14:04Z) - VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning [14.099306230721245]
VLA-RLは、オンライン収集データをテスト時に改善する探索ベースのフレームワークである。
自動抽出タスクセグメントにアノテートされた擬似報酬ラベルに基づいてトレーニングされたロボットプロセス報酬モデルとして、事前学習された視覚言語モデルを微調整する。
VLA-RLにより、OpenVLA-7BはLIBEROの40の挑戦的なロボット操作タスクにおいて、最強の微調整ベースラインを4.5%超えることができる。
論文 参考訳(メタデータ) (2025-05-24T14:42:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。