論文の概要: RoXDrive: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving via Action-Faithful Rollouts
- arxiv url: http://arxiv.org/abs/2609.36851v2
- Date: Wed, 30 Sep 2026 01:53:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.19301
- Title: RoXDrive: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving via Action-Faithful Rollouts
- Title(参考訳): RoXDrive: アクションフルロールアウトによるエンドツーエンド自動運転のためのクローズドループ強化学習
- Abstract要約: 強化学習(RL)ポストトレーニングは、現在のアプローチに代わる有望な代替手段を提供する。
ビデオワールドモデルは、現実的な多段階の将来のロールアウトを生成する能力を示したが、アクション条件を忠実に反映しないかもしれない。
本稿では,信頼性の高いポリシ最適化を実現するプラグイン・アンド・プレイクローズドループRLフレームワークであるRoXDriveを紹介する。
- 参考スコア(独自算出の注目度): 98.41251854883184
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: End-to-end autonomous driving policies are commonly trained via imitation learning on logged demonstrations without observing the consequences of their own actions, leading to causal confusion in closed-loop real-world deployment. To address this issue, reinforcement learning (RL) post-training offers a promising alternative by leveraging world models as interactive training environments to enable future scene generation for policy improvement. Nevertheless, existing approaches either rely on reconstruction-based simulators, offering limited counterfactual interaction, or adopt synthetic simulators to enable long-horizon closed-loop interaction at the cost of a substantial sim-to-real gap. Recently, video world models have exhibited the ability to generate realistic multi-step future rollouts but may not faithfully reflect action conditions, resulting in action-vision mismatch. In this paper, we introduce RoXDrive, a plug-and-play closed-loop RL framework that enables reliable policy optimization by identifying action-faithful world-model rollouts, consisting of two stages: 1) Model pre-training: In addition to imitation-based policy pre-training, we devise an Action-Vision Faithfulness Evaluator for inverse dynamics estimation with our geometry-aware auxiliary trajectory supervision, enabling long-horizon assessment of whether visual dynamics faithfully reflect the conditioning ego actions. 2) Action-faithful RL post-training: Agents iteratively interact with world models to form long-horizon scene rollouts, retaining only action-faithful ones for dense safety-aware scoring and scene-level closed-loop RL post-training. Extensive experiments on nuScenes and an in-house dataset with over 130K training scenarios demonstrate consistent gains across planners, reducing safety violations by 27.6% with DiffusionDrive on nuScenes and 33.7% with Qwen3-VL on the internal data.
- Abstract(参考訳): エンドツーエンドの自動運転ポリシは、ログ化されたデモの模倣学習を通じて、自身のアクションの結果を観察することなく、一般的にトレーニングされる。
この問題に対処するために、強化学習(RL)ポストトレーニングは、世界モデルをインタラクティブなトレーニング環境として活用し、将来のシーン生成を政策改善に有効にすることで、有望な代替手段を提供する。
それにもかかわらず、既存のアプローチはリコンストラクションベースのシミュレータに頼り、カウンターファクトの相互作用が限られているか、あるいは合成シミュレータを採用して、かなりのsim-to-realギャップを犠牲にして長時間のクローズドループの相互作用を可能にする。
近年、ビデオワールドモデルは、現実的な多段階の将来のロールアウトを生成する能力を示したが、アクション条件を忠実に反映しない可能性があるため、アクションビジョンのミスマッチが発生する。
本稿では,プラグアンドプレイのクローズドループRLフレームワークであるRoXDriveを紹介する。
1) モデル事前訓練: 模倣に基づく政策事前訓練に加えて, 視覚力学が条件付きエゴ行動を忠実に反映するかどうかの長期評価を可能にする, 幾何を考慮した補助軌跡監視による逆ダイナミクス推定のためのアクション・ビジョン・フェイスフルネス評価器を考案した。
2) アクションフェースフルRLポストトレーニング: エージェントは世界モデルと反復的に対話してロングホライズンシーンのロールアウトを形成し, アクションフェースフルなロールアウトのみを保持し, 密集した安全スコアとシーンレベルのクローズドループRLポストトレーニングを行う。
nuScenesと130K以上のトレーニングシナリオを備えた社内データセットの大規模な実験は、プランナー間で一貫した増加を示し、nuScenesではDiffusionDrive、内部データではQwen3-VLでは33.7%の安全性違反を27.6%削減した。
関連論文リスト
- CausalDrive: Real-time Causal World Models for Autonomous Driving [60.66609721457312]
制御可能でリアルタイムなファンデーション駆動の世界であるCausalDriveを紹介します。
CaulDriveは、最初のフロントビューフレーム、エゴ車両の軌道、マクロテキストプロンプトのみで動作する。
本稿では,(1)衝突アーティファクトを著しく緩和した生成的クローズループ評価,(2)ビデオ2Rewardモジュールによる大規模強化学習(RL)後トレーニング,(3)リアルタイムの人間-イン-ザ・ループシミュレーション,の3つのダウンストリームアプリケーションにおける汎用性を実証する。
論文 参考訳(メタデータ) (2026-06-13T15:04:44Z) - MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving [62.43744546817599]
視覚言語-アクション(VLA)モデルは、エンドツーエンドのモーションプランナーとして有効であるが、クローズドループ設定で評価すると不安定である。
本稿では, VLAモデルの潜在空間における動的駆動シナリオの, リアクティブでマルチエージェントなロールアウトのための新しいフレームワークMAPLEを提案する。
MAPLEはBench2Driveで最先端の駆動性能を実現し、堅牢なE2E自動運転システムのためのスケーラブルでクローズループなマルチエージェントプレイを実演する。
論文 参考訳(メタデータ) (2026-05-13T23:35:14Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - RIFT: Group-Relative RL Fine-Tuning for Realistic and Controllable Traffic Simulation [13.319344167881383]
データ駆動シミュレーターにおいて、模擬学習事前学習を行う2段階のAV中心シミュレーションフレームワークを導入する。
次に、物理に基づくシミュレータで微調整を学習し、スタイルレベルの制御性を向上する。
微調整段階において,新しいグループ関連RL微調整戦略であるRIFTを提案する。
論文 参考訳(メタデータ) (2025-05-06T09:12:37Z) - SAFE-SIM: Safety-Critical Closed-Loop Traffic Simulation with Diffusion-Controllable Adversaries [94.84458417662407]
制御可能なクローズドループ安全クリティカルシミュレーションフレームワークであるSAFE-SIMを紹介する。
提案手法は,1)現実の環境を深く反映した現実的な長距離安全クリティカルシナリオの生成,2)より包括的でインタラクティブな評価のための制御可能な敵行動の提供,の2つの利点をもたらす。
複数のプランナにまたがるnuScenesとnuPlanデータセットを使用して、我々のフレームワークを実証的に検証し、リアリズムと制御性の両方の改善を実証した。
論文 参考訳(メタデータ) (2023-12-31T04:14:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。