論文の概要: Long-Horizon Consistent and Interaction-Aware World Models for Multi-Style End-to-End Driving
- arxiv url: http://arxiv.org/abs/2609.03225v1
- Date: Thu, 03 Sep 2026 00:00:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.880419
- Title: Long-Horizon Consistent and Interaction-Aware World Models for Multi-Style End-to-End Driving
- Title(参考訳): マルチスタイルエンド・ツー・エンド駆動のための長軸一貫性と相互作用を考慮した世界モデル
- Authors: Yuxuan Han, Kunyuan Wu, Liyunong Yang, Zilu Wang, Cansen Jiang, Yi Xiao, Liang Hu,
- Abstract要約: StyleDriveは、長期の一貫性を共同で強化し、対話的なトラフィック状態を明示的に切り離し、マルチスタイルのポリシー最適化をサポートする、ワールドモデルベースの学習フレームワークである。
我々は,Bench2Driveクローズドループ駆動ベンチマーク上でStyleDriveを評価し,前回のベストワールドモデルベース手法よりも88.44(+17.08)の駆動スコアを達成した。
- 参考スコア(独自算出の注目度): 10.506773245217945
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: End-to-end autonomous driving has increasingly adopted world model-based reinforcement learning frameworks to improve learning efficiency through \textit{imagined rollouts}. However, existing world models suffer from three key limitations: temporal inconsistency in long-horizon imagined rollouts, inadequate modeling of ego-environment interactions, and limited adaptability to diverse driving styles. To address these challenges, we propose \textit{StyleDrive}, a world-model-based learning framework that jointly enforces long-horizon consistency, explicitly disentangles interactive traffic states, and supports multi-style policy optimization within a unified learning paradigm. First, we introduce a temporal consistency regularization that integrates historical latent states through gated cross-attention, stabilizing long-horizon imagined rollouts and mitigating error accumulation. Second, we design an explicit state disentanglement module that separates ego-relevant from ego-irrelevant interactive states, enabling more interpretable and efficient decision-making in complex traffic scenarios. Third, we enable multi-style driving behaviors through Group Relative Policy Optimization, which replaces per-step reward optimization with trajectory-wise relative advantages, reducing reward variance and supporting diverse driving styles without retraining. We evaluate StyleDrive on the Bench2Drive closed-loop driving benchmark, achieving a driving score of 88.44 (+17.08 over the previous best world model-based method) and a success rate of 66.82 (+16.58). Furthermore, we deploy StyleDrive on a real automated guided vehicle platform and demonstrate promising sim-to-real transfer capability in dynamic driving scenarios.
- Abstract(参考訳): エンド・ツー・エンドの自動運転は、‘textit{imagined rollouts} を通じて学習効率を向上させるために、世界モデルに基づく強化学習フレームワークをますます採用している。
しかし、既存の世界モデルには3つの重要な制限がある: 長期にわたる想像的展開における時間的不整合、エゴ環境相互作用の不十分なモデリング、多様な運転スタイルへの適応性に制限がある。
これらの課題に対処するために,長年の一貫性を両立させ,対話的なトラフィック状態を明示的に解消し,統一的な学習パラダイム内でマルチスタイルのポリシー最適化をサポートする,世界モデルベースの学習フレームワークである‘textit{StyleDrive} を提案する。
まず,時間的整合性の整合性を導入し,有意な交差注意,長期水平展開の安定化,誤り蓄積を緩和する。
第2に,エゴ関連状態とエゴ関連状態とを分離し,複雑な交通シナリオにおけるより解釈可能かつ効率的な意思決定を可能にする明示的状態分散モジュールを設計する。
第3に,グループ相対的政策最適化(Group Relative Policy Optimization)により,ステップごとの報酬最適化をトラジェクショナルな相対的優位性に置き換え,報酬の分散を低減し,リトレーニングなしで多様な運転スタイルをサポートする。
我々はBench2Driveのクローズドループ駆動ベンチマークでStyleDriveを評価し、運転スコアは88.44(以前のベストワールドモデルベースで+17.08)、成功率は66.82(+16.58)である。
さらに、我々は、StyleDriveを実際の自動誘導車両プラットフォームにデプロイし、動的な運転シナリオにおいて、将来有望なsim-to-real転送機能を示す。
関連論文リスト
- A Collaborative Multi-Modality Interaction for VLA-based End-to-End Autonomous Driving [96.81243316566764]
VLA(Vision-Language-Action)モデルは、エンドツーエンドの自動運転の強力なパラダイムとして登場した。
マルチモーダリティインタラクションと多軌道計画と最適化を組み合わせた,堅牢なVLAベースのエンドツーエンド自動運転システムを提案する。
論文 参考訳(メタデータ) (2026-08-21T09:06:16Z) - GraphWorld: Long-Horizon Planning with World Models for End-to-End Autonomous Driving [56.50032398571235]
GraphWorldはE2E-ADフレームワークで、潜在世界モデリングを通じて長期計画を明確に強化する。
本研究では,エゴ車と周辺エージェントの相互作用をモデル化することで,エゴ中心の潜在世界表現を学習する世界国家計画を提案する。
この潜在世界状態は、重要な相互作用のダイナミクスと安全関連セマンティクスを捉え、長距離で安全を意識した軌道計画の指針となる条件付け信号として機能する。
論文 参考訳(メタデータ) (2026-06-15T06:26:46Z) - DynFlowDrive: Flow-Based Dynamic World Modeling for Autonomous Driving [67.83404465171257]
DynFlowDriveは、異なる運転行動の下で世界状態の遷移をモデル化する潜在世界モデルである。
異なる駆動動作の下でシーン状態がどのように変化するかを記述した速度場を学習する。
これに基づいて,安定性を考慮した多モード軌道選択戦略を導入する。
論文 参考訳(メタデータ) (2026-03-20T06:19:31Z) - FAR-Drive: Frame-AutoRegressive Video Generation in Closed-Loop Autonomous Driving [11.275815014211046]
自律運転のための学習ベースのクローズドループシミュレータの構築は、3つの大きな課題を提起する。
長期の時間的・横断的な一貫性、反復的自己条件下での自己回帰劣化の緩和、低遅延推論制約を満たす。
自動運転のためのフレームレベル自動回帰ビデオ生成フレームワークであるFAR-Driveを提案する。
論文 参考訳(メタデータ) (2026-03-16T07:40:13Z) - InstaDrive: Instance-Aware Driving World Models for Realistic and Consistent Video Generation [53.47253633654885]
InstaDriveは、2つの重要な進歩を通じてビデオリアリズムを促進する新しいフレームワークである。
これらのインスタンス認識機構を組み込むことで、InstaDriveは最先端のビデオ生成品質を実現する。
私たちのプロジェクトページはhttps://shanpoyang654.io/InstaDrive/page.htmlです。
論文 参考訳(メタデータ) (2026-02-03T08:22:13Z) - From Imitation to Exploration: End-to-end Autonomous Driving based on World Model [24.578178308010912]
RAMBLEは、意思決定を駆動するエンド・ツー・エンドの世界モデルベースのRL方式である。
複雑な動的トラフィックシナリオを処理できる。
CARLA Leaderboard 1.0では、ルート完了率の最先端のパフォーマンスを達成し、CARLA Leaderboard 2.0では38のシナリオをすべて完了している。
論文 参考訳(メタデータ) (2024-10-03T06:45:59Z) - DiFSD: Ego-Centric Fully Sparse Paradigm with Uncertainty Denoising and Iterative Refinement for Efficient End-to-End Self-Driving [55.53171248839489]
我々は、エンドツーエンドの自動運転のためのエゴ中心の完全スパースパラダイムであるDiFSDを提案する。
特に、DiFSDは主にスパース知覚、階層的相互作用、反復的な運動プランナーから構成される。
nuScenesとBench2Driveデータセットで実施された実験は、DiFSDの優れた計画性能と優れた効率を実証している。
論文 参考訳(メタデータ) (2024-09-15T15:55:24Z) - Parameterized Decision-making with Multi-modal Perception for Autonomous
Driving [12.21578713219778]
AUTOと呼ばれる深層強化学習に基づくマルチモーダル認識を用いたパラメータ化意思決定フレームワークを提案する。
ハイブリッド報酬関数は、安全、交通効率、乗客の快適性、および最適な行動を生成するためのフレームワークを導く影響を考慮に入れている。
論文 参考訳(メタデータ) (2023-12-19T08:27:02Z) - Isolating and Leveraging Controllable and Noncontrollable Visual
Dynamics in World Models [65.97707691164558]
Iso-DreamはDream-to-Controlフレームワークを2つの側面で改善する。
まず、逆動力学を最適化することにより、世界モデルに制御可能で制御不能な情報源を学習させることを奨励する。
第2に、エージェントの挙動を世界モデルの切り離された潜在的想像力に最適化する。
論文 参考訳(メタデータ) (2022-05-27T08:07:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。