論文の概要: InDRiVE: Reward-Free World-Model Pretraining for Autonomous Driving via Latent Disagreement
- arxiv url: http://arxiv.org/abs/2512.18850v2
- Date: Sat, 27 Dec 2025 05:30:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 08:17:40.455607
- Title: InDRiVE: Reward-Free World-Model Pretraining for Autonomous Driving via Latent Disagreement
- Title(参考訳): InDRiVE:Reward-free World-Model Pretraining for autonomous Driving via Latent Disagreement
- Authors: Feeza Khan Khanzada, Jaerock Kwon,
- Abstract要約: 本稿では,DreamerV3スタイルのモデルベース強化学習エージェントであるInDRiVEについて述べる。
差別に基づく事前訓練は、町のシフトと一致する相互作用予算の下で、より強いゼロショットと堅牢な数ショット衝突回避をもたらす。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Model-based reinforcement learning (MBRL) can reduce interaction cost for autonomous driving by learning a predictive world model, but it typically still depends on task-specific rewards that are difficult to design and often brittle under distribution shift. This paper presents InDRiVE, a DreamerV3-style MBRL agent that performs reward-free pretraining in CARLA using only intrinsic motivation derived from latent ensemble disagreement. Disagreement acts as a proxy for epistemic uncertainty and drives the agent toward under-explored driving situations, while an imagination-based actor-critic learns a planner-free exploration policy directly from the learned world model. After intrinsic pretraining, we evaluate zero-shot transfer by freezing all parameters and deploying the pretrained exploration policy in unseen towns and routes. We then study few-shot adaptation by training a task policy with limited extrinsic feedback for downstream objectives (lane following and collision avoidance). Experiments in CARLA across towns, routes, and traffic densities show that disagreement-based pretraining yields stronger zero-shot robustness and robust few-shot collision avoidance under town shift and matched interaction budgets, supporting the use of intrinsic disagreement as a practical reward-free pretraining signal for reusable driving world models.
- Abstract(参考訳): モデルベース強化学習(MBRL)は、予測的世界モデルを学ぶことによって、自律運転の相互作用コストを低減することができるが、通常は、設計が困難で、分散シフト下で不安定なタスク固有の報酬に依存する。
本稿では,DreamerV3スタイルのMBRLエージェントであるInDRiVEを提案する。
診断はてんかんの不確実性のプロキシとして機能し、エージェントを未探索の運転状況へと駆り立て、一方、想像力に基づくアクター批評家は学習された世界モデルから直接プランナーフリーな探索ポリシーを学習する。
固有事前訓練後,全パラメータを凍結し,未確認の町やルートに事前訓練した探索方針を配置することにより,ゼロショット転送を評価する。
次に、下流の目標(車線追従と衝突回避)に対する外部フィードバックを限定したタスクポリシーを訓練し、少数ショット適応について検討する。
CARLAにおける町、路線、交通密度における実験により、不一致に基づく事前訓練は、再利用可能な運転世界モデルのための実用的な報酬なし事前訓練信号としての本質的な不一致の使用をサポートするため、町のシフトと相互作用予算の下で、より強いゼロショットロバスト性とロバストな数ショット衝突回避をもたらすことが示されている。
関連論文リスト
- SPACeR: Self-Play Anchoring with Centralized Reference Models [50.55045557371374]
Simエージェントポリシーは、現実的で、人間らしく、高速で、マルチエージェント設定でスケーラブルである。
大規模な拡散モデルやトークン化モデルを用いた模倣学習の最近の進歩は、人間の運転データから直接行動を把握することができることを示している。
本研究では,事前訓練されたトークン化自己回帰運動モデルを利用したSPACeRを提案する。
論文 参考訳(メタデータ) (2025-10-20T19:53:02Z) - InDRiVE: Intrinsic Disagreement based Reinforcement for Vehicle Exploration through Curiosity Driven Generalized World Model [0.0]
本稿では,InDRiVE(Intrinsic Disagreement based Reinforcement for Vehicle Exploration)をモデルベース強化学習フレームワークとして提案する。
エージェントは、世界モデルのアンサンブルを訓練することにより、タスク固有のフィードバックなしで、環境の不確実性の高い領域を積極的に探索する。
InDRiVEはDreamerV2やDreamerV3に比べて高い成功率と少ない屈折率を達成している。
論文 参考訳(メタデータ) (2025-03-07T16:56:00Z) - Mitigating Covariate Shift in Imitation Learning for Autonomous Vehicles Using Latent Space Generative World Models [60.87795376541144]
World Model(ワールドモデル)は、エージェントの次の状態を予測できるニューラルネットワークである。
エンド・ツー・エンドのトレーニングでは、人間のデモで観察された状態と整合してエラーから回復する方法を学ぶ。
クローズドループ試験における先行技術に有意な改善がみられた定性的,定量的な結果を示す。
論文 参考訳(メタデータ) (2024-09-25T06:48:25Z) - Intelligent Roundabout Insertion using Deep Reinforcement Learning [68.8204255655161]
本稿では,多忙なラウンドアバウンドの入場を交渉できる演習計画モジュールを提案する。
提案されたモジュールは、トレーニングされたニューラルネットワークに基づいて、操作の全期間にわたって、ラウンドアバウンドに入るタイミングと方法を予測する。
論文 参考訳(メタデータ) (2020-01-03T11:16:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。