論文の概要: Threat-guided Policy-aware Scene Perturbation for Safe Autonomous Driving with Online Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.10403v1
- Date: Tue, 11 Aug 2026 02:49:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.873271
- Title: Threat-guided Policy-aware Scene Perturbation for Safe Autonomous Driving with Online Reinforcement Learning
- Title(参考訳): オンライン強化学習による安全な自動運転のための安全誘導型政策対応シーン摂動
- Abstract要約: オンラインRLを用いた安全な自動運転を実現するために,Treat-guided Policy-aware Scene Perturbation (TPSP)を提案する。
TPSPは、政策行動と周辺環境の相互作用を捉え、現在の政策に沿ったシーン摂動を可能にする。
実験により、TPSPは安全性の学習効率を向上し、約400万kmの運転データでNAVSIM v2の安全性を向上することが示された。
- 参考スコア(独自算出の注目度): 21.268329695683203
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) has shown promising performance in autonomous driving, yet ensuring the safety of online RL policies remains challenging due to insufficient exposure to safety-critical driving scenes. The long-tailed nature of real-world traffic situations makes dangerous and rare interactions difficult to encounter through conventional sampling, limiting the ability of RL policies to learn robust safety behaviors. Existing methods improve training diversity by synthesizing challenging scenes or adversarial situations. However, these approaches typically optimize scene generation objectives separately from the evolving policy, without explicitly modeling how generated perturbations relate to the current policy's weaknesses and learning needs. In this paper, we propose Threat-guided Policy-aware Scene Perturbation (TPSP) for safe autonomous driving with online RL. TPSP introduces a policy-aware scene encoder to capture the interaction between policy behaviors and surrounding environments, enabling scene perturbation aligned with the current policy. Based on this representation, TPSP selectively perturbs critical objects rather than applying uniform modifications across the scene. Furthermore, we develop a threat-guided optimization strategy that evaluates perturbed scenes through threat-level differences between policy rollouts on original and perturbed scenes, guiding the generation of safety-critical scenes with higher training value. Comprehensive experiments demonstrate that TPSP improves safety learning efficiency, achieving strong safety performance on NAVSIM v2 with approximately 4 million kilometers of simulated driving data. Ablation studies verify that policy-aware targeted perturbations provide more informative safety-critical experiences than random or policy-unaware strategies, enabling safer driving under limited interaction budgets.
- Abstract(参考訳): 強化学習(RL)は自動運転において有望な性能を示したが、安全クリティカルな運転シーンへの露出が不十分なため、オンラインRLポリシーの安全性を保証することは依然として困難である。
現実世界の交通状況の長期的特質は、従来のサンプリングを通して遭遇する危険で稀な相互作用を困難にし、堅牢な安全行動を学ぶためのRLポリシーの能力を制限する。
既存の方法は、挑戦的なシーンや敵の状況を合成することで、トレーニングの多様性を向上させる。
しかし、これらのアプローチは一般的に、現在の政策の弱点や学習ニーズとどのように関連するかを明確にモデル化することなく、進化する政策とは別個にシーン生成の目的を最適化する。
本稿では,オンラインRLを用いた安全な自動運転を実現するために,Treat-guided Policy-aware Scene Perturbation (TPSP)を提案する。
TPSPはポリシー対応のシーンエンコーダを導入し、政策行動と周辺環境の相互作用を捉え、現在のポリシーに沿ったシーン摂動を可能にする。
この表現に基づいて、TPSPはシーン全体に均一な修正を加えるのではなく、重要なオブジェクトを選択的に摂動する。
さらに,本研究は,オリジナルシーンとコントラストシーンのポリシーロールアウトの脅威レベルの違いを考慮し,より訓練価値の高い安全クリティカルシーンの生成を導くことによって,乱れたシーンを評価するための脅威誘導型最適化戦略を開発する。
総合的な実験により、TPSPは安全性の学習効率を向上し、約400万kmの運転データを用いてNAVSIM v2上で強力な安全性能を達成することが示されている。
アブレーション研究は、政策を意識した標的摂動は、ランダムまたは政策を意識しない戦略よりも、より情報に富んだ安全クリティカルな体験を提供し、限られた相互作用予算の下での安全な運転を可能にすることを検証している。
関連論文リスト
- World Engine: Towards the Era of Post-Training for Autonomous Driving [63.61277741443647]
実世界のログから高忠実度インタラクティブ環境を再構築する生成フレームワークであるWorld Engineを紹介する。
World Engineは、稀な安全クリティカルなシナリオにおける障害を大幅に削減し、事前トレーニングデータのみをスケールするよりもはるかに大きな利益をもたらす。
プロダクションスケールの自動運転システムにデプロイすると、結果として、シミュレートされた衝突を減らすことができる。
論文 参考訳(メタデータ) (2026-06-18T06:28:33Z) - From Attacks to Curricula: Learnability-Guided Adversarial Training for Safe Autonomous Driving [56.30087557121323]
AlignADVは学習性誘導型クローズドループ対向トレーニングフレームワークである。
敵のシナリオを解決可能で能力に整合したカリキュラムに変換する。
実験の結果、最大40.6%のトレーニングステップが短縮された。
論文 参考訳(メタデータ) (2026-06-12T02:13:55Z) - Transferable Reinforcement Learning via Probabilistic Latent Embeddings and Dynamic Policy Adaptation for Sim-to-Real Deployment [5.938653166789926]
多くのサイバー物理システムのための深層強化学習(RL)エージェントは、まずシミュレーターで訓練される。
現実の環境では、Sim2Realのギャップが避けられないため、パフォーマンス劣化や安全違反に悩まされることが多い。
本稿では,確率的潜伏埋め込みと動的ポリシー適応による安全かつ効率的な政策伝達を可能にする新しい強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-26T20:22:44Z) - RACER: Epistemic Risk-Sensitive RL Enables Fast Driving with Fewer Crashes [57.319845580050924]
本稿では,リスク感応制御と適応行動空間のカリキュラムを組み合わせた強化学習フレームワークを提案する。
提案アルゴリズムは,現実世界のオフロード運転タスクに対して,高速なポリシーを学習可能であることを示す。
論文 参考訳(メタデータ) (2024-05-07T23:32:36Z) - Safety-aware Causal Representation for Trustworthy Offline Reinforcement
Learning in Autonomous Driving [33.672722472758636]
オフライン強化学習(RL)アプローチは、オフラインデータセットからのシーケンシャルな意思決定問題に対処する上で、顕著な効果を示す。
一般化可能なエンドツーエンド駆動ポリシの学習を容易にするために,saFety-aware strUctured Scenario representation (Fusion)を導入した。
様々な運転シナリオにおける実証的な証拠は、フュージョンが自律運転エージェントの安全性と一般化性を著しく向上させることを証明している。
論文 参考訳(メタデータ) (2023-10-31T18:21:24Z) - Guided Online Distillation: Promoting Safe Reinforcement Learning by
Offline Demonstration [75.51109230296568]
オフラインデータから専門家ポリシーを抽出してオンライン探索をガイドすることは、保存性の問題を軽減するための有望な解決策である、と我々は主張する。
オフラインからオンラインまでの安全なRLフレームワークであるGOLD(Guid Online Distillation)を提案する。
GOLDは、オフラインDTポリシーをオンラインセーフなRLトレーニングを通じて軽量なポリシーネットワークに蒸留し、オフラインDTポリシーとオンラインセーフなRLアルゴリズムの両方を上回っている。
論文 参考訳(メタデータ) (2023-09-18T00:22:59Z) - Robust Driving Policy Learning with Guided Meta Reinforcement Learning [49.860391298275616]
本稿では,ソーシャルカーの多種多様な運転方針を一つのメタ政治として訓練する効率的な方法を提案する。
ソーシャルカーのインタラクションに基づく報酬関数をランダム化することにより、多様な目的を生み出し、メタ政治を効率的に訓練することができる。
本研究では,社会自動車が学習メタ政治によって制御される環境を利用して,エゴ自動車の運転方針の堅牢性を高めるためのトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2023-07-19T17:42:36Z) - Safety Correction from Baseline: Towards the Risk-aware Policy in
Robotics via Dual-agent Reinforcement Learning [64.11013095004786]
本稿では,ベースラインと安全エージェントからなる二重エージェント型安全強化学習戦略を提案する。
このような分離されたフレームワークは、RLベースの制御に対して高い柔軟性、データ効率、リスク認識を可能にする。
提案手法は,難易度の高いロボットの移動・操作作業において,最先端の安全RLアルゴリズムより優れる。
論文 参考訳(メタデータ) (2022-12-14T03:11:25Z) - Minimizing Safety Interference for Safe and Comfortable Automated
Driving with Distributional Reinforcement Learning [3.923354711049903]
そこで本稿では,望ましい快適さと実用性に基づいて,実行時の保守性レベルを調整可能な適応ポリシーを学習するための分散強化学習フレームワークを提案する。
提案アルゴリズムは,認識ノイズが2倍高い場合にも信頼性を向上できるポリシを学習し,非閉塞交差点における自動マージと踏切の訓練構成を示す。
論文 参考訳(メタデータ) (2021-07-15T13:36:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。