論文の概要: Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy
- arxiv url: http://arxiv.org/abs/2606.26527v1
- Date: Thu, 25 Jun 2026 02:02:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.143119
- Title: Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy
- Title(参考訳): アダプティブ・リワード・シェイピングと政策比重化戦略によるサンプル効率移動強化学習
- Abstract要約: 本稿では,自律走行車線変更のための安全転送強化学習フレームワークを提案する。
まず,リスク探索を抑えるために,即時安全コストに基づく適応型教師介入機構を設計する。
第2に、教師誘導型安全伝達モジュールは、教師政策の行動評価情報を学生学習に組み込む。
第3に、教師誘導重み付け最適化機構は、確率比係数を用いて政策最適化におけるサンプル重み付けを調整し、転送性能を安定させる。
- 参考スコア(独自算出の注目度): 17.047679227882075
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Transfer learning improves policy learning efficiency by reusing knowledge from source tasks, providing a feasible paradigm for safe and efficient autonomous highway lane changing decision-making. Existing methods frequently encounter transfer mismatch induced by distribution shifts between source and target domains, leading to training oscillation and performance decline. Besides, target domain adaptation depends on exploratory interactions, which struggles to guarantee training safety in safety-critical lane changing cases. To tackle these limitations, this paper proposes a safe transfer reinforcement learning framework for autonomous highway lane changing. First, we design an adaptive teacher intervention mechanism based on instantaneous safety cost to restrain risky exploration and fade intervention strength progressively, with theoretical analysis on return bounds for mixed behavior policy. This intervention also produces dual-source samples for joint training. Second, a teacher-guided safe transfer module embeds action evaluation information of teacher policy into student learning via reward shaping to boost training safety and efficiency, with teacher guidance decaying as policy safety rises. Third, a teacher-guided weighted optimization mechanism adjusts sample weights in policy optimization using a likelihood ratio factor to stabilize transfer performance. Experiments under varied traffic densities and validations on real-world NGSIM dataset reveal that our method surpasses baseline approaches by over 52.2% in safety and 5.0% in learning efficiency. Results verify the efficacy and robustness of our safety-aware transfer strategy for autonomous highway lane changing under various traffic conditions.
- Abstract(参考訳): トランスファーラーニングは、ソースタスクからの知識を再利用することでポリシー学習効率を改善し、安全かつ効率的な高速道路レーン変更意思決定のための実用的なパラダイムを提供する。
既存の手法では、ソースドメインとターゲットドメイン間の分布シフトによって引き起こされる転送ミスマッチにしばしば遭遇し、トレーニングの発振と性能低下につながる。
さらに、ターゲット領域の適応は探索的相互作用に依存しており、安全クリティカルレーン変更ケースにおけるトレーニングの安全性を保証するのに苦労している。
これらの制約に対処するために,自律走行車線変更のための安全な伝達強化学習フレームワークを提案する。
まず,リスク探索とフェード介入の強度を段階的に抑えるための即時安全コストに基づく適応型教師介入機構を設計し,混合行動政策の帰属境界に関する理論的解析を行った。
この介入は、ジョイントトレーニングのための二重ソースサンプルも生成する。
第2に、教師誘導型セーフトランスファーモジュールは、教師の政策の行動評価情報を報酬形成を介して生徒の学習に組み込んで訓練の安全性と効率を高めるとともに、政策の安全性が上昇するにつれて教師指導が減衰する。
第3に、教師誘導重み付け最適化機構は、確率比係数を用いて政策最適化におけるサンプル重み付けを調整し、転送性能を安定させる。
実世界のNGSIMデータセット上での様々なトラフィック密度と検証実験により、我々の手法が52.2%以上の安全性と5.0%以上の学習効率でベースラインアプローチを超えることが判明した。
その結果,交通条件によって変化する自律走行車線に対する安全対応輸送戦略の有効性とロバスト性について検証した。
関連論文リスト
- Self-Aware Active Learning Enables Continual Improvement in Autonomous Driving [12.669051115615176]
SAGE(Self-Aware Guided Exploring)は、自動運転の訓練後適応のためのアクティブな学習フレームワークである。
好奇心は、脅威に対する介入しきい値を適応的に調整し、エージェントがコンテキスト依存的な方法でリスクを規制できるようにする。
Fearは、パフォーマンスのレグレッションを減らすために、安全指向の制約としてポリシー最適化と評価に統合されている。
論文 参考訳(メタデータ) (2026-08-30T13:01:32Z) - From Attacks to Curricula: Learnability-Guided Adversarial Training for Safe Autonomous Driving [56.30087557121323]
AlignADVは学習性誘導型クローズドループ対向トレーニングフレームワークである。
敵のシナリオを解決可能で能力に整合したカリキュラムに変換する。
実験の結果、最大40.6%のトレーニングステップが短縮された。
論文 参考訳(メタデータ) (2026-06-12T02:13:55Z) - Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving [1.4063588986150455]
本稿では,これらの制約を克服するために,信頼誘導型人間-AIコラボレーション(C-HAC)戦略を開発する。
C-HACは、人間との相互作用を最小限に抑えたヒト誘導政策の迅速かつ安定した学習を実現する。
様々な運転シナリオに対する実験により、C-HACは安全性、効率、全体的な性能において従来の方法よりも大幅に優れていたことが判明した。
論文 参考訳(メタデータ) (2025-06-04T04:31:10Z) - RACER: Epistemic Risk-Sensitive RL Enables Fast Driving with Fewer Crashes [57.319845580050924]
本稿では,リスク感応制御と適応行動空間のカリキュラムを組み合わせた強化学習フレームワークを提案する。
提案アルゴリズムは,現実世界のオフロード運転タスクに対して,高速なポリシーを学習可能であることを示す。
論文 参考訳(メタデータ) (2024-05-07T23:32:36Z) - Safety Correction from Baseline: Towards the Risk-aware Policy in
Robotics via Dual-agent Reinforcement Learning [64.11013095004786]
本稿では,ベースラインと安全エージェントからなる二重エージェント型安全強化学習戦略を提案する。
このような分離されたフレームワークは、RLベースの制御に対して高い柔軟性、データ効率、リスク認識を可能にする。
提案手法は,難易度の高いロボットの移動・操作作業において,最先端の安全RLアルゴリズムより優れる。
論文 参考訳(メタデータ) (2022-12-14T03:11:25Z) - A Regularized Implicit Policy for Offline Reinforcement Learning [54.7427227775581]
オフラインの強化学習は、環境とのさらなるインタラクションなしに、固定データセットから学習を可能にする。
フレキシブルだが十分に調整された完全実装ポリシーの学習を支援するフレームワークを提案する。
D4RLデータセットの実験とアブレーション研究により、我々のフレームワークとアルゴリズム設計の有効性が検証された。
論文 参考訳(メタデータ) (2022-02-19T20:22:04Z) - Learning Interaction-aware Guidance Policies for Motion Planning in
Dense Traffic Scenarios [8.484564880157148]
本稿では,高密度交通シナリオにおける対話型モーションプランニングのための新しい枠組みを提案する。
我々は,他車両の協調性に関する国際的ガイダンスを提供するインタラクション対応政策であるDeep Reinforcement Learning (RL) を通じて学習することを提案する。
学習されたポリシーは、ローカル最適化ベースのプランナーを推論し、対話的な振る舞いで誘導し、他の車両が収まらない場合に安全を維持しながら、密集したトラフィックに積極的にマージする。
論文 参考訳(メタデータ) (2021-07-09T16:43:12Z) - Cautious Adaptation For Reinforcement Learning in Safety-Critical
Settings [129.80279257258098]
都市運転のような現実の安全クリティカルな目標設定における強化学習(RL)は危険である。
非安全クリティカルな「ソース」環境でエージェントが最初に訓練する「安全クリティカル適応」タスクセットを提案する。
多様な環境における事前経験がリスクを見積もるためにエージェントに装備するという直感に基づくソリューションアプローチであるCARLを提案する。
論文 参考訳(メタデータ) (2020-08-15T01:40:59Z) - Efficient Deep Reinforcement Learning via Adaptive Policy Transfer [50.51637231309424]
強化学習(RL)を促進するための政策伝達フレームワーク(PTF)の提案
我々のフレームワークは、いつ、いつ、どのソースポリシーがターゲットポリシーの再利用に最適なのか、いつそれを終了するかを学習する。
実験結果から,学習過程を著しく加速し,最先端の政策伝達手法を超越していることが判明した。
論文 参考訳(メタデータ) (2020-02-19T07:30:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。