論文の概要: Safety-Constrained Reinforcement Learning with Post-Training Reachability Verification for Robot Navigation
- arxiv url: http://arxiv.org/abs/2605.14174v1
- Date: Wed, 13 May 2026 22:53:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.529505
- Title: Safety-Constrained Reinforcement Learning with Post-Training Reachability Verification for Robot Navigation
- Title(参考訳): ロボットナビゲーションのための訓練後到達性検証による安全制約強化学習
- Authors: Qisong He, Xinmiao Huang, Jinwei Hu, Zhuoyun Li, Yi Dong, Changshun Wu, Xiaowei Huang,
- Abstract要約: 本稿では,外部のTD3バックボーン上での条件付きバリュー・アット・リスク(CVaR)制約による最適化を通じて,リスクに敏感なポリシをトレーニングするフレームワークを提案する。
トレーニング中、このポリシーは累積コストに対するCVaR制約の下で最適化され、高コストテール結果に対する感受性が促進される。
重要な発見は、CVaR制約で訓練されたポリシーが、評価された状態の障害からより大きな安全マージンを維持することである。
- 参考スコア(独自算出の注目度): 13.151825012034886
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safe navigation for mobile robots demands policies that remain reliable under the high-consequence perception uncertainty of cluttered environments. Yet most existing safe reinforcement learning (RL) methods assess safety through average cumulative cost. Such metrics can mask dangerous tail-risk behaviors. To address this, we propose a framework that trains risk-sensitive policies through Conditional Value-at-Risk (CVaR) constrained optimization on an off-policy TD3 backbone and evaluates their safety margins post-training through neural network reachability verification. During training, the policy is optimized under CVaR constraints on cumulative costs, promoting sensitivity to high-cost tail outcomes rather than average behavior alone. After training, we compute action reachable sets under bounded observation uncertainty using Taylor Model analysis, yielding a safety rate metric that quantifies the proportion of evaluated states at which the policy's reachable action set remains within prescribed safety margins. A key finding is that policies trained with CVaR constraints maintain larger safety margins from obstacles across evaluated states. This makes them significantly more amenable to formal reachability verification. Experiments across ten navigation scenarios and six baselines show that our method achieves a 98.3\% success rate, the highest safety verification rate among all compared methods, while revealing that average cost rankings and reachability-based safety rankings can diverge. This indicates that reachability verification captures risks which are missed by empirical cost metrics alone. We further validate our approach on a physical Clearpath Jackal robot, demonstrating successful sim-to-real transfer.
- Abstract(参考訳): 移動ロボットの安全なナビゲーションは、散らかった環境の高精度な認識の不確実性の下で信頼性を保つポリシーを要求する。
しかし、既存の安全強化学習(RL)手法は、平均累積コストで安全性を評価する。
このような指標は、危険な尾リスクの行動を隠蔽する可能性がある。
そこで本稿では,CVaR(Conditional Value-at-Risk)によるリスクに敏感なポリシのトレーニングを行うフレームワークを提案する。
トレーニング中、このポリシーは累積コストに対するCVaRの制約の下で最適化され、平均的な振る舞いのみではなく、高コストのテール結果に対する感受性が促進される。
トレーニング後、Taylor Model解析を用いて境界観測不確実性の下での動作到達性集合を計算し、ポリシーの到達性集合が所定の安全マージン内に留まる評価状態の比率を定量化する安全度測定値を得る。
重要な発見は、CVaR制約で訓練されたポリシーが、評価された状態の障害からより大きな安全マージンを維持することである。
これにより、形式的な到達性検証が大幅に容易になる。
10のナビゲーションシナリオと6つのベースラインにわたる実験により,提案手法が98.3倍の成功率を達成した。
これは、到達可能性検証が経験的なコスト指標だけで欠落するリスクを捉えていることを示している。
さらに,本手法をClearpath Jackalロボットに適用し,シミュレート・トゥ・リアルトランスファーの成功例を示す。
関連論文リスト
- SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning [30.037309138373754]
視覚言語アクションモデル(VLA)は、汎用的なロボットポリシーとしての可能性を示している。
これらのモデルは、環境、ロボット自身、人間への危害のリスクを含む、現実世界の展開中に極端な安全上の課題を生じさせる。
我々は、ISA(Integrated safety approach)を探求し、安全要件を体系的にモデル化し、多様な安全でない振る舞いを積極的に引き出すことによって、この問題に対処する。
論文 参考訳(メタデータ) (2025-03-05T13:16:55Z) - TRC: Trust Region Conditional Value at Risk for Safe Reinforcement
Learning [16.176812250762666]
TRCと呼ばれるCVaR制約を持つ信頼領域ベースの安全なRL法を提案する。
まずCVaR上の上界を導出し、その後、信頼領域における微分可能な形で上界を近似する。
他の安全なRL法と比較して、全ての実験で制約を満たす一方、性能は1.93倍向上する。
論文 参考訳(メタデータ) (2023-12-01T04:40:47Z) - Safety Margins for Reinforcement Learning [53.10194953873209]
安全マージンを生成するためにプロキシ臨界度メトリクスをどのように活用するかを示す。
Atari 環境での APE-X と A3C からの学習方針に対するアプローチを評価する。
論文 参考訳(メタデータ) (2023-07-25T16:49:54Z) - Safe Deep Reinforcement Learning by Verifying Task-Level Properties [84.64203221849648]
コスト関数は、安全深層強化学習(DRL)において一般的に用いられる。
このコストは通常、国家空間における政策決定のリスクの定量化が難しいため、指標関数として符号化される。
本稿では,ドメイン知識を用いて,そのような状態に近接するリスクを定量化するための代替手法について検討する。
論文 参考訳(メタデータ) (2023-02-20T15:24:06Z) - Safety Correction from Baseline: Towards the Risk-aware Policy in
Robotics via Dual-agent Reinforcement Learning [64.11013095004786]
本稿では,ベースラインと安全エージェントからなる二重エージェント型安全強化学習戦略を提案する。
このような分離されたフレームワークは、RLベースの制御に対して高い柔軟性、データ効率、リスク認識を可能にする。
提案手法は,難易度の高いロボットの移動・操作作業において,最先端の安全RLアルゴリズムより優れる。
論文 参考訳(メタデータ) (2022-12-14T03:11:25Z) - Safe Reinforcement Learning via Confidence-Based Filters [78.39359694273575]
我々は,標準的な強化学習技術を用いて学習した名目政策に対して,国家安全の制約を認定するための制御理論的アプローチを開発する。
我々は、正式な安全保証を提供し、我々のアプローチの有効性を実証的に実証する。
論文 参考訳(メタデータ) (2022-07-04T11:43:23Z) - Conservative Safety Critics for Exploration [120.73241848565449]
強化学習(RL)における安全な探索の課題について検討する。
我々は、批評家を通じて環境状態の保守的な安全性推定を学習する。
提案手法は,破滅的故障率を著しく低く抑えながら,競争力のあるタスク性能を実現することができることを示す。
論文 参考訳(メタデータ) (2020-10-27T17:54:25Z) - Safe reinforcement learning for probabilistic reachability and safety
specifications: A Lyapunov-based approach [2.741266294612776]
安全運転の最大確率を学習するモデルフリー安全仕様法を提案する。
提案手法は, 各政策改善段階を抑制するための安全な政策に関して, リャプノフ関数を構築する。
安全集合と呼ばれる安全な操作範囲を決定する一連の安全なポリシーを導出する。
論文 参考訳(メタデータ) (2020-02-24T09:20:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。