論文の概要: Safe Reinforcement Learning using Ideas from Model Predictive Control
- arxiv url: http://arxiv.org/abs/2607.07252v1
- Date: Wed, 08 Jul 2026 10:35:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.355298
- Title: Safe Reinforcement Learning using Ideas from Model Predictive Control
- Title(参考訳): モデル予測制御からのアイデアを用いた安全強化学習
- Abstract要約: 強化学習は、データから直接制御ポリシーを合成することを可能にする。
永続的な課題は、アクティブな学習フェーズにおける厳格で厳しい安全性の制約を保証することです。
本稿では,深層強化学習の適応的かつ高性能な性質と,モデル予測制御の形式的安全性を保証する枠組みを提案する。
- 参考スコア(独自算出の注目度): 0.40831821256838124
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Reinforcement learning (RL) enables the synthesis of control policies directly from data, making it highly appealing for complex cyber-physical systems (CPSs) and robotics. A persistent challenge, however, is ensuring strict, hard safety constraints during the active learning phase. In real-world physical systems, violating mechanical limits can cause irreversible damage, necessitating that exploration remains strictly within safe operational regions. We propose a generalized framework that combines the adaptive, high-performance nature of deep reinforcement learning (DRL) with the formal safety guarantees of model predictive control (MPC). Using a mathematical model of the system dynamics, offline MPC computations define a feasible state-action space, representing all safe combinations of system states and control inputs that guarantee constraint satisfaction. During training and deployment, the RL agent's instantaneous actions are projected onto this globally verified feasible set via a safety filter. We systematically evaluate our generalized approach on a non-linear 1-DoF laboratory testbed, demonstrating successful exploration and stable policy convergence on physical hardware.
- Abstract(参考訳): 強化学習(RL)は、データから直接制御ポリシーを合成し、複雑なサイバー物理システム(CPS)やロボット工学に非常にアピールする。
しかし、永続的な課題は、アクティブな学習フェーズにおける厳格で厳しい安全性の制約を保証することだ。
現実世界の物理的システムでは、機械的限界を破ることが不可逆的な損傷を引き起こす可能性がある。
本稿では,深部強化学習(DRL)の適応的かつ高性能な性質と,モデル予測制御(MPC)の形式的安全性を組み合わせた一般化フレームワークを提案する。
システム力学の数学的モデルを用いて、オフラインMPC計算は、システム状態の安全な組み合わせと制約満足度を保証する制御入力を表現し、実現可能な状態-アクション空間を定義する。
訓練と配備の間、RLエージェントの即時動作は、安全フィルタを介してこのグローバルに検証可能なセットに投影される。
我々は,非線形1-DoF実験場における一般化されたアプローチを体系的に評価し,物理ハードウェア上での探索と安定なポリシー収束を実証した。
関連論文リスト
- Sampling-Based Safe Reinforcement Learning [30.21184523512902]
本稿では,学習プロセス全体を通して安全性を維持するモデルに基づく強化学習アルゴリズムを提案する。
この定式化は不確実な力学に対する難解な最悪の最適化を近似する。
規則性条件下では、学習を通しての安全性の保証と、ほぼ最適ポリシーを回復するための有限時間サンプル複雑性を導出する。
論文 参考訳(メタデータ) (2026-05-19T07:21:53Z) - CAPSULE: Control-Theoretic Action Perturbations for Safe Uncertainty-Aware Reinforcement Learning [2.28224729577679]
オフライン環境で確率論的制御-アフィンダイナミクスモデルを学習する安全な強化学習フレームワークを提案する。
提案手法は,既存のベースラインに匹敵するリターンを達成すると同時に,安全性違反を著しく低減する。
論文 参考訳(メタデータ) (2026-04-26T07:31:30Z) - Safe Reinforcement Learning via Recovery-based Shielding with Gaussian Process Dynamics Models [57.006252510102506]
強化学習(Reinforcement Learning, RL)は、最適な意思決定と制御のための強力なフレームワークである。
本稿では,未知および非線形連続力学系に対する安全性を低くした安全RLを実現するための新しい回復型遮蔽フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-12T22:03:35Z) - Safely Learning Controlled Stochastic Dynamics [61.82896036131116]
システム力学の安全な探索と効率的な推定を可能にする手法を提案する。
学習後、学習モデルはシステムのダイナミクスの予測を可能にし、任意の制御の安全性検証を可能にする。
我々は、真の力学のソボレフ正則性を高めることにより、安全性と適応学習率の向上を理論的に保証する。
論文 参考訳(メタデータ) (2025-06-03T11:17:07Z) - Designing Control Barrier Function via Probabilistic Enumeration for Safe Reinforcement Learning Navigation [55.02966123945644]
本稿では,ニューラルネットワーク検証技術を利用して制御障壁関数(CBF)とポリシー修正機構の設計を行う階層型制御フレームワークを提案する。
提案手法は,安全なCBFベースの制御層を構築するために使用される,安全でない操作領域を特定するための確率的列挙に依存する。
これらの実験は、効率的なナビゲーション動作を維持しながら、安全でない動作を補正する提案手法の能力を実証するものである。
論文 参考訳(メタデータ) (2025-04-30T13:47:25Z) - ActSafe: Active Exploration with Safety Constraints for Reinforcement Learning [48.536695794883826]
本稿では,安全かつ効率的な探索のためのモデルベースRLアルゴリズムであるActSafeを提案する。
本稿では,ActSafeが学習中の安全性を保証しつつ,有限時間で準最適政策を得ることを示す。
さらに,最新のモデルベースRLの進歩に基づくActSafeの実用版を提案する。
論文 参考訳(メタデータ) (2024-10-12T10:46:02Z) - Sampling-based Safe Reinforcement Learning for Nonlinear Dynamical
Systems [15.863561935347692]
非線形力学系の制御のための安全かつ収束性のある強化学習アルゴリズムを開発した。
制御とRLの交差点における最近の進歩は、ハードセーフティ制約を強制するための2段階の安全フィルタアプローチに従っている。
我々は,古典的な収束保証を享受するRLコントローラを学習する,一段階のサンプリングに基づくハード制約満足度へのアプローチを開発する。
論文 参考訳(メタデータ) (2024-03-06T19:39:20Z) - Modular Control Architecture for Safe Marine Navigation: Reinforcement Learning and Predictive Safety Filters [0.0]
強化学習は複雑なシナリオに適応するためにますます使われていますが、安全性と安定性を保証するための標準フレームワークは欠如しています。
予測安全フィルタ(PSF)は、明示的な制約処理を伴わずに、学習ベースの制御における制約満足度を確保する、有望なソリューションを提供する。
この手法を海洋航法に適用し,シミュレーションされたCybership IIモデル上でRLとPSFを組み合わせた。
その結果, PSF が安全維持に有効であることは, RL エージェントの学習速度と性能を損なうことなく示され, PSF を使用せずに標準 RL エージェントに対して評価された。
論文 参考訳(メタデータ) (2023-12-04T12:37:54Z) - Recursively Feasible Probabilistic Safe Online Learning with Control Barrier Functions [60.26921219698514]
CBFをベースとした安全クリティカルコントローラのモデル不確実性を考慮した再構成を提案する。
次に、結果の安全制御器のポイントワイズ実現可能性条件を示す。
これらの条件を利用して、イベントトリガーによるオンラインデータ収集戦略を考案する。
論文 参考訳(メタデータ) (2022-08-23T05:02:09Z) - Safe Reinforcement Learning via Confidence-Based Filters [78.39359694273575]
我々は,標準的な強化学習技術を用いて学習した名目政策に対して,国家安全の制約を認定するための制御理論的アプローチを開発する。
我々は、正式な安全保証を提供し、我々のアプローチの有効性を実証的に実証する。
論文 参考訳(メタデータ) (2022-07-04T11:43:23Z) - Safe-Critical Modular Deep Reinforcement Learning with Temporal Logic
through Gaussian Processes and Control Barrier Functions [3.5897534810405403]
強化学習(Reinforcement Learning, RL)は,現実のアプリケーションに対して限られた成功を収める,有望なアプローチである。
本稿では,複数の側面からなる学習型制御フレームワークを提案する。
ECBFをベースとしたモジュラーディープRLアルゴリズムは,ほぼ完全な成功率を達成し,高い確率で安全性を保護することを示す。
論文 参考訳(メタデータ) (2021-09-07T00:51:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。