論文の概要: SMC-ES: Automated synthesis of formally verified control policies
- arxiv url: http://arxiv.org/abs/2607.15003v1
- Date: Thu, 16 Jul 2026 13:51:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.128307
- Title: SMC-ES: Automated synthesis of formally verified control policies
- Title(参考訳): SMC-ES: 公式に検証された制御ポリシーの自動合成
- Authors: Riccardo Curcio, Toni Mancini, Enrico Tronci,
- Abstract要約: 本稿では,性能,安全性,堅牢性に関する公式な保証付きポリシを自動生成するシミュレーションベースの手法を提案する。
SMC-ESは,進化的戦略と統計的モデル検査に基づく検証を統合するアルゴリズムである。
その結果, 計算コストの持続的増加に対して, 本アルゴリズムは性能, 安全性, 堅牢性に関する公式な保証を提供することがわかった。
- 参考スコア(独自算出の注目度): 0.6117371161379209
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The deployment of autonomous cyber-physical systems in safety-critical environments requires closed-loop control strategies (i.e., policies) that are not only performant but also provably safe and robust. While learning-based methodologies such as Reinforcement Learning offer flexible and scalable approaches to automatically synthesize such controllers, they typically lack the formal guarantees necessary for safe deployment. To bridge this gap, we propose a novel simulation-based methodology to automatically synthesize policies with formal guarantees regarding performance, safety, and robustness specifications. Specifically, given a set of properties to verify, a confidence parameter $δ$ and an allowable failure probability $\varepsilon$, our method guarantees that the synthesized policy comes with a certificate: with confidence at least $1 - δ$, the probability of encountering a scenario where the given properties are violated is at most $\varepsilon$. We demonstrate the feasibility of our approach by developing SMC-ES, an algorithm that integrates Evolutionary Strategies with Statistical Model Checking-based verification. We evaluate SMC-ES on a suite of continuous control tasks using Gymnasium and Safety Gymnasium testbeds. Results show that, at the price of a sustainable increase in computational cost, our algorithm provides formal guarantees regarding performance, safety, and robustness specifications, while performing competitively against leading model-free Deep Reinforcement Learning (DRL) and Safe-DRL baselines.
- Abstract(参考訳): 安全クリティカルな環境における自律的なサイバー物理システムの展開には、性能だけでなく、確実に安全かつ堅牢なクローズドループ制御戦略(すなわちポリシー)が必要である。
Reinforcement Learningのような学習ベースの方法論は、そのようなコントローラを自動的に合成するための柔軟でスケーラブルなアプローチを提供するが、通常は安全なデプロイに必要な正式な保証がない。
このギャップを埋めるために、我々は、パフォーマンス、安全性、堅牢性に関する正式な保証付きポリシーを自動で合成する新しいシミュレーションベースの手法を提案する。
具体的には、検証すべきプロパティのセット、信頼性パラメータ$δ$と許容可能な障害確率$\varepsilonが与えられた場合、我々のメソッドは、合成されたポリシーが証明書を伴っていることを保証します。
SMC-ESは,進化的戦略と統計的モデル検査に基づく検証を統合するアルゴリズムである。
Gymnasium および Safety Gymnasium testbeds を用いて,一連の連続制御タスクにおける SMC-ES の評価を行った。
その結果,提案アルゴリズムは,計算コストの持続的増加に対して,性能,安全性,堅牢性に関する公式な保証を提供するとともに,先行するモデルフリーのDeep Reinforcement Learning (DRL) やSafe-DRLベースラインに対して競争力を発揮していることがわかった。
関連論文リスト
- Safe Reinforcement Learning using Ideas from Model Predictive Control [0.40831821256838124]
強化学習は、データから直接制御ポリシーを合成することを可能にする。
永続的な課題は、アクティブな学習フェーズにおける厳格で厳しい安全性の制約を保証することです。
本稿では,深層強化学習の適応的かつ高性能な性質と,モデル予測制御の形式的安全性を保証する枠組みを提案する。
論文 参考訳(メタデータ) (2026-07-08T10:35:04Z) - Safe Reinforcement Learning via Recovery-based Shielding with Gaussian Process Dynamics Models [57.006252510102506]
強化学習(Reinforcement Learning, RL)は、最適な意思決定と制御のための強力なフレームワークである。
本稿では,未知および非線形連続力学系に対する安全性を低くした安全RLを実現するための新しい回復型遮蔽フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-12T22:03:35Z) - ISAACS: Iterative Soft Adversarial Actor-Critic for Safety [0.9217021281095907]
この研究は、ロボットシステムのための堅牢な安全維持コントローラのスケーラブルな合成を可能にする新しいアプローチを導入する。
安全を追求するフォールバックポリシーは、モデルエラーの最悪のケースの実現を促進するために、敵の「混乱」エージェントと共同で訓練される。
学習した制御ポリシーは本質的に安全性を保証するものではないが、リアルタイムの安全フィルタを構築するために使用される。
論文 参考訳(メタデータ) (2022-12-06T18:53:34Z) - Recursively Feasible Probabilistic Safe Online Learning with Control Barrier Functions [60.26921219698514]
CBFをベースとした安全クリティカルコントローラのモデル不確実性を考慮した再構成を提案する。
次に、結果の安全制御器のポイントワイズ実現可能性条件を示す。
これらの条件を利用して、イベントトリガーによるオンラインデータ収集戦略を考案する。
論文 参考訳(メタデータ) (2022-08-23T05:02:09Z) - Safe Reinforcement Learning via Confidence-Based Filters [78.39359694273575]
我々は,標準的な強化学習技術を用いて学習した名目政策に対して,国家安全の制約を認定するための制御理論的アプローチを開発する。
我々は、正式な安全保証を提供し、我々のアプローチの有効性を実証的に実証する。
論文 参考訳(メタデータ) (2022-07-04T11:43:23Z) - Closing the Closed-Loop Distribution Shift in Safe Imitation Learning [80.05727171757454]
模倣学習問題において,安全な最適化に基づく制御戦略を専門家として扱う。
我々は、実行時に安価に評価でき、専門家と同じ安全保証を確実に満足する学習されたポリシーを訓練する。
論文 参考訳(メタデータ) (2021-02-18T05:11:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。