論文の概要: CORE-RL: Confidence-Oriented Reliability Evaluation of Black-Box Reinforcement Learning Policies
- arxiv url: http://arxiv.org/abs/2610.04418v1
- Date: Sat, 03 Oct 2026 10:15:09 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:32:36.442681
- Title: CORE-RL: Confidence-Oriented Reliability Evaluation of Black-Box Reinforcement Learning Policies
- Title(参考訳): CORE-RL:ブラックボックス強化学習ポリシーの信頼性指向信頼性評価
- Abstract要約: CORE-RL: 信頼性指向信頼性評価のためのブラックボックスRLポリシーを提案する。
パイプラインは有限サンプルのクロッパー・ピアソン境界を統一信頼度で計算し、ホーフディングスは報酬と安全性のコストを低くする。
継続的制御タスクの実験は、CORE-RLパイプラインが非準拠ポリシーを自動的に拒否する能力を示している。
- 参考スコア(独自算出の注目度): 7.752056915267077
- License:
- Abstract: The deployment of Reinforcement Learning (RL) agents in critical domains must be preceded with a pipeline to evaluate the alignment of the RL agent with complex multi-objective specifications and robustness under real-world environmental drift. However, to protect intellectual property, the RL agent may be delivered for evaluation as opaque executable or remote API, which makes traditional evaluation techniques based on the internals of the policies infeasible. To address this gap, CORE-RL: Confidence-Oriented Reliability Evaluation of black box RL policy is proposed in this paper. The CORE-RL pipeline introduces a Unified Reliability Metric that formally integrates early task termination and safety constraint violations, preventing unsafe policies from masking failures through premature episode halts. By subjecting the policy to a noise certification envelope of perceptual noise, actuation noise and change in environment dynamics, the pipeline computes the finite-sample Clopper-Pearson bounds on unified reliability metric and Hoeffdings' lower bound on reward and safety cost. The pipeline then defines safe operational design domain to report high-confidence certificates for safety and expected performance. Experiments on continuous control tasks demonstrate the CORE-RL pipeline's ability to automatically reject non-compliant policies and map the safe Operational Design Domain (ODD) of safety-aware policies. Thus CORE-RL provides an evaluation framework towards a quantitative, transparent and reproducible, statistical rationale necessary to safely evaluate, compare, and deploy black box RL solutions.
- Abstract(参考訳): 臨界領域における強化学習(RL)エージェントの展開は、RLエージェントの複雑な多目的仕様と実環境漂流下での堅牢性を評価するパイプラインで先行しなければならない。
しかし、知的財産を保護するため、RLエージェントは不透明な実行可能APIまたはリモートAPIとして評価するために提供され、ポリシーの内部に基づいた従来の評価技術は実現不可能である。
このギャップに対処するため,CORE-RL: Confidence-Oriented Reliability Evaluation of black box RL Policyを提案する。
CORE-RLパイプラインはUnified Reliability Metricを導入し、早期タスク終了と安全制約違反を正式に統合し、早めのエピソード停止による障害のマスキングを防止する。
パイプラインは、知覚ノイズ、アクティベーションノイズ、環境力学の変化のノイズ認定エンベロープにポリシーを適用することにより、統一された信頼性測定値とHoeffdingsの下限の報酬と安全性コストに基づいて有限サンプルクロッパー・ピアソン境界を計算する。
パイプラインは安全設計ドメインを定義し、信頼性の高い証明書を報告し、安全性とパフォーマンスを期待する。
継続的制御タスクの実験では、CORE-RLパイプラインが自動的に非準拠ポリシーを拒否し、安全対応ポリシーの安全な運用設計ドメイン(ODD)をマップする能力を示している。
したがって、CORE-RLは、ブラックボックスRLソリューションを安全に評価し、比較し、デプロイするのに必要な量的かつ透明で、再現可能な統計的根拠に対する評価フレームワークを提供する。
関連論文リスト
- RL-STPA: Adapting System-Theoretic Hazard Analysis for Safety-Critical Reinforcement Learning [0.8291942198324129]
本稿ではRL-STPA(Reinforcement Learning System-Theoretic Process Analysis)を紹介する。
RL-STPAは、RLの固有の課題に3つの重要な貢献を通して対処するために、従来のハザード分析を適用する。
RL-STPAは自律型ドローンの航法と着陸の安全上重要なテストケースである。
論文 参考訳(メタデータ) (2026-04-16T16:27:42Z) - Safe Reinforcement Learning via Recovery-based Shielding with Gaussian Process Dynamics Models [57.006252510102506]
強化学習(Reinforcement Learning, RL)は、最適な意思決定と制御のための強力なフレームワークである。
本稿では,未知および非線形連続力学系に対する安全性を低くした安全RLを実現するための新しい回復型遮蔽フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-12T22:03:35Z) - SPoRt -- Safe Policy Ratio: Certified Training and Deployment of Task Policies in Model-Free RL [54.022106606140774]
本研究では,モデルフリーでエピソードな環境において,新しいタスク固有ポリシーの安全性特性に違反する確率に制約を課す理論的結果を示す。
この境界は、時間的に拡張された性質(安全性の他に)や堅牢な制御問題にも適用できる。
本研究は,このトレードオフを実証し,経験的違反率から得られる理論的境界と後続境界とを比較した実験結果である。
論文 参考訳(メタデータ) (2025-04-08T19:09:07Z) - Safety Modulation: Enhancing Safety in Reinforcement Learning through Cost-Modulated Rewards [23.15178050525514]
セーフ強化学習(Safe Reinforcement Learning, セーフRL)は、RLエージェントをトレーニングして、安全性の制約を守りながら、実環境におけるパフォーマンスを最大化することを目的としている。
本稿では,安全なポリシ関数学習を可能にする,SMPO(Safety Modulated Policy Optimization)と呼ばれる新しい安全なRL手法を提案する。
論文 参考訳(メタデータ) (2025-04-03T21:35:22Z) - Value Functions are Control Barrier Functions: Verification of Safe
Policies using Control Theory [46.85103495283037]
本稿では,制御理論から学習値関数への検証手法の適用方法を提案する。
我々は値関数と制御障壁関数の間の関係を確立する原定理を定式化する。
我々の研究は、RLベースの制御システムの汎用的でスケーラブルで検証可能な設計のための公式なフレームワークに向けた重要な一歩である。
論文 参考訳(メタデータ) (2023-06-06T21:41:31Z) - Online Safety Property Collection and Refinement for Safe Deep
Reinforcement Learning in Mapless Navigation [79.89605349842569]
オンラインプロパティのコレクション・リファインメント(CROP)フレームワークをトレーニング時にプロパティを設計するために導入する。
CROPは、安全でない相互作用を識別し、安全特性を形成するためにコストシグナルを使用する。
本手法をいくつかのロボットマップレスナビゲーションタスクで評価し,CROPで計算した違反量によって,従来のSafe DRL手法よりも高いリターンと低いリターンが得られることを示す。
論文 参考訳(メタデータ) (2023-02-13T21:19:36Z) - Trust Region-Based Safe Distributional Reinforcement Learning for
Multiple Constraints [18.064813206191754]
安全分布型アクタークリティカル(SDAC)と呼ばれる複数の制約に対する信頼領域に基づく安全強化学習アルゴリズムを提案する。
主な貢献は次のとおりである: 1) 多制約問題における不実現可能性問題を管理するための勾配積分法を導入し、理論収束を確実にし、2)低バイアスでリスク-逆制約を推定するTD($lambda$)ターゲット分布を開発する。
論文 参考訳(メタデータ) (2023-01-26T04:05:40Z) - Safe Reinforcement Learning via Confidence-Based Filters [78.39359694273575]
我々は,標準的な強化学習技術を用いて学習した名目政策に対して,国家安全の制約を認定するための制御理論的アプローチを開発する。
我々は、正式な安全保証を提供し、我々のアプローチの有効性を実証的に実証する。
論文 参考訳(メタデータ) (2022-07-04T11:43:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。