論文の概要: SteinGate: Tail-Sensitive Safe Reinforcement Learning via Stein Discrepancy
- arxiv url: http://arxiv.org/abs/2607.13175v1
- Date: Tue, 14 Jul 2026 18:23:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.563832
- Title: SteinGate: Tail-Sensitive Safe Reinforcement Learning via Stein Discrepancy
- Title(参考訳): SteinGate: テイル・センシティブな安全強化学習
- Abstract要約: 本稿では,境界対応型配電安全証明書であるSteinGateを紹介する。
Kernelized Stein Disrepancyを使用して、脆弱なテールフィッティングを堅牢な一貫性チェックに置き換える。
連続制御ベンチマークの実験により、SteinGateは制約違反の頻度と重大さの両方を著しく低減することが示された。
- 参考スコア(独自算出の注目度): 21.962603351578593
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Safe reinforcement learning typically enforces safety by bounding expected cumulative costs, a criterion that often fails to detect rare but catastrophic tail events. To overcome these limitations, this paper introduces SteinGate, a boundary-aware distributional safety certificate that replaces fragile tail fitting with a robust consistency check using Kernelized Stein Discrepancy while accounting for boundary atoms induced by clipped costs. SteinGate evaluates whether observed policy rollout costs remain consistent with a safe reference distribution, providing a non-parametric safety certificate. This certificate is used to dynamically adapt the learning regime: favoring reward-improving policy updates when rollouts remain consistent with the safe reference and switching to recovery behavior when the cost tail deviates. Experiments on continuous-control benchmarks demonstrate that SteinGate significantly reduces both the frequency and severity of constraint violations during training while maintaining competitive returns relative to state-of-the-art baselines.
- Abstract(参考訳): 安全強化学習は、しばしば稀だが破滅的な尾の出来事を検出するのに失敗する基準である、期待される累積コストを制限することによって、安全を強制する。
このような制約を克服するため,本稿では,切断コストによる境界原子を考慮しつつ,カーネル化されたスタインディスクレパンシーを用いた堅牢な整合性チェックに,脆弱なテールフィッティングを置き換えた境界対応分布安全証明書であるSteinGateを紹介する。
SteinGateは、監視対象のポリシーのロールアウトコストが安全な基準分布と一致しているかを評価し、非パラメトリック安全証明書を提供する。
この証明書は学習体制を動的に適応するために使用され、ロールアウトが安全基準と整合性を維持した場合には報酬改善政策の更新を優先し、コストテールがずれた場合には回復行動に切り替える。
連続制御ベンチマークの実験では、SteinGateはトレーニング中の制約違反の頻度と重症度の両方を著しく低減し、最先端のベースラインに対する競合リターンを維持している。
関連論文リスト
- Certified Safety Curation: Distribution-Free Guarantees for Safe Offline Reinforcement Learning [0.0]
Filter-then-cloneパイプライン: セグメント比較からトレーニングされた状態のみの値が、すべてのトラジェクトリをスコアする。
我々は、オフラインのRLや模倣のためのトレーニングセットの構成を認定する事前の作業について知りません。
論文 参考訳(メタデータ) (2026-09-10T06:45:32Z) - Scenario Generation for Risk-Aware Reinforcement Learning with Probably Approximately Safe Guarantees [3.959033903731638]
強化学習 (Reinforcement Learning, RL) ポリシーは、未知または安全でない振る舞いをもたらす過渡摂動への感受性を示す。
政策検証の方法は、安全制約に対する政策軌跡をサンプリングすることによって確率的障壁証明を構築することである。
可変オートエンコーダ (VAE) を用いて, 遭遇した状態空間の分布を近似し, 上界と下界のバリア・サーティフィケートを構成する。
論文 参考訳(メタデータ) (2026-06-03T12:36:43Z) - Constitutional On-Policy Safe Distillation [64.02536207601112]
On-policy Self-distillation (OPSD) は、特権情報に条件付けされた教師を用いて、密集したトークンレベルの監視を提供することにより、効果的なポストトレーニングパラダイムとして登場した。
コンスティチューショナル・オン・ポリティシィ・セーフ蒸留(COPSD)を提案し,まずクロスSFTコールドスタートで教師を校正し,次いでコンスティチューショナル・コンスティチューション・オン・ポリティィ蒸留を行う。
論文 参考訳(メタデータ) (2026-06-02T03:17:56Z) - Trust, Geometry, and Rules: A Credibility-Aware Reinforcement Learning Framework for Safe USV Navigation under Uncertainty [32.34854002457735]
本稿では,信頼性を意識した学習,幾何的安全遮蔽,連続ルール認識の埋め込みを組み込んだフレームワークを提案する。
本研究は,直観的不整合に対するトレーニングの堅牢性の向上と衝突回避性の向上,およびベースラインに対するCOLREGのコンプライアンスについて述べる。
論文 参考訳(メタデータ) (2026-05-26T12:59:43Z) - From Cumulative Constraints to Adaptive Runtime Safety Control for Nonstationary Reinforcement Learning [0.0]
Constraint Projection Safety Shield (CPSS)は、累積安全予算を実行中に適応的な状態レベルの制御制約に変換するランタイムメカニズムである。
CPSSは残りの安全予算を追跡し、それを許容されるリスクしきい値に予測し、予測される安全コストがアクティブなしきい値を超える政策措置をフィルタリングする。
得られた遮蔽ポリシーを解析し、そのメカニズムが実行された動作に対する状態ごとの閾値満足度を保証することを示す。
論文 参考訳(メタデータ) (2026-05-13T03:34:13Z) - Boundary-to-Region Supervision for Offline Safe Reinforcement Learning [56.150983204962735]
バウンダリ・トゥ・レギオン(Bundary-to-Region, B2R)は、コスト信号による非対称な条件付けを可能にするフレームワークである。
B2Rは、CTGを固定された安全予算の下で境界制約として再定義し、すべての実行可能な軌道のコスト分布を統一する。
実験の結果,B2Rは38項目中35項目の安全制約を満たすことがわかった。
論文 参考訳(メタデータ) (2025-09-30T03:38:20Z) - Revisiting Safe Exploration in Safe Reinforcement learning [0.098314893665023]
我々は,トレーニング中の安全性に対処する新しい測定基準であるEMCCを導入する。
EMCCは特に長期の安全違反と時折の安全違反の区別に有効である。
本稿では,アルゴリズム設計のための高速な評価を可能にする,新しい軽量なベンチマークタスクを提案する。
論文 参考訳(メタデータ) (2024-09-02T13:29:29Z) - Safe Deep Reinforcement Learning by Verifying Task-Level Properties [84.64203221849648]
コスト関数は、安全深層強化学習(DRL)において一般的に用いられる。
このコストは通常、国家空間における政策決定のリスクの定量化が難しいため、指標関数として符号化される。
本稿では,ドメイン知識を用いて,そのような状態に近接するリスクを定量化するための代替手法について検討する。
論文 参考訳(メタデータ) (2023-02-20T15:24:06Z) - Online Safety Property Collection and Refinement for Safe Deep
Reinforcement Learning in Mapless Navigation [79.89605349842569]
オンラインプロパティのコレクション・リファインメント(CROP)フレームワークをトレーニング時にプロパティを設計するために導入する。
CROPは、安全でない相互作用を識別し、安全特性を形成するためにコストシグナルを使用する。
本手法をいくつかのロボットマップレスナビゲーションタスクで評価し,CROPで計算した違反量によって,従来のSafe DRL手法よりも高いリターンと低いリターンが得られることを示す。
論文 参考訳(メタデータ) (2023-02-13T21:19:36Z) - Safe Reinforcement Learning via Confidence-Based Filters [78.39359694273575]
我々は,標準的な強化学習技術を用いて学習した名目政策に対して,国家安全の制約を認定するための制御理論的アプローチを開発する。
我々は、正式な安全保証を提供し、我々のアプローチの有効性を実証的に実証する。
論文 参考訳(メタデータ) (2022-07-04T11:43:23Z) - Conservative Safety Critics for Exploration [120.73241848565449]
強化学習(RL)における安全な探索の課題について検討する。
我々は、批評家を通じて環境状態の保守的な安全性推定を学習する。
提案手法は,破滅的故障率を著しく低く抑えながら,競争力のあるタスク性能を実現することができることを示す。
論文 参考訳(メタデータ) (2020-10-27T17:54:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。