論文の概要: Proactive Context-Forecasted Safety Constraints for Nonstationary Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.08080v1
- Date: Tue, 08 Sep 2026 00:44:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.539367
- Title: Proactive Context-Forecasted Safety Constraints for Nonstationary Reinforcement Learning
- Title(参考訳): 非定常強化学習のための積極的文脈予測型安全制約
- Authors: Tim Tomashevskiy,
- Abstract要約: 本稿では,文脈予測に基づくアクティブな安全制約生成のためのフレームワークを提案する。
構造化された文脈変化を伴う運転環境における手法の評価を行う。
その結果, 積極的制約生成は非定常強度と非定常強度の両面における衝突を著しく減少させることがわかった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Ensuring safety in reinforcement learning under nonstationarity requires anticipating changes in risk before they lead to unsafe behavior. Existing approaches typically rely on safety constraints defined at design time or updated reactively during execution, assuming that such constraints remain valid over time. However, in nonstationary environments with evolving contexts and changing driving layouts, these assumptions may fail. We propose a framework for proactive safety constraint generation based on context forecasting. The approach infers latent environmental context from observations, predicts its future evolution, and constructs safety constraints adapted to anticipated conditions. This enables the agent to proactively avoid unsafe regions instead of reacting only after safety violations occur. We evaluate the method in driving environments with structured context variation. The experiments include a sweep over nonstationarity intensities and additional held-out driving layouts, including highway, intersection, and racetrack scenarios. Results show that proactive constraint generation substantially reduces collisions under both seen and out-of-training nonstationarity intensities and generally remains effective across held-out driving layouts while maintaining usable task performance. These findings suggest that context-based constraint generation is a promising approach for safe reinforcement learning under nonstationarity.
- Abstract(参考訳): 非定常性下での強化学習の安全性を確保するには、安全でない行動につながる前にリスクの変化を予測する必要がある。
既存のアプローチは一般的に、設計時に定義された安全制約や、実行中にリアクティブに更新される安全制約に依存します。
しかし、状況が変化し、運転レイアウトが変化する非定常環境では、これらの仮定は失敗する可能性がある。
本稿では,文脈予測に基づくアクティブな安全制約生成のためのフレームワークを提案する。
このアプローチは、観測から潜伏した環境コンテキストを推測し、将来の進化を予測し、予測された条件に適応した安全制約を構築する。
これにより、安全違反が発生した後にのみ反応することなく、安全でない領域を積極的に回避することができる。
構造化された文脈変化を伴う運転環境における手法の評価を行う。
実験には、非定常性の強度を網羅し、ハイウェイ、交差点、競馬場のシナリオを含む、追加のホールドアウト運転レイアウトが含まれる。
その結果、アクティブな制約生成は、目視およびトレーニング外両方の非定常強度の衝突を著しく低減し、一般に、使用可能なタスク性能を維持しながら、保持された運転レイアウトに対して有効であることを示す。
これらの結果は、文脈に基づく制約生成が、非定常下での安全な強化学習に有望なアプローチであることを示唆している。
関連論文リスト
- Adjustment Speed as a Safety Constraint for Nonstationary Reinforcement Learning [0.0]
本稿では,非定常強化学習における安全制約として,調整速度を提案する。
将来の州や地域は、安全を維持するために必要な適応が、学習システムの校正された回復能力を超えると、危険になる可能性がある。
非定常運転環境における実験により, 提案手法は, コンテキスト変化に対応する近地窓の安全違反を主に低減することを示した。
論文 参考訳(メタデータ) (2026-07-21T23:52:07Z) - Hamilton-Jacobi Reachability-Based Safe Reinforcement Learning for Emergency Collision Avoidance [13.82721066487409]
本稿では,ハミルトン・ヤコビ到達可能性に基づく運動安全セットによってガイドされる安全な強化学習フレームワークを提案する。
提案手法は,目標達成率の向上,回避操作の円滑化,基準法よりも大きな統一安全マージンの維持を実現している。
論文 参考訳(メタデータ) (2026-06-13T13:57:30Z) - Safe Continual Reinforcement Learning under Nonstationarity via Adaptive Safety Constraints [0.0]
LILAC+は、非定常下での安全な継続的強化学習のためのフレームワークである。
これは、コンテキストベースの安全制約、適応速度制約、州間安全執行の3つの適応安全メカニズムを組み合わせたものである。
静止状態,非定常状態,非定常状態のシミュレーション運転環境におけるフレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-05-13T04:10:10Z) - Contextual Safety Reasoning and Grounding for Open-World Robots [79.98924225712668]
COREは、環境に関する事前の知識なしに、オンラインのコンテキスト推論、接地、執行を可能にする安全フレームワークである。
知覚の不確実性を考慮したCOREの確率論的安全性保証を提供する。
シミュレーションと実世界の実験を通じて、COREは目に見えない環境において、文脈的に適切な振る舞いを強制することを示した。
論文 参考訳(メタデータ) (2026-02-23T15:51:23Z) - PoSafeNet: Safe Learning with Poset-Structured Neural Nets [49.854863600271614]
既存のアプローチは、しばしば複数の安全制約を均一に、または固定された優先命令によって強制し、実現不可能と不安定な振る舞いを引き起こす。
我々は、この設定を擬似構造的安全性として定式化し、安全制約を部分的に順序づけられた集合としてモデル化し、安全構成を政策クラスの構造的特性として扱う。
この定式化に基づいて、逐次クローズドフォームプロジェクションを介して安全性を強制する、識別可能な神経安全層であるPoSafeNetを提案する。
論文 参考訳(メタデータ) (2026-01-29T22:03:32Z) - ReflexDiffusion: Reflection-Enhanced Trajectory Planning for High-lateral-acceleration Scenarios in Autonomous Driving [14.885968822668824]
ReflexDiffusionは、反射調整により拡散に基づく軌道プランナーを強化する推論段階のフレームワークである。
最先端(SOTA)法よりも14.1%向上した。
論文 参考訳(メタデータ) (2026-01-14T11:03:29Z) - RACER: Epistemic Risk-Sensitive RL Enables Fast Driving with Fewer Crashes [57.319845580050924]
本稿では,リスク感応制御と適応行動空間のカリキュラムを組み合わせた強化学習フレームワークを提案する。
提案アルゴリズムは,現実世界のオフロード運転タスクに対して,高速なポリシーを学習可能であることを示す。
論文 参考訳(メタデータ) (2024-05-07T23:32:36Z) - Enforcing Hard Constraints with Soft Barriers: Safe Reinforcement
Learning in Unknown Stochastic Environments [84.3830478851369]
本研究では,環境を協調的に学習し,制御ポリシーを最適化する安全な強化学習手法を提案する。
本手法は, 安全性の制約を効果的に適用し, シミュレーションにより測定したシステム安全率においてCMDPベースのベースライン法を著しく上回っている。
論文 参考訳(メタデータ) (2022-09-29T20:49:25Z) - Context-Aware Safe Reinforcement Learning for Non-Stationary
Environments [24.75527261989899]
現実的なタスクのために強化学習エージェントを展開する場合、安全は重要な問題である。
非定常環境における安全な適応を実現するために,文脈認識型安全強化学習法(CASRL)を提案する。
提案アルゴリズムは,安全性とロバスト性の観点から,既存のベースラインを著しく上回ることを示す。
論文 参考訳(メタデータ) (2021-01-02T23:52:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。