論文の概要: Safe Online Learning via Smooth Safety-Structured Policy Composition
- arxiv url: http://arxiv.org/abs/2606.31320v1
- Date: Tue, 30 Jun 2026 08:26:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.138583
- Title: Safe Online Learning via Smooth Safety-Structured Policy Composition
- Title(参考訳): Smooth Safety-Structured Policy compositionによる安全なオンライン学習
- Abstract要約: AutoSafeは、構造化された安全監視と介入を直接アクション生成プロセスに統合する、安全を意識したポリシーアーキテクチャである。
一連の継続的制御ベンチマークにおける実証的な結果は、学習のスムーズさを犠牲にすることなく、強力な安全性の強化を示す。
さらに,物理的なカートポールシステム上でのAutoSafeの有効性を検証し,現実世界における安全なオンライン学習の実践的有効性を強調した。
- 参考スコア(独自算出の注目度): 12.206103132138464
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safe online reinforcement learning requires policies to respect safety constraints while maintaining smooth optimization dynamics. Existing approaches typically rely on either strict safety enforcement via action interventions, which introduce discontinuities in system interaction and learning, or soft safety constraint formulations, which preserve smooth learning but provide limited safety assurance. We propose AutoSafe, a safety-aware policy architecture that integrates structured safety monitoring and intervention directly into the action generation process. This design enables smooth, risk-dependent transitions between performance-driven and safety-preserving behaviors, resulting in continuous online interaction and learning dynamics. Empirical results across a suite of continuous-control benchmarks demonstrate strong safety enforcement without sacrificing learning smoothness. We further validate AutoSafe on a physical cart-pole system, highlighting its practical effectiveness for safe online learning in the real world.
- Abstract(参考訳): 安全なオンライン強化学習には、スムーズな最適化のダイナミクスを維持しながら、安全性の制約を尊重するポリシーが必要である。
既存のアプローチは、システム間相互作用と学習の不連続を導入する行動介入による厳格な安全執行、あるいはスムーズな学習を維持しながら、限られた安全保証を提供するソフトセーフティ制約の定式化のいずれかに依存している。
本稿では,構造化された安全監視と介入を直接アクション生成プロセスに統合する安全対応型ポリシーアーキテクチャであるAutoSafeを提案する。
この設計により、パフォーマンス駆動と安全保護の動作間のスムーズでリスク依存的な移行が可能になり、継続的なオンラインインタラクションと学習のダイナミクスをもたらす。
一連の継続的制御ベンチマークにおける実証的な結果は、学習のスムーズさを犠牲にすることなく、強力な安全性の強化を示す。
さらに,物理的なカートポールシステム上でのAutoSafeの有効性を検証し,現実世界における安全なオンライン学習の実践的有効性を強調した。
関連論文リスト
- ResSafe: Learning Safety Filtering with Residual Reinforcement Learning for Humanoids [13.957722062725862]
安全ヒューマノイド制御のための暗黙的安全性フィルタリング機構として, 残留強化学習を提案する。
パフォーマンス、安全性、堅牢性のバランスをとるために、単一の名目上のポリシーに頼るのではなく、パフォーマンスと安全性を分離します。
論文 参考訳(メタデータ) (2026-09-14T17:59:50Z) - World Engine: Towards the Era of Post-Training for Autonomous Driving [63.61277741443647]
実世界のログから高忠実度インタラクティブ環境を再構築する生成フレームワークであるWorld Engineを紹介する。
World Engineは、稀な安全クリティカルなシナリオにおける障害を大幅に削減し、事前トレーニングデータのみをスケールするよりもはるかに大きな利益をもたらす。
プロダクションスケールの自動運転システムにデプロイすると、結果として、シミュレートされた衝突を減らすことができる。
論文 参考訳(メタデータ) (2026-06-18T06:28:33Z) - Safe-RULE: Safe Reinforcement UnLEarning [0.22940141855172028]
オフライン安全な強化学習(Safe RL)は、オンラインインタラクションなしでポリシー学習を可能にする。
本稿では, 有害データの影響を取り除くための防御枠組みとして, 安全強化学習(Safe-RULE)を提案する。
論文 参考訳(メタデータ) (2026-06-08T14:33:40Z) - PoSafeNet: Safe Learning with Poset-Structured Neural Nets [49.854863600271614]
既存のアプローチは、しばしば複数の安全制約を均一に、または固定された優先命令によって強制し、実現不可能と不安定な振る舞いを引き起こす。
我々は、この設定を擬似構造的安全性として定式化し、安全制約を部分的に順序づけられた集合としてモデル化し、安全構成を政策クラスの構造的特性として扱う。
この定式化に基づいて、逐次クローズドフォームプロジェクションを介して安全性を強制する、識別可能な神経安全層であるPoSafeNetを提案する。
論文 参考訳(メタデータ) (2026-01-29T22:03:32Z) - Safe Continual Reinforcement Learning Methods for Nonstationary Environments. Towards a Survey of the State of the Art [0.0]
この研究は、継続的な安全なオンライン強化学習(COSRL)手法に関する最先端の調査を提供する。
オンラインの安全強化学習アルゴリズム構築における理論的側面、課題、オープンな疑問について論じる。
論文 参考訳(メタデータ) (2026-01-08T17:42:56Z) - UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models [67.91151588917396]
大規模言語モデル(LLM)は、幅広いタスクで顕著な進歩を遂げているが、有害なコンテンツ生成やジェイルブレイク攻撃といった安全リスクに弱いままである。
安全に配慮したリサイクルによるLCMの安全性向上のための統合フレームワークであるUpSafe$circ$Cを提案する。
この結果から, 静的アライメントから動的, モジュール, 推論対応制御への移行という, LLMの安全性の新たな方向性が明らかになった。
論文 参考訳(メタデータ) (2025-10-02T16:43:33Z) - Safely Learning Controlled Stochastic Dynamics [61.82896036131116]
システム力学の安全な探索と効率的な推定を可能にする手法を提案する。
学習後、学習モデルはシステムのダイナミクスの予測を可能にし、任意の制御の安全性検証を可能にする。
我々は、真の力学のソボレフ正則性を高めることにより、安全性と適応学習率の向上を理論的に保証する。
論文 参考訳(メタデータ) (2025-06-03T11:17:07Z) - FOSP: Fine-tuning Offline Safe Policy through World Models [3.7971075341023526]
オフラインセーフ強化学習(RL)は、静的データセットから学習し、探索を制限することで、安全性の制約に対処することを目指している。
本稿では、オフライン事前学習ポリシーをオンラインで微調整することで、視覚に基づくロボットタスクの展開時の安全性向上を図る。
論文 参考訳(メタデータ) (2024-07-06T03:22:57Z) - Evaluation of Safety Constraints in Autonomous Navigation with Deep
Reinforcement Learning [62.997667081978825]
学習可能なナビゲーションポリシとして,セーフとアンセーフの2つを比較します。
安全なポリシは、制約をアカウントに含めますが、もう一方はそうではありません。
安全政策は、よりクリアランスの高い軌道を生成することができ(障害物によらず)、全体的な性能を犠牲にすることなく、トレーニング中に衝突を減らすことができることを示す。
論文 参考訳(メタデータ) (2023-07-27T01:04:57Z) - Optimal Transport Perturbations for Safe Reinforcement Learning with Robustness Guarantees [14.107064796593225]
我々は、最適な輸送コストの不確実性セットを用いてロバストネスを組み込んだ安全な強化学習フレームワークを導入する。
安全性の制約のある継続的制御タスクの実験では,本手法はロバストな性能を示しながら,デプロイ時の安全性を大幅に改善する。
論文 参考訳(メタデータ) (2023-01-31T02:39:52Z) - ISAACS: Iterative Soft Adversarial Actor-Critic for Safety [0.9217021281095907]
この研究は、ロボットシステムのための堅牢な安全維持コントローラのスケーラブルな合成を可能にする新しいアプローチを導入する。
安全を追求するフォールバックポリシーは、モデルエラーの最悪のケースの実現を促進するために、敵の「混乱」エージェントと共同で訓練される。
学習した制御ポリシーは本質的に安全性を保証するものではないが、リアルタイムの安全フィルタを構築するために使用される。
論文 参考訳(メタデータ) (2022-12-06T18:53:34Z) - Recursively Feasible Probabilistic Safe Online Learning with Control Barrier Functions [60.26921219698514]
CBFをベースとした安全クリティカルコントローラのモデル不確実性を考慮した再構成を提案する。
次に、結果の安全制御器のポイントワイズ実現可能性条件を示す。
これらの条件を利用して、イベントトリガーによるオンラインデータ収集戦略を考案する。
論文 参考訳(メタデータ) (2022-08-23T05:02:09Z) - SAFER: Data-Efficient and Safe Reinforcement Learning via Skill
Acquisition [59.94644674087599]
安全制約下での複雑な制御タスクにおけるポリシー学習を高速化するアルゴリズムであるSAFEty skill pRiors (SAFER)を提案する。
オフラインデータセットでの原則的なトレーニングを通じて、SAFERは安全なプリミティブスキルの抽出を学ぶ。
推論段階では、SAFERで訓練されたポリシーは、安全なスキルを成功のポリシーに組み込むことを学ぶ。
論文 参考訳(メタデータ) (2022-02-10T05:43:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。