論文の概要: Discriminative Barrier Functions for Safe Adversarial Imitation Learning from Observation
- arxiv url: http://arxiv.org/abs/2607.13938v1
- Date: Wed, 15 Jul 2026 15:20:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.821611
- Title: Discriminative Barrier Functions for Safe Adversarial Imitation Learning from Observation
- Title(参考訳): 観察による安全な敵対的模倣学習のための識別バリア機能
- Abstract要約: 逆強化学習(IRL)アルゴリズムは、専門家によるデモンストレーションから学び、一般化するための強力なツールである。
制御バリア関数(CBF)は制御システムの安全性を保証するが、CBFの分析設計は時間がかかり難解である。
我々は、IRL中の報酬関数候補をCBFの空間に制約することで、これらの制限を共同で解決する。
- 参考スコア(独自算出の注目度): 14.317454403455331
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Inverse Reinforcement Learning (IRL) algorithms are powerful tools for learning from and generalizing expert demonstrations, but they often rely on unconstrained exploration, rendering them unsafe for real-world deployment. Meanwhile, Control Barrier Functions (CBFs) can guarantee the safety of control systems, but the analytical design of CBFs can be time-consuming and esoteric. In this work, we address these limitations jointly by constraining reward function candidacy during IRL to the space of CBFs, yielding a formulation that exhibits safe online control with continuous experiential improvement. Crucially, this framework enables the data-driven recovery of barrier functions directly from unlabeled expert observations. We demonstrate that the recovered barrier function is robust to unsafe states entirely absent from the expert data. Furthermore, we benchmark our method against standard IRL baselines in a simulated navigation environment, demonstrating improved safety performance. Finally, we investigate the trade-offs of planning-based versus policy-based IRL methods across both simulation and a real world obstacle avoidance task.
- Abstract(参考訳): 逆強化学習(IRL)アルゴリズムは、専門家によるデモンストレーションから学び、一般化するための強力なツールだが、制約のない探索に頼り、現実のデプロイメントでは安全ではない。
一方、制御バリア関数(CBF)は制御システムの安全性を保証することができるが、CBFの分析設計は時間がかかり難解である。
本研究では、IRL中の報酬関数候補をCBFの空間に制約することで、これらの制限を協調的に解決し、継続的な経験的改善とともに安全なオンライン制御を示す定式化を行う。
重要なことは、このフレームワークはラベルのない専門家の観察から直接バリア機能のデータ駆動による回復を可能にする。
回収されたバリア関数は、専門家データから完全に欠落した安全でない状態に対して堅牢であることを示す。
さらに,シミュレーションナビゲーション環境における標準IRLベースラインに対して提案手法をベンチマークし,安全性の向上を実証した。
最後に、シミュレーションと実世界の障害物回避タスクの両方において、計画ベースとポリシーベースのIRL手法のトレードオフについて検討する。
関連論文リスト
- CAPSULE: Control-Theoretic Action Perturbations for Safe Uncertainty-Aware Reinforcement Learning [2.28224729577679]
オフライン環境で確率論的制御-アフィンダイナミクスモデルを学習する安全な強化学習フレームワークを提案する。
提案手法は,既存のベースラインに匹敵するリターンを達成すると同時に,安全性違反を著しく低減する。
論文 参考訳(メタデータ) (2026-04-26T07:31:30Z) - BarrierSteer: LLM Safety via Learning Barrier Steering [83.12893815611052]
BarrierSteerは、学習した非線形安全性制約を直接モデルの潜在表現空間に埋め込むことで、安全性を形式化する新しいフレームワークである。
BarrierSteerは、敵の成功率を大幅に低下させ、安全でない世代を減少させ、既存の手法より優れていることを示す。
論文 参考訳(メタデータ) (2026-02-23T18:19:46Z) - Learning Neural Control Barrier Functions from Expert Demonstrations using Inverse Constraint Learning [1.7235805533661985]
我々は、安全、すなわち制御された前方不変集合に属することを考慮し、システムの状態を分類する制約関数を訓練する。
次に、その関数を使用して、新しいシミュレートされた軌道のセットをラベル付けし、神経CBFをトレーニングします。
4つの異なる環境において、我々のアプローチを実証的に評価し、既存のベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2025-10-24T15:20:34Z) - ORN-CBF: Learning Observation-conditioned Residual Neural Control Barrier Functions via Hypernetworks [2.7458654644827134]
制御障壁関数 (CBF) は自律システムの安全クリティカル制御の有効な方法として実証されている。
ハミルトン・ヤコビ(HJ)の到達可能性解析に基づく観測条件付きニューラルCBFを提案する。
論文 参考訳(メタデータ) (2025-09-20T10:29:36Z) - Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint [52.878820730054365]
インストラクションファインチューニング(IFT)は,大規模言語モデル(LLM)の能力向上のための効果的なポストトレーニング戦略として広く採用されている。
LLMの内部機構に関する最近の研究は、隠蔽状態における拒絶方向(r方向)を同定し、拒絶行動の制御において重要な役割を担っている。
このようなドリフトを緩和するため,提案手法では,各トレーニングサンプルの隠れ状態のr方向への投射の大きさを規則化する投射制約損失項を導入する。
論文 参考訳(メタデータ) (2025-09-08T15:24:33Z) - Recursively Feasible Probabilistic Safe Online Learning with Control Barrier Functions [60.26921219698514]
CBFをベースとした安全クリティカルコントローラのモデル不確実性を考慮した再構成を提案する。
次に、結果の安全制御器のポイントワイズ実現可能性条件を示す。
これらの条件を利用して、イベントトリガーによるオンラインデータ収集戦略を考案する。
論文 参考訳(メタデータ) (2022-08-23T05:02:09Z) - Learning Robust Output Control Barrier Functions from Safe Expert Demonstrations [50.37808220291108]
本稿では,専門家によるデモンストレーションの部分的な観察から,安全な出力フィードバック制御法を考察する。
まず,安全性を保証する手段として,ロバスト出力制御バリア関数(ROCBF)を提案する。
次に、安全なシステム動作を示す専門家による実証からROCBFを学習するための最適化問題を定式化する。
論文 参考訳(メタデータ) (2021-11-18T23:21:00Z) - Conservative Safety Critics for Exploration [120.73241848565449]
強化学習(RL)における安全な探索の課題について検討する。
我々は、批評家を通じて環境状態の保守的な安全性推定を学習する。
提案手法は,破滅的故障率を著しく低く抑えながら,競争力のあるタスク性能を実現することができることを示す。
論文 参考訳(メタデータ) (2020-10-27T17:54:25Z) - Learning Control Barrier Functions from Expert Demonstrations [69.23675822701357]
制御障壁関数(CBF)に基づく安全な制御器合成のための学習に基づくアプローチを提案する。
最適化に基づくCBFの学習手法を解析し、基礎となる力学系のリプシッツ仮定の下で証明可能な安全保証を享受する。
私たちの知る限りでは、これらはデータから確実に安全な制御障壁関数を学習する最初の結果です。
論文 参考訳(メタデータ) (2020-04-07T12:29:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。