論文の概要: Safe Execution of RL Policies Via Acceleration-Based CBF-QP Constraint Enforcement for Real-World Robotic Deployments
- arxiv url: http://arxiv.org/abs/2607.14488v1
- Date: Thu, 16 Jul 2026 02:00:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.955914
- Title: Safe Execution of RL Policies Via Acceleration-Based CBF-QP Constraint Enforcement for Real-World Robotic Deployments
- Title(参考訳): 加速型CBF-QP制約による実世界のロボット展開に対するRLポリシの安全実行
- Abstract要約: Acc-CBF-QP(Acc-CBF-QP)は、任意のRLポリシーをトレーニングを変更することなく、実行時に安全なセットに制約する、アクセラレーションベースの擬似プログラム(QP)の安全性フィルタである。
重要な貢献はRL+QPタスクの定式化である。
7-DoF Kinova Gen3 マニピュレータと19-DoF Unitree H1 ヒューマノイドの実験は、シミュレーションとハードウェアの両方において、制約違反の大幅な削減を強調している。
- 参考スコア(独自算出の注目度): 7.750546442815108
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement Learning (RL) has demonstrated remarkable capabilities for solving complex robotic control problems, but its lack of safety guarantees severely limits deployment on hardware. In particular, as legged robots and manipulators often operate near safety-critical boundaries, out-of-distribution states can lead to failure upon deployment. To address this, we introduce Acc-CBF-QP, an acceleration-based Quadratic Program (QP) safety filter using Control Barrier Functions (CBFs) that constrains any RL policy onto a safe set at runtime without modifying training. The method applies to unconstrained and Safe-RL policies, and enforces joint position, velocity, torque, and collision constraints within a unified optimization framework. A key contribution is the formulation of RL+QP tasks that regulate deviation from the RL command when constraints would otherwise be violated. We introduce a TorqueTask, minimizing torque deviation, and a Forward Dynamics Task, minimizing induced acceleration deviation, thus providing principled control over safety-performance trade-offs. Experiments on a 7-DoF Kinova Gen3 manipulator and a 19-DoF Unitree H1 humanoid, both in simulation and on hardware, highlight substantial reductions in constraint violations. On the real H1 hardware, a Safe-RL policy alone yielded 10.04 violations/s, which were reduced by 92% to 0.80 violations/s when augmented with Acc-CBF-QP. On the Kinova Gen3, Acc-CBF-QP fully eliminated violations. Nominal task performance of the RL objective is preserved in violation-free regimes. Under aggressive velocity commands on H1, Acc-CBF-QP improves execution by preventing constraint-induced shutdowns, yielding longer survival times. The full pipeline is open-source.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)は、複雑なロボット制御問題を解決するための優れた能力を示したが、安全性の欠如はハードウェアへの展開を著しく制限している。
特に、脚のあるロボットやマニピュレータは、安全で重要な境界付近で動作するため、アウト・オブ・ディストリビューション状態は、デプロイ時に障害を引き起こす可能性がある。
そこで本研究では,制御バリア関数(CBF)を用いたアクセラレーションベースの準数値プログラム(QP)の安全性フィルタであるAcc-CBF-QPを導入する。
この方法は制約のない安全RLポリシーに適用され、統一最適化フレームワーク内での関節位置、速度、トルク、衝突の制約を強制する。
重要な貢献はRL+QPタスクの定式化である。
本稿では、トルク偏差を最小化するTorqueTaskと、加速度偏差を最小化するフォワードダイナミクスタスクを導入し、安全性能トレードオフを原則的に制御する。
7-DoF Kinova Gen3 マニピュレータと19-DoF Unitree H1 ヒューマノイドの実験は、シミュレーションとハードウェアの両方において、制約違反の大幅な削減を強調している。
実際のH1ハードウェアでは、Safe-RLポリシーだけで10.04の違反/sが得られ、Acc-CBF-QPで拡張すると92%減らして0.80の違反/sとなった。
Kinova Gen3では、Acc-CBF-QPは違反を完全に排除した。
RL目標の固有タスク性能は、違反のない状態に保たれる。
H1上でのアグレッシブなベロシティコマンドの下では、Acc-CBF-QPは制約によって引き起こされるシャットダウンを防止し、寿命を長くすることで実行を改善する。
完全なパイプラインはオープンソースである。
関連論文リスト
- SRL-MPC: Shape-Aware Reinforcement Learned Model Predictive Control [64.66285242901918]
形状認識型学習モデル予測制御 (SRL-MPC) は、形状を単純化せずに不均一な形状の群衆に対して安全で効率的かつ適応的なナビゲーションを行う手法である。
次に強化学習フレームワークは、幾何分離機能(GSF)を読み取るニューラルネットワークを学び、リアルタイムMPCパラメータ更新を出力する。
任意の形状のロボット群を用いたランダム化された群衆シナリオ実験は、SRL-MPCの有効性、スケーラビリティ、堅牢性を示す。
論文 参考訳(メタデータ) (2026-08-21T14:46:06Z) - PPO-EAL: Exact Augmented Lagrangian Proximal Policy Optimization for Safe Robotic Control [8.882504398064087]
PPO-EALは、新しい一階制約付きポリシー最適化フレームワークである。
高度に強化されたラグランジアン最適化を、安全なロボット制御のためのポリシー最適化に統合する。
致命的な大きなペナルティ要因を必要とせず、理論的に根拠づけられた制約執行を達成する。
論文 参考訳(メタデータ) (2026-06-26T08:59:38Z) - Robust Koopman Control Barrier Filters for Safe Actor-Critic Reinforcement Learning [0.0]
本研究では,データから有限次元クープマン予測器を学習する安全フィルタ型アクター批判フレームワークを提案する。
この手法は、制約のないSACリターンをマッチングまたは超過しながら、CartPoleの安定化とトラッキングに対する制約違反をゼロにする。
これらの結果から,ロバストなクープマン-CBFフィルタはモデルレスRLと証明可能な安全性の間に有望な橋渡しとなることが示唆された。
論文 参考訳(メタデータ) (2026-05-26T02:02:40Z) - CBF-RL: Safety Filtering Reinforcement Learning in Training with Control Barrier Functions [19.737602414070768]
制御バリア関数(CBF)は、動的安全性を強制する原則的な方法を提供する。
本稿では, CBF を訓練対象とする安全行動生成フレームワーク CBF-RL を提案する。
論文 参考訳(メタデータ) (2025-10-16T17:58:58Z) - Constraint-Aware Reinforcement Learning via Adaptive Action Scaling [6.6638441348404855]
本稿では,予測制約違反に基づいてエージェントの行動をスケールするモジュール型コスト認識レギュレータを提案する。
規制当局は、行動の抑制を回避しつつ、制約違反を最小限に抑えるよう訓練されている。
提案手法は, SAC や TD3 などの非政治的 RL 手法とシームレスに連携し, 安全ガイムの移動作業における最先端のリターン・ツー・コスト比を実現する。
論文 参考訳(メタデータ) (2025-10-13T14:59:28Z) - Uniformly Safe RL with Objective Suppression for Multi-Constraint Safety-Critical Applications [73.58451824894568]
広く採用されているCMDPモデルは予測のリスクを制約しており、長い尾の州で危険な行動を起こす余地がある。
安全クリティカルな領域では、そのような行動は破滅的な結果をもたらす可能性がある。
本稿では,目標を最大化するタスク報酬を適応的に抑制する新しい手法であるObjective Suppressionを提案する。
論文 参考訳(メタデータ) (2024-02-23T23:22:06Z) - A Multiplicative Value Function for Safe and Efficient Reinforcement
Learning [131.96501469927733]
本稿では,安全評論家と報酬評論家からなる新しい乗法値関数を持つモデルフリーRLアルゴリズムを提案する。
安全評論家は、制約違反の確率を予測し、制限のないリターンのみを見積もる報酬批評家を割引する。
安全制約を付加した古典的RLベンチマークや、画像を用いたロボットナビゲーションタスク、生のライダースキャンを観察する4つの環境において、本手法の評価を行った。
論文 参考訳(メタデータ) (2023-03-07T18:29:15Z) - SAUTE RL: Almost Surely Safe Reinforcement Learning Using State
Augmentation [63.25418599322092]
安全性の制約をほぼ確実に(あるいは確率1で)満たすことは、実生活アプリケーションにおける強化学習(RL)の展開に不可欠である。
安全性向上型マルコフ決定プロセス(MDP)の導入による課題に対処する。
Saute MDPがSafe Augmentationの問題を、新機能の異なる視点から見ることができることを示す。
論文 参考訳(メタデータ) (2022-02-14T08:57:01Z) - Robust Deep Reinforcement Learning against Adversarial Perturbations on
State Observations [88.94162416324505]
深部強化学習(DRL)エージェントは、自然な測定誤差や対向雑音を含む観測を通して、その状態を観察する。
観測は真の状態から逸脱するので、エージェントを誤解させ、準最適行動を起こすことができる。
本研究は, 従来の手法を, 対人訓練などの分類タスクの堅牢性向上に応用することは, 多くのRLタスクには有効でないことを示す。
論文 参考訳(メタデータ) (2020-03-19T17:59:59Z) - Guided Constrained Policy Optimization for Dynamic Quadrupedal Robot
Locomotion [78.46388769788405]
我々は,制約付きポリシー最適化(CPPO)の実装に基づくRLフレームワークであるGCPOを紹介する。
誘導制約付きRLは所望の最適値に近い高速収束を実現し,正確な報酬関数チューニングを必要とせず,最適かつ物理的に実現可能なロボット制御動作を実現することを示す。
論文 参考訳(メタデータ) (2020-02-22T10:15:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。