論文の概要: Continue, Abort, or Fall: Viability-Aware Policy Selection (VAPS) for Safe Humanoid Acrobatics
- arxiv url: http://arxiv.org/abs/2610.01397v1
- Date: Thu, 01 Oct 2026 10:02:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.046228
- Title: Continue, Abort, or Fall: Viability-Aware Policy Selection (VAPS) for Safe Humanoid Acrobatics
- Title(参考訳): 安全なヒューマノイドアクロバティックスのための生存意識政策選択(VAPS)
- Abstract要約: 可視性政策選択は、安全を政策条件付き、後退する水平決定として扱う。
VAPSは、未学習のポリシーを監督し、ハードウェアを保護するための強力なフレームワークであることを示す。
- 参考スコア(独自算出の注目度): 17.42194320194216
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Dynamic humanoid motions such as flips risk hardware damage due to suboptimal policies, disturbances or sim-to-real gaps. A motion tracking policy offers no way out once the maneuver leaves its reference, and a backup policy needs to take over to protect the hardware for a minimum-damage landing. Which backup to use matters as much as when to switch. We present Viability-Aware Policy Selection (VAPS), which treats safety as a policy-conditioned, receding-horizon decision. Besides a protective fall policy, we also train an abort policy which can abort the motion at any time, landing on its feet. At every control step, learned predictors estimate whether the nominal tracking policy and the abort policy remain viable over a short horizon, and a least-sacrificial hierarchy keeps the most task-ambitious behavior that remains viable. In simulation with randomized disturbances, VAPS sharply reduces head contact and hand contact, which are the dominant sources of hardware damage, with both a Unitree G1 and a LimX Oli; on the LimX Oli, we validate the viability predictors and the full VAPS controller for side-flip motions. VAPS Pareto-dominates the strongest single-network alternatives we could train, including an end-to-end safe-tracking policy and students distilled from VAPS's own oracle-routed decisions, in both task success and head impact. We also show that VAPS is a powerful framework to supervise undertrained policies and protect the hardware.
- Abstract(参考訳): 動的ヒューマノイド運動は、準最適ポリシー、障害、シム・トゥ・リアルギャップによるハードウェアの損傷をフリップする。
モーショントラッキングポリシーは、操作が基準を逸脱した後で、最小損傷着陸のためにハードウェアを保護するためにバックアップポリシーが引き継がなければならない。
どのバックアップを使うかは、切り替える時間だけです。
本稿では, 安全を政策条件, 後退・水平決定として扱うVAPS(Viability-Aware Policy Selection)を提案する。
保護的な転倒ポリシーに加えて、私たちはいつでも動きを中止できる中止ポリシーをトレーニングします。
あらゆる制御ステップにおいて、学習した予測者は、名目追跡ポリシーと中止ポリシーが短い地平線上で有効であるかどうかを見積もる。
乱れのシミュレーションでは、VAPSはハードウェア損傷の主な原因である頭部接触と手接触を、Unitree G1とLimX Oliの両方で大幅に低減し、LimX Oliでは、バイラビリティ予測器と完全なVAPSコントローラをサイドフリップ動作に対して検証する。
VAPS Pareto-は、エンドツーエンドの安全な追跡ポリシーやVAPS自身の託宣決定から学生を抽出し、タスクの成功とヘッドインパクトの両方でトレーニングできる最強のシングルネットワークの代替品である。
また、VAPSは未学習のポリシーを監督し、ハードウェアを保護するための強力なフレームワークであることを示す。
関連論文リスト
- Integrating Physics-Informed Neural Networks for Safe Reinforcement Learning in a 1-DoF Helicopter System [0.4460583138505672]
深層強化学習(DRL)は、産業用サイバー物理システムに強力な制御を提供する。
その“ブラックボックス”探索は、厳格なハードウェア安全性の限界を侵害するリスクがある。
近似ポリシー最適化関数に直接微分可能な物理モデルを組み込む。
論文 参考訳(メタデータ) (2026-07-03T09:14:04Z) - Exact, Efficient, and Safe Occlusion-Aware Planning Using AH-Polyhedrons [5.980069180948256]
我々は,精密かつ効率的なオクルージョン対応計画フレームワークであるAPRO(AH-Polyhedron Reachability for Occlusions)を提案する。
我々の重要な洞察は、AH-ポリヘドロンの結合として以前の作業におけるセットベースの安全条件を再構築することである。
提案手法は,提案手法を最適化した計画立案者や,リアルタイムアプリケーションのための二項探索方式に統合する方法を示す。
論文 参考訳(メタデータ) (2026-06-13T01:28:07Z) - From Attacks to Curricula: Learnability-Guided Adversarial Training for Safe Autonomous Driving [56.30087557121323]
AlignADVは学習性誘導型クローズドループ対向トレーニングフレームワークである。
敵のシナリオを解決可能で能力に整合したカリキュラムに変換する。
実験の結果、最大40.6%のトレーニングステップが短縮された。
論文 参考訳(メタデータ) (2026-06-12T02:13:55Z) - Shield-Loco: Shielding Locomotion Policies with Predictive Safety Filtering [10.242244578585897]
大規模オフライン安全な学習は、すべてのエッジケースをカバーするには実用的ではない。
本稿では,RLポリシーに従属する名目接触位置をポストホックフィルタでフィルタする安全フィルタを提案する。
密集した散らばった環境下での四足ロボットのフィルタの有効性を検証する。
論文 参考訳(メタデータ) (2026-06-05T11:59:43Z) - VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring [60.53395558502203]
Vision-Language Embodied Safety Agent (VLESA)は、自我中心のビデオから人間の活動を監視する。
VLESAは、コンテキストに応じて同一のアクションが安全または危険である意図に依存した安全性に対処する。
目標を共同で推測し,映像から将来の行動を予測するための意図-行動予測エージェントを提案する。
論文 参考訳(メタデータ) (2026-06-02T17:42:17Z) - LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails [41.04710068888387]
我々は,動的政策に関する世俗的な潜在政策検討を学習するガードレールフレームワークである潜在政策ガードレール(LPG)を紹介した。
政策ガードレールのベンチマークでは、LPG-4Bの平均安全性は84.5%、F1は77.9%に達した。
論文 参考訳(メタデータ) (2026-05-17T08:35:38Z) - ADV-0: Closed-Loop Min-Max Adversarial Training for Long-Tail Robustness in Autonomous Driving [63.980630608984605]
本稿では、ゼロサムマルコフゲームとして、駆動ポリシー(ディフェンダー)と敵エージェント(アタックラー)の相互作用を扱うクローズドループのmin-max最適化フレームワークであるADV-0を提案する。
これを実現するため,我々は動的敵の進化を反復的な選好学習とし,この最適性を効率的に近似し,アルゴリズムに依存しない解をゲームに提供する。
実験により、多様な安全クリティカルな障害を効果的に露呈し、学習方針と運動プランナーの両方の一般化可能性を大幅に向上させることが示されている。
論文 参考訳(メタデータ) (2026-03-16T12:58:31Z) - DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents [52.92354372596197]
大規模言語モデル(LLM)は、強力な推論と計画能力のため、エージェントシステムの中心となってきています。
この相互作用は、外部ソースからの悪意のある入力がエージェントの振る舞いを誤解させる可能性がある、インジェクション攻撃のリスクも引き起こす。
本稿では,信頼に値するエージェントシステムのための動的ルールベースの分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-13T05:01:09Z) - Dynamic Simplex: Balancing Safety and Performance in Autonomous Cyber
Physical Systems [1.3309898919316483]
本稿では,双方向スイッチングが可能なオンラインコントローラスイッチングロジックを用いたシンプルな戦略を提案する。
提案手法は, 現状技術よりも衝突が少なく, 性能も高いことを示す。
論文 参考訳(メタデータ) (2023-02-20T04:00:53Z) - Safety Correction from Baseline: Towards the Risk-aware Policy in
Robotics via Dual-agent Reinforcement Learning [64.11013095004786]
本稿では,ベースラインと安全エージェントからなる二重エージェント型安全強化学習戦略を提案する。
このような分離されたフレームワークは、RLベースの制御に対して高い柔軟性、データ効率、リスク認識を可能にする。
提案手法は,難易度の高いロボットの移動・操作作業において,最先端の安全RLアルゴリズムより優れる。
論文 参考訳(メタデータ) (2022-12-14T03:11:25Z) - Preventing Imitation Learning with Adversarial Policy Ensembles [79.81807680370677]
模倣学習は、政策プライバシに関する問題を引き起こす専門家を観察することで、ポリシーを再現することができる。
プロプライエタリなポリシーをクローンする外部オブザーバに対して、どうすれば保護できるのか?
新しい強化学習フレームワークを導入し、準最適政策のアンサンブルを訓練する。
論文 参考訳(メタデータ) (2020-01-31T01:57:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。