論文の概要: Arrive and Survive: Scaling Safe Goal-Conditioned Policy Learning from One-Bit Failure Signals
- arxiv url: http://arxiv.org/abs/2608.26571v1
- Date: Thu, 27 Aug 2026 03:24:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.232497
- Title: Arrive and Survive: Scaling Safe Goal-Conditioned Policy Learning from One-Bit Failure Signals
- Title(参考訳): Arrive and Survive: 単一ビット障害信号による安全な目標設定ポリシ学習のスケーリング
- Abstract要約: コントラスト強化学習は、政策学習を自己監督的コントラスト目標にキャストすることで、ゴール条件付きタスクにおいて効果的にスケールする。
我々の理論的分析は、この省略がゴール到達値の体系的過大評価バイアスを引き起こすことを示している。
質量重み付きInfoNCEは、批判的学習における短命な未来を過度に補正し、ログサバイバルマススコアは、政策最適化において欠落した生存質量を復元する。
- 参考スコア(独自算出の注目度): 1.7496207597922033
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Contrastive reinforcement learning (CRL) scales effectively in goal-conditioned tasks by casting policy learning into a self-supervised contrastive objective. However, in a failure-terminated Markov decision process, established CRL considers pre-failure future goals only when constructing positive samples, without accounting for the probability mass removed by failure termination. Our theoretical analysis shows that this omission induces a systematic overestimation bias in goal-reaching values. Consequently, near-failure trajectories provide disproportionately strong supervision of success despite retaining little future occupancy. Unsafe actions can thereby be reinforced through catastrophic failure bootstrapping, leading to failed policy learning and unsustainable goal-reaching behaviours. To address this problem, we introduce two minimal yet strong corrections: mass-weighted InfoNCE corrects the overweighting of short surviving futures in critic learning, and a log-survival-mass score restores the missing survival mass in policy optimization. The resulting method, Safe Contrastive Reinforcement Learning (Safe-CRL), requires only the one-bit signal provided by failure termination to scale safe goal-conditioned policy learning. Across twelve failure-prone robot navigation and locomotion tasks, Safe-CRL consistently improves survival and substantially outperforms the Scaling-CRL baseline in goal-reaching performance. Additionally, deep Safe-CRL policies exhibit complex failure-avoidance behaviours. This study completes the CRL theory under failure termination and provides a scalable safe RL framework. The code is available via https://github.com/RomainLITUD/safe-crl.
- Abstract(参考訳): コントラスト強化学習(CRL)は、政策学習を自己指導型コントラスト目標にすることで、ゴール条件付きタスクにおいて効果的にスケールする。
しかし、マルコフ決定過程において、確立されたCRLは、失敗終了によって除去される確率質量を考慮せずに、正のサンプルを構築する場合にのみ、失敗前の将来の目標を考える。
我々の理論的分析は、この省略がゴール到達値の体系的過大評価バイアスを引き起こすことを示している。
結果として、ほぼ欠陥のある軌道は、将来的な占有がほとんどないにもかかわらず、成功に対する不当に強力な監督を提供する。
これにより、安全でない行動は破滅的な失敗のブートストラップによって強化され、失敗するポリシー学習と持続不可能な目標達成行動につながる。
この問題に対処するために、質量重み付けInfoNCEは批判学習における短命な未来を過度に補正し、対数サバイバルマススコアは政策最適化において欠落した生存質量を復元する。
その結果,セーフコントラスト強化学習(Safe Contrastive Reinforcement Learning (Safe-CRL))は,障害終了によって提供される1ビット信号のみを必要とする。
12の障害を起こしやすいロボットナビゲーションと移動タスクの中で、Safe-CRLは一貫して生存率を改善し、目標達成性能においてScaling-CRLベースラインを大幅に上回っている。
さらに、Deep Safe-CRLポリシーは複雑な障害回避動作を示す。
本研究は, 故障終了時のCRL理論を完了し, スケーラブルな安全なRLフレームワークを提供する。
コードはhttps://github.com/RomainLITUD/safe-crl.comから入手できる。
関連論文リスト
- RL Forgets! Towards Continual Policy Optimization [57.4336338996653]
継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
我々は,事前タスク動作KL目標に基づくリプレイフリーフレームワークである継続ポリシー最適化(CPO)を提案する。
論文 参考訳(メタデータ) (2026-07-05T15:46:11Z) - Survival Reinforcement Learning: Toward Scalable Self-Supervised RL [10.768601219140153]
自己教師型コントラスト強化学習(CRL)は、顕著な深度スケーリング能力を示している。
本稿では,Survival Reinforcement Learning (SRL)について紹介する。
論文 参考訳(メタデータ) (2026-05-29T13:05:08Z) - On Minimizing Adversarial Counterfactual Error in Adversarial RL [18.044879441434432]
敵の騒音は、安全クリティカルなシナリオにおいて重大なリスクを生じさせる。
我々は,ACoE(Adversarial Counterfactual Error)と呼ばれる新しい目標を導入する。
本手法は, 対向RL問題に対処するための最先端手法を著しく上回っている。
論文 参考訳(メタデータ) (2024-06-07T08:14:24Z) - Strategically Conservative Q-Learning [89.17906766703763]
オフライン強化学習(RL)は、RLの実用性を拡張するための魅力的なパラダイムである。
オフラインRLの最大の難しさは、オフ・オブ・ディストリビューション(OOD)アクションに遭遇する際の近似誤差の影響を緩和することである。
本稿では, 予測が容易かつ困難であるOODデータを識別する, SCQ(Strategical conservative Q-Learning) という新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-06T22:09:46Z) - Offline Goal-Conditioned Reinforcement Learning for Safety-Critical
Tasks with Recovery Policy [4.854443247023496]
オフライン目標条件強化学習(GCRL)は、オフラインデータセットから少ない報酬で目標達成タスクを解決することを目的としている。
本稿では,RbSL(Recovery-based Supervised Learning)と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2024-03-04T05:20:57Z) - A Multiplicative Value Function for Safe and Efficient Reinforcement
Learning [131.96501469927733]
本稿では,安全評論家と報酬評論家からなる新しい乗法値関数を持つモデルフリーRLアルゴリズムを提案する。
安全評論家は、制約違反の確率を予測し、制限のないリターンのみを見積もる報酬批評家を割引する。
安全制約を付加した古典的RLベンチマークや、画像を用いたロボットナビゲーションタスク、生のライダースキャンを観察する4つの環境において、本手法の評価を行った。
論文 参考訳(メタデータ) (2023-03-07T18:29:15Z) - Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning [63.53407136812255]
オフライン強化学習は、探索を必要とせずに、事前に収集された静的データセットから効果的なポリシーを学ぶことを約束する。
既存のQラーニングとアクター批判に基づくオフポリティクスRLアルゴリズムは、アウト・オブ・ディストリビューション(OOD)アクションや状態からのブートストラップ時に失敗する。
我々は,OOD状態-動作ペアを検出し,トレーニング目標への貢献度を下げるアルゴリズムであるUncertainty Weighted Actor-Critic (UWAC)を提案する。
論文 参考訳(メタデータ) (2021-05-17T20:16:46Z) - Assured Learning-enabled Autonomy: A Metacognitive Reinforcement
Learning Framework [4.427447378048202]
事前指定された報酬機能を持つ強化学習(rl)エージェントは、さまざまな状況で安全性を保証できない。
本稿では,メタ認知学習機能を備えたRLアルゴリズムを用いて,自律制御フレームワークを提案する。
論文 参考訳(メタデータ) (2021-03-23T14:01:35Z) - Conservative Safety Critics for Exploration [120.73241848565449]
強化学習(RL)における安全な探索の課題について検討する。
我々は、批評家を通じて環境状態の保守的な安全性推定を学習する。
提案手法は,破滅的故障率を著しく低く抑えながら,競争力のあるタスク性能を実現することができることを示す。
論文 参考訳(メタデータ) (2020-10-27T17:54:25Z) - Robust Deep Reinforcement Learning against Adversarial Perturbations on
State Observations [88.94162416324505]
深部強化学習(DRL)エージェントは、自然な測定誤差や対向雑音を含む観測を通して、その状態を観察する。
観測は真の状態から逸脱するので、エージェントを誤解させ、準最適行動を起こすことができる。
本研究は, 従来の手法を, 対人訓練などの分類タスクの堅牢性向上に応用することは, 多くのRLタスクには有効でないことを示す。
論文 参考訳(メタデータ) (2020-03-19T17:59:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。