論文の概要: SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions
- arxiv url: http://arxiv.org/abs/2607.08925v1
- Date: Thu, 09 Jul 2026 20:41:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.736662
- Title: SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions
- Title(参考訳): SafeExplorer: 回復介入による強化学習のための曖昧なポリシーグラディエント
- Authors: Elham Daneshmand, Majid Khadiv, Glen Berseth, Hsiu-Chin Lin,
- Abstract要約: 物理ロボット上での強化学習エージェントの訓練は、転倒によってプラットフォームが損傷し、シミュレータのリセットのように解除できないため、すべての転倒をコストがかかる。
標準緩和ハンドコントロールは、設計者が指定した安全領域を離れるたびに、別の回復ポリシーに制御する。
我々は、近位政策最適化(PPO)のドロップイン修正により、このバイアスに対処する。
我々のアルゴリズムは、標準的なPPOよりも、HalfCheetah、Ant、Unitree Go1上の233x、48x、26xの要素でトレーニング時間の低下を減らす。
- 参考スコア(独自算出の注目度): 17.763106379903228
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training reinforcement-learning agents directly on physical robots makes every fall costly, since a fall can damage the platform and cannot be undone like a simulator reset; the goal is therefore to minimize falls during training rather than trade them off against return, as constrained Markov decision process (MDP) formulations do. A standard mitigation hands control to a separate recovery policy whenever the agent leaves a designer-specified safe region (a subset of state space it should stay within), but the resulting mixed-policy rollouts silently bias every on-policy update, and the importance-sampling correction that would remove this bias is ill-defined whenever the recovery policy is deterministic. We address this bias with a drop-in modification of proximal policy optimization (PPO). Its core is an unbiased policy-gradient estimator that uses the score function only at safe timesteps and never evaluates the recovery policy's density, so it stays valid even when the recovery policy is deterministic, exactly where importance sampling breaks, and it empirically dominates importance sampling even when the recovery policy is stochastic. Because the recovery policy still makes credit assignment slow near the safe-region boundary, two further components accelerate learning: a closed-form value for recovery-triggering states when dynamics and recovery are deterministic, and an imitation loss that copies recovery actions only when recovery succeeds. On a three-environment, five-seed benchmark, the resulting algorithm reduces training-time falls by factors of 233x, 48x, and 26x on HalfCheetah, Ant, and Unitree Go1 over standard PPO, while matching or exceeding PPO's final reward, and on Ant, where the recovery policy is unreliable, it is the only method that reaches 80% of the best final reward.
- Abstract(参考訳): 物理ロボット上での強化学習エージェントの訓練は、転倒がプラットフォームを損傷し、シミュレータリセットのように脱落することができないため、すべての転倒をコストがかかる。
標準的な緩和ハンドコントロールは、エージェントがデザイナーが指定した安全な領域(内部に置かれるべき状態空間のサブセット)を残した時に別のリカバリポリシーに委ねられるが、結果として生じる混合ポリティのロールアウトは、オン・ポリティの更新毎にサイレントにバイアスを与え、リカバリポリシーが決定的であれば、このバイアスを除去する重要サンプリング補正は不確定である。
このバイアスは、近位政策最適化(PPO)のドロップイン修正によって対処する。
その中核は、スコア関数を安全なタイミングでのみ使用し、リカバリポリシの密度を決して評価しないアンバイアスの政策勾配推定器であり、リカバリポリシが決定的であった場合、正確には重要サンプリングが壊れた場合でも有効であり、リカバリポリシが確率的であった場合でも、重要サンプリングを経験的に支配する。
回復方針は依然として安全な領域境界付近でクレジットの割り当てを遅くするため、さらに2つのコンポーネントが学習を加速する: ダイナミックスとリカバリが決定論的であるときのリカバリトリガ状態のクローズドフォーム値と、リカバリが成功したときのみリカバリアクションを複製する模倣損失である。
3環境の5シードのベンチマークでは、このアルゴリズムは、通常のPPOよりも233x、48x、26x、ハーフチーター、アント、ユニツリーのGo1で233x、48x、26xの遅延を減らし、PPOの最終報酬をマッチングまたは超過しながら、回復ポリシーが信頼できないAntでは、最高の最終報酬の80%に達する唯一の方法である。
関連論文リスト
- VIMPO: Value-Implicit Policy Optimization for LLMs [106.88933849641272]
GRPOのようなグループ相対的手法は、批評家の訓練を避けるが、典型的には全てのトークンに軌道レベルの利点を割り当てる。
アクター批判的手法は、より密集した学習信号を提供するが、学習価値関数を自身のトレーニング不安定性で要求する。
本稿では,KL-正規化強化学習の最適条件からポリシ実装値関数を導出する,批判のないポリシ最適化手法であるVIMPOを紹介する。
論文 参考訳(メタデータ) (2026-06-18T09:44:12Z) - Credit Assignment with Resets in Language Model Reasoning [19.869062158993113]
ポストトレイン言語モデルは、トラジェクトリ内のすべてのトークンに対して、単一の結果報酬を均一に割り当てる。
この制限は、軌道全体を均一に更新するのではなく、目標とする故障推論ステップの洗練を可能にすることで対処できる。
本稿では、ランダムリセットポリシー最適化(RRPO)と自己リセットポリシー最適化(SRPO)の2つの手法を提案する。
論文 参考訳(メタデータ) (2026-05-25T07:11:50Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models [90.39703013636868]
RePO-VLAは、リカバリ駆動のポリシー最適化フレームワークである。
成功、回復、失敗の軌跡に異なる役割を割り当てる。
対人的な成功は、平均で20%から75%、実世界の規模で80%まで上昇する。
論文 参考訳(メタデータ) (2026-05-10T08:24:05Z) - Bayesian Conservative Policy Optimization (BCPO): A Novel Uncertainty-Calibrated Offline Reinforcement Learning with Credible Lower Bounds [1.2183405753834562]
オフライン強化学習(RL)は、ログ化された遷移の固定バッチから決定ポリシーを学ぶことを目的としている。
本稿では,不確実性を即興的に保守的な政策改善に変換する統一的な枠組みであるEmphBayesian conservative Policy Optimization (BCPO)を提案する。
BCPOは環境/価値モデルよりも階層的なベイズ的後縁を維持し、アクション値に基づいてエンフレッシブルな下界(LCB)を構築し、明示的なKL正規化の下でポリシー更新を行う。
論文 参考訳(メタデータ) (2026-03-06T01:46:02Z) - Anchored Policy Optimization: Mitigating Exploration Collapse Via Support-Constrained Rectification [14.911955979675772]
我々は,グローバルな形状マッチングからサポートカバレッジへパラダイムをシフトさせるアンコレッドポリシー最適化(APO)を提案する。
APOは精度と多様性のトレードオフを破り、Pass@1を大幅に改善します。
論文 参考訳(メタデータ) (2026-02-05T14:41:57Z) - Off-Policy Evaluation for Large Action Spaces via Policy Convolution [60.6953713877886]
ポリシ・コンボリューション(Policy Convolution)のファミリーは、アクション内の潜在構造を使用して、ログとターゲットポリシを戦略的に畳み込みます。
合成およびベンチマークデータセットの実験では、PCを使用する場合の平均二乗誤差(MSE)が顕著に改善されている。
論文 参考訳(メタデータ) (2023-10-24T01:00:01Z) - Rewards Encoding Environment Dynamics Improves Preference-based
Reinforcement Learning [4.969254618158096]
本研究では、報酬関数(REED)の符号化環境ダイナミクスにより、最先端の嗜好に基づくRLフレームワークに必要な選好ラベルの数を劇的に減らすことを示す。
一部のドメインでは、REEDベースの報酬関数は、基礎的真理報酬に基づいて訓練されたポリシーより優れたポリシーをもたらす。
論文 参考訳(メタデータ) (2022-11-12T00:34:41Z) - Doubly Robust Off-Policy Value and Gradient Estimation for Deterministic
Policies [80.42316902296832]
本研究では,行動継続時の非政治データから決定論的政策の政策値と勾配を推定する。
この設定では、密度比が存在しないため、標準重要度サンプリングとポリシー値と勾配の2倍の頑健な推定が失敗する。
異なるカーネル化アプローチに基づく2つの新しい頑健な推定器を提案する。
論文 参考訳(メタデータ) (2020-06-06T15:52:05Z) - Kalman meets Bellman: Improving Policy Evaluation through Value Tracking [59.691919635037216]
政策評価は強化学習(RL)における重要なプロセスである
我々はKalman Optimization for Value Approximation (KOVA)と呼ばれる最適化手法を考案した。
KOVAはパラメータとノイズリターンの不確実性の両方に関する正規化対象関数を最小化する。
論文 参考訳(メタデータ) (2020-02-17T13:30:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。