論文の概要: P3: Probabilistic Policy Propagation for Stable VAE-Based Robot Learning
- arxiv url: http://arxiv.org/abs/2607.25541v1
- Date: Tue, 28 Jul 2026 10:22:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.796229
- Title: P3: Probabilistic Policy Propagation for Stable VAE-Based Robot Learning
- Title(参考訳): P3:安定なVAE型ロボット学習のための確率的政策伝搬
- Authors: Liyun Yan, Jianming Ma, Yang Zhang, Shengcheng Fu, Zhanxiang Cao, Keqi Zhu, Yizhi Chen, Yue Gao,
- Abstract要約: 変分オートエンコーダは、ロボット工学における高次元および雑音の観測を符号化するために広く用いられている。
VAEベースのポリシのための分散フレームワークであるP3を紹介する。
P3$ couples moment-based probabilistic method for stable and efficient learning with sample-based calibration。
- 参考スコア(独自算出の注目度): 7.562987805321605
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Variational Autoencoders are widely used to encode high-dimensional and noisy observations in robotics. However, their stochastic latent creates a mismatch with Proximal Policy Optimization (PPO): an effective policy marginalizes over the latent distribution, whereas former implementations estimate its probability ratio and KL divergence using only one latent sample. We identify a fundamental but overlooked theoretical cause: naive single-sample approximations in stochastic latent space induce significant variance and bias in the surrogate loss. To address this, we introduce P^3 (Probabilistic Policy Propagation), a distribution-aware optimization framework for VAE-based policies. $P^3$ couples moment-based probabilistic method for stable and efficient learning with sampling-based calibration for robust policy behavior under latent uncertainty. In our experiments, P^3 boosts data efficiency from 64.6% to >96%, reduces convergence steps by >20%. Furthermore, P^3 is evaluated on challenging humanoid parkour tasks and shows an effective foundation for VAE-based PPO. Code is available at https://github.com/ylyem9x/P3_Open.
- Abstract(参考訳): 変分オートエンコーダは、ロボット工学における高次元および雑音の観測を符号化するために広く用いられている。
しかし、その確率的潜伏は、PPO(Proximal Policy Optimization)とのミスマッチを生じさせ、有効政策は潜伏分布を疎外し、一方、以前の実装では潜伏サンプルを1つだけ使って確率比とKLの発散を推定する。
確率的潜在空間における単サンプル近似は、サロゲート損失において有意なばらつきとバイアスを引き起こす。
そこで本稿では,VAEベースのポリシを対象とした分散最適化フレームワークであるP^3(Probabilistic Policy Propagation)を紹介する。
遅延不確実性の下でのロバストな政策行動のためのサンプリングベースの校正による安定かつ効率的な学習のためのモーメントベースの確率的手法。
我々の実験では、P^3はデータ効率を64.6%から96%に向上し、収束ステップを20%削減する。
さらに,P^3はヒューマノイドパーキングの課題に対して評価され,VAEベースのPPOの有効基盤を示す。
コードはhttps://github.com/ylyem9x/P3_Openで公開されている。
関連論文リスト
- Beyond Mode Collapse: Distribution Matching for Diverse Reasoning [69.88237286885065]
GRPOのようなオンライン強化学習手法はモード崩壊に悩まされる。
このことは、逆KL最小化のモード探索行動に由来することを示す。
KL最小化の原理的近似によりモード崩壊を防止するDMPOを提案する。
論文 参考訳(メタデータ) (2026-05-19T07:13:00Z) - Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization [60.87651283510059]
Group Relative Policy Optimization (GRPO) はLLM推論を効果的にスケールするが、計算コストは禁じている。
本研究では,非バイアス勾配推定を保ちながら動的プルーニングを可能にする動的プルーニングポリシー最適化(DPPO)を提案する。
刈り込みによって引き起こされるデータの空間性を軽減するため,ウィンドウベースの欲求戦略であるDense Prompt Packingを導入する。
論文 参考訳(メタデータ) (2026-03-04T14:48:53Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - Rethinking the Trust Region in LLM Reinforcement Learning [72.25890308541334]
PPO(Proximal Policy Optimization)は、大規模言語モデル(LLM)のデファクト標準アルゴリズムとして機能する。
より原則的な制約でクリッピングを代用する多変量確率ポリシー最適化(DPPO)を提案する。
DPPOは既存の方法よりも優れたトレーニングと効率を実現し、RLベースの微調整のためのより堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2026-02-04T18:59:04Z) - Reparameterization Proximal Policy Optimization [35.59197802340267]
ポリシーグラデーション(RPG)は、微分可能なダイナミクスを活用することで、サンプル効率を改善することを約束している。
我々は、安定なサンプル再利用を可能にするために代理目的を利用するPPO(Proximal Policy Optimization)からインスピレーションを得ている。
本稿では,安定かつサンプル効率の高いRPGベースの手法であるRe Parameters Proximal Policy Optimization (RPO)を提案する。
RPOはRPGに適したポリシー勾配クリッピング機構を用いることで、複数のエポック上で安定したサンプル再利用を可能にする。
論文 参考訳(メタデータ) (2025-08-08T10:50:55Z) - Policy Gradient with Active Importance Sampling [55.112959067035916]
政策勾配法(PG法)はISの利点を大いに生かし、以前に収集したサンプルを効果的に再利用することができる。
しかし、ISは歴史的サンプルを再重み付けするための受動的ツールとしてRLに採用されている。
我々は、政策勾配のばらつきを減らすために、サンプルを収集する最良の行動ポリシーを模索する。
論文 参考訳(メタデータ) (2024-05-09T09:08:09Z) - Probabilistic Inference in Reinforcement Learning Done Right [37.31057328219418]
強化学習における一般的な見解は、マルコフ決定過程(MDP)のグラフィカルモデルに確率論的推論として問題を提起している。
この量を近似するための従来のアプローチは任意に貧弱であり、真の統計的推論を実装しないアルゴリズムに繋がる。
我々はまず、この量が、後悔によって測定されるように、効率的に探索するポリシーを生成するために実際に利用できることを明らかにした。
論文 参考訳(メタデータ) (2023-11-22T10:23:14Z) - Uncertainty-Aware Instance Reweighting for Off-Policy Learning [63.31923483172859]
本研究では,不確実性を考慮した逆確率スコア推定器 (UIPS) を提案する。
実世界の3つのレコメンデーションデータセットを用いた実験結果から,提案したUIPS推定器の有効サンプル効率が示された。
論文 参考訳(メタデータ) (2023-03-11T11:42:26Z) - Batch Reinforcement Learning with a Nonparametric Off-Policy Policy
Gradient [34.16700176918835]
オフライン強化学習は、より良いデータ効率を約束する。
現在の非政治政策勾配法は、高いバイアスまたは高い分散に悩まされ、しばしば信頼できない見積もりを提供する。
閉形式で解ける非パラメトリックベルマン方程式を提案する。
論文 参考訳(メタデータ) (2020-10-27T13:40:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。