論文の概要: ProxPI: Proximal Prior Injection for Sampling-Based MPC under Learned-Prior Mismatch
- arxiv url: http://arxiv.org/abs/2609.00941v1
- Date: Tue, 01 Sep 2026 09:03:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.489602
- Title: ProxPI: Proximal Prior Injection for Sampling-Based MPC under Learned-Prior Mismatch
- Title(参考訳): ProxPI:学習者ミスマッチ下でのサンプリングベースMPCの至適プリインジェクション
- Authors: Euncheol Im, Myotaeg Lim, Yisoo Lee,
- Abstract要約: モデル予測経路積分制御において、ポリシー中心のウォームスタートアプローチは、サンプリング分布をポリシー出力に集中させる。
本稿では,MPPIサンプリングを名目中心に維持し,ソフトな近接コストでポリシーを取り入れた Proximal Prior Injection (ProxPI) を提案する。
理論的には,各更新毎に事前の廃棄補正を集中的に行うのに対して,名目中心サンプリングは維持し,タスクコストと先行処理の両方で設定された解に収束する。
- 参考スコア(独自算出の注目度): 3.345437353879255
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Combining learned policies with model predictive control can leverage learned task priors while retaining online adaptation to new objectives and constraints, but performance degrades when the policy is out of distribution. In policy-guided model predictive path integral (MPPI) control, a policy-centered warm-start approach centers the sampling distribution on the policy output. When the prior is mismatched, centering the sampling distribution on the policy output restricts exploration around an unsuitable solution and prevents recovery toward the task optimum. We propose Proximal Prior Injection (ProxPI), which retains nominal-centered MPPI sampling and incorporates the policy through a soft proximity cost. This matches the in-distribution performance of existing prior-injection schemes while enabling the optimizer to escape an inaccurate policy and recover vanilla MPPI-level performance. We theoretically show that re-centering on the prior discards the optimizer's correction at every update, whereas nominal-centered sampling retains it and converges to a solution set by both the task cost and the prior, and that this failure is not removed by a larger rollout budget. Simulations and real-robot experiments demonstrate robust performance under both in-distribution and out-of-distribution tasks.
- Abstract(参考訳): 学習済みのポリシーとモデル予測制御を組み合わせることで、学習済みのタスク先行を活用でき、新たな目標や制約へのオンライン適応を維持することができる。
政策誘導モデル予測経路積分(MPPI)制御では、政策中心のウォームスタートアプローチが政策出力のサンプリング分布の中心となる。
前者がミスマッチした場合、ポリシー出力にサンプリング分布を集中させることで、不適当解周辺の探索を制限し、タスク最適に対するリカバリを防止する。
本稿では,MPPIサンプリングを名目中心に維持し,ソフトな近接コストでポリシーを取り入れた Proximal Prior Injection (ProxPI) を提案する。
これは、既存のプリインジェクション方式の分散性能と一致し、オプティマイザが不正確なポリシーを回避し、バニラMPPIレベルのパフォーマンスを回復することを可能にする。
理論的には、前回の更新でオプティマイザの補正が破棄されるのに対して、名目中心のサンプリングはタスクコストと前回の処理の両方で設定されたソリューションに収束し、この障害はより大きなロールアウト予算で除去されないことを示す。
シミュレーションと実ロボット実験は、分布内および分布外の両方のタスクで堅牢な性能を示す。
関連論文リスト
- Ratio-Variance Regularized Policy Optimization [64.95520246570446]
ポリシ比の分散を明示的に制約することは、信頼領域の制約に対する原則的な局所近似をもたらすことを示す。
本稿では,この制約を実装したR2bf VPO$(Ratio-Variance Regularized Policy Optimization)を紹介する。
論文 参考訳(メタデータ) (2026-05-26T09:53:42Z) - OGPO: Sample Efficient Full-Finetuning of Generative Control Policies [53.42266064673132]
ジェネレーティブコントロールポリシー(GCP)は、ロボット学習に有効なパラメータ化として登場した。
この研究は、GCPを微調整するためのサンプル効率であるOGPO(Off-policy Generative Policy Optimization)を導入している。
OGPOはマルチタスク設定、高精度挿入、デクスタラス制御にまたがる操作タスクにおける最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-05-04T18:36:40Z) - Robust Regularized Policy Iteration under Transition Uncertainty [6.7431287237221085]
我々は、オフラインRLをロバストなポリシー最適化として定式化し、遷移カーネルを不確実性集合内の決定変数として扱う。
本稿では、抽出可能な最大最小二レベル目標を、抽出可能なKL正規化サロゲートに置き換えるロバスト正規化ポリシーイテレーション(RRPI)を提案する。
D4RLベンチマークの実験では、RRPIは高い平均性能を示し、最近のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-03-10T08:18:27Z) - Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization [60.87651283510059]
Group Relative Policy Optimization (GRPO) はLLM推論を効果的にスケールするが、計算コストは禁じている。
本研究では,非バイアス勾配推定を保ちながら動的プルーニングを可能にする動的プルーニングポリシー最適化(DPPO)を提案する。
刈り込みによって引き起こされるデータの空間性を軽減するため,ウィンドウベースの欲求戦略であるDense Prompt Packingを導入する。
論文 参考訳(メタデータ) (2026-03-04T14:48:53Z) - OptPO: Optimal Rollout Allocation for Test-time Policy Optimization [11.375209834858135]
テスト時のポリシー最適化により、大規模言語モデルでは、自己生成ロールアウトからのフィードバックを活用することで、分散シフトに適応することができる。
我々は、推論予算を適応的に割り当てる原則的フレームワークであるテスト時間ポリシー最適化のための最適ロールアウト割当(OptPO)を提案する。
論文 参考訳(メタデータ) (2025-12-02T15:38:52Z) - Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer [52.09480867526656]
人間の嗜好を学習する際の分布変化と不確実性の一形態として,不一致の原因を同定する。
過度な最適化を緩和するために、まず、逆選択された報酬モデルに最適なポリシーを選択する理論アルゴリズムを提案する。
報奨モデルとそれに対応する最適ポリシーの等価性を用いて、優先最適化損失と教師付き学習損失を組み合わせた単純な目的を特徴とする。
論文 参考訳(メタデータ) (2024-05-26T05:38:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。