論文の概要: Accelerating Reinforcement Learning via MPC Solver-Gradient Guidance for Weights-varying MPC
- arxiv url: http://arxiv.org/abs/2609.01061v1
- Date: Tue, 01 Sep 2026 10:55:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.591613
- Title: Accelerating Reinforcement Learning via MPC Solver-Gradient Guidance for Weights-varying MPC
- Title(参考訳): 重み変化MPCのためのMPCソルバ勾配誘導による強化学習の高速化
- Authors: Baha Zarrouki, Arslan Thobani, Jasper Hoffmann, Mattia Piccinini, Rudolf Reiter, Felix Jahncke, Sébastien Gros, Davide Scaramuzza, Johannes Betz,
- Abstract要約: 本稿では,RLをベースとしたオンラインMPCコスト重み付けのためのソルバ感度向上手法を提案する。
SG-RL in Proximal Policy Optimization (PPO) with four modular algorithm that inject solver-gradient guidance into actor-update scaling, policy loss, advantage estimation, and value-function learning。
意図的なモデルミスマッチを持つ2つのフルスケールの自律レースプラットフォームにおいて、SG-RLは最大70.6%のサンプルでPPOの最高のクローズドループリターンに達し、クローズドループリターンにおいてGB-PLベースラインを少なくとも54%上回り、ゼロショットを目に見えない環境に一般化する。
- 参考スコア(独自算出の注目度): 17.152519147246842
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In Model Predictive Control (MPC), cost-function weights shape closed-loop behavior, yet changing conditions often make fixed parametrizations suboptimal and motivate context-dependent online adaptation. Learning such policies is difficult because behavior depends implicitly on numerical MPC solutions, producing nonlinear, potentially nonsmooth, long-horizon dependencies on policy parameters. This creates a bias-variance tradeoff: Reinforcement Learning (RL) optimizes realized closed-loop return from environment samples but is sample-inefficient, whereas Gradient-Based Policy Learning (GB-PL) uses low-variance solver gradients from differentiable MPC to optimize surrogate losses on predicted trajectories but can be biased under model mismatch. We propose Solver-Gradient Guided Reinforcement Learning (SG-RL), a solver-sensitivity augmentation for RL-based online MPC cost-weight adaptation. SG-RL keeps sampled closed-loop return as the objective and uses bounded solver-derived gradients as auxiliary guidance to improve stability and sample efficiency. We instantiate SG-RL in Proximal Policy Optimization (PPO) with four modular algorithms that inject solver-gradient guidance into actor-update scaling, policy loss, advantage estimation, and value-function learning. On two full-scale autonomous racing platforms with intentional model mismatch, SG-RL reaches PPO's best closed-loop return with up to 70.6% fewer samples, outperforms GB-PL baselines by at least 54% in closed-loop return, and generalizes zero-shot to unseen environments.
- Abstract(参考訳): モデル予測制御(MPC)では、コスト関数の重みは閉ループの挙動を形作るが、条件が変化すると固定パラメトリゼーションが最適以下になり、文脈依存のオンライン適応を動機付ける。
このようなポリシーの学習は、振る舞いが数値的なMPCソリューションに暗黙的に依存するため、ポリシーパラメータに対する非線形で、潜在的に非平滑で、長い水平な依存関係を生成するため困難である。
Reinforcement Learning (RL) は環境サンプルから実現されたクローズドループリターンを最適化するが、サンプル非効率であるのに対し、 Gradient-Based Policy Learning (GB-PL) は、予測されたトラジェクトリに対するサロゲート損失を最適化するために、微分可能なMPCからの低分散ソルバ勾配を使用する。
本稿では,RLをベースとしたオンラインMPCコスト重み付けのためのソルバー・グラディエントガイド強化学習(SG-RL)を提案する。
SG-RLは, 試料ループリターンを目的として維持し, 安定度と試料効率を向上させるための補助ガイダンスとして有界ソルバ由来勾配を用いる。
SG-RL in Proximal Policy Optimization (PPO) with four modular algorithm that inject solver-gradient guidance into actor-update scaling, policy loss, advantage estimation, and value-function learning。
意図的なモデルミスマッチを持つ2つのフルスケールの自律レースプラットフォームにおいて、SG-RLは最大70.6%のサンプルでPPOの最高のクローズドループリターンに達し、クローズドループリターンにおいてGB-PLベースラインを少なくとも54%上回り、ゼロショットを目に見えない環境に一般化する。
関連論文リスト
- Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization [60.87651283510059]
Group Relative Policy Optimization (GRPO) はLLM推論を効果的にスケールするが、計算コストは禁じている。
本研究では,非バイアス勾配推定を保ちながら動的プルーニングを可能にする動的プルーニングポリシー最適化(DPPO)を提案する。
刈り込みによって引き起こされるデータの空間性を軽減するため,ウィンドウベースの欲求戦略であるDense Prompt Packingを導入する。
論文 参考訳(メタデータ) (2026-03-04T14:48:53Z) - BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping [69.74252624161652]
適応クリッピング(BAPO)を用いたBAlanced Policy Optimizationを提案する。
BAPOはクリッピングバウンダリを動的に調整し、適応的に正と負のコントリビューションを再バランスさせ、エントロピーを保持し、RL最適化を安定化させる。
AIME 2024とAIME 2025ベンチマークでは、7B BAPOモデルがSkyWork-OR1-7Bのようなオープンソースモデルを上回っています。
論文 参考訳(メタデータ) (2025-10-21T12:55:04Z) - ADARL: Adaptive Low-Rank Structures for Robust Policy Learning under Uncertainty [28.291179179647795]
我々は、ロバスト性を改善する二段階最適化フレームワークであるtextbfAdaptive Rank Representation (AdaRL) を提案する。
下位レベルでは、AdaRLは、センチュロイドモデルの周りにあるワッサーシュタイン球からサンプリングされた力学を用いて、固定ランク制約の下でポリシー最適化を行う。
上層では、偏微分トレードオフのバランスをとるためにランクを適応的に調整し、ポリシーパラメータを低階多様体に投影する。
論文 参考訳(メタデータ) (2025-10-13T20:05:34Z) - Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning [77.92320830700797]
強化学習は、大規模言語モデルの推論機能を実現する上で中心的な役割を果たしてきた。
本稿では,ポリシー更新時の曲率情報を追跡し,活用するトラクタブルな計算フレームワークを提案する。
アルゴリズムであるCurvature-Aware Policy Optimization (CAPO)は、不安定な更新に寄与するサンプルを特定し、それらをマスクアウトする。
論文 参考訳(メタデータ) (2025-10-01T12:29:32Z) - Intersection of Reinforcement Learning and Bayesian Optimization for Intelligent Control of Industrial Processes: A Safe MPC-based DPG using Multi-Objective BO [0.0]
Model Predictive Control (MPC)ベースのReinforcement Learning (RL)は、Deep Neural Network (DNN)ベースのRL手法の、構造化された解釈可能な代替手段を提供する。
標準MPC-RLアプローチは、収束の遅さ、パラメータ化の制限による最適条件学習、オンライン適応時の安全性の問題に悩まされることが多い。
MPC-RLと多目的ベイズ最適化(MOBO)を統合した新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-14T02:31:52Z) - On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning [59.11784194183928]
政策勾配アルゴリズムは大規模言語モデル(LLM)の推論能力の向上に成功している。
規則化されたポリシーグラディエント(RPG)ビューは、広く使われている$k_3$ペナルティが、正確には非正規化されたKLであることを示している。
RPG-REINFORCE with RPG-Style Clipは、DAPOよりも最大6ドル以上の絶対パーセンテージポイントの精度を向上させる。
論文 参考訳(メタデータ) (2025-05-23T06:01:21Z) - Efficiently Training Deep-Learning Parametric Policies using Lagrangian Duality [55.06411438416805]
制約付きマルコフ決定プロセス(CMDP)は、多くの高度な応用において重要である。
本稿では,パラメトリックアクターポリシーを効率的に訓練するための2段階深度決定規則(TS-DDR)を提案する。
現状の手法と比較して, 解の質を高め, 数桁の計算時間を削減できることが示されている。
論文 参考訳(メタデータ) (2024-05-23T18:19:47Z) - Model-Based Reparameterization Policy Gradient Methods: Theory and
Practical Algorithms [88.74308282658133]
Reization (RP) Policy Gradient Methods (PGM) は、ロボット工学やコンピュータグラフィックスにおける連続的な制御タスクに広く採用されている。
近年の研究では、長期強化学習問題に適用した場合、モデルベースRP PGMはカオス的かつ非滑らかな最適化環境を経験する可能性があることが示されている。
本稿では,長期モデルアンロールによる爆発的分散問題を緩和するスペクトル正規化法を提案する。
論文 参考訳(メタデータ) (2023-10-30T18:43:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。