論文の概要: Dream-MPC: Gradient-Based Model Predictive Control with Latent Imagination
- arxiv url: http://arxiv.org/abs/2605.04568v1
- Date: Wed, 06 May 2026 07:13:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.692325
- Title: Dream-MPC: Gradient-Based Model Predictive Control with Latent Imagination
- Title(参考訳): Dream-MPC:遅延イマジネーションを用いた勾配モデル予測制御
- Authors: Jonathan Spieler, Sven Behnke,
- Abstract要約: 最先端のモデルに基づく強化学習(Reinforcement Learning, RL)アプローチは、勾配のない人口ベースの計画手法、学習された政策ネットワーク、あるいは政策ネットワークと計画の組み合わせを使用する。
本研究では,ロールアウトポリシから少数の候補軌道を生成する新しい手法であるDream-MPCを提案し,学習世界モデルを用いて各軌道の勾配上昇を最適化する。
24個の連続制御タスクの結果から,Dream-MPCは基本方針の性能を大幅に向上し,勾配のないMPCや最先端のベースラインよりも優れることが示された。
- 参考スコア(独自算出の注目度): 17.4778210092639
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: State-of-the-art model-based Reinforcement Learning (RL) approaches either use gradient-free, population-based methods for planning, learned policy networks, or a combination of policy networks and planning. Hybrid approaches that combine Model Predictive Control (MPC) with a learned model and a policy prior to leverage the advantages of both paradigms have shown promising results. However, these approaches typically rely on gradient-free optimization methods, which can be computationally expensive for high-dimensional control tasks. While gradient-based methods are a promising alternative, recent works have empirically shown that gradient-based methods often perform worse than their gradient-free counterparts. We propose Dream-MPC, a novel approach that generates few candidate trajectories from a rolled-out policy and optimizes each trajectory by gradient ascent using a learned world model, uncertainty regularization and amortization of optimization iterations over time by reusing previously optimized actions. Our results on 24 continuous control tasks show that Dream-MPC can significantly improve the performance of the underlying policy and can outperform gradient-free MPC and state-of-the-art baselines. We will open source our code and more at https://dream-mpc.github.io.
- Abstract(参考訳): 最先端のモデルに基づく強化学習(Reinforcement Learning, RL)アプローチは、勾配のない人口ベースの計画手法、学習された政策ネットワーク、あるいは政策ネットワークと計画の組み合わせを使用する。
モデル予測制御(MPC)と学習モデルと、両方のパラダイムの利点を利用するためのポリシーを組み合わせたハイブリッドアプローチは、有望な結果を示している。
しかし、これらの手法は一般に勾配のない最適化手法に依存しており、高次元制御タスクには計算コストがかかる。
勾配に基づく手法は有望な代替手段であるが、最近の研究は勾配に基づく手法が勾配のない手法よりも悪いことを実証的に示している。
本研究では,学習された世界モデルを用いた勾配上昇による各軌道の最適化,不確かさの正則化,最適化反復の時間的補正を,これまで最適化された動作を再利用することで実現した新しい手法であるDream-MPCを提案する。
24個の連続制御タスクの結果から,Dream-MPCは基本方針の性能を大幅に向上し,勾配のないMPCや最先端のベースラインよりも優れることが示された。
コードと詳細はhttps://dream-mpc.github.io.comで公開します。
関連論文リスト
- V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think [90.69263509098948]
本稿では,ELBOをベースとしたサロゲートとグループ相対ポリシー最適化アルゴリズムを統合した変分GRPOを提案する。
V-GRPOはテキストと画像の合成において最先端のパフォーマンスを実現し、MixGRPOよりも2倍のスピードアップ、DiffusionNFTより3倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-04-25T17:03:21Z) - Closing the Train-Test Gap in World Models for Gradient-Based Planning [64.36544881136405]
本研究では,効率的な勾配計画を可能にする世界モデルの学習方法を提案する。
テスト時には,古典的勾配のないクロスエントロピー法よりも優れた手法が提案される。
論文 参考訳(メタデータ) (2025-12-10T18:59:45Z) - Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning [77.92320830700797]
強化学習は、大規模言語モデルの推論機能を実現する上で中心的な役割を果たしてきた。
本稿では,ポリシー更新時の曲率情報を追跡し,活用するトラクタブルな計算フレームワークを提案する。
アルゴリズムであるCurvature-Aware Policy Optimization (CAPO)は、不安定な更新に寄与するサンプルを特定し、それらをマスクアウトする。
論文 参考訳(メタデータ) (2025-10-01T12:29:32Z) - Unifying Model Predictive Path Integral Control, Reinforcement Learning, and Diffusion Models for Optimal Control and Planning [6.871390204787483]
我々は,Gibs測度の勾配に基づく最適化により,MPPI,RL,拡散モデルを結ぶ統一的な視点を確立する。
まず,MPPIをスムーズなエネルギー関数上の勾配上昇として解釈できることを示す。
次に、目的関数に指数変換を適用することにより、ポリシー勾配法がMPPIに還元されることを実証する。
論文 参考訳(メタデータ) (2025-02-27T19:26:36Z) - Gradient-based Planning with World Models [21.9392160209565]
我々は、世界モデルの微分可能性を完全に活用する勾配に基づく代替案について検討する。
サンプル効率のよい設定では、ほとんどのタスクの代替手法と比較して、同等あるいは優れた性能が得られる。
論文 参考訳(メタデータ) (2023-12-28T18:54:21Z) - Acceleration in Policy Optimization [50.323182853069184]
我々は、楽観的かつ適応的な更新を通じて、政策改善のステップにフォレストを組み込むことにより、強化学習(RL)における政策最適化手法を加速するための統一パラダイムに向けて研究する。
我々は、楽観主義を、政策の将来行動の予測モデルとして定義し、適応性は、過度な予測や変化に対する遅延反応からエラーを軽減するために、即時かつ予測的な修正措置をとるものである。
我々は,メタグラディエント学習による適応型楽観的ポリシー勾配アルゴリズムを設計し,実証的なタスクにおいて,加速度に関連するいくつかの設計選択を実証的に強調する。
論文 参考訳(メタデータ) (2023-06-18T15:50:57Z) - Multi-Objective Policy Gradients with Topological Constraints [108.10241442630289]
本稿では, PPOアルゴリズムの簡単な拡張により, TMDPにおけるポリシー勾配に対する新しいアルゴリズムを提案する。
シミュレーションと実ロボットの両方の目的を任意に並べた実世界の多目的ナビゲーション問題に対して,これを実証する。
論文 参考訳(メタデータ) (2022-09-15T07:22:58Z) - Anchor-Changing Regularized Natural Policy Gradient for Multi-Objective
Reinforcement Learning [17.916366827429034]
複数の報酬値関数を持つマルコフ決定プロセス(MDP)のポリシー最適化について検討する。
本稿では,順応的な一階法からアイデアを取り入れたアンカー変更型正規化自然政策グラディエントフレームワークを提案する。
論文 参考訳(メタデータ) (2022-06-10T21:09:44Z) - Evaluating model-based planning and planner amortization for continuous
control [79.49319308600228]
我々は、モデル予測制御(MPC)と学習モデルとモデルフリーポリシー学習を組み合わせたハイブリッドアプローチを採っている。
モデルフリーエージェントは高いDoF制御問題においても強いベースラインであることがわかった。
モデルに基づくプランナを,パフォーマンスを損なうことなく,計画が損なわれるようなポリシーに置き換えることが可能であることを示す。
論文 参考訳(メタデータ) (2021-10-07T12:00:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。