論文の概要: Beyond Pure Sampling: Hybrid Optimization Mechanisms for Non-Convex Model Predictive Control
- arxiv url: http://arxiv.org/abs/2606.00737v1
- Date: Sat, 30 May 2026 14:09:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:57:33.974689
- Title: Beyond Pure Sampling: Hybrid Optimization Mechanisms for Non-Convex Model Predictive Control
- Title(参考訳): 純粋サンプリングを超えて:非凸モデル予測制御のためのハイブリッド最適化機構
- Abstract要約: ME-DDP に基づく手法は,コストが比較的単純で局所情報が十分に代表される低次元システムにおいて,DDP に基づく手法よりも一貫して優れていた。
その結果,コストが比較的単純で,局所的な情報が十分に代表的である低次元システムでは,DDP法を常に上回っていることがわかった。
- 参考スコア(独自算出の注目度): 16.21889938470088
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper investigates the optimization mechanisms of non-convex Model Predictive Control (MPC) using the Maximum Entropy Differential Dynamic Programming (ME-DDP) framework. Navigating non-convex cost landscapes induced by nonlinear dynamics, multiple obstacles, etc. remains a fundamental challenge in robotics, where gradient-based methods frequently converge to suboptimal local minima. We demonstrate a dual-step optimization mechanism designed to overcome these traps. (1) an initial phase of using DDP to exploit the gradient of the cost landscape, followed by (2) disruption of the optimization via sampling from policies characterized by the inverse Hessian of the action-value function. We provide a rigorous analysis of this sampling mechanism of three ME-DDP variants: Unimodal Gaussian ME-DDP, Multimodal Gaussian ME-DDP, and Stein Variational DDP. Furthermore, with navigation tasks of four robotic systems under cluttered environments, we conduct extensive benchmarking of three variants of the ME-DDP, against deterministic DDP, and one of the most successful sampling-based schemes, Model Predictive Path Integral (MPPI) control with three policy parameterizations and update laws that correspond to those of ME-DDPs. The results show that in low-dimensional systems where the cost landscapes are relatively simple and local information is sufficiently representative, our framework consistently outperforms MPPIs. In high-dimensional systems, MPPI can occasionally discover aggressive maneuvers that enable it to steer the systems faster than DDP-based methods, whereas our method maintains a higher, more stable success rate. Finally, we validate the practical efficacy of the framework through hardware experiments with a quadrotor navigating a dense, non-convex obstacle field, confirming the robustness of the proposed framework for real-world deployment.
- Abstract(参考訳): 本稿では,最大エントロピー微分動的プログラミング(ME-DDP)フレームワークを用いた非凸モデル予測制御(MPC)の最適化機構について検討する。
非線形力学や複数障害物などによって引き起こされる非凸のコスト景観をナビゲートすることは、勾配に基づく手法がしばしば最適な局所最小値に収束するロボット工学の基本的な課題である。
これらのトラップを克服するために設計された二段階最適化機構を実証する。
1) コストランドスケープの勾配を利用したDDPの初期フェーズ,(2) アクション値関数の逆ヘシアンを特徴とするポリシーのサンプリングによる最適化の中断。
単調なガウス ME-DDP, マルチモーダルなガウス ME-DDP, スタイン変分 DDP の3種類のME-DDPのサンプリング機構について, 厳密な解析を行った。
さらに, 乱雑な環境下での4つのロボットシステムのナビゲーションタスクにおいて, 3種類のME-DDP, 決定論的DDP, および最も成功したサンプリングベーススキームの1つであるモデル予測経路積分(MPPI)を広範囲にベンチマークし, 3つのポリシーパラメータ化とME-DDPに対応する法則の更新を行う。
その結果、コストランドスケープが比較的単純で、ローカル情報が十分に代表的である低次元システムでは、我々のフレームワークは一貫してMPPIよりも優れていた。
高次元システムでは、MPPIは時折、DDPベースの手法よりも高速にシステムを操縦できる攻撃的な操作を発見できるが、我々の手法はより高い、より安定した成功率を維持している。
最後に,高密度で非凸な障害物場をナビゲートする四極子を用いたハードウェア実験により,本フレームワークの実用的有効性を検証するとともに,提案フレームワークの現実的展開に対する堅牢性を確認する。
関連論文リスト
- Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation [68.02899606570223]
本稿では,効率的なエンボディナビゲーションのための統合フレームワークであるTAMP-Navを提案する。
まず、ナビゲーションを2次元の視覚座標に再構成するPixel-to-3D Action Formulation(Point)を導入する。
次に,Selective Reasoning and Anchor-Trajectory Memory Mechanism (Think and Memorize)を提案する。
論文 参考訳(メタデータ) (2026-08-18T08:37:08Z) - Data-Driven Control of a Magnetically Actuated Fish-Like Robot [2.5782420501870296]
磁力で動く魚のようなロボットは、小型化と機敏さのために水中探査に有望なソリューションを提供する。
本稿では、解析モデルに頼ることなく、これらの複雑さに対処するデータ駆動制御フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-05T04:08:08Z) - DDP-WM: Disentangled Dynamics Prediction for Efficient World Models [79.53092337527382]
本稿では,DDP-WMについて紹介する。DDP-WMはDDP-WM(Distangled Dynamics Prediction)の原理に基づく新しい世界モデルである。
DDP-WMは、効率的な履歴処理と動的ローカライゼーションを統合したアーキテクチャにより、この分解を実現する。
実験により、DDP-WMは様々なタスクにおいて、大幅な効率と性能を達成することが示された。
論文 参考訳(メタデータ) (2026-02-02T08:04:25Z) - Parallel Diffusion Solver via Residual Dirichlet Policy Optimization [88.7827307535107]
拡散モデル(DM)は、最先端の生成性能を達成したが、シーケンシャルなデノナイジング特性のため、高いサンプリング遅延に悩まされている。
既存のソルバベースの加速度法では、低次元の予算で画像品質が著しく低下することが多い。
本研究では,各ステップに複数の勾配並列評価を組み込んだ新しいODE解法であるEnsemble Parallel Directionsolvr(EPD-EPr)を提案する。
論文 参考訳(メタデータ) (2025-12-28T05:48:55Z) - OMP: One-step Meanflow Policy with Directional Alignment [26.114675928221974]
高忠実でリアルタイムな操作のために設計されたワンステップ平均フローポリシー(OMP)。
AdroitとMeta-Worldベンチマークの実験では、OMPは成功率と軌道精度において最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2025-12-22T12:45:35Z) - Model-Based Diffusion Sampling for Predictive Control in Offline Decision Making [48.998030470623384]
オフラインの意思決定は、さらなるインタラクションを伴わずに、固定データセットからの信頼性の高い振る舞いを必要とする。
i)タスク整列軌道を多様に生成するプランナー,(ii)システム力学との整合性を強制するダイナミクスモデル,(iii)タスク目標に整合した動作を選択するランサーモジュールからなる構成モデルに基づく拡散フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-09T06:26:02Z) - Discrete-Guided Diffusion for Scalable and Safe Multi-Robot Motion Planning [56.240199425429445]
マルチロボット運動計画(MPMP)は、共有された連続作業空間で動作する複数のロボットのための軌道を生成する。
離散マルチエージェント探索(MAPF)法は,その拡張性から広く採用されているが,粗い離散化の軌道品質は高い。
本稿では、制約付き生成拡散モデルを用いた離散MAPF解法を導入することにより、2つのアプローチの限界に対処する。
論文 参考訳(メタデータ) (2025-08-27T17:59:36Z) - PER-DPP Sampling Framework and Its Application in Path Planning [5.158004370485019]
意思決定中心の強化学習フレームワークは、高度な制御システム研究で注目されている。
本研究では,強化学習体験再生機構におけるサンプル問題に対する方法論的改善を提案する。
多様性評価にDPP(Determinant Point Process)を導入することにより、適応的な選択プロトコルを備えた二重基準サンプリングフレームワークを開発する。
論文 参考訳(メタデータ) (2025-03-10T14:58:16Z) - Variational Inference MPC using Normalizing Flows and
Out-of-Distribution Projection [7.195824023358536]
衝突のないナビゲーションのためのモデル予測制御(MPC)手法を提案する。
ロボットの力学と複雑な障害物測地の両方を考慮に入れた分布を学習する。
プロジェクション付きFlowMPPIは,分布内およびOOD環境において,最先端のMPCベースラインより優れていることを示す。
論文 参考訳(メタデータ) (2022-05-10T04:43:15Z) - Neural Stochastic Dual Dynamic Programming [99.80617899593526]
我々は、問題インスタンスを断片的線形値関数にマッピングすることを学ぶトレーニング可能なニューラルモデルを導入する。
$nu$-SDDPは、ソリューションの品質を犠牲にすることなく、問題解決コストを大幅に削減できる。
論文 参考訳(メタデータ) (2021-12-01T22:55:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。