論文の概要: Optimal Control with Learned Critics under Unmodeled State Dependencies
- arxiv url: http://arxiv.org/abs/2610.05359v1
- Date: Sun, 04 Oct 2026 16:37:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 14:21:51.023498
- Title: Optimal Control with Learned Critics under Unmodeled State Dependencies
- Title(参考訳): 非モデル状態依存下での学習的批判による最適制御
- Abstract要約: モデル予測制御(MPC)は、意思決定のための構造化された制約対応のメカニズムを提供する。
本稿では,ローカルモデルベースプランニングのデータ効率と構造を組み合わせた学習ベースのMPCフレームワークを提案する。
我々は、最適制御ループ内の学習力学と批判ネットワークを評価するGPU加速バッチiLQRソルバを開発した。
- 参考スコア(独自算出の注目度): 7.004224236341429
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Model Predictive Control (MPC) provides a structured and constraint-aware mechanism for decision-making, but its reliance on optimization-friendly analytical dynamics models limits its use in tasks with contacts and other hard-to-model state dependencies. Model-free reinforcement learning avoids explicit modeling assumptions but typically requires large amounts of interaction data. We present a learning-based MPC framework that combines the data efficiency and structure of local model-based planning with learned components that compensate for incomplete dynamics and finite-horizon myopia. The method augments a nominal analytical model with a residual dynamics network that learns missing state-dependent effects from data and combines the resulting planner with a learned action-value critic that injects long-horizon MDP structure into the local iLQR optimization. To make this practical at reinforcement-learning scale, we develop a GPU-accelerated batched iLQR solver that evaluates learned dynamics and critic networks inside the optimal-control loop and solves thousands of trajectory-optimization problems in parallel. The complete system is integrated into a robotics simulator, enabling scalable model-based reinforcement learning under incomplete dynamics. Experiments on biased and incompletely modeled control tasks show that the approach improves closed-loop control performance while preserving the model-based structure needed for efficient constrained trajectory optimization.
- Abstract(参考訳): モデル予測制御(MPC)は、意思決定のための構造化された制約対応のメカニズムを提供するが、最適化に親しみやすい解析力学モデルに依存しているため、連絡先やその他のハード・ツー・モデルの状態依存を伴うタスクでの使用が制限される。
モデルなし強化学習は明示的なモデリングの前提を避けるが、通常大量の相互作用データを必要とする。
本稿では、局所モデルに基づくプランニングにおけるデータ効率と構造を、不完全ダイナミクスや有限水平ミオピアを補う学習コンポーネントと組み合わせた学習ベースのMPCフレームワークを提案する。
この方法は、データから状態依存効果を学習し、結果のプランナーと学習したアクション値の批判とを組み合わせて、局所的なiLQR最適化に長い水平MDP構造を注入する、名目解析モデルを残留力学ネットワークで強化する。
強化学習スケールでこれを実用化するために、最適制御ループ内の学習力学と批判ネットワークを評価し、数千の軌道最適化問題を並列に解くGPU加速バッチiLQRソルバを開発した。
完全なシステムはロボットシミュレータに統合され、不完全な力学の下でスケーラブルなモデルベースの強化学習を可能にする。
バイアス付きおよび不完全モデル化された制御タスクの実験は、効率的な制約軌道最適化に必要なモデルベース構造を保ちながら、閉ループ制御性能を向上させることを示した。
関連論文リスト
- Efficient Reinforcement Learning using Linear Koopman Dynamics for Nonlinear Robotic Systems [4.946483489399818]
本稿では,非線形ロボットシステムの最適閉ループ制御のためのモデルに基づく強化学習フレームワークを提案する。
提案手法は、クープマン作用素理論を通じて線形昇降力学を学習し、結果のモデルをポリシー最適化のためのアクタ批判アーキテクチャに統合する。
このフレームワークは、いくつかのシミュレーションされた非線形制御ベンチマークと、2つの実世界のハードウェアプラットフォームで評価される。
論文 参考訳(メタデータ) (2026-04-21T20:40:22Z) - Learning Robust Satellite Attitude Dynamics with Physics-Informed Normalising Flow [2.7222301668137483]
宇宙機の姿勢力学の学習に物理インフォームドニューラルネットワークを組み込むことの利点について検討する。
バシリスクシミュレータで生成されたシミュレーションデータに基づいて複数のモデルを訓練する。
PINNベースのモデルは、制御精度とロバスト性の観点から、純粋にデータ駆動モデルよりも一貫して優れています。
論文 参考訳(メタデータ) (2025-08-11T10:50:49Z) - Deep autoregressive density nets vs neural ensembles for model-based
offline reinforcement learning [2.9158689853305693]
本稿では、利用可能なデータからシステムダイナミクスを推定し、仮想モデルロールアウトにおけるポリシー最適化を行うモデルベース強化学習アルゴリズムについて考察する。
このアプローチは、実際のシステムで破滅的な失敗を引き起こす可能性のあるモデルエラーを悪用することに対して脆弱である。
D4RLベンチマークの1つのよく校正された自己回帰モデルにより、より良い性能が得られることを示す。
論文 参考訳(メタデータ) (2024-02-05T10:18:15Z) - End-to-End Reinforcement Learning of Koopman Models for Economic Nonlinear Model Predictive Control [45.84205238554709]
本研究では, (e)NMPCの一部として最適性能を示すために, Koopman シュロゲートモデルの強化学習法を提案する。
エンドツーエンドトレーニングモデルは,(e)NMPCにおけるシステム識別を用いてトレーニングしたモデルよりも優れていることを示す。
論文 参考訳(メタデータ) (2023-08-03T10:21:53Z) - Active Learning of Discrete-Time Dynamics for Uncertainty-Aware Model Predictive Control [46.81433026280051]
本稿では,非線形ロボットシステムの力学を積極的にモデル化する自己教師型学習手法を提案する。
我々のアプローチは、目に見えない飛行条件に一貫して適応することで、高いレジリエンスと一般化能力を示す。
論文 参考訳(メタデータ) (2022-10-23T00:45:05Z) - When to Update Your Model: Constrained Model-based Reinforcement
Learning [50.74369835934703]
モデルベースRL(MBRL)の非遅延性能保証のための新規で一般的な理論スキームを提案する。
続いて導いた境界は、モデルシフトとパフォーマンス改善の関係を明らかにします。
さらなる例では、動的に変化する探索からの学習モデルが、最終的なリターンの恩恵をもたらすことが示されている。
論文 参考訳(メタデータ) (2022-10-15T17:57:43Z) - Information Theoretic Model Predictive Q-Learning [64.74041985237105]
本稿では,情報理論的MPCとエントロピー正規化RLとの新たな理論的関連性を示す。
バイアスモデルを利用したQ-ラーニングアルゴリズムを開発した。
論文 参考訳(メタデータ) (2019-12-31T00:29:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。