論文の概要: Topological Feasibility Guarantees for Differentiable Predictive Control
- arxiv url: http://arxiv.org/abs/2608.10332v1
- Date: Tue, 11 Aug 2026 00:27:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.852854
- Title: Topological Feasibility Guarantees for Differentiable Predictive Control
- Title(参考訳): 微分予測制御のためのトポロジカル可能性保証
- Abstract要約: 微分予測制御(DPC)は、明示的モデル予測制御(MPC)ポリシーを近似するための自己教師付き学習手法である。
安全管理のコア要件であるファシビリティ保証は、現在、確率的またはオンライン安全フィルタを介して提供されている。
本稿では,誘導可能な安全セットの新たなトポロジカル解析を用いて,DPCに対する決定論的実現可能性を保証する。
- 参考スコア(独自算出の注目度): 0.8880611506199766
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Differentiable predictive control (DPC), a self-supervised learning approach for approximating explicit model predictive control (MPC) policies, offers significant computational advantages over online optimization-based MPC. However, feasibility guarantees, a core requirement for safe control, are currently provided either probabilistically or via online safety filters. The lack of rigorous feasibility guarantees for offline policy optimization remains an open problem. This paper establishes deterministic feasibility guarantees for DPC using a novel topological analysis of the induced reachable safe set, without requiring online safety filters. By exploiting the inherent model-based nature of DPC, in which differentiable system dynamics are embedded directly into the computational graph, we analyze the properties of the learned control policies and the corresponding system states from topological and geometric perspectives. Inspired by our theoretical analysis, we propose a novel self-supervised offline policy learning strategy that utilizes a proxy loss with Control Barrier Functions (CBFs). Crucially, these properties not only significantly improve policy training but also enable the derivation of strict, deterministic feasibility guarantees from a finite number of training samples. Extensive closed-loop simulations validate our theoretical findings, demonstrating that the empirical constraint violations monotonically decrease to zero as the training sample size increases. Ultimately, this work illustrates that DPC policy optimization yields formal safety certificates that are structurally unattainable with conventional black-box methods, e.g., reinforcement learning (RL) or supervised learning-based approximate MPC, thereby providing a new perspective on feasibility guarantees in learning-based control.
- Abstract(参考訳): 明示的モデル予測制御(MPC)ポリシーを近似するための自己教師付き学習アプローチである微分予測制御(DPC)は、オンライン最適化ベースのMPCよりも大きな計算上の優位性を提供する。
しかし、安全管理のコア要件である実現可能性保証は、現在確率論的またはオンライン安全フィルタを介して提供されている。
オフラインポリシー最適化の厳格な実現可能性の欠如は、依然として未解決の問題である。
本稿では,オンラインの安全フィルタを必要とせずに,誘導可能な安全セットの新たなトポロジカル解析を用いて,DPCに対する決定論的実現可能性を保証する。
微分可能系力学を計算グラフに直接埋め込むDPCの固有モデルに基づく性質を利用して、学習した制御ポリシーと対応する系状態の特性を位相的および幾何学的視点から解析する。
そこで我々は,制御バリア関数(CBF)によるプロキシ損失を利用した,自己制御型オフラインポリシー学習戦略を提案する。
重要なことに、これらの特性は政策トレーニングを著しく改善するだけでなく、有限個のトレーニングサンプルから厳密で決定論的実現可能性を保証することができる。
大規模クローズドループシミュレーションは,トレーニングサンプルのサイズが大きくなるにつれて,経験的制約違反が単調に0に減少することを示した。
最終的に、DPCポリシーの最適化は、従来のブラックボックス法(例えば、強化学習(RL)や教師あり学習に基づく近似MPC)で構造的に不可能な形式的安全証明書を出力し、学習ベース制御における実現可能性の新たな視点を提供する。
関連論文リスト
- Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning [50.738952715864116]
表現的連続制御ポリシは、シミュレーションされた実ロボット制御のための模倣学習のスケーリングにおける進歩のバックボーンを形成する。
テスト時に完全にポリシー最適化を行うRLアルゴリズムであるQGF(Q-Guided Flow)を提案する。
実証的には、QGFはシングルタスクおよびゴール条件のオフラインRLベンチマークにおいて、以前のテスト時間RLメソッドよりも優れている。
論文 参考訳(メタデータ) (2026-06-09T16:45:57Z) - Learning Predictive Control with Deep Koopman Operators for Autonomous Vehicle Motion Planning [11.149068950974113]
モデル予測制御(MPC)は自律走行車(AV)運動計画に広く用いられているが、リアルタイム適用性は限られている。
Actor-criticは動的道路環境における非線形学習問題に対するオンラインソリューションを提供する。
本稿では、効率的なリアルタイム動作制御のためのディープ・クープマン演算子を用いたフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-06T12:26:21Z) - OGPO: Sample Efficient Full-Finetuning of Generative Control Policies [53.42266064673132]
ジェネレーティブコントロールポリシー(GCP)は、ロボット学習に有効なパラメータ化として登場した。
この研究は、GCPを微調整するためのサンプル効率であるOGPO(Off-policy Generative Policy Optimization)を導入している。
OGPOはマルチタスク設定、高精度挿入、デクスタラス制御にまたがる操作タスクにおける最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-05-04T18:36:40Z) - Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning [77.92320830700797]
強化学習は、大規模言語モデルの推論機能を実現する上で中心的な役割を果たしてきた。
本稿では,ポリシー更新時の曲率情報を追跡し,活用するトラクタブルな計算フレームワークを提案する。
アルゴリズムであるCurvature-Aware Policy Optimization (CAPO)は、不安定な更新に寄与するサンプルを特定し、それらをマスクアウトする。
論文 参考訳(メタデータ) (2025-10-01T12:29:32Z) - Differentiable Predictive Control with Safety Guarantees: A Control
Barrier Function Approach [3.617866023850784]
我々は、安全性と堅牢性を保証する新しい形態の微分可能予測制御(DPC)を開発した。
DPCは、明示的モデル予測制御(MPC)問題に対する近似解を得るための教師なし学習に基づく手法である。
論文 参考訳(メタデータ) (2022-08-03T19:24:44Z) - Supported Policy Optimization for Offline Reinforcement Learning [74.1011309005488]
オフライン強化学習(RL)に対する政策制約手法は、通常、パラメータ化や正規化を利用する。
規則化手法は学習方針と行動方針の分岐を減少させる。
本稿では、密度に基づくサポート制約の理論的定式化から直接導出した支援政策最適化(SPOT)について述べる。
論文 参考訳(メタデータ) (2022-02-13T07:38:36Z) - Closing the Closed-Loop Distribution Shift in Safe Imitation Learning [80.05727171757454]
模倣学習問題において,安全な最適化に基づく制御戦略を専門家として扱う。
我々は、実行時に安価に評価でき、専門家と同じ安全保証を確実に満足する学習されたポリシーを訓練する。
論文 参考訳(メタデータ) (2021-02-18T05:11:41Z) - COMBO: Conservative Offline Model-Based Policy Optimization [120.55713363569845]
ディープニューラルネットワークのような複雑なモデルによる不確実性推定は困難であり、信頼性が低い。
我々は,サポート外状態動作の値関数を正規化するモデルベースオフラインRLアルゴリズムCOMBOを開発した。
従来のオフラインモデルフリーメソッドやモデルベースメソッドと比べて、comboは一貫してパフォーマンスが良いことが分かりました。
論文 参考訳(メタデータ) (2021-02-16T18:50:32Z) - Learning Constrained Adaptive Differentiable Predictive Control Policies
With Guarantees [1.1086440815804224]
本稿では,線形システムに対する制約付きニューラルコントロールポリシーの学習方法として,微分可能予測制御(DPC)を提案する。
我々は,モデル予測制御(MPC)損失関数の逆伝搬と,微分可能な閉ループ系力学モデルによるペナルティの制約により,直接的な政策勾配を求めるために,自動微分を用いる。
論文 参考訳(メタデータ) (2020-04-23T14:24:44Z) - Neural Lyapunov Model Predictive Control: Learning Safe Global
Controllers from Sub-optimal Examples [4.777323087050061]
多くの実世界の産業アプリケーションでは、例えば人間の操作者による実行など、既存の制御戦略を持つことが典型的である。
この研究の目的は、安全と安定性を維持する新しいコントローラを学習することで、この未知の、安全だが、最適でないポリシーを改善することである。
提案アルゴリズムは、端末コストを学習し、安定性基準に従ってMPCパラメータを更新する。
論文 参考訳(メタデータ) (2020-02-21T16:57:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。