論文の概要: Learning-Based Stochastic Optimal Control with Infinite-Horizon Probabilistic Constraints
- arxiv url: http://arxiv.org/abs/2608.01151v1
- Date: Sun, 02 Aug 2026 11:00:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.105019
- Title: Learning-Based Stochastic Optimal Control with Infinite-Horizon Probabilistic Constraints
- Title(参考訳): 無限水平確率制約を用いた学習型確率最適制御
- Abstract要約: 無限水平連成確率制約を用いた最適制御問題を考察する。
我々は、元の問題を制約付きマルコフ決定プロセスとして再構成する。
拡張状態空間上で定義された決定論的マルコフポリシーに収束することを示す。
- 参考スコア(独自算出の注目度): 9.67618824743514
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this paper, we consider stochastic optimal control problems with infinite-horizon joint chance constraints. By means of an appropriate state augmentation, we reformulate the original problem as a constrained Markov decision process, in which both the cost and the constraint function exhibit an additive structure. We then prove that this formulation enjoys strong duality, thereby enabling us to reformulate the problem as an equivalent unconstrained one in the Lagrange dual framework. We propose a dual-ascent algorithm to solve the resulting problem and show that it converges to a deterministic Markov policy defined over the augmented state space that is both optimal and feasible. To accommodate continuous state-input spaces, we propose a dedicated learning algorithm to approximate the value function in an offline training setting, thereby significantly reducing the computational complexity of the online control phase. We then test our approach on a numerical example and demonstrate its effectiveness compared to online predictive control methods in terms of performance and computational complexity.
- Abstract(参考訳): 本稿では,無限水平連成確率制約を用いた確率的最適制御問題について考察する。
適切な状態拡張により、コストと制約関数の両方が付加的な構造を示す制約付きマルコフ決定過程として元の問題を再構成する。
すると、この定式化が強い双対性を持つことを証明し、これによりラグランジュ双対フレームワークにおける同値な非拘束的問題として問題を再構成することができる。
結果の問題を解決するための二段階アルゴリズムを提案し、最適かつ実現可能な拡張状態空間上で定義された決定論的マルコフポリシーに収束することを示す。
連続的な状態入力空間に対応するため、オフライントレーニング環境における値関数を近似する専用学習アルゴリズムを提案し、オンライン制御フェーズの計算複雑性を著しく低減する。
次に,本手法を数値的な例で検証し,オンライン予測制御法と比較して,性能および計算複雑性の観点からその効果を実証する。
関連論文リスト
- A Single-Loop Bilevel Deep Learning Method for Optimal Control of Obstacle Problems [10.846737757627638]
本稿では,メッシュフリーで,高次元かつ複雑な領域に拡張性を持ち,離散化されたサブプロブレムの繰り返し解を回避できる単一ループバイレベルディープラーニング手法を提案する。
提案手法は,古典的数値法と比較して計算コストを低減しつつ,良好な精度を実現する。
論文 参考訳(メタデータ) (2026-01-07T17:30:42Z) - Learning based convex approximation for constrained parametric optimization [11.379408842026981]
本稿では、制約付き最適化問題を解決するために、入力ニューラルネットワーク(ICNN)に基づく自己教師付き学習フレームワークを提案する。
厳密な収束解析を行い、このフレームワークが元の問題のKKT近似点に収束することを示す。
提案手法は精度,実現可能性,計算効率の両立を実現している。
論文 参考訳(メタデータ) (2025-05-07T00:33:14Z) - Single-loop Algorithms for Stochastic Non-convex Optimization with Weakly-Convex Constraints [49.76332265680669]
本稿では、目的関数と制約関数の両方が弱凸である問題の重要な部分集合について検討する。
既存の手法では、収束速度の遅さや二重ループ設計への依存など、しばしば制限に直面している。
これらの課題を克服するために,新しい単一ループペナルティに基づくアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-04-21T17:15:48Z) - Trust-Region Sequential Quadratic Programming for Stochastic Optimization with Random Models [57.52124921268249]
本稿では,1次と2次の両方の定常点を見つけるための信頼逐次準計画法を提案する。
本手法は, 1次定常点に収束するため, 対象対象の近似を最小化して定義された各イテレーションの勾配ステップを計算する。
2階定常点に収束するため,本手法は負曲率を減少するヘッセン行列を探索する固有ステップも計算する。
論文 参考訳(メタデータ) (2024-09-24T04:39:47Z) - A Double Tracking Method for Optimization with Decentralized Generalized Orthogonality Constraints [4.6796315389639815]
分散最適化問題は分散制約の存在下では解決できない。
目的関数の勾配と制約写像のヤコビアンを同時に追跡する新しいアルゴリズムを導入する。
合成と実世界の両方のデータセットに数値的な結果を示す。
論文 参考訳(メタデータ) (2024-09-08T06:57:35Z) - Double Duality: Variational Primal-Dual Policy Optimization for
Constrained Reinforcement Learning [132.7040981721302]
本研究では,訪問尺度の凸関数を最小化することを目的として,制約付き凸決定プロセス(MDP)について検討する。
制約付き凸MDPの設計アルゴリズムは、大きな状態空間を扱うなど、いくつかの課題に直面している。
論文 参考訳(メタデータ) (2024-02-16T16:35:18Z) - Fully Stochastic Trust-Region Sequential Quadratic Programming for
Equality-Constrained Optimization Problems [62.83783246648714]
目的と決定論的等式制約による非線形最適化問題を解くために,逐次2次プログラミングアルゴリズム(TR-StoSQP)を提案する。
アルゴリズムは信頼領域半径を適応的に選択し、既存の直線探索StoSQP方式と比較して不確定なヘッセン行列を利用することができる。
論文 参考訳(メタデータ) (2022-11-29T05:52:17Z) - Learning to Optimize with Stochastic Dominance Constraints [103.26714928625582]
本稿では,不確実量を比較する問題に対して,単純かつ効率的なアプローチを開発する。
我々はラグランジアンの内部最適化をサロゲート近似の学習問題として再考した。
提案したライト-SDは、ファイナンスからサプライチェーン管理に至るまで、いくつかの代表的な問題において優れた性能を示す。
論文 参考訳(メタデータ) (2022-11-14T21:54:31Z) - Algorithm for Constrained Markov Decision Process with Linear
Convergence [55.41644538483948]
エージェントは、そのコストに対する複数の制約により、期待される累積割引報酬を最大化することを目的としている。
エントロピー正規化ポリシーとベイダの二重化という2つの要素を統合した新しい双対アプローチが提案されている。
提案手法は(線形速度で)大域的最適値に収束することが示されている。
論文 参考訳(メタデータ) (2022-06-03T16:26:38Z) - Adaptive Discretization for Model-Based Reinforcement Learning [10.21634042036049]
本稿では,適応離散化手法を導入し,効率的なモデルに基づくエピソード強化学習アルゴリズムを設計する。
我々のアルゴリズムは、空間の適応的な離散化を維持するために拡張された楽観的なワンステップ値反復に基づいている。
論文 参考訳(メタデータ) (2020-07-01T19:36:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。