論文の概要: Optimal Constrained sc-LTL Planning in MDPs via Switching Policies
- arxiv url: http://arxiv.org/abs/2608.05021v1
- Date: Wed, 05 Aug 2026 16:24:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.987904
- Title: Optimal Constrained sc-LTL Planning in MDPs via Switching Policies
- Title(参考訳): スイッチングポリシによるMDPの最適制約Sc-LTL計画
- Authors: Zetong Xuan, Yu Wang,
- Abstract要約: 我々は,コセーフな線形時間論理(sc-LTL)に規定される目的と安全性の制約を兼ね備えたマルコフ決定過程における最適ポリシの合成について検討した。
我々の問題は本質的には、SC-LTL仕様の複雑さのために非マルコフ的であり、目的と制約のバランスをとるためにポリシーのランダム化を必要とする可能性がある。
グリッドワールドケーススタディでは,スイッチングポリシが目標と安全制約の最適なトレードオフを実現し,最適性とトラクタビリティの両立を実証している。
- 参考スコア(独自算出の注目度): 2.5735476569508995
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study the synthesis of optimal policies for planning problems on Markov decision processes with both objectives and safety constraints specified in co-safe linear temporal logic (sc-LTL). Our problems are inherently non-Markovian due to the complexity of the sc-LTL specification and may require policy randomization to balance the objective and constraint. We propose a novel approach that reduces the constrained sc-LTL planning problem to a constrained reachability problem on an extended model. We then show that a class of switching policies constructed from stationary policies for the individual sc-LTL specifications is sufficient for optimality for the constrained reachability problem. Our finding enables a tractable linear program to compute the optimal policy. A grid world case study demonstrates that our switching policies can achieve the optimal trade-off between the objective and the safety constraint and validates both optimality and tractability.
- Abstract(参考訳): 本稿では,コセーフな線形時間論理(sc-LTL)に規定される目的と安全性の制約を兼ね備えたマルコフ決定過程の計画問題に対する最適ポリシーの合成について検討する。
我々の問題は本質的には、SC-LTL仕様の複雑さのために非マルコフ的であり、目的と制約のバランスをとるためにポリシーのランダム化を必要とする可能性がある。
本稿では,制約付きSC-LTL計画問題を拡張モデル上の制約付き到達可能性問題に還元する新しい手法を提案する。
次に,Sc-LTL仕様の定常ポリシから構築したスイッチングポリシのクラスが,制約付き到達可能性問題に対する最適性に十分であることを示す。
我々の発見により、抽出可能な線形プログラムが最適ポリシーを計算できる。
グリッドワールドケーススタディでは,スイッチングポリシが目標と安全制約の最適なトレードオフを実現し,最適性とトラクタビリティの両立を実証している。
関連論文リスト
- Exact Model-Free Policy Iteration for Co-safe LTL Planning [2.5735476569508995]
本研究では,有限マルコフ決定過程における共安全線形時間論理のモデル自由強化学習について検討する。
そこで我々は,まずディスカウントされたサロゲートを用いてクランプ集合を同定する2段階のモデルフリー強化学習法を開発した。
我々は、政策評価ステップのほぼ確実に収束と、政策反復アルゴリズムの有限終了を最適ポリシーで証明する。
論文 参考訳(メタデータ) (2026-08-05T16:58:25Z) - Alignment of large language models with constrained learning [93.2264691508005]
本研究では,制約付きアライメント問題に対する最適大言語モデル (LLM) ポリシーの計算問題について検討する。
我々はラグランジアン双対性を用いて、ラグランジアンによるポリシーの更新と双対降下による双対変数の更新を交互に交互に行う反復的双対ベースアライメント法を開発する。
論文 参考訳(メタデータ) (2025-05-26T01:04:56Z) - Resilient Constrained Reinforcement Learning [87.4374430686956]
本稿では,複数の制約仕様を事前に特定しない制約付き強化学習(RL)のクラスについて検討する。
報酬訓練目標と制約満足度との間に不明確なトレードオフがあるため、適切な制約仕様を特定することは困難である。
我々は、ポリシーと制約仕様を一緒に検索する新しい制約付きRLアプローチを提案する。
論文 参考訳(メタデータ) (2023-12-28T18:28:23Z) - Constrained Decision Transformer for Offline Safe Reinforcement Learning [16.485325576173427]
我々は、新しい多目的最適化の観点から、オフラインセーフなRL問題を考察する。
本稿では,デプロイメント中のトレードオフを動的に調整可能な制約付き決定変換器(CDT)アプローチを提案する。
論文 参考訳(メタデータ) (2023-02-14T21:27:10Z) - Policy Optimization with Linear Temporal Logic Constraints [37.27882290236194]
本稿では,線形時間論理制約を用いた政策最適化の問題点について考察する。
我々は,タスク満足度とコスト最適性の両方を保証するために,サンプル複雑性分析を楽しむモデルベースアプローチを開発した。
論文 参考訳(メタデータ) (2022-06-20T02:58:02Z) - COptiDICE: Offline Constrained Reinforcement Learning via Stationary
Distribution Correction Estimation [73.17078343706909]
オフラインの制約付き強化学習(RL)問題。エージェントは、所定のコスト制約を満たしながら期待されるリターンを最大化するポリシーを計算し、事前に収集されたデータセットからのみ学習する。
定常分布空間におけるポリシーを最適化するオフライン制約付きRLアルゴリズムを提案する。
我々のアルゴリズムであるCOptiDICEは、コスト上限を制約しながら、利益に対する最適政策の定常分布補正を直接見積もる。
論文 参考訳(メタデータ) (2022-04-19T15:55:47Z) - Model-Free Reinforcement Learning for Optimal Control of MarkovDecision
Processes Under Signal Temporal Logic Specifications [7.842869080999489]
有限水平マルコフ決定過程に対する最適ポリシーを求めるためのモデルフリー強化学習アルゴリズムを提案する。
本稿では,不確実性および性能目標下での複雑なミッションにおけるロボット動作計画の文脈におけるアプローチの有効性について述べる。
論文 参考訳(メタデータ) (2021-09-27T22:44:55Z) - CRPO: A New Approach for Safe Reinforcement Learning with Convergence
Guarantee [61.176159046544946]
安全強化学習(SRL)問題では、エージェントは期待される全報酬を最大化し、一定の制約の違反を避けるために環境を探索する。
これは、大域的最適ポリシーを持つSRLアルゴリズムの最初の分析である。
論文 参考訳(メタデータ) (2020-11-11T16:05:14Z) - Guided Constrained Policy Optimization for Dynamic Quadrupedal Robot
Locomotion [78.46388769788405]
我々は,制約付きポリシー最適化(CPPO)の実装に基づくRLフレームワークであるGCPOを紹介する。
誘導制約付きRLは所望の最適値に近い高速収束を実現し,正確な報酬関数チューニングを必要とせず,最適かつ物理的に実現可能なロボット制御動作を実現することを示す。
論文 参考訳(メタデータ) (2020-02-22T10:15:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。