論文の概要: Exact Model-Free Policy Iteration for Co-safe LTL Planning
- arxiv url: http://arxiv.org/abs/2608.05047v1
- Date: Wed, 05 Aug 2026 16:58:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.018243
- Title: Exact Model-Free Policy Iteration for Co-safe LTL Planning
- Title(参考訳): 安全なLTL計画のための厳密なモデルフリーポリシーイテレーション
- Authors: Zetong Xuan, Yu Wang,
- Abstract要約: 本研究では,有限マルコフ決定過程における共安全線形時間論理のモデル自由強化学習について検討する。
そこで我々は,まずディスカウントされたサロゲートを用いてクランプ集合を同定する2段階のモデルフリー強化学習法を開発した。
我々は、政策評価ステップのほぼ確実に収束と、政策反復アルゴリズムの有限終了を最適ポリシーで証明する。
- 参考スコア(独自算出の注目度): 2.5735476569508995
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This work studies model-free reinforcement learning for co-safe linear temporal logic (sc-LTL) objectives in finite Markov decision processes, which can be reduced to maximal reachability objectives via the standard product construction. For this problem, direct sample-based bootstrap methods (e.g., TD or Q-learning) may fail to converge to optimal policies due to the noncontractive nature and nonuniqueness of solutions to the Bellman equation. We develop a new two-step model-free reinforcement learning method that first uses a discounted surrogate to identify a clamp set that resolves this nonuniqueness, and then applies undiscounted policy evaluation and greedy policy improvement with guarantees of finding an optimal solution. We prove almost-sure convergence of the policy evaluation step and finite termination of the policy iteration algorithm at an optimal policy. These theoretical results are validated through numerical experiments on a stochastic grid world.
- Abstract(参考訳): 本研究は, 有限マルコフ決定過程における共安全線形時間論理(sc-LTL)目標に対するモデルフリー強化学習について検討し, 標準積構成により最大到達可能性目標に還元できることを示した。
この問題に対して、直接サンプルベースのブートストラップ法(例えば、TD や Q-ラーニング)は、ベルマン方程式に対する解の非競合性や非特異性のために最適ポリシーに収束しない可能性がある。
提案手法は,まずディスカウントされたサロゲートを用いて,この非特異性を解決するクランプセットを同定し,次に最適解を見つけることを保証するために,未公表の政策評価と欲求政策改善を適用する2段階のモデルフリー強化学習手法である。
我々は、政策評価ステップのほぼ確実に収束と、政策反復アルゴリズムの有限終了を最適ポリシーで証明する。
これらの理論的結果は確率格子世界における数値実験によって検証される。
関連論文リスト
- Rectified Robust Policy Optimization for Model-Uncertain Constrained Reinforcement Learning without Strong Duality [53.525547349715595]
我々はRectified Robust Policy Optimization (RRPO) と呼ばれる新しいプライマリのみのアルゴリズムを提案する。
RRPOは双対の定式化に頼ることなく、主問題に直接作用する。
我々は、最もよく知られた下界と一致する複雑性を持つ、ほぼ最適な実現可能なポリシーに収束することを示す。
論文 参考訳(メタデータ) (2025-08-24T16:59:38Z) - Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning [66.4260157478436]
政策学習における強化学習について検討する。
目的は、特定の種類の利害関係において最高の政策と競争力のある政策を見つけることである。
論文 参考訳(メタデータ) (2025-07-06T14:40:05Z) - Achieving $\widetilde{\mathcal{O}}(\sqrt{T})$ Regret in Average-Reward POMDPs with Known Observation Models [69.1820058966619]
平均逆無限水平POMDPを未知の遷移モデルで扱う。
この障壁を克服する斬新でシンプルな推定器を提示する。
論文 参考訳(メタデータ) (2025-01-30T22:29:41Z) - Model-Free $\mu$-Synthesis: A Nonsmooth Optimization Perspective [4.477225073240389]
本稿では,重要なポリシー検索ベンチマーク,すなわち$mu$- synthesisを再考する。
本研究では, 段階的な探索手法が, 実際に顕著な数値的な結果をもたらしていることを示す。
論文 参考訳(メタデータ) (2024-02-18T17:17:17Z) - Probabilistic Reach-Avoid for Bayesian Neural Networks [71.67052234622781]
最適合成アルゴリズムは、証明された状態の数を4倍以上に増やすことができることを示す。
このアルゴリズムは、平均的な到達回避確率を3倍以上に向上させることができる。
論文 参考訳(メタデータ) (2023-10-03T10:52:21Z) - Randomized Policy Optimization for Optimal Stopping [0.0]
本稿では,ランダム化線形ポリシーに基づく最適停止手法を提案する。
提案手法は最先端手法を著しく上回り得ることを示す。
論文 参考訳(メタデータ) (2022-03-25T04:33:15Z) - A Reinforcement Learning Approach to the Stochastic Cutting Stock
Problem [0.0]
本稿では,削減された無限水平決定プロセスとして,カットストック問題の定式化を提案する。
最適解は、各状態と決定を関連付け、期待される総コストを最小化するポリシーに対応する。
論文 参考訳(メタデータ) (2021-09-20T14:47:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。