論文の概要: Hierarchical Multilevel Monte Carlo for Order-Optimal Neural Actor-Critic in Average-Reward CMDPs
- arxiv url: http://arxiv.org/abs/2607.28390v2
- Date: Sat, 01 Aug 2026 21:45:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.182822
- Title: Hierarchical Multilevel Monte Carlo for Order-Optimal Neural Actor-Critic in Average-Reward CMDPs
- Title(参考訳): 平均逆CMDPにおける次数最適ニューラルアクター臨界に対する階層的マルチレベルモンテカルロ
- Abstract要約: 本研究では,最適性ギャップと$tildeO(T-1/2)$の制約違反を両立させるアルゴリズムを開発した。
これは、一般的な政策パラメータ化とニューラル批評家による無限水平平均逆CMDPに対する最初の順序最適収束保証を確立する。
- 参考スコア(独自算出の注目度): 46.80389197344682
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Constrained Markov Decision Processes (CMDPs) provide a natural framework for reinforcement learning in safety-critical applications, where agents maximize long-term reward while satisfying long-term constraints. Although primal-dual actor-critic methods with linear critics are well understood, extending order-optimal convergence guarantees to neural critics in average-reward CMDPs has remained open. The main challenge is a fundamental bias-cost trade-off in neural critic estimation: under Neural Tangent Kernel (NTK) analysis, reducing critic bias substantially increases critic optimization cost, preventing order-optimal convergence in the primal-dual framework. We resolve this bottleneck by introducing a hierarchical Multilevel Monte Carlo (MLMC) neural critic that performs debiasing simultaneously across trajectory sampling and critic optimization. The resulting estimator attains the bias of a long critic optimization run with only logarithmic expected sample cost. Building on this estimator, we develop a primal-dual Natural Actor-Critic algorithm that achieves both an optimality gap and a constraint violation of order $\tilde{O}(T^{-1/2})$. This establishes the first order-optimal convergence guarantees for infinite-horizon average-reward CMDPs with general policy parameterization and neural critics, while eliminating the need to know the underlying mixing time. Our results are novel even in the unconstrained setting.
- Abstract(参考訳): 制約付きマルコフ決定プロセス(CMDP)は、安全クリティカルなアプリケーションにおける強化学習のための自然な枠組みを提供する。
線形批判を伴う原始的二元的アクター批判法はよく理解されているが、平均回帰CMDPにおけるニューラル評論家に対する順序最適収束の保証は、まだオープンである。
ニューラル・タンジェント・カーネル(NTK)分析では、批判バイアスの低減は批評家の最適化コストを大幅に増加させ、原始双対フレームワークにおける順序-最適収束を防止します。
我々はこのボトルネックを解決するために、階層的マルチレベルモンテカルロ(MLMC)神経評論家を導入し、軌道サンプリングと批判最適化を同時に行う。
得られた推定器は、対数的な予測サンプルコストのみで長い批評家最適化のバイアスを得る。
この推定器を用いて、最適性ギャップと次数$\tilde{O}(T^{-1/2})$の制約違反を両立させるプリマル・デュアル・ナチュラル・アクター・クリティカルアルゴリズムを開発した。
これにより、一般的な政策パラメータ化と神経評論家を伴う無限水平平均逆CMDPに対する最初の順序最適収束保証が確立され、基礎となる混合時間を知る必要がなくなる。
私たちの結果は制約のない環境でも新規です。
関連論文リスト
- Near-Optimal Primal-Dual Algorithm for Learning Linear Mixture CMDPs with Adversarial Rewards [0.8984888893275712]
有限-水平線形混合制約マルコフ決定過程における安全強化学習について検討する。
本稿では, 後悔と制約違反境界を実現するプリミティブ・デュアルポリシー最適化アルゴリズムを提案する。
これは、線形混合CMDPと逆効果を持つ最初の証明可能な効率のよいアルゴリズムである。
論文 参考訳(メタデータ) (2026-03-29T21:51:33Z) - Global Convergence of Average Reward Constrained MDPs with Neural Critic and General Policy Parameterization [44.90217052441265]
無限水平制約マルコフ決定過程(CMDP)について,一般政策パラメータ化と多層ニューラルネットワーク評論家を用いて検討する。
本稿では,ニューラル評論家推定と自然政策勾配の更新を統合した原始二重自然なアクター批判アルゴリズムを提案する。
我々は,政策や批判クラスによって引き起こされる近似誤差に対して,$tildemathcalO(T-1/4)$のグローバル収束および累積制約違反率を確立する。
論文 参考訳(メタデータ) (2026-03-08T15:53:59Z) - Regret Analysis of Unichain Average Reward Constrained MDPs with General Parameterization [47.72469270565647]
無限水平平均逆制約マルコフ決定過程 (CMDP) を一鎖の仮定と一般政策パラメーター化の下で検討する。
本研究では,マルチレベルモンテカルロ推定器と,混合時間オークルを必要とせず,一鎖動力学を扱う明示的なバーンイン機構を活用する。
論文 参考訳(メタデータ) (2026-02-08T14:54:02Z) - Finite-Sample Analysis of Policy Evaluation for Robust Average Reward Reinforcement Learning [50.81240969750462]
我々は、ロバスト平均マルコフ決定過程(PMD)における政策評価の第1次有限サンプル解析を提案する。
頑健なベルマン作用素は、慎重に構築された半ノルムの下で収縮し、制御バイアスを持つフレームワークを開発することを示す。
本手法は,ロバストな政策評価とロバストな平均報酬推定のために,$tildemathcalO(epsilon-2)$のオーダー最適サンプル複雑性を実現する。
論文 参考訳(メタデータ) (2025-02-24T03:55:09Z) - A Single-Loop Deep Actor-Critic Algorithm for Constrained Reinforcement Learning with Provable Convergence [7.586600116278698]
Deep Actor-Critic Network (DNN)は、Actor-Critic Network (DNN)とDeep Neural Network (DNN)を組み合わせたネットワークである。
Deep Actor-Critic Network (DNN)は、Actor-Critic Network (DNN)とDeep Neural Network (DNN)を組み合わせたネットワークである。
Deep Actor-Critic Network (DNN)は、Actor-Critic Network (DNN)とDeep Neural Network (DNN)を組み合わせたネットワークである。
Deep Actor-Critic Network (DNN)は、Actor-Critic Network (DNN)とDeep Neural Network (DNN)を組み合わせたネットワークである。
Deep Actor-Critic Network (DNN)
論文 参考訳(メタデータ) (2023-06-10T10:04:54Z) - Finite-Time Complexity of Online Primal-Dual Natural Actor-Critic Algorithm for Constrained Markov Decision Processes [13.908826484332282]
そこで我々は,コストの抑えられたマルコフ決定プロセス問題を解決するために,オンライン・プリマル・デュアル・アクター・クリティカル法について検討した。
本稿では,CMDP問題の解法として,オンライン・プリマル・デュアル・アクター・クリティカル法の有限時間複雑性を初めて検討した。
論文 参考訳(メタデータ) (2021-10-21T18:05:40Z) - Faster Algorithm and Sharper Analysis for Constrained Markov Decision
Process [56.55075925645864]
制約付き意思決定プロセス (CMDP) の問題点について検討し, エージェントは, 複数の制約を条件として, 期待される累積割引報酬を最大化することを目的とする。
新しいユーティリティ・デュアル凸法は、正規化ポリシー、双対正則化、ネステロフの勾配降下双対という3つの要素の新たな統合によって提案される。
これは、凸制約を受ける全ての複雑性最適化に対して、非凸CMDP問題が$mathcal O (1/epsilon)$の低い境界に達する最初の実演である。
論文 参考訳(メタデータ) (2021-10-20T02:57:21Z) - Doubly Robust Off-Policy Actor-Critic: Convergence and Optimality [131.45028999325797]
ディスカウント型MDPのための2倍堅牢なオフポリチックAC(DR-Off-PAC)を開発した。
DR-Off-PACは、俳優と批評家の両方が一定のステップで同時に更新される単一のタイムスケール構造を採用しています。
有限時間収束速度を研究し, dr-off-pac のサンプル複雑性を特徴とし, $epsilon$-accurate optimal policy を得る。
論文 参考訳(メタデータ) (2021-02-23T18:56:13Z) - Single-Timescale Actor-Critic Provably Finds Globally Optimal Policy [122.01837436087516]
我々は、強化学習アルゴリズムの最も一般的なファミリーの一つであるアクター批判のグローバル収束とグローバル最適性について研究する。
線形関数近似を用いたシングルタイムスケールアクター批評家の収束率と大域的最適性を確立した。
論文 参考訳(メタデータ) (2020-08-02T14:01:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。