Fugu-MT 論文翻訳(概要): A Novel Framework for Policy Mirror Descent with General Parametrization and Linear Convergence

論文の概要: A Novel Framework for Policy Mirror Descent with General Parametrization and Linear Convergence

arxiv url: http://arxiv.org/abs/2301.13139v1
Date: Mon, 30 Jan 2023 18:21:48 GMT
ステータス: 翻訳完了
システム内更新日: 2023-01-31 13:30:05.316426
Title: A Novel Framework for Policy Mirror Descent with General Parametrization and Linear Convergence
Title（参考訳）: 一般パラメトリゼーションと線形収束を考慮した政策ミラーの新たな枠組み
Authors: Carlo Alfano, Rui Yuan, Patrick Rebeschini
Abstract要約: 一般パラメトリゼーションを自然に許容するミラー降下に基づくポリシー最適化のための新しいフレームワークを提案する。本稿では,浅部ニューラルネットワークを用いたケーススタディを提案する。
参考スコア（独自算出の注目度）: 15.297569497776378
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: Modern policy optimization methods in applied reinforcement learning are often inspired by the trust region policy optimization algorithm, which can be interpreted as a particular instance of policy mirror descent. While theoretical guarantees have been established for this framework, particularly in the tabular setting, the use of a general parametrization scheme remains mostly unjustified. In this work, we introduce a novel framework for policy optimization based on mirror descent that naturally accommodates general parametrizations. The policy class induced by our scheme recovers known classes, e.g. tabular softmax, log-linear, and neural policies. It also generates new ones, depending on the choice of the mirror map. For a general mirror map and parametrization function, we establish the quasi-monotonicity of the updates in value function, global linear convergence rates, and we bound the total variation of the algorithm along its path. To showcase the ability of our framework to accommodate general parametrization schemes, we present a case study involving shallow neural networks.
Abstract（参考訳）: 適用強化学習における最近のポリシー最適化手法は、しばしば信頼領域ポリシー最適化アルゴリズムに触発され、これはポリシーミラー降下の特定の例として解釈できる。この枠組み、特に表の設定において理論的な保証が確立されているが、一般的なパラメトリゼーションスキームの使用はほとんど不当である。本稿では,一般パラメトリゼーションを自然に適応するミラー降下に基づくポリシー最適化のための新しい枠組みを提案する。本手法によって引き起こされるポリシークラスは、表型ソフトマックス、ログ線形、ニューラルポリシーなどの既知のクラスを回復する。また、ミラーマップの選択に応じて新しいものを生成する。一般ミラー写像とパラメトリゼーション関数に対して,値関数の更新と大域的線形収束率の準単調性を確立し,その経路に沿ってアルゴリズム全体の変動を限定した。一般のパラメトリゼーションスキームに対応するためのフレームワークの能力を示すために,浅層ニューラルネットワークを用いたケーススタディを提案する。

関連論文リスト

Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning [66.4260157478436]
政策学習における強化学習について検討する。目的は、特定の種類の利害関係において最高の政策と競争力のある政策を見つけることである。
論文参考訳（メタデータ） (2025-07-06T14:40:05Z)
Convergence of Policy Mirror Descent Beyond Compatible Function Approximation [66.4260157478436]
我々は,より弱い変動支配を前提とした理論的PMD一般政策クラスを開発し,最良クラス政策への収束を得る。我々の主観念は、占有度-勾配測度によって誘導される局所ノルムによって誘導される新しい概念を活用する。
論文参考訳（メタデータ） (2025-02-16T08:05:46Z)
Last-Iterate Global Convergence of Policy Gradients for Constrained Reinforcement Learning [62.81324245896717]
我々はC-PGと呼ばれる探索非依存のアルゴリズムを導入し、このアルゴリズムは(弱)勾配支配仮定の下でのグローバルな最終点収束を保証する。制約付き制御問題に対して,我々のアルゴリズムを数値的に検証し,それらを最先端のベースラインと比較する。
論文参考訳（メタデータ） (2024-07-15T14:54:57Z)
Learning Optimal Deterministic Policies with Stochastic Policy Gradients [62.81324245896716]
政策勾配法(PG法)は連続強化学習(RL法)問題に対処する手法として成功している。一般的には、収束(ハイパー)政治は、決定論的バージョンをデプロイするためにのみ学習される。本稿では,サンプルの複雑性とデプロイされた決定論的ポリシのパフォーマンスのトレードオフを最適化するために,学習に使用する探索レベルの調整方法を示す。
論文参考訳（メタデータ） (2024-05-03T16:45:15Z)
PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback [106.63518036538163]
我々は、強化学習におけるポリシーアライメントの最近強調された重要な問題に対処するために、新しい統合された二段階最適化ベースのフレームワーク、textsfPARLを提案する。本フレームワークは, 上向きの目標(逆設計)の分布を, 下向きの最適変数で明示的にパラメータ化することにより, これらの問題に対処する。その結果,提案したtextsfPARL が RL のアライメントの懸念に対処できる可能性が示唆された。
論文参考訳（メタデータ） (2023-08-03T18:03:44Z)
On Optimal Regularization Parameters via Bilevel Learning [0.06213771671016098]
我々は、既存の理論よりも最適な正則化パラメータの正則性をよりよく特徴づける新しい条件を提供する。数値計算の結果は, この新条件を, 小型・高次元の両問題に対して検証し, 検討した。
論文参考訳（メタデータ） (2023-05-28T12:34:07Z)
A Parametric Class of Approximate Gradient Updates for Policy Optimization [47.69337420768319]
我々は、勾配形式とスケーリング関数の限定的な選択の観点から、基礎となる更新を再表現する統一的な視点を開発する。我々は、収束速度と最終的な結果品質の両方の利点をもたらすことができる方法で、既存のアルゴリズムを一般化する、新しいが、動機のよい更新を得る。
論文参考訳（メタデータ） (2022-06-17T01:28:38Z)
Optimistic Policy Optimization is Provably Efficient in Non-stationary MDPs [113.8752163061151]
非定常線形カーネルマルコフ決定過程(MDP)におけるエピソード強化学習(RL)の研究線形最適化アンダーライン最適化アルゴリズム(PROPO)を提案する。 PROPOはスライディングウィンドウベースのポリシー評価と周期的リスタートベースのポリシー改善の2つのメカニズムを特徴としている。
論文参考訳（メタデータ） (2021-10-18T02:33:20Z)
Policy Mirror Descent for Regularized Reinforcement Learning: A Generalized Framework with Linear Convergence [60.20076757208645]
本稿では,正規化RLを解くためのGPMDアルゴリズムを提案する。我々は,このアルゴリズムが次元自由な方法で,全範囲の学習率に線形に収束することを実証した。
論文参考訳（メタデータ） (2021-05-24T02:21:34Z)
Near Optimal Policy Optimization via REPS [33.992374484681704]
emphrelative entropy policy search (reps) は多くのシミュレーションと実世界のロボットドメインでポリシー学習に成功した。勾配に基づく解法を用いる場合、REPSの性能には保証がない。最適規則化ポリシーに好適な収束を維持するためのパラメータ更新を計算するために,基礎となる決定プロセスへの表現的アクセスを利用する手法を提案する。
論文参考訳（メタデータ） (2021-03-17T16:22:59Z)
Structured Policy Iteration for Linear Quadratic Regulator [40.52288246664592]
構造化線形ポリシーを導出する手法であるLQRに対して,textitStructured Policy Iteration (S-PI)を導入する。このような(ブロック)間隔や低ランクの構造化ポリシーは、標準のLQRポリシーよりも大きな利点がある。既知モデルとモデルフリー設定の両方において、パラメータの適切な選択の下で収束解析を証明している。
論文参考訳（メタデータ） (2020-07-13T06:03:15Z)
Neural Proximal/Trust Region Policy Optimization Attains Globally Optimal Policy [119.12515258771302]
オーバーパラメトリゼーションを備えたPPOOの変種が,グローバルな最適ネットワークに収束することを示す。我々の分析の鍵は、1次元の単調性の概念の下で無限勾配の反復であり、そこでは勾配はネットワークによって瞬く。
論文参考訳（メタデータ） (2019-06-25T03:20:04Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。