Fugu-MT 論文翻訳(概要): An Analytical Update Rule for General Policy Optimization

論文の概要: An Analytical Update Rule for General Policy Optimization

arxiv url: http://arxiv.org/abs/2112.02045v1
Date: Fri, 3 Dec 2021 17:50:11 GMT
ステータス: 翻訳完了
システム内更新日: 2021-12-06 15:56:01.831056
Title: An Analytical Update Rule for General Policy Optimization
Title（参考訳）: 一般政策最適化のための分析更新ルール
Authors: Hepeng Li, Nicholas Clavette and Haibo He
Abstract要約: パラメータ化関数近似器に依存しない解析的ポリシー更新ルールを提案する。更新ルールは、モノトニック改善を保証する一般的なポリシーに適している。
参考スコア（独自算出の注目度）: 27.934715480016006
License: http://creativecommons.org/licenses/by-nc-sa/4.0/
Abstract: We present an analytical policy update rule that is independent of parameterized function approximators. The update rule is suitable for general stochastic policies with monotonic improvement guarantee. The update rule is derived from a closed-form trust-region solution using calculus of variation, following a new theoretical result that tightens existing bounds for policy search using trust-region methods. An explanation building a connection between the policy update rule and value-function methods is provided. Based on a recursive form of the update rule, an off-policy algorithm is derived naturally, and the monotonic improvement guarantee remains. Furthermore, the update rule extends immediately to multi-agent systems when updates are performed by one agent at a time.
Abstract（参考訳）: パラメータ化関数近似器に依存しない解析的ポリシー更新ルールを提案する。更新規則は、単調な改善を保証する一般的な確率的ポリシーに適している。更新ルールは,信頼領域法を用いた政策探索の既存の境界を厳格化する新たな理論的結果に続いて,変動計算を用いた閉形式信頼領域解から導出される。ポリシー更新ルールと値関数メソッドとの接続を構築する説明を提供する。更新ルールの再帰形式に基づいて、非政治アルゴリズムが自然に導出され、単調な改善保証が残る。さらに、更新ルールは、一度に1つのエージェントによって更新が行われると、すぐにマルチエージェントシステムに拡張される。

関連論文リスト

Achieve Performatively Optimal Policy for Performative Reinforcement Learning [55.983627302691424]
本研究は,0階次FrankWolfe- (0FW) アルゴリズムを提案する。実験結果から, 所望のPOポリシを求める場合, 既存の近似よりも0FWの方が有効であることが示唆された。
論文参考訳（メタデータ） (2025-10-06T01:56:31Z)
Convergence of Policy Mirror Descent Beyond Compatible Function Approximation [66.4260157478436]
我々は,より弱い変動支配を前提とした理論的PMD一般政策クラスを開発し,最良クラス政策への収束を得る。我々の主観念は、占有度-勾配測度によって誘導される局所ノルムによって誘導される新しい概念を活用する。
論文参考訳（メタデータ） (2025-02-16T08:05:46Z)
Divergence-Augmented Policy Optimization [12.980566919112034]
本稿では,非政治データの再利用時にポリシー最適化を安定化させる手法を提案する。その考え方は、データを生成する行動ポリシーと現在のポリシーをBregmanに分けて、非政治データによる小規模で安全なポリシー更新を保証する、というものだ。 Atariゲームにおける実証実験により,非政治データの再利用が必要なデータ共有シナリオにおいて,本手法は他の最先端の深層強化学習アルゴリズムよりも優れた性能が得られることが示された。
論文参考訳（メタデータ） (2025-01-25T02:35:46Z)
Last-Iterate Convergent Policy Gradient Primal-Dual Methods for Constrained MDPs [107.28031292946774]
無限水平割引マルコフ決定過程(拘束型MDP)の最適ポリシの計算問題について検討する。我々は, 最適制約付きポリシーに反復的に対応し, 非漸近収束性を持つ2つの単一スケールポリシーに基づく原始双対アルゴリズムを開発した。我々の知る限り、この研究は制約付きMDPにおける単一時間スケールアルゴリズムの非漸近的な最後の収束結果となる。
論文参考訳（メタデータ） (2023-06-20T17:27:31Z)
Trust-Region-Free Policy Optimization for Stochastic Policies [60.52463923712565]
本研究では,政策に対する信頼領域の制約が,基礎となるモノトニック改善の保証を損なうことなく,信頼領域のない制約によって安全に置き換えられることを示す。我々は,TREFree(Trust-Region-Free Policy Optimization)と呼ばれるアルゴリズムを,信頼領域の制約が不要であるとして明示する。
論文参考訳（メタデータ） (2023-02-15T23:10:06Z)
Sample Complexity of Policy-Based Methods under Off-Policy Sampling and Linear Function Approximation [8.465228064780748]
政策評価には、オフ政治サンプリングと線形関数近似を用いる。自然政策勾配(NPG)を含む様々な政策更新規則が政策更新のために検討されている。我々は、最適なポリシーを見つけるために、合計$mathcalO(epsilon-2)$サンプルの複雑さを初めて確立する。
論文参考訳（メタデータ） (2022-08-05T15:59:05Z)
A Parametric Class of Approximate Gradient Updates for Policy Optimization [47.69337420768319]
我々は、勾配形式とスケーリング関数の限定的な選択の観点から、基礎となる更新を再表現する統一的な視点を開発する。我々は、収束速度と最終的な結果品質の両方の利点をもたらすことができる方法で、既存のアルゴリズムを一般化する、新しいが、動機のよい更新を得る。
論文参考訳（メタデータ） (2022-06-17T01:28:38Z)
Beyond the Policy Gradient Theorem for Efficient Policy Updates in Actor-Critic Algorithms [10.356356383401566]
強化学習では、ある状態における最適な行動は、その後の状態における政策決定に依存する。政策勾配定理は, 目標値に対する構造対称性のため, 未学習の遅い政策更新を規定する。我々は、その欠陥を欠いたポリシー更新を導入し、古典的な仮定で$mathcalO(t-1)$で、グローバル最適性への収束の保証を証明した。
論文参考訳（メタデータ） (2022-02-15T15:04:10Z)
Global Optimality and Finite Sample Analysis of Softmax Off-Policy Actor Critic under State Distribution Mismatch [29.02336004872336]
我々は、非政治アクター批評家アルゴリズムのグローバル最適性と収束率を確立する。私たちの研究は、政策勾配法の最適性に関する既存の研究を超えています。
論文参考訳（メタデータ） (2021-11-04T16:48:45Z)
Policy Mirror Descent for Regularized Reinforcement Learning: A Generalized Framework with Linear Convergence [60.20076757208645]
本稿では,正規化RLを解くためのGPMDアルゴリズムを提案する。我々は,このアルゴリズムが次元自由な方法で,全範囲の学習率に線形に収束することを実証した。
論文参考訳（メタデータ） (2021-05-24T02:21:34Z)
Dealing with Non-Stationarity in Multi-Agent Reinforcement Learning via Trust Region Decomposition [52.06086375833474]
非定常性は多エージェント強化学習における厄介な問題である。ポリシーシーケンスの定常性を明示的にモデル化するための$delta$-stationarity測定を導入する。共同政策の分岐を推定するために,メッセージパッシングに基づく信頼領域分解ネットワークを提案する。
論文参考訳（メタデータ） (2021-02-21T14:46:50Z)
Ensuring Monotonic Policy Improvement in Entropy-regularized Value-based Reinforcement Learning [14.325835899564664]
Entropy-regularized value-based reinforcement learning methodは、ポリシー更新毎にポリシーの単調な改善を保証する。本稿では,政策変動緩和のためのポリシー更新の度合いを調整するための基準として,この下界を利用した新しい強化学習アルゴリズムを提案する。
論文参考訳（メタデータ） (2020-08-25T04:09:18Z)
Stable Policy Optimization via Off-Policy Divergence Regularization [50.98542111236381]
信頼地域政策最適化(TRPO)とPPO(Pximal Policy Optimization)は、深層強化学習(RL)において最も成功した政策勾配アプローチの一つである。本稿では, 連続的な政策によって引き起こされる割引状態-行動訪問分布を, 近接項で抑制し, 政策改善を安定化させる新しいアルゴリズムを提案する。提案手法は, ベンチマーク高次元制御タスクの安定性と最終的な性能向上に有効である。
論文参考訳（メタデータ） (2020-03-09T13:05:47Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。