論文の概要: Second-Order Actor-Critic Methods for Discounted MDPs via Policy Hessian Decomposition
- arxiv url: http://arxiv.org/abs/2605.14982v1
- Date: Thu, 14 May 2026 15:46:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.92116
- Title: Second-Order Actor-Critic Methods for Discounted MDPs via Policy Hessian Decomposition
- Title(参考訳): 政策ヘシアン分解による分散MDPの2次アクター臨界法
- Abstract要約: 目的の曲率情報をフル活用したアクター更新の2次近似を解析する。
本研究では,この近似が2段階のアクター批判的枠組みの下で適切に修正されることを示す。
この知見に基づいて、割引報酬設定のための2次アクター批判法を定式化する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We address the discounted reward setting in reinforcement learning (RL). To mitigate the value approximation challenges in policy gradient methods, actor-critic approaches have been developed and are known to converge to stationary points under suitable assumptions. However, these methods rely on first-order updates. In contrast, second-order optimization provides principled curvature-aware updates that are proven to accelerate convergence, but its application in RL is limited by the computational complexity of Hessian estimation. In this work, we analyze second-order approximations for the actor update that leverage the full curvature information of the objective as much as possible. A stable approximation requires treating the action-value function as locally constant with respect to policy parameters, which does not generally hold in policy gradient methods. We show that this approximation becomes well-justified under a two-timescale actor-critic framework, where the critic evolves on a faster timescale and can be treated as quasi-stationary during actor updates. Building on this insight, we formulate a second-order actor-critic method for the discounted reward setting that leverages Hessian-vector product (HVP) computations, resulting in a computationally efficient and stable second-order update.
- Abstract(参考訳): 強化学習(RL)における割引報酬設定について検討する。
政策勾配法における値近似の課題を軽減するため、アクター-批判的アプローチが開発され、適切な仮定の下で定常点に収束することが知られている。
しかし、これらの手法は1次更新に依存している。
対照的に、二階最適化は収束を加速することが証明された原則付き曲率対応の更新を提供するが、RLにおけるその適用はヘッセン推定の計算複雑性によって制限される。
本研究では,対象物の曲率情報を可能な限り活用するアクター更新の2次近似を解析する。
安定近似では、アクション値関数をポリシーパラメータに関して局所定数として扱う必要があり、一般にポリシー勾配法では成り立たない。
この近似は、批評家がより高速な時間スケールで進化し、アクター更新時に準静止状態として扱われる2段階のアクター批判的枠組みの下で、適切に修正されることを示す。
この知見に基づいて,HVP(Hessian-vector Product)計算を利用する割引報酬設定のための2次アクター批判法を定式化し,計算効率が高く安定した2次更新を行う。
関連論文リスト
- Actor-Critic with Active Importance Sampling [61.41272490044518]
本稿では,Active-Importance-Sampling Actor-Critic (AISAC)アルゴリズムを提案する。
AISACはActor-Criticフレームワークの拡張であり、ポリシー勾配推定のばらつきを低減する。
実験では、標準的なアクター・クライブ法と比較して学習速度、サンプル効率、トレーニングが改善された。
論文 参考訳(メタデータ) (2026-05-08T01:21:32Z) - Quasi-Newton Compatible Actor-Critic for Deterministic Policies [2.745166507489733]
強化学習における2次決定論的アクター批判的枠組みを提案する。
我々は、真の政策勾配とパフォーマンス・ヘッセンの近似を同時に保存する二次的批判を導入する。
論文 参考訳(メタデータ) (2025-11-12T17:49:02Z) - Policy Gradient with Second Order Momentum [2.44755919161855]
第2次モメンタムによるポリシーグラディエント(PG-SOM)は、強化学習政策のための軽量な2次最適化スキームである。
PG-SOMは古典的なREINFORCE更新を2つの指数関数的に重み付けされた統計量で強化している。
標準制御ベンチマークの実験では、サンプル効率が2.1倍に向上し、第1次やフィッシャー・マトリクスのベースラインに比べてかなりのばらつきが減少した。
論文 参考訳(メタデータ) (2025-05-16T06:23:53Z) - On the Second-Order Convergence of Biased Policy Gradient Algorithms [11.955062839855334]
勾配ポリシーは2階の定常点でサドルを逃れる。
バイアス勾配法の新しい2次解析法を提案する。
また,チェーンの初期状態分布の収束点を確立する。
論文 参考訳(メタデータ) (2023-11-05T02:33:30Z) - A Two-Time-Scale Stochastic Optimization Framework with Applications in Control and Reinforcement Learning [13.908826484332282]
最適化問題の解法として,新しい2段階勾配法を提案する。
最初の貢献は、提案した2時間スケール勾配アルゴリズムの有限時間複雑性を特徴づけることである。
我々は、強化学習における勾配に基づく政策評価アルゴリズムに適用する。
論文 参考訳(メタデータ) (2021-09-29T23:15:23Z) - Doubly Robust Off-Policy Actor-Critic: Convergence and Optimality [131.45028999325797]
ディスカウント型MDPのための2倍堅牢なオフポリチックAC(DR-Off-PAC)を開発した。
DR-Off-PACは、俳優と批評家の両方が一定のステップで同時に更新される単一のタイムスケール構造を採用しています。
有限時間収束速度を研究し, dr-off-pac のサンプル複雑性を特徴とし, $epsilon$-accurate optimal policy を得る。
論文 参考訳(メタデータ) (2021-02-23T18:56:13Z) - Variance Penalized On-Policy and Off-Policy Actor-Critic [60.06593931848165]
本稿では,平均値と変動値の両方を含むパフォーマンス基準を最適化する,オン・ポリティィおよびオフ・ポリティィ・アクター・クリティカルなアルゴリズムを提案する。
提案手法は, アクタ批判的かつ事前の分散-ペナライゼーションベースラインに匹敵するだけでなく, リターンのばらつきが低いトラジェクトリも生成する。
論文 参考訳(メタデータ) (2021-02-03T10:06:16Z) - Average-Reward Off-Policy Policy Evaluation with Function Approximation [66.67075551933438]
平均報酬MDPの関数近似によるオフポリシ政策評価を検討する。
ブートストラップは必要であり、オフポリシ学習とFAと一緒に、致命的なトライアドをもたらす。
そこで本研究では,勾配型tdアルゴリズムの成功を再現する2つの新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-01-08T00:43:04Z) - Single-Timescale Actor-Critic Provably Finds Globally Optimal Policy [122.01837436087516]
我々は、強化学習アルゴリズムの最も一般的なファミリーの一つであるアクター批判のグローバル収束とグローバル最適性について研究する。
線形関数近似を用いたシングルタイムスケールアクター批評家の収束率と大域的最適性を確立した。
論文 参考訳(メタデータ) (2020-08-02T14:01:49Z) - Kalman meets Bellman: Improving Policy Evaluation through Value Tracking [59.691919635037216]
政策評価は強化学習(RL)における重要なプロセスである
我々はKalman Optimization for Value Approximation (KOVA)と呼ばれる最適化手法を考案した。
KOVAはパラメータとノイズリターンの不確実性の両方に関する正規化対象関数を最小化する。
論文 参考訳(メタデータ) (2020-02-17T13:30:43Z) - Greedy Actor-Critic: A New Conditional Cross-Entropy Method for Policy
Improvement [31.602912612167856]
本研究では,クロスエントロピー法(CEM)を入力条件(状態)に拡張したアクタの代替更新について検討する。
この濃度の速度は、アクターよりも遅い速度で集中する提案ポリシーによって制御される。
我々は,アクター更新にCCEMを使用するGreedy ACアルゴリズムが,ソフトアクター・クライブよりも優れ,エントロピー・レギュラー化に対する感度がはるかに低いことを実証的に示す。
論文 参考訳(メタデータ) (2018-10-22T06:35:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。