論文の概要: Convergence and Regret of the Policy Gradient for Multi-Armed Bandits in Diffusion Environment
- arxiv url: http://arxiv.org/abs/2607.29593v1
- Date: Fri, 31 Jul 2026 16:19:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.7952
- Title: Convergence and Regret of the Policy Gradient for Multi-Armed Bandits in Diffusion Environment
- Title(参考訳): 拡散環境における多要素帯域の収束と緩和
- Authors: Yanwei Jia, Du Ouyang,
- Abstract要約: 任意の一定の学習率で最適アームにほぼ確実に収束することを示す。
また,一定学習率が時間不変しきい値以下である場合,非漸近的後悔上限を導出する。
さらに、同じリャプノフ関数は離散時間ポリシー勾配アルゴリズムの解析にも有用である。
- 参考スコア(独自算出の注目度): 3.007949058551534
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper studies the policy gradient update for a multi-arm bandit problem in diffusion environment that is described by a stochastic differential equation (SDE) under the continuous-time reinforcement learning framework by Wang et al. (2020), Jia and Zhou (2022b). With the logit parameterization for the stochastic policy, we show that it converges almost surely to the optimal arm under an arbitrary constant learning rate. Furthermore, we derive the non-asymptotic regret upper bound when the constant learning rate is below a time-invariant threshold; and the regret bound has order $O(\log T)$. We improve the analysis in Lattimore (2026a) for the same SDE by constructing a novel Lyapunov function and demonstrate the transparency of analyzing policy gradient using the tools in SDEs. In addition, the same Lyapunov function is also helpful in analyzing the discrete-time policy gradient algorithm.
- Abstract(参考訳): 本稿では,Wang et al (2020), Jia and Zhou (2022b) による連続時間強化学習フレームワークの下で,確率微分方程式(SDE)により記述された拡散環境におけるマルチアームバンディット問題のポリシー勾配更新について検討する。
確率的ポリシのロジットパラメータ化により、任意の定値学習率で最適アームにほぼ確実に収束することを示す。
さらに, 一定学習率が時間不変しきい値以下である場合, 非漸近的後悔上限を導出し, 後悔限界は$O(\log T)$である。
我々は、新しいリャプノフ関数を構築することにより、同じSDEに対するLattimore (2026a)の分析を改善し、SDEのツールを用いた政策勾配の分析の透明性を実証する。
さらに、同じリャプノフ関数は離散時間ポリシー勾配アルゴリズムの解析にも有用である。
関連論文リスト
- Stability and convergence analysis of AdaGrad for non-convex optimization via novel stopping time-based techniques [17.34603953600226]
適応勾配(AdaGrad)は、ディープラーニングの強力なツールとして登場した。
AdaGradを包括的に分析し、文献の既存のギャップを埋める。
論文 参考訳(メタデータ) (2024-09-08T08:29:51Z) - Convergence Analysis for Entropy-Regularized Control Problems: A Probabilistic Approach [19.742628365680353]
一般の連続時間エントロピー正規化制御問題に対するポリシ・イット・アルゴリズム(PIA)の収束性について検討する。
本手法は, 1次元の拡散制御ケースに拡張可能であることを示す。
論文 参考訳(メタデータ) (2024-06-16T14:31:26Z) - Learning Optimal Deterministic Policies with Stochastic Policy Gradients [62.81324245896716]
政策勾配法(PG法)は連続強化学習(RL法)問題に対処する手法として成功している。
一般的には、収束(ハイパー)政治は、決定論的バージョンをデプロイするためにのみ学習される。
本稿では,サンプルの複雑性とデプロイされた決定論的ポリシのパフォーマンスのトレードオフを最適化するために,学習に使用する探索レベルの調整方法を示す。
論文 参考訳(メタデータ) (2024-05-03T16:45:15Z) - Faster Convergence of Stochastic Accelerated Gradient Descent under Interpolation [51.248784084461334]
我々はNesterov加速度アンダーホ条件の一般化版に対する新しい収束率を証明した。
本分析により, 従来の研究に比べて, 強い成長定数への依存度を$$$から$sqrt$に下げることができた。
論文 参考訳(メタデータ) (2024-04-03T00:41:19Z) - Bregman Gradient Policy Optimization [97.73041344738117]
本稿では,Bregmanの発散と運動量に基づく強化学習のためのBregmanグラデーションポリシーの最適化を設計する。
VR-BGPOは、各イテレーションで1つの軌道のみを必要とする$epsilon$stationaryポイントを見つけるために、$tilde(epsilon-3)$で最高の複雑性に達する。
論文 参考訳(メタデータ) (2021-06-23T01:08:54Z) - Is Temporal Difference Learning Optimal? An Instance-Dependent Analysis [102.29671176698373]
我々は、割引決定過程における政策評価の問題に対処し、生成モデルの下で、ll_infty$errorに対するマルコフに依存した保証を提供する。
我々は、ポリシー評価のために、局所ミニマックス下限の両漸近バージョンと非漸近バージョンを確立し、アルゴリズムを比較するためのインスタンス依存ベースラインを提供する。
論文 参考訳(メタデータ) (2020-03-16T17:15:28Z) - Sampling and Update Frequencies in Proximal Variance-Reduced Stochastic
Gradient Methods [0.0]
本稿では, 一般近似分散還元勾配法を提案し, 強い凸性仮定の下で解析する。
このアルゴリズムの特別な例は、SAGA、L-SVRGとその近位変種である。
論文 参考訳(メタデータ) (2020-02-13T14:56:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。