論文の概要: Unregularized Convergence of Single-Loop, Entropy-Regularized Natural Actor-Critic
- arxiv url: http://arxiv.org/abs/2608.19587v1
- Date: Thu, 20 Aug 2026 03:08:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.4393
- Title: Unregularized Convergence of Single-Loop, Entropy-Regularized Natural Actor-Critic
- Title(参考訳): 単一ループ型エントロピー型自然アクターの非正規化収束
- Abstract要約: エントロピー正則化は自然政策勾配法の安定化と加速に広く用いられている。
我々は1ループのエントロピー規則化自然アクター・クライトを解析する。
非中心的な批評家を訓練することで、トレーニング方針が決定論に近づいたとしても、我々の批判的追跡は安定し続けることができる。
- 参考スコア(独自算出の注目度): 3.756550107432323
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: While entropy regularization is widely used to stabilize and accelerate Natural Policy Gradient methods, its ability to yield faster convergence rates for the unregularized objective remains underexplored. Existing analyses often rely on double-loop architectures and invoke a linear entropy penalty. To bridge the gap between theory and practice, we analyze a single-loop, entropy-regularized Natural Actor-Critic algorithm under compatible linear function approximation. By training an uncentered critic, our critic tracking can remain stable even as the training policy approaches determinism and the Fisher information matrix degenerates. We focus on two primary regimes for the optimization landscape: a Stochastic Regime, where we fuse coupled actor-critic updates into a joint Lyapunov recurrence, and a Deterministic Regime, where we pivot to a Policy Mirror Descent framework to circumvent the collapse of Euclidean geometry. By exploiting a positive Minimal Action Gap in the unregularized Markov decision process, we introduce an Exponential Translation mechanism that maps the regularized gap to the unregularized one up to an exponentially decaying tail. By tuning the fixed temperature, our algorithm achieves accelerated unregularized convergence rates, up to approximation-error terms: $\tilde{\mathcal{O}}(T_{total}^{-1})$ in the Stochastic Regime, and $\tilde{\mathcal{O}}(T_{total}^{-2/3})$ for the average iterate alongside $\tilde{\mathcal{O}}(T_{total}^{-1/3})$ for the last iterate in the Deterministic Regime. Here, $T_{total}$ denotes the total number of stochastic critic updates (or Monte Carlo rollouts). Furthermore, in the tabular setting, our positive-action-gap analysis yields a $\tilde{\mathcal{O}}(T_{total}^{-2/3})$ average-iterate rate, surpassing the $\mathcal{O}(T_{total}^{-1/2})$ worst-case statistical barrier that applies without a positive action margin.
- Abstract(参考訳): エントロピー正則化は自然政策グラディエント法を安定化・加速するために広く用いられているが、非正規化対象に対するより高速な収束率を得る能力はいまだ探索されていない。
既存の分析はしばしば二重ループアーキテクチャに依存し、線形エントロピーペナルティを生じさせる。
理論と実践のギャップを埋めるため,線形関数近似の下で1ループのエントロピー規則化自然アクター・クリティカルアルゴリズムを解析する。
非中心的な批評家を訓練することで、トレーニング方針が決定論に近づき、フィッシャー情報行列が退化しても、我々の批評家追跡は安定している。
我々は、最適化ランドスケープの2つの主要なレジームに焦点を当てる: 確率的レジーム: アクターと批評家の同時更新を共同でリアプノフの再発に融合させる、決定論的レジーム: ユークリッド幾何学の崩壊を回避するために、政策鏡のDescentフレームワークに転換する、決定論的レジーム。
非正規化マルコフ決定過程における正の最小作用ギャップを利用することにより、正規化されたギャップを非正規化されたギャップを指数的に減衰するテールにマッピングする指数変換機構を導入する。
固定温度を調整することにより、近似誤差の項である $\tilde{\mathcal{O}}(T_{total}^{-1})$, $\tilde{\mathcal{O}}(T_{total}^{-2/3})$, $\tilde{\mathcal{O}}(T_{total}^{-1/3})$。
ここで、$T_{total}$は確率的批判の更新(あるいはモンテカルロのロールアウト)の総数を表す。
さらに、表の設定では、我々の正のアクションギャップ分析は、正のアクションマージンを伴わない最悪の統計的障壁である$\tilde{\mathcal{O}}(T_{total}^{-2/3})$平均定位率を上回り、$\mathcal{O}(T_{total}^{-1/2})$平均値を超える。
関連論文リスト
- Stability and Generalization of Straight-Through Estimators for Training Two-Layer Quantized Neural Networks [16.84694273405234]
ヒンジロスを伴う2層2層活性化ネットワークを訓練するための恒常的ストレートスルー推定器(STE)について検討した。
我々の中心的な問題は、アルゴリズム安定性が不連続なSTEトレーニングルールによって生成される推定器の統計的一般化を説明することができるかどうかである。
論文 参考訳(メタデータ) (2026-09-06T07:12:16Z) - Near-Optimal Regret in Adversarial Kernel Bandits [50.68324062892194]
本稿では,各ラウンドにおける損失が任意の有界要素によって誘導される逆カーネルバンドイット問題について検討する。
我々の主な結果は、$widetildeObig(sqrtT, d_*(),log|X|big)$, ここでは$d_*()$は有効次元の広く解釈された概念である。
論文 参考訳(メタデータ) (2026-05-26T06:10:24Z) - Regularized Online RLHF with Generalized Bilinear Preferences [68.44113000390544]
一般的な嗜好を伴う文脈的オンラインRLHFの問題を考える。
一般化された双線形選好モデルを用いて、低ランクなスキュー対称行列による選好を捉える。
グリーディポリシーの双対ギャップは推定誤差の正方形によって有界であることを示す。
論文 参考訳(メタデータ) (2026-02-26T15:27:53Z) - Convergence Rate of the Last Iterate of Stochastic Proximal Algorithms [8.636513507553504]
加算合成凸最適化問題を解くための2つの古典的アルゴリズムを解析する。
我々は、最後の反復収束率を得るために、一般的だが厳密な有界分散仮定に焦点を当てる。
本結果は,複数タスクおよびフェデレーション学習において発生するグラフ誘導正規化器に直接適用し,協調グラフのエッジ上の和として正規化器を分解する。
論文 参考訳(メタデータ) (2026-02-05T09:50:06Z) - Optimal Rates in Continual Linear Regression via Increasing Regularization [39.30412893918111]
本研究では,ランダムなタスク順序付けの下での連続線形回帰について検討する。
この設定では、$k$学習後の最悪の損失は、$Omega (1/k)$の低いバウンドを認める。
明示的等方的$ell$正則化と有限ステップ予算による暗黙的正則化という2つのよく使われる正則化スキームを用いる。
論文 参考訳(メタデータ) (2025-06-06T19:51:14Z) - Nonasymptotic Analysis of Stochastic Gradient Descent with the Richardson-Romberg Extrapolation [22.652143194356864]
本研究では, 勾配勾配勾配(SGD)を一定のステップサイズで解くことで, 密接な凸と滑らかな問題を解く問題に対処する。
得られた推定子の平均二乗誤差を、反復数$n$に対して拡張する。
我々の分析は、時相マルコフ連鎖と見なされるSGDの特性に依存している。
論文 参考訳(メタデータ) (2024-10-07T15:02:48Z) - Cyclic Block Coordinate Descent With Variance Reduction for Composite
Nonconvex Optimization [26.218670461973705]
非漸近勾配ノルム保証を協調する問題の解法を提案する。
本研究は,ニューラルネットの深部学習における循環還元方式の有効性を実証するものである。
論文 参考訳(メタデータ) (2022-12-09T19:17:39Z) - Beyond Exact Gradients: Convergence of Stochastic Soft-Max Policy Gradient Methods with Entropy Regularization [20.651913793555163]
古典的エントロピー正規化政策勾配法をソフトマックス政策パラメトリゼーションで再検討する。
提案したアルゴリズムに対して,大域的最適収束結果と$widetildemathcalO(frac1epsilon2)$のサンプル複雑性を確立する。
論文 参考訳(メタデータ) (2021-10-19T17:21:09Z) - Optimal policy evaluation using kernel-based temporal difference methods [78.83926562536791]
カーネルヒルベルト空間を用いて、無限水平割引マルコフ報酬過程の値関数を推定する。
我々は、関連するカーネル演算子の固有値に明示的に依存した誤差の非漸近上界を導出する。
MRP のサブクラスに対する minimax の下位境界を証明する。
論文 参考訳(メタデータ) (2021-09-24T14:48:20Z) - Mean-Square Analysis with An Application to Optimal Dimension Dependence
of Langevin Monte Carlo [60.785586069299356]
この研究は、2-ワッサーシュタイン距離におけるサンプリング誤差の非同相解析のための一般的な枠組みを提供する。
我々の理論解析は数値実験によってさらに検証される。
論文 参考訳(メタデータ) (2021-09-08T18:00:05Z) - On the Convergence of Stochastic Extragradient for Bilinear Games with
Restarted Iteration Averaging [96.13485146617322]
本稿では, ステップサイズが一定であるSEG法の解析を行い, 良好な収束をもたらす手法のバリエーションを示す。
平均化で拡張した場合、SEGはナッシュ平衡に確実に収束し、スケジュールされた再起動手順を組み込むことで、その速度が確実に加速されることを証明した。
論文 参考訳(メタデータ) (2021-06-30T17:51:36Z) - High-probability Bounds for Non-Convex Stochastic Optimization with
Heavy Tails [55.561406656549686]
我々は、勾配推定が末尾を持つ可能性のある一階アルゴリズムを用いたヒルベルト非最適化を考える。
本研究では, 勾配, 運動量, 正規化勾配勾配の収束を高確率臨界点に収束させることと, 円滑な損失に対する最もよく知られた繰り返しを示す。
論文 参考訳(メタデータ) (2021-06-28T00:17:01Z) - On Linear Stochastic Approximation: Fine-grained Polyak-Ruppert and
Non-Asymptotic Concentration [115.1954841020189]
The inequality and non-asymptotic properties of approximation procedure with Polyak-Ruppert averaging。
一定のステップサイズと無限大となる反復数を持つ平均的反復数に対する中心極限定理(CLT)を証明する。
論文 参考訳(メタデータ) (2020-04-09T17:54:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。