論文の概要: Variance-Aware Fine-Grained Gap-Dependent Bounds for Online Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.04752v1
- Date: Sat, 03 Oct 2026 20:36:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 17:08:56.803623
- Title: Variance-Aware Fine-Grained Gap-Dependent Bounds for Online Reinforcement Learning
- Title(参考訳): オンライン強化学習のための可変型微細ギャップ依存境界
- Abstract要約: モデルなしオンライン強化学習において、ギャップ依存的後悔とポリシー切替コストについて検討した。
改良された UCB-Bernstein アルゴリズムである UCB-Bernstein+ に対して、最初の微細なギャップ依存後悔上限を確立する。
我々の分析は、元のCB-Bernsteinアルゴリズムよりも、後悔と局所的なスイッチングコストの両方の最悪のケース保証を改善した。
- 参考スコア(独自算出の注目度): 13.370933509246568
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study model-free online reinforcement learning (RL) for episodic tabular Markov decision processes, focusing on both gap-dependent regret and policy switching cost. While fine-grained gap-dependent analysis has been established for model-free RL algorithms using Hoeffding-type exploration bonuses, such results for model-free algorithms with variance-based exploration bonuses remain unknown, despite their superior worst-case and coarse-grained gap-dependent guarantees. In this paper, we resolve this open problem by establishing the first fine-grained gap-dependent regret upper bound for UCB-Bernstein+, a refined UCB-Bernstein algorithm, in variance-aware model-free online RL. Moreover, by integrating a stage-wise policy update design into our fine-grained framework and using refined variance-based bonuses, we achieve the best-known gap-dependent local switching cost to date. In addition, our analysis yields improved worst-case guarantees for both regret and local switching cost over the original UCB-Bernstein algorithm. Numerical experiments further demonstrate that UCB-Bernstein+ achieves favorable empirical performance in both regret and local switching cost.
- Abstract(参考訳): 表層表層マルコフ決定過程のモデルフリーオンライン強化学習(RL)について検討し、ギャップ依存的後悔と政策切替コストに着目した。
Hoeffding型探索ボーナスを用いたモデルフリーRLアルゴリズムのきめ細かいギャップ依存解析が確立されているが、モデルフリーな探索ボーナスを持つモデルフリーなアルゴリズムは、より優れた最悪ケースと粗いギャップ依存保証にもかかわらず、いまだに不明である。
本稿では、分散を考慮したモデルレスオンラインRLにおいて、改良された UCB-Bernstein+ アルゴリズムである UCB-Bernstein+ に対して、最初のきめ細かいギャップ依存後悔上限を確立することで、この問題を解決する。
さらに、当社の詳細なフレームワークに段階的なポリシー更新設計を組み込んで、改良された分散ベースのボーナスを利用することで、現在までに最もよく知られているギャップ依存ローカルスイッチングコストを実現する。
さらに,本解析により,元の UCB-Bernstein アルゴリズムよりも,後悔と局所的なスイッチングコストの両面で最悪のケースが保証された。
数値実験により, UCB-Bernstein+は, 後悔と局所的なスイッチングコストの両方において, 良好な実験性能が得られることが示された。
関連論文リスト
- Q-Learning with Fine-Grained Gap-Dependent Regret [13.370933509246568]
既存のモデルフリーアルゴリズムは、最小限の最悪の後悔を実現するが、そのギャップ依存境界はいまだに粗いままであり、最適以下のギャップの構造を完全に捉えることができない。
UCBベースと非UCBベースの両方のアルゴリズムに対して、きめ細かいギャップ依存的後悔境界を確立する。
論文 参考訳(メタデータ) (2025-10-08T05:02:16Z) - Sublinear Regret for a Class of Continuous-Time Linear-Quadratic Reinforcement Learning Problems [10.404992912881601]
拡散に対する連続時間線形四元数(LQ)制御のクラスに対する強化学習(RL)について検討した。
モデルパラメータの知識にも,その推定にも依存しないモデルフリーアプローチを適用し,RLアルゴリズムを設計して,適切なポリシパラメータを直接学習する。
論文 参考訳(メタデータ) (2024-07-24T12:26:21Z) - Model-Based Epistemic Variance of Values for Risk-Aware Policy Optimization [59.758009422067]
モデルベース強化学習における累積報酬に対する不確実性を定量化する問題を考察する。
我々は、解が値の真後分散に収束する新しい不確実性ベルマン方程式(UBE)を提案する。
本稿では,リスク・サーキングとリスク・アバース・ポリシー最適化のいずれにも適用可能な汎用ポリシー最適化アルゴリズムQ-Uncertainty Soft Actor-Critic (QU-SAC)を導入する。
論文 参考訳(メタデータ) (2023-12-07T15:55:58Z) - Optimal Convergence Rate for Exact Policy Mirror Descent in Discounted
Markov Decision Processes [18.35462792871242]
Policy Mirror Descentは、強化学習における様々な新しい基本的な手法を網羅するアルゴリズムのファミリーである。
不正確な政策評価を伴う政策反復の不安定性に動機づけられたPMDは、PIの政策改善ステップをアルゴリズム的に規則化する。
我々は,適応的なステップサイズの下で,非正規化PSDアルゴリズムの一般ファミリーによって,PIの次元自由な$gamma$-rateが達成可能であることを示す。
論文 参考訳(メタデータ) (2023-02-22T13:55:08Z) - Achieving the Pareto Frontier of Regret Minimization and Best Arm
Identification in Multi-Armed Bandits [91.8283876874947]
本稿では,BoBW-lil'UCB$(gamma)$アルゴリズムの設計と解析を行う。
i) RMとBAIの両方の目的に対して最適なアルゴリズムを同時に実行できないことを示す。
また、BoBW-lil'UCB$(gamma)$は、時間複雑性と後悔の点で競合よりも優れていることを示す。
論文 参考訳(メタデータ) (2021-10-16T17:52:32Z) - Breaking the Sample Complexity Barrier to Regret-Optimal Model-Free
Reinforcement Learning [52.76230802067506]
漸進的強化学習における後悔を最小限に抑えるために,新しいモデルフリーアルゴリズムを提案する。
提案アルゴリズムは、2つのQ-ラーニングシーケンスの助けを借りて、初期設定された参照更新ルールを用いる。
初期の分散還元法の設計原理は、他のRL設定とは独立した関心を持つかもしれない。
論文 参考訳(メタデータ) (2021-10-09T21:13:48Z) - Distributional Robustness and Regularization in Reinforcement Learning [62.23012916708608]
経験値関数の新しい正規化器を導入し、ワッサーシュタイン分布のロバストな値関数を下限とすることを示す。
強化学習における$textitexternalな不確実性に対処するための実用的なツールとして正規化を使用することを提案する。
論文 参考訳(メタデータ) (2020-03-05T19:56:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。