論文の概要: Model Selection with Near Optimal Rates for Reinforcement Learning with
General Model Classes
- arxiv url: http://arxiv.org/abs/2107.05849v1
- Date: Tue, 13 Jul 2021 05:00:38 GMT
- Title: Model Selection with Near Optimal Rates for Reinforcement Learning with
General Model Classes
- Title(参考訳): 一般モデルクラスを用いた強化学習のための最適値に近いモデル選択
- Authors: Avishek Ghosh, Sayak Ray Chowdhury and Kannan Ramchandran
- Abstract要約: 有限地平線エピソディック強化学習(RL)問題に対するモデル選択の問題に対処する。
textttARL-GENが$TildemathcalO(d_mathcalE* H2+sqrtd_mathcalE* mathbbM* H2T)$の後悔を得ることを示す。
- 参考スコア(独自算出の注目度): 27.361399036211694
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We address the problem of model selection for the finite horizon episodic
Reinforcement Learning (RL) problem where the transition kernel $P^*$ belongs
to a family of models $\mathcal{P}^*$ with finite metric entropy. In the model
selection framework, instead of $\mathcal{P}^*$, we are given $M$ nested
families of transition kernels $\cP_1 \subset \cP_2 \subset \ldots \subset
\cP_M$. We propose and analyze a novel algorithm, namely \emph{Adaptive
Reinforcement Learning (General)} (\texttt{ARL-GEN}) that adapts to the
smallest such family where the true transition kernel $P^*$ lies.
\texttt{ARL-GEN} uses the Upper Confidence Reinforcement Learning
(\texttt{UCRL}) algorithm with value targeted regression as a blackbox and puts
a model selection module at the beginning of each epoch. Under a mild
separability assumption on the model classes, we show that \texttt{ARL-GEN}
obtains a regret of
$\Tilde{\mathcal{O}}(d_{\mathcal{E}}^*H^2+\sqrt{d_{\mathcal{E}}^* \mathbb{M}^*
H^2 T})$, with high probability, where $H$ is the horizon length, $T$ is the
total number of steps, $d_{\mathcal{E}}^*$ is the Eluder dimension and
$\mathbb{M}^*$ is the metric entropy corresponding to $\mathcal{P}^*$. Note
that this regret scaling matches that of an oracle that knows $\mathcal{P}^*$
in advance. We show that the cost of model selection for \texttt{ARL-GEN} is an
additive term in the regret having a weak dependence on $T$. Subsequently, we
remove the separability assumption and consider the setup of linear mixture
MDPs, where the transition kernel $P^*$ has a linear function approximation.
With this low rank structure, we propose novel adaptive algorithms for model
selection, and obtain (order-wise) regret identical to that of an oracle with
knowledge of the true model class.
- Abstract(参考訳): 我々は、遷移核 $p^*$ が有限計量エントロピーを持つモデルの族 $\mathcal{p}^*$ に属する有限地平線エピソディック強化学習(rl)問題に対するモデル選択の問題に対処する。
モデル選択フレームワークでは、$\mathcal{P}^*$の代わりに、遷移カーネルのネストされたファミリー$\cP_1 \subset \cP_2 \subset \ldots \subset \cP_M$が与えられる。
我々は,真移行カーネルが$P^*$である最小のファミリに適応する新しいアルゴリズム,すなわち \emph{Adaptive Reinforcement Learning (General)} (\textt{ARL-GEN}) を提案し,解析する。
\texttt{ARL-GEN} は、評価対象回帰をブラックボックスとしてアッパー信頼強化学習 (\texttt{UCRL}) アルゴリズムを使用し、各エポックの初めにモデル選択モジュールを配置する。
モデルクラスに対する穏やかな分離可能性の仮定の下では、 \textt{arl-gen} は $\tilde{\mathcal{o}}(d_{\mathcal{e}}^*h^2+\sqrt{d_{\mathcal{e}}^* \mathbb{m}^* h^2 t})$ の後悔を得ることを示し、高い確率で$h$ は水平長、$t$ はステップの総数、$d_{\mathcal{e}}^*$ はeluder次元、$\mathbb{m}^*$ は $\mathcal{p}^*$ に対応する計量エントロピーであることを示した。
ここでは,<texttt{ARL-GEN} に対するモデル選択のコストは,T$ に対する弱い依存度をもつ後悔の加法項であることを示す。
その後、分離性仮定を除去し、遷移カーネル $P^*$ が線形関数近似を持つ線形混合 MDP のセットアップを考える。
