論文の概要: Tight Sample Complexity Bounds for Entropic Best Policy Identification
- arxiv url: http://arxiv.org/abs/2605.13717v1
- Date: Wed, 13 May 2026 16:02:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:28.163155
- Title: Tight Sample Complexity Bounds for Entropic Best Policy Identification
- Title(参考訳): エントロピック・ベスト・ポリシー同定のためのTight Sample Complexity bounds
- Authors: Amer Essakine, Claire Vernade,
- Abstract要約: エントロピーリスク尺度に基づく有限水平リスク感応型強化学習における最良政体同定について検討した。
最近の研究は、ほぼ最適な政策を特定するのに必要なサンプル数に基づいて、下界と上界の指数的地平面依存性の一定のギャップを確立した。
この指数係数は指数ユーティリティの過度に緩い濃度制御に追従できることを示す。
- 参考スコア(独自算出の注目度): 2.868123762178957
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study best-policy identification for finite-horizon risk-sensitive reinforcement learning under the entropic risk measure. Recent work established a constant gap in the exponential horizon dependence between lower and upper bounds on the number of samples required to identify an approximately optimal policy. Precisely, known lower bounds scale in $Ω(e^{|β| H})$ where $H$ is the horizon of the MDP, while the state-of-the-art upper bound achieves at best $O(e^{2|β| H})$ (arXiv:2506.00286v2) using a generative model. We show that this extra exponential factor can be traced to overly loose concentration control for exponential utilities. To close this open gap, we revisit the analysis of this problem through a forward-model based algorithm building on KL-based exploration bonuses that we adapt to the entropic criterion. The improvement we get is due to two main novel technical innovations. We leverage the smoothness properties of the exponential utility to derive sharper concentration bounds, and we propose a new stopping rule that exploits further this tightness to obtain a sample complexity that matches the lower bound.
- Abstract(参考訳): エントロピーリスク尺度に基づく有限水平リスク感応型強化学習における最良政体同定について検討した。
最近の研究は、ほぼ最適な政策を特定するのに必要なサンプル数に基づいて、下界と上界の指数的地平面依存性の一定のギャップを確立した。
正確には、既知の下界は$Ω(e^{|β| H})$でスケールし、$H$ は MDP の地平線であるが、最先端の上界は生成モデルを用いて$O(e^{2|β| H})$ (arXiv:2506.00286v2) となる。
この指数係数は指数ユーティリティの過度に緩い濃度制御に追従できることを示す。
この開放的なギャップを埋めるために、我々は、エントロピック基準に適応するKLに基づく探索ボーナスに基づく前方モデルに基づくアルゴリズム構築を通じて、この問題の分析を再考する。
改善は2つの新しい技術革新によるものです。
我々は指数的効用の滑らか性を利用してよりシャープな濃度境界を導出し、さらにこの厳密性を利用して下界に一致するサンプル複雑性を得る新しい停止則を提案する。
関連論文リスト
- Reinforcement Learning for Exponential Utility: Algorithms and Convergence in Discounted MDPs [2.574071344130061]
マルコフ決定過程における指数効用最適化のための強化学習(RL)は、原則的値ベースアルゴリズムを欠いている。
2つのQ値型拡張を導出し、関連する作用素が$L_infty$とsup-log/Thompsonメトリクスの縮約であることを示す。
我々は、時間スケールの分離により、ほぼ全周収束を確立し、有限時間収束率を与えるとともに、サブ線形パワーロー演算子によって制御される1時間スケールのアルゴリズムを提供する。
論文 参考訳(メタデータ) (2026-05-08T17:41:48Z) - Learning to Explore with Lagrangians for Bandits under Unknown Linear Constraints [8.784438985280094]
線形制約が未知の多腕バンディットにおける純粋探索として問題を研究する。
まず、制約下での純粋な探索のために、サンプルの複雑さを低く抑えたラグランジアン緩和を提案する。
第二に、ラグランジアンの下界と凸の性質を利用して、トラック・アンド・ストップとガミファイド・エクスプローラー(LATSとLAGEX)の2つの計算効率の良い拡張を提案する。
論文 参考訳(メタデータ) (2024-10-24T15:26:14Z) - Achieving $\tilde{\mathcal{O}}(1/N)$ Optimality Gap in Restless Bandits through Gaussian Approximation [21.34216861973257]
有限水平Multiform Armed Bandit (RMAB) 問題を$N$等質アームを用いて検討する。
我々のアプローチは、平均だけでなくRMAB力学の分散も捉えるガウス系の構築に基づいている。
これは、RMABを退化させるための$tildemathcalO (1/N)$Optimity gapを確立する最初の結果である。
論文 参考訳(メタデータ) (2024-10-19T06:29:18Z) - Scalable Primal-Dual Actor-Critic Method for Safe Multi-Agent RL with
General Utilities [12.104551746465932]
安全マルチエージェント強化学習について検討し、エージェントはそれぞれの安全制約を満たしつつ、局所的な目的の総和をまとめて最大化しようとする。
我々のアルゴリズムは、$mathcalOleft(T-2/3right)$のレートで1次定常点(FOSP)に収束する。
サンプルベースの設定では、高い確率で、我々のアルゴリズムは、$epsilon$-FOSPを達成するために$widetildemathcalOleft(epsilon-3.5right)$サンプルが必要です。
論文 参考訳(メタデータ) (2023-05-27T20:08:35Z) - Optimal Horizon-Free Reward-Free Exploration for Linear Mixture MDPs [60.40452803295326]
線形マルコフ決定過程(MDP)を学習するための新たな報酬なしアルゴリズムを提案する。
我々のアルゴリズムの核心は、探索駆動の擬似回帰を用いた不確実性重み付き値目標回帰である。
我々のアルゴリズムは$tilde O(d2varepsilon-2)$ episodesを探索するだけで、$varepsilon$-optimal policyを見つけることができる。
論文 参考訳(メタデータ) (2023-03-17T17:53:28Z) - Policy-based Primal-Dual Methods for Concave CMDP with Variance Reduction [18.95829896746939]
目的と制約の両方を状態行動占有度尺度の凹凸関数として定義したコンケーブCMDPについて検討する。
本稿では, 基本変数をポリシー勾配の上昇により更新し, 二次変数を予測下次降下により更新する, 可変生成プライマル・デュアルポリシー勾配を提案する。
論文 参考訳(メタデータ) (2022-05-22T02:50:16Z) - Tight Exponential Analysis for Smoothing the Max-Relative Entropy and
for Quantum Privacy Amplification [56.61325554836984]
最大相対エントロピーとその滑らかなバージョンは、量子情報理論の基本的な道具である。
我々は、精製された距離に基づいて最大相対エントロピーを滑らかにする量子状態の小さな変化の崩壊の正確な指数を導出する。
論文 参考訳(メタデータ) (2021-11-01T16:35:41Z) - An Exponential Lower Bound for Linearly-Realizable MDPs with Constant
Suboptimality Gap [66.75488143823337]
また, 指数的標本複雑度は, 一定の準最適ギャップを仮定しても, 未だに保持していることを示した。
おそらく驚くことに、これはオンラインrl設定と生成モデル設定の指数関数的な分離を意味する。
論文 参考訳(メタデータ) (2021-03-23T17:05:54Z) - Provably Efficient Safe Exploration via Primal-Dual Policy Optimization [105.7510838453122]
制約付きマルコフ決定過程(CMDP)を用いた安全強化学習(SRL)問題について検討する。
本稿では,関数近似設定において,安全な探索を行うCMDPの効率の良いオンラインポリシー最適化アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-03-01T17:47:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。