論文の概要: The Sample Complexity of Policy Learning with Mu-Resets
- arxiv url: http://arxiv.org/abs/2608.07772v1
- Date: Fri, 07 Aug 2026 21:42:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.509944
- Title: The Sample Complexity of Policy Learning with Mu-Resets
- Title(参考訳): Mu-Resets を用いた政策学習のサンプル複雑さ
- Authors: Gene Li,
- Abstract要約: 我々は,KakadeとLangfordの$$-resetsインタラクションプロトコルの下で,政策に基づく強化学習を研究する。
リセット分布を仮定したカバレッジの概念によって、水平線への依存が$H$で支配されることを示す。
- 参考スコア(独自算出の注目度): 3.3419758838643414
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study policy-based reinforcement learning under the $μ$-resets interaction protocol of Kakade and Langford [KL02]. This interaction protocol enables the learner to sample trajectories from a given exploratory reset distribution $μ$, in addition to the starting distribution. We resolve the question raised by [KLS25] on the role of policy realizability for the sample complexity of this problem. Critically, the dependence on horizon $H$ is governed by the notion of coverage assumed of the reset distribution. Under bounded all-policy concentrability, we show a $\exp(Ω(H))$ sample complexity lower bound; with bounded pushforward concentrability, we show the dependence on horizon is tightly characterized as $\exp(Θ(\sqrt H))$.
- Abstract(参考訳): 我々は,カカデとラングフォード[KL02]の$μ$-resetsインタラクションプロトコルの下でポリシーに基づく強化学習を研究する。
このインタラクションプロトコルにより、学習者は、開始分布に加えて、所定の探索リセット分布から$μ$のトラジェクトリをサンプリングすることができる。
我々は,[KLS25]によって提起された,この問題のサンプル複雑性に対する政策実現可能性の役割に関する疑問を解決した。
臨界的に、水平線上の$H$への依存は、リセット分布を仮定したカバレッジの概念によって支配される。
有界な全政治集中性の下では、$\exp(Ω(H))$サンプルの複雑さを低い有界で示し、有界なプッシュフォワード集中性を持つならば、地平線への依存は$\exp(\sqrt H)$として強く特徴づけられる。
関連論文リスト
- Wasserstein Policy Learning for Distributional Outcomes [19.98190660365478]
分布評価結果を用いたオフライン政策学習について検討する。
政策学習フレームワークの統計的保証を確立する。
我々は、$N および $mathrmNtext-dim()/N への先行依存の鋭さを確立するミニマックス下界を提供する。
論文 参考訳(メタデータ) (2026-06-17T14:31:53Z) - Achieving $ε^{-2}$ Sample Complexity for Single-Loop Actor-Critic under Minimal Assumptions [4.440305753099883]
我々は、強化学習における非政治アクターのための最終項目収束率を確立する。
我々は、最小限の仮定の下で$$-optimal Policyを見つけるために、最初の$tildemathcalO(-2)$サンプル複雑性を保証する。
論文 参考訳(メタデータ) (2026-05-13T15:04:59Z) - SOUP: Token-level Single-sample Mix-policy Reinforcement Learning for Large Language Models [67.41779761651924]
SOUPは、トークンレベルで個々のサンプル内でオフとオンの学習を統合するフレームワークである。
標準のオン・ポリティクス・トレーニングと既存のオフ・ポリティクス・エクステンションを一貫して上回っている。
論文 参考訳(メタデータ) (2026-01-29T09:56:15Z) - Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits [49.96531901205305]
我々は$f$-divergence-regularized offline policy learningを分析する。
逆Kullback-Leibler (KL) の発散に対して、単極集中性の下での最初の$tildeO(epsilon-1)$サンプル複雑性を与える。
これらの結果は,$f$-divergence-regularized policy learningの包括的理解に向けて大きな一歩を踏み出したものと考えられる。
論文 参考訳(メタデータ) (2025-02-09T22:14:45Z) - Statistical Analysis of Policy Space Compression Problem [54.1754937830779]
政策探索手法は強化学習において重要であり、継続的な状態反応と部分的に観察可能な問題に対処するための枠組みを提供する。
政策圧縮による政策空間の削減は、学習プロセスを加速するための強力で報酬のないアプローチとして現れます。
この手法は方針空間をより小さく代表的な集合に凝縮し、元の効果のほとんどを維持している。
論文 参考訳(メタデータ) (2024-11-15T02:46:55Z) - Optimal Horizon-Free Reward-Free Exploration for Linear Mixture MDPs [60.40452803295326]
線形マルコフ決定過程(MDP)を学習するための新たな報酬なしアルゴリズムを提案する。
我々のアルゴリズムの核心は、探索駆動の擬似回帰を用いた不確実性重み付き値目標回帰である。
我々のアルゴリズムは$tilde O(d2varepsilon-2)$ episodesを探索するだけで、$varepsilon$-optimal policyを見つけることができる。
論文 参考訳(メタデータ) (2023-03-17T17:53:28Z) - Policy Mirror Descent Inherently Explores Action Space [10.772560347950053]
1/epsilon2)$tildemathcalO($tildemathcalO)を,探索戦略を使わずに,オンラインポリシグラデーションメソッドのサンプル複雑性を初めて確立しました。
新しいポリシー勾配法は、最適なポリシーを探す際に、潜在的にリスクの高い行動に繰り返しコミットするのを防ぐことができる。
論文 参考訳(メタデータ) (2023-03-08T05:19:08Z) - Settling the Horizon-Dependence of Sample Complexity in Reinforcement
Learning [82.31436758872715]
我々は,環境相互作用の$O(1)$のエピソードのみを用いて,同一のPAC保証を実現するアルゴリズムを開発した。
値関数と有限水平マルコフ決定過程の接続を確立する。
論文 参考訳(メタデータ) (2021-11-01T00:21:24Z) - A Lower Bound for the Sample Complexity of Inverse Reinforcement
Learning [26.384010313580596]
逆強化学習(IRL)は、与えられたマルコフ決定過程(MDP)に対して望ましい最適ポリシーを生成する報酬関数を求めるタスクである。
本稿では, 有限状態, 有限作用IRL問題のサンプル複雑性に対する情報理論の下界について述べる。
論文 参考訳(メタデータ) (2021-03-07T20:29:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。