論文の概要: Peng's Q($λ$) for Conservative Value Estimation in Offline Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2605.14779v1
- Date: Thu, 14 May 2026 12:48:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.826919
- Title: Peng's Q($λ$) for Conservative Value Estimation in Offline Reinforcement Learning
- Title(参考訳): オフライン強化学習における保守的価値推定のためのPengのQ($λ$)
- Authors: Byeongchan Kim, Min-hwan Oh,
- Abstract要約: 我々は、モデルなしオフライン多段階強化学習アルゴリズム、Reserve PengのQ($$)(CPQL)を提案する。
我々のアルゴリズムはベルマン演算子の代替としてペンのQ($$) (PQL)演算子を保守的な値推定に適応させる。
CPQLは同時に過悲観的な値推定を緩和し、動作ポリシよりもパフォーマンスを向上(あるいは同等)し、ほぼ最適なパフォーマンス保証を提供する。
- 参考スコア(独自算出の注目度): 35.18584220158021
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose a model-free offline multi-step reinforcement learning (RL) algorithm, Conservative Peng's Q($λ$) (CPQL). Our algorithm adapts the Peng's Q($λ$) (PQL) operator for conservative value estimation as an alternative to the Bellman operator. To the best of our knowledge, this is the first work in offline RL to theoretically and empirically demonstrate the effectiveness of conservative value estimation with a \textit{multi-step} operator by fully leveraging offline trajectories. The fixed point of the PQL operator in offline RL lies closer to the value function of the behavior policy, thereby naturally inducing implicit behavior regularization. CPQL simultaneously mitigates over-pessimistic value estimation, achieves performance greater than (or equal to) that of the behavior policy, and provides near-optimal performance guarantees -- a milestone that previous conservative approaches could not achieve. Extensive numerical experiments on the D4RL benchmark demonstrate that CPQL consistently and significantly outperforms existing offline single-step baselines. In addition to the contributions of CPQL in offline RL, our proposed method also contributes to the offline-to-online learning framework. Using the Q-function pre-trained by CPQL in offline settings enables the online PQL agent to avoid the performance drop typically observed at the start of fine-tuning and to attain robust performance improvements. Our code is available at https://github.com/oh-lab/CPQL.
- Abstract(参考訳): 本稿では,モデルなしオフライン多段階強化学習(RL)アルゴリズム,保守党ペンのQ($λ$)を提案する。
我々のアルゴリズムはベルマン作用素の代替としてペンのQ($λ$)演算子を保守的な値推定に適応させる。
我々の知る限り、これはオフラインRLにおける最初の研究であり、オフライン軌跡を十分に活用して、‘textit{multi-step} 演算子による保守的値推定の有効性を理論的かつ実証的に実証したものである。
オフラインRLにおけるPQL演算子の固定点は、振る舞いポリシーの値関数に近づき、暗黙の振る舞い規則化を自然に誘導する。
CPQLは同時に過悲観的な値推定を緩和し、動作ポリシのそれよりもパフォーマンスを向上(あるいは同等)し、ほぼ最適なパフォーマンス保証を提供する。
D4RLベンチマークの大規模な数値実験は、CPQLが既存のオフラインシングルステップベースラインよりも一貫して、大幅に向上していることを示している。
オフラインRLにおけるCPQLのコントリビューションに加えて,提案手法はオフライン-オンライン学習フレームワークにも貢献する。
オフライン設定でCPQLによって事前トレーニングされたQ関数を使用することで、オンラインPQLエージェントは、微調整の開始時に一般的に見られるパフォーマンス低下を回避し、堅牢なパフォーマンス改善を実現することができる。
私たちのコードはhttps://github.com/oh-lab/CPQLで公開されています。
関連論文リスト
- BiCQL-ML: A Bi-Level Conservative Q-Learning Framework for Maximum Likelihood Inverse Reinforcement Learning [10.016258281947122]
BiCQL-MLはポリシーなしのオフライン逆強化学習アルゴリズムである。
BiCQL-MLは報酬回復とダウンストリームポリシのパフォーマンスの両方を改善している。
論文 参考訳(メタデータ) (2025-11-27T08:27:10Z) - IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion
Policies [72.4573167739712]
Implicit Q-learning(IQL)は、修正されたBellmanバックアップを通じてデータセットアクションのみを使用して、Q-関数をトレーニングする。
この訓練されたQ-関数で表される値が実際にどのポリシーで達成されるのかは不明である。
我々はImplicit Q-learning (IDQL)を導入し、一般のIQL批判とポリシー抽出手法を組み合わせた。
論文 参考訳(メタデータ) (2023-04-20T18:04:09Z) - Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online
Fine-Tuning [104.05522247411018]
オフライン強化学習(RL)手法は微調整中は動作が悪くなる傾向がある。
このような校正値関数を学習するオフラインRLアルゴリズムが効果的なオンライン微調整につながることを示す。
実際には、Cal-QLは、オフラインのRLのための保守的なQ学習(CQL)の上に、1行のコード変更で実装できる。
論文 参考訳(メタデータ) (2023-03-09T18:31:13Z) - Conservative Q-Learning for Offline Reinforcement Learning [106.05582605650932]
CQLは既存のオフラインRLメソッドよりも大幅に優れており、多くの場合、ファイナルリターンの2~5倍高いポリシを学習しています。
理論的には、CQLは現在のポリシーの価値の低いバウンダリを生成し、理論的改善保証を伴う政策学習手順に組み込むことができることを示す。
論文 参考訳(メタデータ) (2020-06-08T17:53:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。